漫剧制作知识库 · 母本(AI 摄取版)
用途:这是一份「AI 可整体读取、可推理」的漫剧制作全量知识库母本。你的 AI 工具(Agent / RAG 检索 / 工作流)读取本目录下全部 .md 后,应获得关于「漫剧(AIGC 微短剧)从剧本到分发」的完整认知,无需再查外部。 知识截止:2026-09-20。模型名称、价格、平台规则会过期,见下方「时效与更新」。 在线版本(给人看):https://manju.zbjh.top/ —— 可全文搜索、可切明暗主题;AI 摄取入口:https://manju.zbjh.top/ai/ (单文件全文 https://manju.zbjh.top/ai/kb_full.md 可一次投喂)。本母本为源文本,内容与线上一致。
一、模块地图(AI 阅读顺序建议)
| 文件 | 主题 | 深度 | 何时读 |
|---|---|---|---|
00_总索引与说明.md | 本文件:地图、阅读指引、时效 | — | 总是先读 |
01_基础认知与题材图谱.md | 什么是漫剧、赛道、题材分类 | 基础 | 入门/定位 |
02_剧本与叙事工程.md | 爽点/钩子、剧本结构、分镜标准、台词节奏 | 深 | 写剧本前 |
03_角色与美术资产规范.md | 角色设定文档、三视图/表情表/色板、风格、资产管理 | 深 | 建角色前 |
04_工具路线_线上与本地.md | H3/即梦/ComfyUI 速查 + 决策树 | 浓缩 | 选工具时 |
05_声音与音画节奏.md | TTS/口型/BGM/音效/混音 | 浓缩 | 做声音时 |
06_后期包装与平台适配.md | 剪辑/字幕/封面/画幅/倍速 | 浓缩 | 后期时 |
07_质量评测与排错手册.md | QA 清单、一致性评分、排错表 | 深 | 质检/出问题 |
08_运营分发与变现.md | 平台/投流/数据/变现/IP | 浓缩 | 上线前 |
09_术语表.md | 漫剧黑话字典(含英文/别名) | 深 | 遇到陌生词随时查 |
10_案例库.md | 爆款拆解(A–I 九例:甜宠/逆袭/悬疑/权谋/重生/出海/战神/甜宠2/知识口播)+ 反面案例 + 记录模板 | 深 | 找参考/避坑 |
11_出海专项.md | 出海平台/本地化/题材选型/各地合规差异 | 深 | 做出海前 |
12_分镜表实操与模板.md | 分镜表 14 字段定义、填写纪律、合格样例、字段→生产映射、分镜病 | 深 | 写分镜/转生产前 |
13_双流程实战_剧本分镜到出片.md | 线上A/混合B 双流程、可抄提示词、一致性&连贯性保证、第八章 GitHub/B站 实测资源索引 | 深 | 真正动手出片前 |
推荐摄取顺序:00 → 09(先建词表)→ 01 → 02 → 03 → 12(分镜实操)→ 13(双流程实战)→ 04 → 07 → 05/06/08 → 10 → 11。 遇到具体症状先查 07 排错表;遇到陌生术语先查 09 术语表;做出海先查 11。
二、知识范围声明
本母本覆盖漫剧制作的全链路知识域:
- 认知层:定义、赛道、题材、商业模式
- 创意层:剧本、叙事、角色与美术资产
- 工程层:工具路线(线上/本地)、声音、后期、质量评测
- 分发层:平台、投流、数据、变现、合规
- 元层:术语表、案例库
边界:本母本不替代具体工具的实时 API 文档(如 MiniMax platform.minimaxi.com/docs、即梦官网),也不构成法律意见。涉及价格、许可、平台规则,以官方原文为准。
三、时效与更新机制
- 标注截止日:每个含时效信息(价格/模型名/平台规则)的文件顶部应注明知识截止日。
- 季度复核:漫剧工具迭代极快(例:MiniMax H3 于 2026-07 发布、即梦 Seedance 2.5 于 2026-08 更新),建议每 3 个月复核一次
04/05/08三篇。 - 重大变更触发更新:某工具发布里程碑版本、平台规则重大调整、出现新的主流工作流时,立即补更对应模块并回写本索引。
- AI 使用约定:若 AI 在回答中引用了过期信息,应标注「该信息截至 2026-09,可能已变更」。
四、与其他资料的关系
本母本是「单一事实来源(single source of truth)」。以下旧文件仍为辅助资料,但以本母本为准:
01_高端仿真人漫剧制作全流程手册.html(原理/全流程,详但偏仿真人)02_开源项目清单.csv(51 个开源项目清单)03_新手30天上手路线与分镜表模板.md(30 天拆解)- 在线知识库 https://manju.zbjh.top/ (图文 / 可搜索版,与母本同源;AI 摄取版 https://manju.zbjh.top/ai/ )
高端仿真人漫剧授课PPT/(17 页授课版)
五、给 AI 的快速自检(读完本母本后应能回答)
- 漫剧和短视频、传统动画、真人微短剧的区别是什么?
- 一条爆款漫剧的「钩子 + 爽点 + 结构」长什么样?
- 怎么写一份让 AI 绘图工具不「跳脸」的角色设定?
- 线上 H3 / 即梦 与本地 ComfyUI 各自怎么选、怎么混用?
- 成片发布前,QA 清单要过哪几关?跳脸/口型错位怎么修?
- 「IP-Adapter / LoRA / PuLID / Ref2VA / FL2VA / 卡点 / Cliffhanger」分别指什么?
01 · 基础认知与题材图谱
知识截止 2026-09。AI 入门漫剧的第一站:它是什么、在哪播、有哪些题材。
一、什么是漫剧(AIGC 微短剧)
- 定义:用 AI 生成画面与声音、带连贯剧情的短片。常见单集 30–90 秒、竖屏(9:16)为主,整剧常 80–100 集。
- 与传统区别:
- vs 短视频:漫剧有连续剧情与角色弧,非随机内容。
- vs 真人微短剧:漫剧画面由 AI 生成,无需实拍/演员。
- vs 动画番剧:漫剧成本低、量产快、单集极短、爽点密度高。
二、赛道与平台
| 平台 | 特点 | 适配 |
|---|---|---|
| 抖音 / 快手 | 流量大、投流成熟 | 甜宠/逆袭/爽文 |
| 微信视频号 | 私域+社交分发 | 全类型 |
| 红果短剧 | 免费短剧分发 | 男频/长剧 |
| 番茄/小程序 | IP 源头+变现 | 改编 |
| ReelShort / TikTok | 出海 | 译制/原创 |
三、题材图谱(常用)
| 题材 | 一句话 | 爽点类型 | 画风建议 |
|---|---|---|---|
| 甜宠 | 高糖恋爱 | 撒糖/双向奔赴 | 半写实韩系 |
| 逆袭/龙傲天 | 废柴觉醒打脸 | 打脸/身份曝光 | 动态漫 |
| 重生 | 带着记忆重来 | 先知/复仇 | 半写实 |
| 虐恋 | 爱而不得 | 虐心/追妻火葬场 | 写实 |
| 悬疑 | 真相层层揭开 | 反转/信息释放 | 暗调写实 |
| 玄幻/修仙 | 修炼升级 | 突破/越级 | 二次元 |
| 都市 | 职场/商战 | 逆袭/打脸 | 半写实 |
| 古装 | 权谋/宫斗 | 权谋/反转 | 半写实 |
| 婆媳/家庭 | 温情/冲突 | 共情/解气 | 写实 |
四、商业模式
- IAP 投流:花钱买曝光,靠付费点播/解锁回收(主流)。
- 平台分账:按播放/完播分润。
- 品牌定制:为客户做定制漫剧广告。
- IP 衍生:爆款 IP 改编动漫/影视(如次元折叠计划)。
- 出海:译制或原创投 ReelShort 等。
五、AI 漫剧的独有优势与风险
- 优势:成本极低、量产快、可私有、角色可完全掌控。
- 风险:脸崩/口型/合规、内容同质化、平台规则变动。
- 详见
07质量评测、08运营合规。
02 · 剧本与叙事工程
知识截止 2026-09。本节讲「怎么写出观众愿意看完的漫剧」——这是 AI 漫剧最容易缺的一层。工具再强,剧本拉胯也救不回来。
一、核心概念:爽点 与 钩子
爽点(Payoff):观众看完产生「爽/爽到了/解气/上头」的情绪释放点。漫剧的本质是高频、密集、可预期的爽点投放。
- 没有爽点的漫剧 = 没人看完。
- 爽点类型:逆袭打脸、身份曝光、误会解除、复仇成功、撒糖、绝境翻盘、真相大白。
钩子(Hook):开篇 3 秒内抓住人的东西。常见钩子:
- 冲突钩子:「你被开除了?正好,我是你新老板。」
- 悬念钩子:「这封信,能证明你爸不是自杀。」
- 反转钩子:「温柔老公深夜给另一个女人转账 99 笔。」
- 情绪钩子:特写一张泪脸 + 一句扎心台词。
AI 创作铁律:前 3 秒必须有钩子,前 15 秒必须抛第一个爽点,每 20–30 秒至少一个小爽点,每集末尾留悬念(Cliffhanger)。
二、剧本结构
2.1 单集结构(以 60 秒竖屏为例)
[0–3s] 钩子:冲突/悬念/反转开场 [3–15s] 情境铺陈 + 第一个小爽点 [15–40s] 冲突升级,情绪推高 [40–55s] 爽点爆发(打脸/曝光/撒糖) [55–60s] 新悬念收尾(Cliffhanger,逼看下一集)
2.2 多集连续结构
- 悬念链:每集结尾留一个未解问题,下一集开头 3 秒先给回应再抛新钩。
- 信息释放节奏:核心秘密分 3–5 次释放,每次释放都伴随爽点,不要一次说完。
- 情绪曲线:避免平。一集内要有「压抑→释放→再压抑→大释放」的起伏。
2.3 全剧弧线(百集级)
设定(身份/困境)→ 小冲突(验证爽点模型)→ 升级(敌人/难度变大) → 反转(身份/真相曝光)→ 高潮(终极打脸/团圆)→ 收束(留续作空间)
三、选题与定位
| 维度 | 问自己 |
|---|---|
| 人群 | 给谁看?(女频/男频/全龄) |
| 情绪 | 主打哪种情绪?(爽/甜/虐/恐/燃) |
| 爽感公式 | 主角用什么方式、对谁、完成什么爽点? |
| 差异点 | 同类题材里你的钩子新在哪? |
| 可持续性 | 这个设定能撑 80–100 集不注水吗? |
常见题材(详见 01_基础认知与题材图谱.md):甜宠、逆袭、战神/龙傲天、重生、虐恋、悬疑、玄幻、都市、古装、婆媳。
四、分镜脚本标准写法
每集产出一份分镜表,字段如下(AI 出图/出视频时直接喂):
| 字段 | 说明 | 示例 |
|---|---|---|
| 镜号 | 顺序 | SC01 |
| 景别 | 远/全/中/近/特 | 中近景 |
| 画面 | 主体+动作+构图 | 女主背影,转身,雨中 |
| 动作 | 关键动作 | 抬手甩耳光 |
| 台词 | 角色+内容(≤12 字/句) | 女主:这一巴掌,迟到了三年。 |
| 时长 | 秒 | 4s |
| 音效 | 环境/打击 | 雨声、巴掌声 |
| BGM | 情绪 | 压抑弦乐→爆发 |
| 备注 | 一致性约束 | 保持紫围巾、银徽章 |
AI 拆镜提示词模板(给 LLM 用):
你是漫剧分镜师。给定剧情梗概:{梗概}。
输出 8–12 个分镜,每个含:镜号/景别/画面/动作/台词(≤12字)/时长/音效/BGM/一致性备注。
要求:前3秒有钩子,每20-30秒一个小爽点,结尾留悬念。台词口语化、短句。
五、台词节奏
- 短句优先:单句 ≤12 字最适合口型对齐(海螺 H3 / 即梦均如此)。
- 信息密度:一句一个信息,不堆修饰。
- 口语化:像人说话,不像朗读。
- 情绪词外置:语气/动作写在角色标签外,如
(女主 冷笑) says [Chinese] 你配吗。 - 避免长段独白:长对白必嘴型错位,拆成短句或改画外音。
六、常见剧本病(AI 尤其易犯)
| 病 | 表现 | 修复 |
|---|---|---|
| 铺垫癌 | 前 10 秒还在介绍背景 | 直接上钩子,背景靠动作带 |
| 爽点晚 | 30 秒后才第一次爽 | 前 15 秒必给小爽点 |
| 脸谱化 | 反派纯坏无动机 | 给反派一个「能共情」的理由 |
| 逻辑断 | 上一镜恨人下一镜相爱 | 补过渡情绪戏 |
| 注水 | 同一爽点重复三遍 | 一集一个主爽点 + 一个副爽点 |
| 无悬念 | 结尾圆满无钩 | 每集末尾加未解问题 |
七、AI 写剧本工作流建议
- 定位:先用 LLM 确定人群/情绪/爽感公式/差异点。
- 大纲:生成全剧弧线(80–100 集梗概)。
- 逐集:每集生成分镜表(用上方模板)。
- 校验:用「常见剧本病」表自检,重点查钩子与爽点密度。
- 转译:分镜表直接作为出图/出视频的提示词输入(见
03角色资产 +04工具路线)。
03 · 角色与美术资产规范
知识截止 2026-09。本节是「让 AI 绘图/视频工具不跳脸、跨百集一致」的底层约束。角色资产做对了,后面所有工序都省心;做错了,全程救火。
一、角色设定文档(Character Sheet)模板
每个主要角色建一份,存为 角色库/男主.md 等。AI 出图/出视频时,把「固定特征词」段直接喂给提示词。
# 角色:陆昭(男主) - 身份:被废世家的庶子 / 隐忍谋士 - 性格:冷静、记仇、外柔内刚 - 外貌固定特征(2–4 个,反复用): 1. 左眉骨一道旧疤 2. 玄色广袖长袍,袖口绣暗金云纹 3. 瞳色墨黑,目光沉静 4. 常执一柄未出鞘的乌木剑 - 声线:低沉青年男声,语速慢,带克制笑意 - 标志性动作:说话时以指节轻叩剑鞘 - 关系:与女主是「表面敌对→同盟→相爱」
固定特征词原则:压到 2–4 个最强辨识点,每次提示词都重复。特征越多越容易崩(社区实测跨 9 场景不崩的秘诀)。
二、三视图 与 表情表
| 资产 | 用途 | 建议 |
|---|---|---|
| 三视图(正面/侧面/背面) | 给 IP-Adapter / LoRA 训练 / 参考图锁脸 | 每角色至少 3 张,同一光照同一服饰 |
| 表情表(喜/怒/哀/惊/默/冷笑) | 保证情绪一致性 | 6 格一张图,固定构图 |
| 定妆图(全身带场景光) | 首帧/参考图 | 用于 H3 Ref2VA、即梦参考 |
给 AI 绘图的关键:参考图尽量用干净立绘(纯色背景、无杂物),背景杂物多会带进生成画面(海螺 H3 实测坑)。
三、色板(Color Palette)
每个角色/场景定一组色,写进设定文档,出图提示词强制带:
- 主色(服饰主调)、辅色(配饰)、点缀色(标志物)
- 例:陆昭 = 玄黑(#1a1a1a) + 暗金(#c9a24b) + 乌木深棕(#3a2c1c)
风格锚(Style Anchor):用 1–2 张「定稿图」作为 IP-Adapter 权重 0.3 的锚,锁整剧画风(见 04 工具路线)。
四、美术风格定义
| 风格 | 说明 | 一致性难度 | 适用 |
|---|---|---|---|
| 仿真人/写实 | 真人质感,AI 视频最易「恐怖谷」 | 高(脸崩风险大) | 都市/甜宠/悬疑 |
| 半写实 | 拟真但略动漫,折中 | 中 | 通用 |
| 二次元 | 日系/国漫动画风 | 低(模型成熟) | 玄幻/校园 |
| 3D 卡通 | 三渲二质感 | 中 | 儿童/合家欢 |
| 动态漫 | 静态漫画 + 微动 | 低(最易量产) | 男频/爽文改编 |
一致性难度规律:越写实越难保脸;二次元/动态漫最稳。新手建议从二次元或动态漫起步。
五、场景资产
- 主场景清单:每剧列 5–10 个常驻场景(如:陆府正厅、雁回城街市、靖王军帐)。
- 风格统一:同一场景固定光照基调、色调、构图母版。
- 种子锁场景(ComfyUI):同一场景用固定 Seed + 不同 ControlNet 姿态,保证「同一个房间三个角度真的是同一个房间」(见
04)。
六、资产命名与管理规范
目录结构示例:
角色库/
男主_陆昭/
ref_正面.png ref_侧面.png ref_背面.png
exp_喜.png exp_怒.png exp_哀.png exp_惊.png exp_默.png exp_冷笑.png
lora_陆昭.safetensors
女主_xxx/
场景库/
陆府正厅_v1.png 雁回城街市_v1.png
分镜帧/
EP01_SC01_中近景_v1.png ...
命名规则:{类别}_{角色/场景}_{角度/镜号}_{版本}.png,版本用 _v1/_v2 递增,不覆盖旧版。 版本控制:每轮生成保留原始帧,精修另存,便于回退(避免「改坏找不回」)。
七、给工具的角色描述写法(跨工具通用)
- 文字描述:
黑色短发、左眉旧疤、玄色广袖长袍绣暗金云纹、墨黑瞳、执乌木剑 - 图生视频:每段提示词开头复述「保持原图构图与质感」+ 重复固定特征词
- 参考模式(H3 Ref2VA / 即梦):图1–图N 为角色多角度参考,声明「严格保持{特征}一致」
- 避免:临时加戏新特征、长段形容词堆砌、中英文混写专有画风名(保留英文原词更稳)
04 · 工具路线(线上与本地)速查
知识截止 2026-09。完整参数见在线版 https://manju.zbjh.top/ 。本篇给 AI 速查精华 + 决策树。
一、三路线总览
| 路线 | 代表 | 上手 | 单镜成本 | 一致性 | 音画同步 | 隐私 |
|---|---|---|---|---|---|---|
| 线上 · MiniMax H3 | 海螺 AI | 快 | 按秒(¥0.5/0.8) | 参考图软约束 | 原生一次出 | 上传云端 |
| 线上 · 即梦 | 字节 | 快 | 积分/会员 | 主体绑定锁 | 原生一次出 | 上传云端 |
| 本地 · ComfyUI | 你的 3060 12GB | 慢 | 电费≈0 | LoRA 强约束 | 需自拼 | 本机私有 |
二、MiniMax H3 要点
- 全模态:画面+原生 32kHz 立体声一次出,对白/音效同出。
- 两种模式:FL2VA(文/首尾帧生视频)、Ref2VA(最多 9 图+3 视频+3 音频,锁角色脸/声线)。二者不可混用。
- 提示词四段式(任务/素材关系/故事动作/镜头风格声音)+ 末尾负面清单;对白
(角色 S1) says [Chinese] ≤12字。 - 成本:768P ¥0.5/秒、2K ¥0.8/秒、768→2K ¥0.3/秒;按「可用镜头×重试」算账。
- 本地:H3-Base(768P)已开源,2K/Context-IR 未开源 → 本地 Base + API 补两端。ComfyUI ≥0.30.0 有原生工作流。
三、即梦要点
- 视频 3.5 Pro + Seedance 2.0/2.5:四模态输入、主体绑定锁(跨镜一张脸)、原生音画同步、多镜头叙事原生支持。
- 功能:首尾帧、对口型(≤9 秒)、运镜/速度控制、智能画布、故事创作模式(拖拽排序+时间轨+一键导出)。
- 生态:小章鱼 Octo(对话式创作)、Seedance 2.5 + Maya/Blender 插件、「次元折叠」千万元扶持(联合番茄小说)。
四、ComfyUI 本地要点(RTX 3060 12GB)
- 能跑:SDXL/FLUX+IP-Adapter(锁脸)、PuLID(关键帧)、Wan2.2 5B(动作)、FramePack(口播 6G 出 60 秒)、LTX(微动)、GPT-SoVITS/F5-TTS(配音)、LivePortrait/Wav2Lip(口型)。
- 一致性三方案:IP-Adapter/PuLID(免训练快)→ LoRA(强一致,主角必做,15–30 张参考图)→ HyperLoRA(轻量多角色)。
- 红线:避开 Wan 14B、2K、多模型同载;优先 FramePack+Wan5B+IP-Adapter。
五、决策树(给 AI 选路线)
要私有/跨百集一致? ─是→ 本地 ComfyUI(训 LoRA)
│否
要快速出带声成片? ─是→ 线上 H3(Ref2VA 锁角色)
│否
竖屏/中文口型/故事模式? → 即梦
量大要省钱? → 混合:线上打样 + 本地量产,或本地768P + 云端升2K
六、混合路线(常态解法)
- 线上打样 + 本地量产:即梦/H3 试镜头定参考图 → 回 ComfyUI 训 LoRA 批量出。
- 本地 768P + 云端升 2K:只给最终采用镜头升档,省大钱。
- 原则:贵且稀缺(2K 升档、复杂参考解析)买云端;量大/要一致/私有放本地。
05 · 声音与音画节奏
知识截止 2026-09。声音是漫剧「沉浸感」的一半。线上工具(H3/即梦)原生音画同步;本地需自拼配音+口型。
一、配音(TTS / 语音克隆)
| 工具 | 特点 | 本地显存 |
|---|---|---|
| GPT-SoVITS | 5–20 条样本克隆声线,质量高 | CPU 可 |
| F5-TTS | 跨语言、自然 | 中 |
| Fish Speech / IndexTTS | 多语种、稳定 | 中 |
| 即梦/海螺原生 | 直接出,免后配 | 云端 |
- 声线设计:主角/配角/旁白用不同音色;同一角色全剧固定声线(参考图锁脸同理)。
- 台词规范:单句 ≤12 字最利口型;长对白拆短句或改画外音。
二、口型(Lip-sync)
- 图→对口型:LivePortrait(肖像驱动,轻)、Wav2Lip(通用)、EchoMimic V2(半身/全身数字人)、LatentSync(端到端)。
- 即梦对口型:≤9 秒,选音色或上传配音,嘴型自然。
- 要点:先出无声视频再对口型,或选原生音画同步模型省一步。
三、BGM 与音效
- BGM:按情绪曲线选曲;商用需授权或来自无版权曲库(如平台自带/CC0)。
- 音效:环境声(雨/街市)、打击(巴掌/刀剑)、转场 whoosh。
- 混音:对白优先,BGM 不压人声;统一响度(LUFS 约 -16 至 -14)。
四、音画同步要点
- 对白短句 → 口型自然;长句必错位。
- 剪辑时音频对齐视频帧,统一帧率(24/25/30fps)。
- 卡点:画面切换对齐 BGM 鼓点,提升爽感(见
06后期)。
五、自检(见 07 QA 清单声音层)
口型匹配?对白清晰?BGM 比例?环境音到位?授权合规?
06 · 后期包装与平台适配
知识截止 2026-09。后期决定「能不能让人看下去」。与02剧本节奏、05声音共同构成成片质感。
一、剪辑节奏
- 快剪:漫剧每镜 2–5 秒,避免长镜拖沓。
- 卡点:画面切换对齐 BGM 鼓点(见
05)。 - 情绪剪辑:爽点处可慢镜/定格强调,压抑处加速。
二、转场
- 硬切(最常用)、叠化(时间/情绪过渡)、遮罩/光效转场(高潮)。
- 避免花哨转场干扰叙事。
三、字幕
- 位置:底部居中/偏下,留安全区(竖屏底部 15%)。
- 字号:手机可视,≥ 画面高度 1/12。
- 配色:白字+描边/半透明底,保证任何背景可读。
- 出海:双语或译制字幕(manga-image-translator 可机翻)。
四、封面与标题
- 封面:高冲突瞬帧 + 大字标题,决定点击率。
- 标题:含钩子/爽点关键词(例:「被休当天,她亮出隐藏身份」)。
五、画幅与规格
| 平台 | 画幅 | 分辨率 |
|---|---|---|
| 抖音/视频号/红果(竖屏) | 9:16 | 1080×1920 |
| 横屏/B 站 | 16:9 | 1920×1080 |
| 方屏 | 1:1 | 1080×1080 |
- 成片导出:MP4(H.264),码率 ≥ 8Mbps,帧率与生成一致。
六、倍速/变速
- 动作戏轻微加速增强张力;抒情戏正常或慢镜。
- 注意变速后口型/音频需重新对齐(优先在生成阶段定速)。
七、与前面环节的关系
- 剪辑节奏源于
02分镜表的时间分配; - 字幕/口型源于
05; - 最终成片进
07QA 与08分发。
07 · 质量评测与排错手册
知识截止 2026-09。本节是「发布前必过清单」+「症状→根因→修复」可机读排错表。AI 在质检环节应优先查此文件。
一、发布前 QA 清单(逐条过)
剧本层
- [ ] 前 3 秒有钩子?前 15 秒有第一个爽点?
- [ ] 每 20–30 秒有小爽点?结尾有悬念?
- [ ] 台词单句 ≤12 字?口语化?无长段独白?
画面层
- [ ] 角色跨镜头脸一致(无跳脸)?
- [ ] 场景跨镜头一致(同一房间不变成两个)?
- [ ] 无多手/多脚/肢体畸形/五官错乱?
- [ ] 无闪烁/抖动/水印/乱码文字?
声音层
- [ ] 口型与台词匹配(无严重错位)?
- [ ] 对白清晰不被 BGM 压住?
- [ ] 环境音/音效到位?
一致性与合规
- [ ] 画风全程统一(IP-Adapter/风格锚生效)?
- [ ] 已加 AI 生成标识?
- [ ] 肖像/声线/音乐/BGM 已授权或来自无版权源?
- [ ] 无涉政/低俗/侵权 IP?
二、一致性评分(自用评估,0–10 分)
| 维度 | 评分点 | 参考 |
|---|---|---|
| 角色一致 | 跨镜头脸/发型/服饰/配饰 | 参考图 + 固定特征词 |
| 场景一致 | 同一场景不串 | 种子锁/参考图 |
| 光影一致 | 光照方向/基调统一 | 固定 LoRA/提示词 |
| 口型一致 | 嘴型跟语音 | LivePortrait/Wav2Lip |
| 画风一致 | 整体质感统一 | 风格锚 IP-Adapter 0.3 |
及格线:单集综合 ≥7 分可发;核心角色任何一镜 ≥8 分。低于线则回炉(见排错表)。
三、排错表(症状 → 根因 → 修复)
| 症状 | 可能根因 | 修复 |
|---|---|---|
| 跳脸(同角色每镜变样) | 无参考图/无 LoRA;特征词太多太杂 | 上 Ref2VA 参考模式或训 LoRA;特征词压到 2–4 个;加 IP-Adapter 0.6–0.8 |
| 闪烁/抖动 | 视频模型帧间不稳定;高动态 | 拆 5 秒内短镜;降运动幅度;换更稳模型(LTX 微动) |
| 多手/肢体畸形 | 姿态控制缺失;强动作 | 加 ControlNet OpenPose;强动作拆短镜;避免单段大动作 |
| 口型错位 | 对白太长;TTS 与口型模型不匹配 | 对白改 ≤12 字短句;用原生音画同步(H3/即梦)或 LivePortrait 重对 |
| 音画不同步 | 后期混音偏移;帧率不一致 | 统一 24/25/30fps;口型在合成阶段对齐 |
| 风格漂移 | 未锁画风;混用底模 | 固定单一 Checkpoint;IP-Adapter 风格锚 0.3;全程同 LoRA |
| 场景串味 | 同场景 Seed 未锁;参考图混杂 | 固定场景 Seed;场景参考图单独管理 |
| 卡顿/不流畅 | 帧率过低;插帧缺失 | 升帧率;加帧插值(RIFE);避免突变运镜 |
| 模糊 | 步数低/分辨率低/超分缺失 | 升步数;出图后用 Real-ESRGAN 超分;避免直接拉伸 |
| 水印/乱码文字 | 模型自带;提示词要了文字 | 负面词加「水印、文字、logo」;避免让 AI 写实体文字 |
| 节奏拖 | 单镜过长;无卡点 | 每镜 2–5 秒快剪;对齐 BGM 鼓点 |
| 脸崩(特写) | 特写超出模型稳定区 | 特写用 PuLID 精修关键帧;降 CFG 防爆 |
| 明暗跳变 | 跨镜光照不统一 | 提示词固定光照描述;后期统一调色 LUT |
四、自检流程(从后往前逐级 preview)
- 成片整体看一遍:节奏/钩子/爽点是否到位。
- 声音轨单独听:口型、清晰度、BGM 比例。
- 画面逐镜看:跳脸/畸形/闪烁/水印。
- 一致性抽检:随机抽 3 镜比角色/场景/画风。
- 合规最后查:AI 标识、授权、内容安全。
原则:问题从「后工序」往前查——若口型错,先看声音对不对,再看视频,再看原始帧,逐级定位根因,不要一上来重生成整条。
08 · 运营分发与变现
知识截止 2026-09。片子做完只是开始。本节讲怎么发出去、怎么赚钱、怎么不踩合规雷。
一、平台规则与入驻
- 抖音/快手:需实名+资质,AI 生成内容须显著标识;投流生态成熟。
- 视频号:私域分发强,适合沉淀粉丝。
- 红果短剧:免费模式,适合长男频剧。
- 番茄/小程序:IP 源头与变现闭环。
- 出海:ReelShort、TikTok,译制或原创,注意当地合规。
二、投流基础(IAP)
- IAP(信息流投放):花钱买曝光,按转化(解锁/付费)计费。
- ROI:回收/投放,核心看单集回本周期。
- 关键指标:完播率(最重要)、互动率(赞评转)、涨粉、付费率。
三、数据指标与优化
| 指标 | 含义 | 优化方向 |
|---|---|---|
| 完播率 | 看完比例 | 强钩子+快节奏(见 02/06) |
| 互动率 | 赞评转 | 情绪强、留悬念引评论 |
| 涨粉 | 关注转化 | 人设/系列化 |
| 付费率 | 解锁付费 | 爽点密集、卡点收费 |
- A/B 测封面/前两秒;数据差先改钩子与节奏,不急着换画风。
四、变现方式
- 平台分账:按播放/完播分润。
- 付费解锁:IAP 点播(主流)。
- 品牌定制:为客户做定制漫剧广告。
- IP 衍生:爆款改动漫/影视(如次元折叠计划,S+ 投院线)。
- 带货/引流:剧情植入商品或服务。
五、IP 授权合规
- 改编小说/IP 须走正版授权渠道(如番茄/次元折叠计划),勿私自改编有版权作品。
- 自创 IP 也要注意:避免模仿特定公众人物、避免侵权元素。
六、深度合成合规红线(务必)
- 成片加显著 AI 生成标识(平台强制)。
- 肖像/声线/音乐取得授权或来自无版权源。
- 涉政/低俗/侵权内容禁发。
- 各平台《用户协议》与生成内容授权以官方原文为准(本库不构成法律意见)。
七、与前面环节的衔接
- 剧本阶段(
02)就要考虑「哪集设付费卡点」「钩子是否够强」。 - 视觉/声音(
03/05)决定完播;后期(06)决定点击。 - 分发前过
07QA + 本節合规。
09 · 术语表(漫剧黑话字典)
知识截止 2026-09。AI 读取漫剧相关资料时,遇到下列词应映射到本表定义。每条含「英文/别名」便于跨源对齐。按拼音/主题排序。
A–C
- AIGC 微短剧:用 AI 生成画面/声音的微短剧。别名:AI 漫剧、AI 短剧。
- Cliffhanger(悬念结尾):每集末尾留未解悬念,逼看下一集。
- 超分(Super-Resolution):把低分辨率图/视频放大变清晰,如 Real-ESRGAN。
D–F
- 定格(Freeze Frame):画面静止的瞬间,常用于转场或强调。
- 定妆图(Character Key Art):角色最终定稿的全身/半身设定图,用作参考。
- 豆包(Doubao):字节跳动大模型,中文语感好,与即梦同生态;常用于单集剧本扩写、分镜脚本拆解、直接产出画面/视频提示词。
- DeepSeek:深度求索大模型,逻辑与结构化强;常用于选题/梗概/分集大纲/角色卡(需严谨分层)。
- 动态漫:静态漫画 + 轻微镜头运动/口型,最易量产的漫剧形态。
- 分镜(Storyboard):把剧本拆成镜头序列的表/图,含景别/动作/台词/时长。
- 分镜表(Shot List):分镜的表格化落地,标准 14 字段(镜头号/景别/时长/画面/运镜/台词/情绪/音效/BGM/提示词/模型/一致性/音频/状态),见
12_分镜表实操与模板.md。 - 风格锚(Style Anchor):用定稿图作 IP-Adapter 参考锁整剧画风,权重约 0.3。
G–J
- 钩子(Hook):开篇 3 秒内抓住观众的东西(冲突/悬念/反转)。
- IP-Adapter:免训练的图像提示适配器,给参考图即控制生成形象;权重 0.6–0.8 最稳——需要更强锁脸时才上探 0.8–0.9(代价:画面易僵、细节变糊)。⚠️ H3 系工作流(如
i2v_minimax.json)没有独立 IP-Adapter 节点,其"一致性"靠首帧风格锚实现,此时 IP-Adapter 权重不生效(见13_双流程实战4.9 / 9.3;工作台的ipAdapterWeight仅对含 IP-Adapter 节点的 SDXL/FLUX 工作流有效)。注意与上一条「风格锚」区分:锁画风时权重约 0.3,锁脸(人物一致性)时 0.6–0.8——两者用途不同、数值不能混用。 - IP(Intellectual Property):这里指可改编的剧情/角色版权资产。
- 即梦(Jimeng):字节跳动 AIGC 平台,出图模型 Seedream 5.0、出视频模型 Seedance 2.0/2.5;核心功能"角色一致性/人物一致性强化"开关(参考强度 0.6–0.85)。
- 景别(Shot Size):远/全/中/近/特写。
- 剧本(Script):漫剧的文字底本,含剧情与台词。
- 卡点(Beat Sync):画面/剪辑节奏对齐音乐鼓点。
K–L
- 口型同步(Lip-sync):让角色嘴型匹配语音。工具:LivePortrait / Wav2Lip / EchoMimic / LatentSync。
- 夸大(?)— 无。
- LoRA(Low-Rank Adaptation):低秩微调,把角色特征训进模型权重,强一致;需 15–30 张参考图。
- łączenie — 忽略。
- 链路(Pipeline):从剧本到成片的工序链。
- 连贯性 — 见一致性。
- 亮度/光影一致 — 见一致性。
M–P
- 漫剧:AI 生成的、带剧情短片,通常竖屏、单集 30–90 秒。源自「动态漫画」。
- Seedream 5.0:即梦出图模型(2026),文生图/图生图,支持角色一致性。
- Seedance 2.0/2.5:即梦出视频模型(2026),五要素导演法(主体→动作→镜头→场景→风格),支持 @Image/@Video/@Audio 参考标签、首尾帧。
- 角色一致性(Character Consistency):跨镜头角色不变脸;即梦用"角色一致性开关",本地用 IP-Adapter/PuLID/FaceID/InstantID + 定妆图。
- MiniMax H3(海螺):全模态视频模型,画面+原生声音一次出;模式 FL2VA/Ref2VA。
- 模型(Model):生成图像/视频/声音的 AI 权重,如 Wan2.2、LTX、FLUX、SDXL。
- PuLID:免训练锁脸方案,比 IP-Adapter 锁脸更强但占显存,适合关键帧精修。
Q–S
- 前 3 秒法则:钩子必须在前 3 秒出现。
- 强一致性:跨镜头角色/场景不变,靠 LoRA/参考图实现。
- 情绪曲线:一集内情绪起伏的曲线,避免平。
- FL2VA(首末帧模式):文生视频或用首/尾帧图生视频,H3 的一种模式。
- Ref2VA(参考模式):喂多图/视频/音频作参考,H3 锁角色脸/声线的模式。
- 三视图:角色正面/侧面/背面图,用于锁脸与训练。
- 色板(Color Palette):角色/场景的配色方案,维持一致性。
- 爽点(Payoff):观众情绪释放点,漫剧命脉。
- 首尾帧(First/Last Frame):图生视频时给定起止两帧控构图。
T–Z
- TTS(Text-to-Speech):文本转语音,如 GPT-SoVITS / F5-TTS / Fish Speech。
- 投流(Paid Acquisition):花钱买曝光(IAP 信息流投放)。
- 完播率(Completion Rate):看完比例,核心数据指标。
- 微短剧:单集 1–3 分钟的短剧,竖屏为主。
- 粗剪(Rough Cut)/ 精剪(Fine Cut):剪辑两阶段——粗剪定结构与节奏,精剪调细节与卡点。
- 场记(Continuity):记录跨镜头一致性细节(服装/道具/光影/位置),防穿帮。
- 定版(Final Lock):成片最终确认、不再改动的状态,进入发布流程。
- IAP(In-App Purchase):应用内付费,短剧常见变现。
- ReelShort:出海短剧平台(中文短剧译制/原创)。
- 一致性(Consistency):跨镜头角色/场景/画风/光影不崩。
- 运镜(Camera Movement):镜头运动,如推/拉/摇/移/环绕。
- 倍速(Playback Speed):剪辑时加速,用于动作戏。
- 跃迁/反转(Twist):剧情意外转折。
出海与本地化
- 出海(Going Global):把漫剧发行到海外市场(ReelShort/DramaBox/TikTok)。
- 本地化(Glocalization):全球本地化,保留普适骨架替换语言/文化。
- 文化折扣(Cultural Discount):题材因文化差异在海外吸引力下降;豪门/狼人低、古装权谋高。
- 译制(Subtitling):加目标语言文字幕,保留原声。
- 配音(Dubbing):母语配音,口型需重对。
- 重制(Remake):用本地面孔/场景重拍,文化梗替换。
- ReelShort / DramaBox:出海短剧平台(中文短剧译制/原创)。
- EU AI Act:欧盟 AI 法案,要求 AI 生成内容显著标识。
工具与模型名词速查
- ComfyUI:节点式本地 AI 工作流平台。
- Wan2.2 / LTX / FramePack / AnimateDiff:图生视频模型(Wan 质量高、FramePack 口播省显存)。
- GPT-SoVITS / F5-TTS / IndexTTS / Fish Speech:语音克隆/合成。
- LivePortrait / Wav2Lip / EchoMimic V2 / LatentSync:口型同步。
- ControlNet / OpenPose / Canny / Depth:构图/姿态/轮廓/空间控制插件。
- Sage 注意力补丁(SageAttn):加速并降显存,强动作偶发雪花噪点。
- LTX2.3:Lightricks 开源音视频同步模型,ComfyUI 原生支持;GGUF 量化 8G 显存即可跑,原生音频输入、唇同步自然、长时序稳定;"20 宫格工作流"可一次性把 20 分镜拼大图动画化成连贯漫剧。
- 20 宫格(20-panel grid):把多个分镜拼成一张大图一次性动画化的工作流,覆盖剧情多、效率高(对比四宫格约 12 秒)。适合日漫/韩漫/动态漫画/竖屏短剧。
- ComfyUI-Jimeng-API:GitHub 节点(fkxianzhou 等维护),把即梦/豆包的 Seedream(出图)/ Seedance(出视频)封装成 ComfyUI 节点,支持多 Key、配额控制、异步并发,让即梦出图出视频直接进本地画布,免网页端/本地来回切。
- 导演台(MiniMaxH3 Director):
ComfyUI_MiniMaxH3_Director节点,多段生成(fl2v 首尾帧 / r2v 参考锁脸),做长剧/短剧分段一致性。 - Qwen-AIO:2026 漫剧节点大合集(含 QwenImageEdit 角色一致性超强、Qwen Image 2512、Qwen3-TTS),被多名保姆级教程列为"最强漫剧节点"。
- Dify:开源 AI 编排平台,做"大脑"调度编剧/导演/提示词 Agent,配合 ComfyUI 做全自动化生产线(Flux 出图 / LTX 视频 / TTS 配音)。
- H3 Community License:MiniMax H3 本地权重许可,排除 US / EU / UK / South Korea 适用地域(这些地区不能跑本地权重,云 API 版 Hailuo 不受限)。
10 · 案例库(爆款拆解 + 反面案例)
知识截止 2026-09。案例用于建立「好漫剧长什么样」的判断基准。以下为教学性典型示例(非特定真实作品),结构可复用。
一、爆款拆解模板(分析任何一条漫剧都用这 8 问)
- 题材与人群?
- 钩子是什么(前 3 秒)?
- 爽点类型与密度(每 X 秒一个)?
- 单集结构(起承转合 + 结尾悬念)?
- 视觉:画风/一致性/运镜?
- 声音:口型/声线/BGM/音效?
- 为什么火(情绪/缺口/时势)?
- 可复制点 vs 不可复制点?
二、爆款示例 A:甜宠《总裁的隐藏新娘》(虚构典型)
- 题材/人群:女频甜宠,18–35 女性。
- 钩子:第 1 秒,婚礼现场新郎当众撕婚约:「我娶的不是你,是她。」镜头切到角落女主冷笑。
- 爽点:每 15–20 秒一个小糖/小打脸(误会→解→撒糖),每集末尾大反转悬念。
- 结构:相遇误会→身份错位→打脸渣男→双向奔赴;单集 60 秒 = 钩子 3s + 误会 15s + 撒糖 25s + 反转悬念 17s。
- 视觉:半写实韩系画风,IP-Adapter 锁女主脸(桃花眼/栗色卷发/珍珠耳钉),一致性稳。
- 声音:女主清冷声线、男主低音,原生音画同步(即梦/海螺),BGM 甜系钢琴。
- 火因:情绪精准(爽+甜)、钩子强、脸稳不跳、竖屏适配。
- 可复制:钩子公式 + 爽点密度 + 参考图锁脸;不可复制:演员/IP 独家。
三、爆款示例 B:逆袭《废柴觉醒》(虚构典型,男频)
- 题材/人群:男频逆袭/龙傲天,16–40 男性。
- 钩子:被当众羞辱「你这废物也配?」→ 下一秒金手指觉醒,眼神骤变。
- 爽点:打脸反派(每集至少 1 次),身份曝光递进。
- 结构:受辱→觉醒→小试牛刀→大反派登场→终极打脸。
- 视觉:动态漫(最易量产),强对比光影,动作拆 5 秒内短镜避免崩。
- 声音:旁白燃系 + 战斗音效,卡点剪辑对齐鼓点。
- 火因:爽感直接、节奏快、量产稳定。
- 可复制:动态漫 + 卡点快剪 + 短镜避崩。
四、爆款示例 C:悬疑《沉默的房间》(虚构典型)
- 钩子:监控画面里,死者竟在案发后第 3 天出现在自家客厅。
- 爽点:真相逐层揭开(每次释放一个信息 + 一个小反转)。
- 结构:悬念链,每集末尾抛更大疑问。
- 视觉:仿真人/半写实,暗调,光影统一靠固定 LoRA。
- 声音:环境音压迫感强,对白短句利于口型。
- 火因:强悬念 + 信息释放节奏好。
- 可复制:悬念链写法 + 信息分次释放。
五、反面案例与修复
| 反面案例 | 问题 | 修复 |
|---|---|---|
| 开篇 10 秒介绍背景,无钩子 | 完播率极低 | 直接上冲突/悬念,背景靠动作带 |
| 女主第 3 镜变脸 | 跳脸,出戏 | 上参考图/LoRA,特征词压 2–4 个 |
| 对白长段独白,嘴型乱 | 口型错位 | 拆 ≤12 字短句,或改画外音 |
| 单镜 15 秒无变化 | 节奏拖 | 拆 2–5 秒快剪,卡 BGM 点 |
| 画风前 5 集动漫后转写实 | 风格漂移 | 固定单一底模 + 风格锚 |
| 大动作单段 15 秒武打 | 肢体崩坏 | 拆 5 秒内,后期拼接 |
| 无 AI 标识直接发 | 合规风险 | 加显著 AI 生成标识 |
| BGM 压过对白 | 听不清 | 混音对白优先,响度统一 |
六、补充案例
示例 D:古装权谋《天下英雄》(严肃向典型,男频/全龄)
- 题材/人群:古装权谋/武侠,男性与全龄向,偏好「智斗 + 身份谜题」。
- 钩子:第 1 秒,主角被当众剥夺姓氏:「陆家庶子,不配姓陆。」下一镜他在雪地拾起断剑。
- 爽点:非「直接打脸」,而是「布局反杀」——每集一个小局(识破阴谋/借力打力/身份递进),爽感来自「观众比反派先看懂」。
- 结构:受抑→设局→破局→身份曝光(递进)→终极权谋对决;单集 60 秒 = 钩子 3s + 困局 18s + 妙手 22s + 余波悬念 17s。
- 视觉:半写实国风,IP-Adapter 锁男主(眉骨旧疤/玄袍暗金云纹),暗金色调统一靠风格锚。
- 声音:旁白沉稳 + 古琴/大鼓 BGM,对白短句(文言白话语感但不拗口)。
- 火因:信息密度高但不注水,智斗取代纯爽,黏住「爱动脑」人群。
- 可复制:钩子公式(剥夺/误解)+ 困局→妙手结构 + 参考图锁脸;不可复制:原著 IP 与人物弧深度。
示例 E:重生复仇《她重生后》(女频典型)
- 钩子:上一世被推下楼,睁眼回到出嫁前一夜。
- 爽点:先知复仇(躲坑/反杀/提前布局),每集一个「前世遗憾 this 世补足」。
- 结构:重生觉醒→避开原悲剧→反制仇人→真相与救赎。
- 视觉:写实都市,IP-Adapter 锁女主(泪痣/短发),冷调转暖调体现心境。
- 声音:女主声线从怯懦转冷静(同一角色声线可随成长微调,但需标注)。
- 火因:「重生 + 逆天改命」强情绪 + 因果爽感。
- 可复制:重生设定 + 前世今生对照结构。
示例 F:出海译制爆款拆解(ReelShort 型)
- 钩子(译制):英文「You fired me? I'm your new boss.」对应中文「你开了我?我是你新老板。」
- 爽点:与国内同构(打脸/身份曝光),但节奏更慢半拍——欧美观众对长对白容忍度更高,单句可放宽到 ≤16 字(英文音节),卡点仍要。
- 结构:与国内一致,但首集需更长铺垫建立语境(文化折扣)。
- 视觉:仿真人/半写实为主(欧美偏好真人质感),一致性要求更严(脸崩在欧美评论区更敏感)。
- 声音:母语配音优先于译制字幕(ReelShort 主流为英语原生配音);口型需对齐英文。
- 火因:强类型 + 文化折扣低题材(狼人/豪门/霸总) + 母语配音。
- 可复制:题材选型(跨文化普适)+ 母语配音 + 节奏本地化;详见
11_出海专项.md。
七、补充案例(续)
示例 G:男频战神《战神归来》(虚构典型,无敌/神豪流)
- 题材/人群:男频无敌流/神豪,16–40 男性。
- 钩子:被丈母娘当众羞辱「穷鬼也配娶我女儿?」→ 下一秒手机弹出「您尾号 **** 到账 9.8 亿」。
- 爽点:打脸递进(羞辱者→围观者→隐藏大佬),每集至少 1 次身份曝光。
- 结构:受辱→金手指/财富觉醒→小试牛刀→大反派登场→终极打脸。
- 视觉:写实都市 + 强对比光影,动作拆 ≤3s 短镜避崩,豪车/大场面靠参考图。
- 声音:旁白燃系 + 重低音 BGM,卡点对齐鼓点。
- 火因:情绪直给、阶层逆袭共鸣强、量产稳定。
- 可复制:受辱→反转公式 + 卡点快剪;不可复制:演员/IP 独家。
示例 H:女频甜宠《偏偏喜欢你》(虚构典型)
- 钩子:「我结婚了,对象是你最讨厌的人。」新娘笑看镜头。
- 爽点:误会与撒糖交替,每 15–20s 一个小糖/小打脸,集末大反转。
- 结构:误会→身份错位→打脸渣男→双向奔赴。
- 视觉:半写实韩系,IP-Adapter 锁女主(桃花眼/栗色卷发/珍珠耳钉),脸稳。
- 声音:清冷女声 + 低音男声,甜系钢琴 BGM。
- 火因:情绪精准、脸稳不跳、竖屏适配。
- 可复制:钩子公式 + 爽点密度 + 参考图锁脸。
示例 I:知识科普口播《3 分钟看懂 X》(虚构典型,知识漫剧)
- 钩子:「你以为 X 是这样?错,真相颠覆认知。」(前 3s 抛反常识结论)
- 爽点:每 20–30s 一个"原来如此"的信息 payoff,节奏替代情绪爽。
- 结构:反常识钩子→拆解误区→给出机制→行动建议;单集 60–90s。
- 视觉:数字人/半身口播为主(FramePack + IP-Adapter 锁主讲人),少场景切换。
- 声音:主讲人声线稳定 + 轻 BGM,关键术语字幕高亮。
- 火因:信息密度高、完播与收藏兼得,可批量矩阵。
- 可复制:钩子公式 + 信息 payoff 密度 + 数字人量产;不可复制:选题判断力。
八、案例记录模板(你自己怎么记)
每做/每拆解一条漫剧,按下面 8 问记一笔,长期积累即成你专属的判断基准。可直接复制到笔记软件。
【案例名】______(虚构/真实·注明) 【题材人群】______ 【钩子(前3s)】______ 【爽点类型/密度】每___秒一个 【单集结构】起____ 承____ 转____ 合____ + 结尾悬念____ 【视觉】画风____ / 一致性手段____ / 运镜____ 【声音】声线____ / 口型____ / BGM____ / 音效____ 【火因】情绪____ / 缺口____ / 时势____ 【可复制点】______ 【不可复制点】______ 【我的结论/可借鉴】______
- 拆解别人爆款:填前 8 问,重点标「可复制 vs 不可复制」。
- 复盘自己成片:加「我的结论」一栏,记这次哪里踩坑、下次改哪。
- 攒到 20+ 条后,按题材聚类,能快速判断"这类题材的钩子公式是什么"。
九、给 AI 的用法
- 写新剧本前,用「拆解模板」先分析 2–3 个对标爆款,提取可复用的钩子/爽点/结构。
- 自检成片时,对照「反面案例」逐条排除。
- 建立自己的案例库:每做一条,按第八节模板记一笔,长期积累判断基准。
11 · 出海专项(Glocalization)
知识截止 2026-09。出海不是「把国内片加个字幕」,而是「题材/节奏/声音/合规」全链路的本地化。本节讲漫剧出海的关键差异与做法。先读01平台、08变现合规,再读本篇。
一、为什么出海(与国内差异)
| 维度 | 国内 | 出海(欧美为主) |
|---|---|---|
| 平台 | 抖音/视频号/红果 | ReelShort、TikTok、YouTube Shorts、DramaBox |
| 主流题材 | 甜宠/逆袭/古装权谋 | 豪门/狼人/霸总/狼人+言情(文化折扣低) |
| 画风 | 半写实/动态漫都行 | 仿真人/半写实为主(欧美偏好真人质感) |
| 配音 | 中文原生 | 母语配音优先(英语原生最稳) |
| 节奏 | 前 3 秒钩子、单句 ≤12 字 | 钩子同样强,但单句可放宽到 ≤16 字(英文音节) |
| 付费 | IAP 点播成熟 | 同样 IAP,但单价/汇率差异大 |
核心结论:出海的关键不是技术,是 Glocalization(全球本地化)——保留「强钩子+爽点密度」的普适骨架,替换题材、语言、配音、文化梗。
二、平台与分发差异
| 平台 | 定位 | 适配做法 |
|---|---|---|
| ReelShort | 中文短剧译制/原创出海头部 | 英语原生配音、豪门/狼人题材 |
| DramaBox | 多语种分发 | 多语言字幕+配音并行 |
| TikTok | 流量池大、算法分发 | 竖屏、前 3 秒强钩子、话题标签 |
| YouTube Shorts | 长尾流量+广告分账 | 适合「免费前几集+引流付费」 |
| 本地短剧 App | 东南亚/拉美新兴市场 | 译制为主,成本低 |
三、本地化三层次
- 译制(Subtitle):最浅。字幕翻译,保留原声。缺点:口型对不上、沉浸感弱。工具:manga-image-translator(图内文字)、常规字幕机翻+人工润色。
- 配音(Dubbing):中。母语配音,口型需重对(LivePortrait/Wav2Lip 对齐目标语言)。主流做法。
- 重制(Remake):深。用本地面孔/场景重拍(AI 换脸+换参考图),文化梗替换。成本最高但转化最好。
推荐起步:译制试水 → 数据好再上母语配音 → 爆款再重制。
四、题材选型(文化折扣低 = 易出海)
| 题材 | 文化折扣 | 说明 |
|---|---|---|
| 豪门/霸总 | 低 | 全球通吃 |
| 狼人/吸血鬼( paranormal) | 低 | 欧美原生偏好 |
| 逆袭/打脸 | 低 | 情绪普适 |
| 甜宠 | 中 | 需本地化甜度 |
| 古装权谋 | 高 | 需大量语境铺垫,慎选 |
| 婆媳/家庭 | 高 | 本土文化强,难出海 |
五、合规差异(重点,各地不同)
- 欧盟:《EU AI Act》要求 AI 生成内容标识(透明度义务),深度合成需标注;数据受 GDPR 约束。
- 美国:FTC 对「AI 生成误导」有披露要求;各州对深伪(deepfake)有立法。
- 各国平台协议:ReelShort/DramaBox 均有「AI 内容标识 + 内容安全」条款,以官方原文为准。
- 通用红线:肖像/声线授权、无涉政/色情/侵权、显著 AI 标识——比国内更严,务必先查目标市场法规。
本库不构成法律意见。出海前建议就目标市场合规做专项核查。
六、工具与模型差异
- 配音:英语/多语种优先 GPT-SoVITS(需英样本)、Fish Speech(多语种稳)、IndexTTS;或直接使用支持英语的云端 TTS。
- 口型:目标语言口型需重对,LivePortrait/Wav2Lip 支持多语种;云端(H3/即梦)若支持目标语言原生音画同步则最省事。
- 画风:欧美偏好仿真人,注意「恐怖谷」风险(见
03风格定义),建议半写实起步。 - 参考图:用本地化面孔作参考图/LoRA,避免「中国脸」在欧美出戏。
七、节奏与数据差异
- 节奏:欧美观众对长对白容忍度更高,但卡点剪辑仍有效;首集需更长铺垫(文化折扣)。
- 数据:关注完播率、付费率、单集回本周期(ROI);不同市场汇率与付费力差异大,需分市场核算。
- A/B:分市场测封面/前两秒/题材,不套用国内结论。
八、出海工作流(建议)
1. 选题材:文化折扣低(豪门/狼人/逆袭) 2. 国内打样:先用 H3/即梦 出中文版验证钩子+爽点 3. 译制试水:加英文字幕投 TikTok/YouTube 测数据 4. 母语配音:数据好→英语原生配音(口型重对) 5. 重制升级:爆款→本地面孔重制 6. 分平台分发:ReelShort/DramaBox/本地 App 7. 合规核查:目标市场标识/授权/内容安全
九、给 AI 的用法
- 判断一条漫剧能否出海:先看题材文化折扣(第四节)。
- 给出海片做本地化:按「译制→配音→重制」三层次递进,不要一步到位。
- 自检出海合规:对照第五节各地要求,缺标识/授权即拦截。
12 · 分镜表实操与模板(Storyboard Practice)
知识截止 2026-09。本模块是 03_新手30天上手路线与分镜表模板.md 里「分镜表模板」的实操版:模板告诉你"有哪些列",本模块告诉你"每一列怎么填才不会出事"。AI 在生成分镜或把剧本转成可生产清单时,应严格按本规范。
一、为什么分镜表是漫剧的"施工图纸"
漫剧是"先有图纸、再批量施工"的工业流程。没有分镜表,会出现三种典型事故:
- 跳脸:前后镜头提示词前缀不一致,角色特征漂移。
- 接不上:相邻镜头没标首尾帧/衔接关系,剪辑处硬切跳戏。
- 节奏崩:单镜过长导致模型崩坏(闪烁/鬼手)或完播率掉。
分镜表 = 给"人"看的拍摄计划 + 给"AI"看的结构化指令。一个好分镜表,应能让另一位创作者或 AI 只看表就复刻出这条片子。
二、标准字段定义(14 列)
| 字段 | 作用 | 填写要点 |
|---|---|---|
| 镜头号 SC | 序号与剪辑顺序 | SC01、SC02…;重拍用 SC02b 不覆盖原行 |
| 景别 | 远/全/中/近/特写 | 决定显存与崩坏风险:特写易鬼手,远景易糊 |
| 时长(s) | 该镜头持续秒数 | 单镜 ≤5s 是黄金线,动作戏 ≤3s,口播可 8–12s |
| 画面内容 | 这一镜发生什么 | 动词开头:"主角推门""刀光闪过",忌形容词堆砌 |
| 运镜 | 推/拉/摇/移/固定/环绕 | 固定最稳;环绕最易闪;首次用固定建立一致性 |
| 台词/旁白 | 该镜配音文本 | 短句 ≤12 字(中文)利于口型;长句拆镜 |
| 情绪 | 该镜情绪标签 | 紧张/甜/燃/悬疑…用于情绪曲线自检 |
| 音效 SFX | 环境/动作音 | 风声、开门、刀鸣…与 BGM 分层 |
| BGM | 配乐段 | 标注曲风与起止,避免全程同一首 |
| 生图提示词(核心) | 喂给绘图模型的词 | 全剧统一前缀 + 仅改动作;特征词压 2–4 个 |
| 视频模型 | Wan2.2 / 即梦 / H3… | 标清用哪种,便于排查崩坏来源 |
| 一致性方案 | IP-Adapter/PuLID/LoRA | 跨镜头锁脸手段,关键帧标注更强方案 |
| 音频文件 | v01.wav 路径 | 与台词字段对应,便于对口型 |
| 状态/备注 | 进度 + 衔接说明 | 待生成/已修脸/已配音;备注写"首尾帧接 SC01" |
三、填写纪律(来自踩坑经验,必须遵守)
- 前缀统一:全剧提示词核心前缀写死(角色名 + 风格 + 画幅),只改动作部分。例:
photorealistic, cinematic, 30s woman, jet-black bob, mole under left eye, 9:16,+ 动作。 - 首尾帧必填:相邻镜头若需顺滑衔接,下游镜头必须标注"首尾帧接 SC0X",否则硬切跳戏。
- 单镜 ≤5s:超出的拆成 2–3 个短镜,后期拼接。这是防闪烁/鬼手的第一原则。
- 台词短句化:对白按 ≤12 字切分;长独白改画外音或拆镜,否则口型必乱。
- 景别分级规避:大特写手部、极限表情优先避开;必须时后期修复/遮挡。
- 状态可追溯:每行状态用 待生成 → 生成中 → 已修脸 → 已配音 → 已合成,便于追进度与复盘。
四、合格样例(60 秒成片 · 8 镜完整分镜)
题材:女频甜宠「走廊偶遇」钩子片段。统一前缀:photorealistic, cinematic, 28s woman, jet-black bob, mole under left eye, pearl earring, soft side-light, 9:16,
| 镜头号 | 景别 | 时长 | 画面内容 | 运镜 | 台词/旁白 | 情绪 | 生图提示词(核心) | 视频模型 | 一致性 | 音频 | 状态 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| SC01 | 近景 | 4 | 女主在走廊尽头回头 | 缓慢推镜 | "你终于来了" | 紧张 | …she turns head, corridor | 即梦 | IP-Adapter | v01.wav | 已合成 |
| SC02 | 中景 | 3 | 两人对峙 | 固定 | —— | 压迫 | …two facing, tension | 即梦 | IP-Adapter | sfx_door | 已合成 |
| SC03 | 特写 | 3 | 男主冷笑抿唇 | 固定 | —— | 玩味 | …man smirk close-up | Wan2.2 | IP-Adapter+PuLID | sfx_breath | 已合成 |
| SC04 | 近景 | 5 | 女主垂眸又抬眼 | 微摇 | "我以为你不敢来" | 试探 | …she looks down then up | Wan2.2 | IP-Adapter | v04.wav | 已合成 |
| SC05 | 中景 | 4 | 男主逼近一步 | 推进 | —— | 压迫 | …man steps closer | 即梦 | IP-Adapter | sfx_step | 已合成 |
| SC06 | 全景 | 3 | 走廊灯光忽暗 | 固定 | —— | 悬疑 | …corridor light dims | 即梦 | 风格锚 | sfx_light | 已合成 |
| SC07 | 近景 | 5 | 女主轻笑转身 | 环绕 | "那就…陪你玩玩" | 反转 | …she smiles turns | Wan2.2 | IP-Adapter+PuLID | v07.wav | 已合成 |
| SC08 | 特写 | 3 | 男主眼神骤变(钩子收) | 固定 | —— | 悬念 | …man eyes sharpen | Wan2.2 | IP-Adapter+PuLID | sfx_sting | 已合成 |
衔接说明:SC01→SC02 用首尾帧接;SC04 微摇不宜超 5s;SC07 环绕仅 5s 控闪;情绪曲线:紧张→压迫→玩味→试探→压迫→悬疑→反转→悬念,全程不平。
五、从分镜表到生产的字段映射
| 分镜字段 | 落实环节 / 工具 |
|---|---|
| 生图提示词 + 一致性 | 绘图:即梦 / FLUX / SDXL + IP-Adapter / PuLID |
| 视频模型 + 首尾帧 | 生视频:Wan2.2 / 即梦 / H3(FL2VA/Ref2VA) |
| 台词/旁白 + 音频文件 | 声音:GPT-SoVITS / F5-TTS / 海螺原生音 |
| 运镜 + 时长 | 剪辑:剪映 / 达芬奇,卡 BGM 点 |
| 音效 + BGM | 混音:对白优先,响度统一 |
| 情绪 | QA 自检:画情绪曲线,查是否"平" |
六、常见分镜病(与 10_案例库 反面案例对照)
| 分镜病 | 表现 | 修复(改表即可) |
|---|---|---|
| 开篇无钩子 | 前 10s 介绍背景 | 第一镜直接上冲突/悬念,背景靠动作带 |
| 单镜过长 | 15s 武打一段 | 拆成 ≤5s 短镜,后期拼 |
| 台词超长 | 独白 30 字 | 拆 ≤12 字短句或改画外音 |
| 跳脸 | 第 3 镜特征变 | 特征词压 2–4 个 + 参考图/LoRA |
| 风格漂移 | 前动漫后写实 | 全剧单一底模 + 风格锚 |
| 接不上 | 剪辑处硬跳 | 下游镜标"首尾帧接 SC0X" |
七、给 AI 的用法
- 用户给剧本时,AI 应主动生成符合本节字段的分镜表,而非只给剧情概述。
- 生成提示词时,自动套用统一前缀模板,避免跳脸。
- 自检分镜表:检查单镜时长、台词字数、首尾帧衔接、情绪曲线,四项不过不放行。
- 本模块与
03模板互补:03是"列名",本模块是"填法 + 样例 + 病"。
13 · 双流程实战:从剧本分镜到出片(线上 + 本地)
知识截止 2026-09。本篇把"豆包 / DeepSeek 写剧本分镜 → 即梦出图 →(即梦出视频 或 ComfyUI + MiniMax H3 出视频)"两条流水线写成可照做的实操,含可抄提示词、优化技巧、人物一致性 & 剧情连贯性保证。前序模块:02 剧本与叙事工程、03 角色与美术资产、12 分镜表实操与模板。
一、两条流程总览(先选路)
| 维度 | 流程 A · 纯线上 | 流程 B · 混合(本地出视频) |
|---|---|---|
| 剧本 / 分镜 | 豆包 + DeepSeek(两路通用) | 同左 |
| 出图 | 即梦(Seedream 5.0) | 即梦(Seedream 5.0) |
| 出视频 | 即梦(Seedance 2.0/2.5) | ComfyUI + MiniMax H3(本地,INT8 量化) |
| 人物一致性 | 即梦"角色一致性"开关 | 即梦定妆图 → 同时作 H3 首帧/参考图,全链路同一张脸 |
| 配音 | 后期加(剪映 / TTS)或即梦音画同步 | H3 原生带配音(FL2VA 联合生成),少后期对口型 |
| 硬件 | 任意电脑 / 手机 | 需 N 卡 ≥12G 显存(RTX 3060 12G 可跑 INT8) |
| 成本 | 即梦积分 / 会员(有免费额度) | 一次性模型下载 40–60G + 电费,出片零边际成本 |
| 适用 | 新手最快出片、验证创意 | 量大、数据私有、不排队、要原生配音 |
一句话决策:先走 A 跑通带声成片建立手感;要量产百集不崩 / 数据私有 / 原生配音再上 B。两条前半段(剧本分镜 + 出图)完全共用,只差"出视频"这一步。
二、共同前半段:豆包 + DeepSeek 做剧本与分镜
2.1 两个模型怎么分工(不要只用其中一个)
- DeepSeek:逻辑与结构化强,适合选题 / 故事梗概 / 分集大纲 / 角色卡(需要严谨分层、不漏人物锚点)。
- 豆包:中文语感好、与即梦同生态,适合单集剧本扩写 / 分镜脚本拆解 / 直接产出"画面提示词 + 视频提示词"(即梦能直接吃)。
- 推荐组合:DeepSeek 出骨架(梗概→大纲→角色卡)→ 豆包 出血肉(单集剧本→分镜脚本→生图/视频提示词)。两者都免费,可互换。
2.2 分层生成法(不要一次性让 AI 写整剧,这是新手第一大坑)
按 5 步递进,每步确认再下一步:
- 选题 → 2. 故事设定 / 人设 → 3. 分集大纲 → 4. 单集剧本 → 5. 分镜脚本。
每步单独发指令,AI 输出更可控、画面更好生成。
2.3 可直接抄的提示词(5 层结构,DeepSeek / 豆包通用)
你是一名专业的短剧编剧,擅长【题材:古风逆袭 / 都市爽文 / 甜宠 / 悬疑】, 熟悉抖音、快手短剧的快节奏叙事(角色设定层)。 请为我创作一部 6 集、每集 60 秒的竖屏 9:16 AI 漫剧《【剧名】》(任务描述层)。 要求: 1. 前 3 秒强钩子(冲突 / 悬念 / 反转);每 10–15 秒一个小高潮;结尾留悬念(分镜约束层)。 2. 角色数量 2–4 人、场景 ≤3 个,方便 AI 生成(分镜约束层)。 3. 先输出"角色设定表":每人含 姓名 / 年龄 / 性格关键词 / 外貌特征(发型+服饰+标志性配饰)/ 声音风格建议(人设定义层,最关键:这是后续锁脸的锚点)。 4. 再输出"6 集分集大纲":每集 标题 / 开头钩子 / 剧情发展 / 爽点 / 结尾悬念 / 主要角色 / 主要场景。 5. 输出格式为 Markdown 表格(格式要求层)。
要点:外貌描述必须具体到发型、服饰、标志性特征(如"左眼下小痣""银色细框眼镜"),这些是豆包/即梦保持角色一致性的锚点,后续提示词里原样粘贴、不临时改写。
2.4 单集剧本 → 分镜脚本(豆包,含可直接喂即梦的提示词字段)
请把第 1 集扩写成完整分镜脚本。要求: 1. 每个镜头 3–5 秒; 2. 每镜含:镜头编号 / 时长 / 景别 / 画面内容 / 角色动作 / 表情 / 运镜 / 台词·旁白 / 音效建议; 3. 额外输出两列:AI 绘图提示词、AI 视频提示词(方便直接复制到即梦 / H3); 4. 保持角色一致性,不要出现大规模群像和复杂打斗; 5. 风格统一为:【写实国风 / 日系赛璐璐 / 半写实韩系】。
2.5 画面提示词固定结构(给即梦 / H3 生图生视频都好用)
[主体角色描述] , [动作 / 表情] , [环境场景] , [构图 / 景别] , [光影氛围] , [画风关键词] , [质量词]
示例:20 岁少女,在樱花树下回头微笑,长发被风吹起,粉色花瓣飘落,特写镜头,柔和的午后阳光,浅景深,日系清新风格,4K 高清。
2.6 提示词优化 6 招(决定成败)
- 抽象 → 视觉化:把"温暖的氛围"改成"午后金色阳光透过百叶窗洒在木地板上,空气漂浮微尘";把"他很难过"改成"女主眼眶泛红,双手攥紧衣角,低头沉默"。
- 5W1H 写动作:谁、在哪、做什么、什么情绪、怎么拍、几秒。
- 单镜 ≤5 秒:超过模型上限时长必崩、必闪。
- 台词 ≤12 字 / 短句:长句 AI 配音气短、口型错位。
- 首尾帧衔接:跨镜头必填首尾帧字段,决定衔接顺滑。
- 定妆图锚定:先出角色定妆图再量产所有镜头,全剧固定一套模型 + 画风关键词,严禁中途切换。
2.7 豆包"万能极简脚本模板"(B站 / 头条爆款验证,30 秒速出)
当只想快速跑通、不写长梗概时,直接用这一条(已被多个实战教程验证有效):
写 30–60 秒爆款竖屏漫剧脚本,题材=【逆袭 / 甜宠 / 悬疑 / 古风】, 开篇 3 秒强冲突,1 主角 1 矛盾,台词 ≤3 句,结尾必留悬念; 输出:镜号 / 景别 / 画面(含可直接生图的视觉描述)/ 台词 / 情绪。
- 进阶变体(结构更稳):「10 秒钩子 → 30 秒冲突 → 1 分钟逆袭 → 20 秒悬念结尾」 四段式,让 AI 按段填充。
- 关键:无论精简还是分层模板,"外貌特征词"必须单独成段、原样粘贴到出图提示词(见 2.3 要点)。
三、流程 A:纯线上(即梦出图 + 即梦出视频)
3.1 即梦出图(Seedream 5.0)
- 万能公式:主体 + 场景 + 风格 + 画质 + 镜头。比例选 9:16(竖屏热门)。
- ⚠️ 先做角色"三视图"再量产(B站 / 头条反复验证的防崩脸第一招):把 2.3 的角色外貌描述粘贴进"文生图",一次性生成 正面 / 侧面 / 背面 各 2–3 张(或一张图里组图 3 视图),挑五官端正、发型服装清晰的一组存相册。之后所有分镜都垫这张图当参考,人物不跑偏。
- 选其中一张最满意的当主定妆图(全剧统一参考锚),其余作多角度备用。
- 注意 Seedream 5.0 / 4.0 的尺寸约束:需 16 像素对齐、宽高比受限、总像素有上限(并非自由尺寸端点),出图前在即梦里选好预设比例(9:16)。
3.2 即梦角色一致性(核心功能)
- 回即梦 → "图生图" → 上传定妆图 → 打开"角色一致性 / 人物一致性强化 / 智能参考"开关(参考强度 0.6–0.85,太高死板、太低忽略参考)。
- B站 实操更稳的做法:上传 2–4 张主角多角度图(即 3.1 的三视图)→ 开启"智能参考" → 全程保持五官不变,比单图参考更抗崩脸。
- 把单镜"画面描述"复制进去,提示词格式:
景别 + 场景环境 + 人物动作表情 + 画风 + 高清。 - 每个镜头出 2–3 张备选,挑五官不畸形、画风统一者,按"镜头01 / 镜头02…"命名保存。
3.3 即梦出视频(Seedance 2.0 / 2.5)
- 五要素导演法(顺序越靠前权重越高):
主体/角色 → 动作/剧情 → 镜头/运镜 → 场景/氛围/光影 → 风格/特效/音频。
- 最稳模板:
[主体详细描述] , [动作/剧情拆分] , [镜头语言+时间轴] , [场景光影] , [电影风格/音频提示] ,高质量,电影感,角色一致性强。 - 参考标签:上传图/视频/音频后,提示词里写
@Image1@Video2@Audio1(最多 9 图 + 3 视频 + 3 音频),如"参考 @Image1 的外貌/服装""口型同步 @Audio1"。 - 参数:创意度 0.3–0.6(太高跑偏)、运动强度 中等(高强度只给快节奏打斗)、时长 5–8 秒(新手别超 8 秒)、固定种子可复现。
3.4 图生视频提示词(最稳,直接抄)
动作 + 运镜 + 风格 + 流畅度
示例:镜头缓慢推近,少女转头,眼神惊讶,治愈系,画面流畅无卡顿,5 秒。
3.5 线上避坑
- 手部畸形 / 五官崩 → 直接舍弃重生成,不将就。
- 单镜超 8 秒 → 拆 2–5 秒快剪,卡 BGM 点。
- 画风漂移 → 全剧固定一套模型 + 风格词,定妆图锁死。
3.6 图生视频提示词库(B站实战验证,直接抄)
- 通用微动:
镜头缓慢推近,人物轻微呼吸/发丝衣料微动,画面流畅无卡顿,电影感,5 秒 - 情绪特写:
微风拂动头发,眼神从疑惑转为坚定,柔光,8K 画质,柔和光影,5 秒 - 场景推进:
镜头缓慢环绕,背景轻微流动,保持人物不变,治愈系色调,6 秒 - 关键:只让"发丝/衣料/光影"微动,主体大幅动作留给后期或拆短镜,否则必崩手/必闪。
3.7 剪映后期节奏(让 PPT 式死图变"活漫剧")
- 每张分镜图时长设 2–3 秒,叠加 "放大 / 推进"运镜(关键帧缩放 105%→110%)让画面不呆板。
- AI 配音选少年 / 御姐 / 温柔声线,语速放慢避免机械感;自动字幕。
- BGM 按题材:悬疑用低沉纯音、甜宠用温柔钢琴、逆袭用渐强鼓点;配光斑 / 暗角滤镜提升氛围。
- 导出 9:16 竖屏 1080P,卡 BGM 节拍剪点。
3.8 选题与新手避坑(B站 / 头条高赞共识)
- 新手三大爆款赛道:甜宠 / 悬疑 / 古风(古风玄幻、都市爽文、甜宠逆袭、悬疑惊悚最稳)。
- 别碰:玄幻大场景、战争群像(新手 hold 不住,必崩)。
- 先做 30 秒短片跑通流程,再拉长到 1–3 分钟,避免中途放弃。
- 节奏铁律:单集 1–3 分钟,开篇 10 秒必抛冲突,每 30 秒一个反转 / 悬念,末尾强悬念驱动追更。
四、流程 B:混合(即梦出图 + ComfyUI + MiniMax H3 出视频)· 针对 RTX 3060 12G
4.1 为什么这么搭
- 即梦出图:角色一致性开关最稳,定妆图质量高,省去本地折腾生图。
- H3 本地出视频:原生画面 + 音频联合生成(FL2VA 任务),自带配音轨、少后期对口型;不排队、数据私有、量产后零边际成本。
- 3060 12G 能跑:H3 用 INT8 量化 + 动态 VRAM 卸载,全流程内存从 123.6G 压到 42.5G,社区实测 12G 显存可跑通。
- 🆕 更进一步:即梦也能进 ComfyUI 画布(GitHub 真实节点
ComfyUI-Jimeng-API,fkxianzhou 维护):它把火山方舟的 Seedream(出图)/ Seedance(出视频)封装成 ComfyUI 节点,支持多 Key、配额控制、异步并发,可一次性把"即梦出图 → H3 出视频"串在同一个 ComfyUI 工作流里,不再网页端和本地两个界面来回切。注意:Seedance 2.0/2.5 高级输入有上限(最多 9 参考图 / 3 参考视频 / 3 参考音频),Seedream 尺寸需 16 像素对齐,用节点时按上限填参考。
4.2 3060 12G 部署 H3 前置清单(节点 + 模型)
- ComfyUI ≥ 0.30.0(桌面版或启动器,旧版缺 H3 节点);模板库
Template Library → Video → MiniMax H3内置三套工作流。 - 安装 H3 节点(GitHub 真实可用,三选一或组合):
comfyui-minimax-h3(官方插件 v0.2.1):基础H3Loader / H3TextEncode / H3VideoGenerate,日志出现Minimax H3 Node Loaded即成功。ComfyUI_MiniMaxH3_Director(AIMixer,导演台):多段生成核心,任务类型fl2v(首尾帧)/r2v(参考主体锁脸,需 REF2VA 主模型)/ 文生视频,做长剧 / 短剧一致性最实用。ComfyUI-Easy-Media(yolain):easy-minimaxH3ToVideo一站式节点,自动按 mode(reference / multi_frames / last_frame)路由到正确核心节点,参考图自动展开,省去手动接线。- 关键参数(社区实测):采样器 res_multistep + simple,steps=25,CFG=1.0,Sigma shift video=12 / audio=3;CLIP Loader 的 type 必须选
minimax(否则提示词编码报错);帧数按 17n+5 对齐(如 124 帧 ≈ 5 秒),训练上限 362 帧 ≈ 15 秒 @24fps,超出必漂移 / 崩坏,长内容用导演台分段。 - 下载 INT8 量化模型(推荐多数人的版本),目录结构:
ComfyUI/models/
├─ diffusion_models/ minimax_h3_fl2va_pruned_int8_convrot.safetensors (主干)
├─ text_encoders/ qwen3vl_32b_minimax_h3_int8_convrot.safetensors (文本编码器,可能成对:主体+尾部,都要放)
└─ vae/ minimax_h3_video_vae_fp16.safetensors
minimax_h3_audio_vae_fp32.safetensors (音频 VAE,原生配音的关键)
- 国内用魔搭下载更快:
modelscope download --model Gluttony10/MiniMax-H3-INT8-CONVROT --local_dir ComfyUI/models/MiniMax-H3。 - 显存仍紧 → 切 GGUF 社区量化(更小但对画质略降);放
diffusion_models重启即识别。 - 加速可选 4-Step Turbo LoRA(
models/loras,提速明显)。
4.3 H3 三种工作流怎么选(关键:用即梦定妆图当输入)
- 图生视频(Image to Video):上传即梦定妆图 / 分镜首帧 → 出动态。最稳,推荐主线。
- 参考生视频(Reference to Video / Ref2VA):喂多图/视频/音频作参考,锁角色脸 + 声线,跨镜头一致性最强。
- 文生视频(Text to Video):纯文字出片,适合空镜 / 转场,不锁特定脸。
4.4 H3 出视频提示词公式(图生视频,直接抄)
主体 + 动作/状态 + 环境光感 + 镜头语言 + 时长
示例:
- 动物:
一只橘猫在洒满阳光的木地板上打滚,午后暖光,浅景深,手持微距质感,轻微胶片颗粒,5 秒 - 人物:
少女在窗前缓缓回头,眼神从疑惑转为坚定,冷调室内光,慢速推近镜头,电影感,6 秒
4.5 H3 原生配音注意
- FL2VA 任务画面 + 音频联合生成,导出 mp4 自带音频轨,省掉"TTS + 对口型"环节。
- 中文口型仍需校一遍(尤其长句);要 2K 分辨率需用"再生成模块"(本地升档或云端),基础 768p。
4.5b ⚠️ H3 本地权重许可证合规(必读)
- MiniMax H3 Community License 明确排除 US / EU / UK / South Korea 的适用地域:在这些地区不能运行本地权重(云 API 版 Hailuo 不受此限)。
- 你在中国大陆本地部署 H3 权重不受影响;但若作品面向海外分发,注意各地 AIGC 标识 / 深度合成法规(见
11_出海专项)。
4.6 时序稳定(闪烁 / 手部 / 漂移)
- 单镜 ≤5 秒,拼接时用首尾帧控制衔接。
- 大动作拆 5 秒内、后期拼接;手部大特写用遮挡 / 后期修。
- 即梦定妆图同时作 H3 首帧/参考 → 全链路同一张脸,漂移最小化。
4.7 3060 速度预期 & 降本
- 3060 12G:5 秒 480p 约 5–10 分钟(取决于模型从盘载入速度,模型放 NVMe 固态更快)。
- 降本:降输出分辨率、装 Turbo LoRA、GGUF 兜底;多镜批量时用批量脚本统一管理提示词+参考图+参数,一次提交自动拼接。
4.8 🆕 备选:LTX2.3 + 20 宫格全本地方案(3060 12G 更省心)
- 若 H3 本地部署嫌重,可换 Lightricks 开源的 LTX2.3(ComfyUI 原生支持,GGUF 量化 8G 显存即可跑,24G 更丝滑):原生音频输入、唇同步自然、长时序稳定(单张大图不易崩)。
- "20 宫格工作流"(UP 主「AI代码侠土豆」等有 JSON 分享):把 20 个分镜拼成一张大图,一次性动画化,直接得接近 1 分钟的连贯漫剧素材,剪映简单拼接即成分镜连贯成片;相比四宫格(约 12 秒)覆盖剧情更多。
- 配套节点:
ComfyUI-KJNodes、ComfyUI-LTXVideo、Qwen3-TTS(角色声音)。适合日漫 / 韩漫 / 动态漫画 / 竖屏短剧创作者,性价比高。 - 取舍:LTX2.3 胜在低显存 + 长时序 + 音画同步;H3 胜在原生 2K + 更强 prompt 遵循 + 导演台分段。两条都能用即梦定妆图当首帧锚定脸。
4.9 🆕 工程化落地:用「漫剧工作台」串起流程 B(你的真实工具链)
你机器上已有一套自研的 AI 漫剧制作工作台(E:\ai漫剧工作台\workbench\,Node.js 零依赖 Web 应用 ai-manju-workbench),它就是把本章流程 B 直接工程化的载体——不用在即梦网页、ComfyUI 界面、EchoMimic 之间手动切来切去。
架构(三层数据模型 + 统一 Provider 层)
- 三层模型:
项目 → 剧集 → 分镜(shot),每个 shot 挂载剧本 / 定妆图 / 视频 / 数字人 / 音频资产与流水线日志。 - Provider 层:
豆包 / DeepSeek(剧本)、即梦(定妆图)、ComfyUI(出图 FLUX / SDXL+IPA + 出视频 H3)、EchoMimic(数字人)。
与流程 B 各环节一一对应
| 流程 B 环节 | 工作台落地 | 模式 |
|---|---|---|
| 豆包 / DeepSeek 写剧本分镜 | Provider 层已接;默认手动粘贴,可开 API 自动(见下方「API 自动模式」) | 手动 / API |
| 即梦出定妆图 | 手动导入路径;或经 ComfyUI-Jimeng-API 节点自动 | 手动 / API-节点 |
| ComfyUI + H3 出视频 | workflows/i2v_minimax.json(H3 图生视频),自动提交 / 轮询 / 下载 | 自动 |
| 角色一致性 | 风格锚 = 首帧图 + ipAdapterWeight 0.3 | 自动 |
| EchoMimic 数字人 | 已接 7860,有音频才跑、无则跳过不阻断 | 自动 |
你的 aki-v7 本地侧已齐(无需新装):D:\ComfyUI-aki-v7\ComfyUI\custom_nodes 已含全套 H3 节点——ComfyUI_MiniMaxH3_Director(导演台)、ComfyUI-MiniMax-H3-StoryBoard、ComfyUI-H3-Multishot、ComfyUI-MiniMaxH3-TeaCache、ComfyUI-H3-Conditioning-Cache-AI-Drama-Production-Suite、h3-studio、comfyui-speed-minimaxH3、comfyui_ipadapter_plus、ComfyUI-GGUF、comfyui-Impact-Pack 等共 34 个。即梦出图还可走本地 FLUX.1-dev GGUF / SDXL+IP-Adapter 工作流(免即梦排队)。
config.json 关键配置(已对齐流程 B)
import.mode: manual:云侧剧本 / 定妆图默认手动粘贴导入(稳定、免密钥);改api则开启自动调用(需填config.api密钥)。video.comfyui:baseUrl=http://127.0.0.1:8188,workflow=workflows/i2v_minimax.json(MiniMax H3 扁平 API 图:首帧注入节点5LoadImage、提示词注入节点6MiniMaxH3ImageToVideo.prompt、画布注入节点6width/height、种子节点7RandomNoise、产物取节点15SaveVideo),canvas=768x1344。imageGen.comfyui:inputDir=D:/ComfyUI-aki-v7/ComfyUI/input,flux_t2i.json(FLUX 定妆图)+sdxl_ipa.json(SDXL+IPA 分镜一致性)。digitalHuman.echomimic:baseUrl=http://127.0.0.1:7860(EchoMimic v2 Gradio)。
跑通步骤(本机,沙箱连不上 localhost):详见工作台目录 流程B跑通Checklist.md——① 起 aki-v7(8188)+ 可选 EchoMimic(7860)→ ② 起工作台 node index.js(8787)→ ③ 豆包 / DeepSeek 写剧本粘贴导入、即梦出定妆图导入路径 → ④ 点 run shot 自动出 H3 视频。
API 自动模式(可选升级):剧本端接豆包 / DeepSeek API 后可自动生成(src/providers/script.js + config.api);出图端装 ComfyUI-Jimeng-API 节点并配 jimeng 工作流即自动。密钥留空则回落 manual,不破坏现有流程。
4.9.1 整集批量一键出图(已落地)
逐镜点「真实生成」适合精修;量产时用整集批量:工作台选中剧集即进入「批量创作」视图,点独立大按钮「🔥 一键出图(整集 N 镜)」,一次生成本集所有尚未出图的分镜。
- 后端
POST /api/projects/:pid/episodes/:eid/genallimages?dryRun=1:遍历本集 shots,对「已有图 / 无生图提示词 /(SDXL+IPA 缺角色锚)」的分镜自动跳过并附原因,其余按统一设置调genImage串行提交到 8188。 - 统一设置(一次配好,整集复用):模型(FLUX / SDXL+IPA / 即梦 Seedream)、尺寸、即梦锁脸强度、共享角色定妆图(整集锁同一张脸)、提示词模板。
- 优先级:每镜自身
imagePrompt> 模板;共享定妆图 > 各镜自有keyframe。即梦走图生图锁脸(定妆图注入jimeng_img的image,强度注入strength)。 - 边界:真实批量占 GPU,耗时≈镜数×单镜出图,串行不并行(单卡保护);沙箱连不上本机 8188,真跑需本机终端
node server.js。
4.10 即梦出图全自动:ComfyUI-Jimeng-API 节点(让流程 B 出图端也自动化)
现状:流程 B 出图端默认走"即梦网页出图 → 导入路径"或"本地 FLUX/SDXL+IPA"。装此节点后,即梦 Seedream 出图 + Seedance 出视频可直接进 ComfyUI 画布,与 H3 视频节点串同一条工作流,免网页/本地来回切——这是出图端全自动的关键一步。
- 仓库:
fkxianzhou/ComfyUI-Jimeng-API(Mu-L 维护同名分支)。支持 Seedream 5.0/4.0 出图、Seedance 2.0/2.5 出视频;多 Key 管理 + 配额限制 + 异步并发。 - 安装:
cd D:/ComfyUI-aki-v7/ComfyUI/custom_nodes && git clone https://github.com/fkxianzhou/ComfyUI-Jimeng-API,重启 ComfyUI;或 ComfyUI Manager 搜「ComfyUI Jimeng API」安装。要求 ComfyUI ≥0.25.1(aki-v7 满足)。无模型需下载,SDK 自装。 - Key 申请:火山方舟(Volcano Ark)控制台 → 开通即梦/豆包视觉模型 → 创建 API Key。
- 配置法 A(节点内):加
Jimeng API Client节点 →key_name选Custom→ 填 Key → 运行一次自动保存(刷新页面后在下拉出现)。 - 配置法 B(文件):插件根目录
api_keys.json.example改名api_keys.json,填customName+key。 - 关键节点(菜单 JimengAI):
火山方舟 API 客户端(必须,工作流起点,加载 key)图像生成(Seedream 5):Pro/Lite;Pro 最多 10 张参考图、默认开提示词优化——角色定妆图经此节点出视频生成(Seedance 2 / 2.5):图生视频(首/尾帧)、多模态参考;2.5 最长 30 秒配额设置:按 key 设video_limit防超额(按量付费,建议放视频工作流)- 与 workbench 串联(已落地):
config.imageGen.comfyui已加"jimeng": "workflows/jimeng_seedream.json"与nodeMap.jimeng(prompt/image/seed/output 字段已配);前端生图步骤下拉已含「即梦 Seedream」选项,选即梦时显示「需先装 Jimeng-API 节点」提示。装上ComfyUI-Jimeng-API节点 + 配火山方舟 Key 后,出图端即全自动(与 H3 视频端共用 8188)。模板workflows/jimeng_seedream.json与《即梦Jimeng节点安装图文Checklist》已随 workbench 一并交付,照做即可。 - 注意事项:Seedream 5 Pro 尺寸约束(16 像素对齐、比例 1:16–16:1、总像素 921600–4194304);按量付费务必接 Quota 节点防超额;Seedream 3 / Seedance 1.0-lite 已进退役路径,勿用旧节点。
- 图生图锁脸(已落地):
jimeng_seedream.json的jimeng_img节点自带image(参考图)+strength(锁脸强度 0.3–0.9)。工作台生图时若第3步已导入定妆图,会把定妆图当参考图注入image、并以「锁脸强度」输入框(默认 0.6)注入strength→ 系列分镜自动锁同一张脸,比单次文生图定妆图更抗跳脸。这是流程 B「人物一致性」在出图端的技术落点(对应第五章一致性表)。 - 即梦图 → H3 首帧联动(已落地):即梦图生图产出的图(资产
image)可直接作 H3 首帧——pipeline 视频阶段在无手动keyframe时自动回退用即梦image资产,注入i2v_minimax.json的首帧节点5(LoadImage → 主节点6MiniMaxH3ImageToVideo.first_frame),实现「即梦锁脸图 → H3 视频」的角色一致性联动(video.js已支持按data/assets/images/解析出图资产路径)。前端「图生视频」步会显示当前 H3 首帧来源(定妆图 / 即梦图)。
4.11 剧集合成:多镜拼整集成片(已落地)
把本集各镜成片按顺序拼成一条完整剧集视频(src/providers/merge.js,POST /api/projects/:pid/episodes/:eid/merge):
- 取片规则:优先各镜后期成片
post.finalPath(含字幕/BGM),无则回退原始video.url;缺失/未出片的镜自动跳过并计数。 - 归一化再拼:各段画布/帧率可能不一致(即梦 Seedream 竖屏图 vs H3 输出),故先用 ffmpeg
scale + pad归一化到统一画布(config.merge.canvas,默认1080:1920@30)、setsar=1、统一 fps;无音轨的段落自动补静音(anullsrc),保证每段都有音轨,再concat -c copy合成(失败回退重编码)。 - 输出:
data/assets/merge/<pid>/<eid>/<eid>_full.mp4,经/api/file/预览/下载;前端「🎬 整集成片(多镜合并)」步可一键触发并预览。 - 依赖:本机 ffmpeg + ffprobe(ffprobe 用于探测音轨;默认与 ffmpeg 同目录,
config.post.ffprobeBin可覆盖)。 - 全链集成:「⚡ 整集一键跑全链」在分发前自动调用合并;若整集成片已存在,落地页会把「整集成片(合并)」卡置顶。
4.12 分发:整集落地页 + 视频号 / 抖音(已落地)
流程 B 最后一环「分发」已在工作台做实(逐镜「分发」步骤):
- 整集落地页:
POST /api/projects/:pid/episodes/:eid/distribute(src/providers/distribute.js)聚合本集所有分镜成片——优先后期成片post.finalPath(含字幕/BGM),无则回退原始video.url——连同封面帧,生成一个响应式 HTML 落地页,写入data/assets/dist/<pid>/<eid>/index.html,经通用资产路由/api/file/<rel>流式访问,可直接外链预览 / 分享。 - 视频号 / 抖音 一键上传:按钮打开对应创作者中心(视频号
channels.weixin.qq.com、抖音creator.douyin.com)并复制本机成片绝对路径到剪贴板,登录后「发布视频 → 选择文件」即可。真实平台 API 自动上传需 OAuth 凭证(暂未接,distribute.js已留可插拔扩展位)。 - 通用资产路由
/api/file/<rel>:统一暴露data/assets/下任意资产(成片 / 图 / 封面 / 落地页 HTML),带目录穿越防护(越界返回 403)。 - 与后期联动:落地页封面取
post.coverPath(ffmpeg 抽帧),成片取post.finalPath;若已合并整集成片则置顶。到此流程 B 全链闭环:剧本 → 出图 → 视频 → 数字人 → 后期 → 合并 → 分发。
五、人物一致性保证(两条流程对照)
| 手段 | 流程 A(线上·即梦) | 流程 B(混合·即梦+H3/ComfyUI) |
|---|---|---|
| 定妆图 | 先做角色定妆图,全剧复用 | 同左,且同图喂给 H3 当首帧/参考 |
| 一致性开关 | 即梦"角色一致性"开关(强度 0.6–0.85) | H3 Ref2VA 锁脸锁声;本地 SDXL / FLUX 用 IP-Adapter(权重 0.6–0.8 最稳,需更强才上探 0.8–0.9) / PuLID / FaceID / InstantID。⚠️ H3 系工作流无独立 IP-Adapter 节点,一致性靠首帧风格锚(见 4.9 / 9.3) |
| 画风 | 固定一套模型 + 风格词 | 同左,禁止中途切换 |
| Seed | 即梦固定种子可复现 | 本地固定 Seed + 角色卡(3–5 张多角度参考图)+ ControlNet 控姿势构图 |
铁律五条:① 先做角色三视图(正/侧/背)再量产,全剧垫同一组参考图;② 先定妆再量产;③ 全剧固定一套模型 + 画风;④ 外貌特征词压 2–4 个、原样粘贴;⑤ 保存成功图的 Seed 值与提示词模板。
六、剧情连贯性保证
- 分镜脚本纪律:跨镜头必填首尾帧;景别按"远→中→特写"循环制造节奏;每 30 秒一个反转 / 悬念(B站 实战节奏),开篇 10 秒必抛冲突。
- 连续镜 / 时间线管理:建"跨镜状态表"(角色位置、服装、道具、光影),防穿帮(即
03的场记)。 - 钩子-爽点-悬念结构不丢:每集结尾强悬念驱动追更;单集只解决一个冲突,别塞太多信息。
- 视觉连贯:风格锚(定妆图)+ 首尾帧,保证跨集画风/光影不漂移。
- 对白连贯:短句、带冲突/情绪;能演出来的不写出来(用画面代替台词)。
七、给 AI 的用法
- 把本篇 +
02(剧本)+03(资产)+12(分镜实操)一起交给 AI,AI 能照抄 2.3 / 2.4 / 3.4 / 4.4 的提示词,产出可直接喂即梦 / H3 的分镜脚本(含生图/视频提示词列)。 - 自检清单(出片前过一遍):
- [ ] 角色有定妆图?全剧统一一张脸?
- [ ] 每镜 ≤5 秒?首尾帧衔接填了?
- [ ] 台词 ≤12 字短句?前 3 秒有冲突/悬念?
- [ ] 每集结尾留悬念?画风/模型全剧一致?
- [ ] 线上:即梦角色一致性开关开没开?本地:H3 三种工作流选对、音频 VAE 就位(否则没声音)?
八、GitHub / B站 实测可用资源索引(2026-09 补充)
下列节点 / 工作流 / UP 主均为本轮检索验证过、可实际取用的资源,作为落地参考(模型名与价格随官方更新,使用前回官网核对)。
8.1 ComfyUI 节点(GitHub,可直接 git clone 安装)
- 即梦 / 豆包 API 入画布:
fkxianzhou/ComfyUI-Jimeng-API(多 Key + 配额 + 异步并发,支持 Seedream 5.0/4.0 出图、Seedance 2.0/2.5 出视频,ComfyUI ≥0.25.1);同类另有mbaisha/Comfyui-Jimeng-api、weisiren000/comfyui-jimeng-api(均支持 Seedream 4.0 多图融合 / 组图)。 - MiniMax H3 本地出视频:
comfyui-minimax-h3(官方插件)、AIMixer/ComfyUI_MiniMaxH3_Director(导演台,长剧分段一致性)、yolain/ComfyUI-Easy-Media(easy-minimaxH3ToVideo 一站式路由)。另 ComfyUI core ≥0.30 自带云端 Hailuo H3 节点(按秒计费,非本地权重)。 - 角色一致性 / 出图增强(本地):
ComfyUI-Impact-Pack(人物一致性必备)、ComfyUI-IPAdapter、ComfyUI-LTXVideo(LTX2.3 视频)、ComfyUI-KJNodes(宫格/调度)、if-ai/ComfyUI-IF_AI_tools(Ollama 集成)、city96/ComfyUI-GGUF(量化加速)。 - Dify + ComfyUI 全自动编排:
langgenius/dify(Docker 部署)做"大脑"(编剧 / 导演 / 提示词 Agent),ComfyUI 做"双手"(Flux 出图 / LTX 视频 / TTS 配音),适合量产。
8.2 工作流 / 整合包(社区分享)
- LTX2.3 + 20 宫格自动化漫剧工作流:B站搜索「ComfyUI LTX2.3 20宫格 自动化漫剧」,UP 主「AI代码侠土豆」等分享 JSON + 模型 + 样例提示词。
- Qwen-AIO 大合集节点:含
QwenImageEdit(角色一致性超强)、Qwen Image 2512、Qwen3-TTS,被多个保姆级教程列为"2026 最强漫剧节点"。 - MiniMax H3 基础工作流:
minimax_h3_basic_workflow.json(文生视频最简验证),导入 Ctrl+O 即用。
8.3 B站 / 公开教程(实操向)
- 即梦 AI 官方新手教程(APP 内「新手学堂」+ B站「即梦 AI 漫剧教程」):中文界面、每日免费额度、角色锁定功能。
- 系统实战:B站《AI 漫剧从 0 到 1 实战》(UP 主:AI漫剧教程君、漫剧制作工厂),避坑多、解决剧情断层 / 画面崩坏。
- 专项:B站「大叔的 AI 课」SD 漫剧系列(Lora / 角色一致性);可灵图生视频教程(丝滑动态提示词);剪映漫剧专属模板(自动字幕 / 转场 / AI 配音)。
- 节奏范式:头条 / 抖音高赞「30 分钟出片五步法」「0 成本 3 天出片」(选题→豆包脚本→即梦三视图→图生视频→剪映),新手可直接抄。
九、流程 B 跑通 Checklist(本地实操,回写自 workbench/流程B跑通Checklist.md)
用 E:\ai漫剧工作台\workbench\ 跑流程 B 的本机实操清单。沙箱连不上本机 localhost,真跑需你本机终端。
9.1 启动顺序与端口
- 先起本地引擎(单卡别并行新任务):ComfyUI(aki-v7) 默认
8188(启动日志出现Minimax H3 Node Loaded即 H3 节点就位);EchoMimic v2 可选7860。 - 再起工作台:
workbench目录node index.js(或run_web.bat)→8787。 - 浏览器开
http://127.0.0.1:8787。
9.2 手动导入步骤(默认 manual 模式)
- 豆包 / DeepSeek 写剧本 → 工作台粘贴导入(
importScript)。 - 即梦出角色定妆图(先三视图正/侧/背)→ 导出本机 →
importKeyframe填路径。 - 可选:口播音频导出 →
importAudio(EchoMimic 必须音频才跑数字人)。 - 点该分镜
run→ 自动提交 ComfyUI 跑 H3 图生视频 → 下载到data/assets/videos/。
9.3 i2v_minimax.json 校验
- 须是 API 格式(Prompt 格式)的扁平图(勿用带"子图(subgraph)"的 UI 导出);
config.video.comfyui.nodeMap:首帧 = 节点5(LoadImage).image,提示词 = 节点6(MiniMaxH3ImageToVideo).prompt,画布 = 节点6.width/height,种子 = 节点7(RandomNoise).noise_seed,产物 = 节点15(SaveVideo)。核心 H3 节点定义见comfy_extras/nodes_minimax_h3.py(MiniMaxH3ImageToVideo输入含 clip/vae/prompt/width/height/length/first_frame/last_frame;length须 17k+5,124≈5s@24fps)。 - 改动工作流后先跑
node tools/check_workflow.mjs校验(零依赖):会揪出 nodeMap 指向不存在节点、inputs 为空、数字 id 引用、字段_1/_2错位、prompt 注入图像字段等问题——旧版i2v_minimax.json就是这样被发现"看着像、跑不了"(把带子图的示例错误拍平),现已按本机核心节点重建为扁平图。参考可打开custom_nodes/comfyui-speed-minimaxH3/example_workflows/图生视频-关图就是文生.json核对。 - minimax_h3 系无独立 IP-Adapter 节点(靠首帧风格锚);帧数按 17n+5 对齐,上限 362 帧 ≈15 秒,超出必崩。
- 首帧来源:优先用第3步导入的定妆图
keyframe;若该镜只有即梦图生图产出的image资产,pipeline 自动回退用它作首帧(无需再手动导入定妆图),实现「即梦锁脸图 → H3 视频」联动。
9.4 常见失败排查
- 连不上 8188:aki-v7 没起 / 端口错 / 沙箱隔离(本机终端才通),
curl http://127.0.0.1:8188/system_stats自测。 - 正忙:单卡不能并行,队列非空时拒绝提交;等当前视频跑完。
- 无视频产物:工作流缺合成/保存节点,或 json 非 API 格式。
- 视频没声音:H3 原生配音需
minimax_h3_audio_vae_fp32.safetensors就位。 - 数字人跳过:没
importAudio(非错误,单独重跑即可)。 - 定妆图不存在:
importKeyframe路径错,或图没放 aki-v7 input 目录(config.inputDir 已配,复制即认)。 - 即梦出图慢/排队:切本地 FLUX / SDXL+IPA(config.imageGen 的 flux/sdxl_ipa)免排队。
9.5 API 自动模式(可选升级)
config.import.mode改api,并填config.api.doubao(或deepseek)的apiKey,重启工作台 → 剧本步「✨ 一键生成(API)」即自动产出本镜剧本分镜;密钥留空自动回落 manual,不破坏现有流程。- 出图端装
ComfyUI-Jimeng-API节点 + 配火山方舟 Key(见 4.10)后即全自动。
9.6 分发(落地页 + 视频号 / 抖音)
- 后期成片后,逐镜「分发」步 → 「🌐 生成落地页」聚合整集成片为落地页(
data/assets/dist/<pid>/<eid>/index.html,经/api/file/访问)。 - 「视频号上传 / 抖音上传」按钮打开对应创作者中心并复制本机成片路径,登录后「发布视频 → 选择文件」即可。真实 API 上传需 OAuth 凭证(暂未接,
distribute.js已留可插拔位)。
9.7 剧集合成(多镜拼整集)
- 各镜后期完成后,剧集批量视图「🎬 整集成片(多镜合并)」→「合并整集成片」:自动收集各镜成片、逐段归一化(scale+pad 到
config.merge.canvas、统一 fps、无音轨补静音)后拼成一条整集视频 →data/assets/merge/<pid>/<eid>/<eid>_full.mp4。 - 需本机 ffmpeg + ffprobe;「⚡ 整集一键跑全链」会在分发前自动执行此步。
十、后期自动化(ffmpeg:字幕 / BGM / 封面 · 已落地 workbench)
流程 B 前四环产出「视频 + 数字人」,但仍无字幕、无配乐、无封面——不能直接发。后期模块把这一步工程化。
10.1 三个能力(src/providers/post.js)
- 字幕 burn-in:
srtFromScript(剧本)按句末标点切分 → 生成 SRT → ffmpegsubtitles=...:force_style=...烧入。样式由config.post.subtitles(字号 28 / 白字 / 黑描边 / 底对齐)控制。 - BGM 混音:
mixBGM抽原音 + BGM 音量(默认 0.3)→amix最短输出 aac。BGM 来自shot.assets.bgm(前端填路径)或config.post.bgm。 - 封面帧:
coverFrame取第 1 秒一帧存 jpg,用作落地页 / 分发封面。
10.2 触发与落点
- 流水线 P5 在 P3 数字人后自动调 post(用绝对路径确定的
video.url作源);/post路由可单独重跑;前端「后期」step 有「导出成片」按钮。 - 任一步失败仅跳过不阻断(如没 ffmpeg、没 BGM),日志进
shot.assets.post.log。 - 资产落点:
data/assets/post/<pid>/<eid>/(成片*_sub.mp4、字幕*_sub.srt、封面*_cover.jpg)。
10.3 依赖与注意事项
- ffmpeg 本机自备:
post.js用spawn('ffmpeg')调用;本机需装 ffmpeg 并在 PATH,或用config.post.ffmpegBin填绝对路径(如D:/ffmpeg/bin/ffmpeg.exe)。沙箱有 8.1.1 但真跑在您机器。 - 字幕精度:自动切句基于标点均分时间戳,长镜头不够准;精确字幕请在前端粘贴台词或导入
.srt。 - 剧集合成同走 ffmpeg(
src/providers/merge.js,详见 4.11):多镜成片归一化后 concat 成整集视频,同样依赖本机 ffmpeg + ffprobe。 - 与流程 A(剪映加字幕配乐,B站范式)互补:workbench 走 ffmpeg 工程化、可批量、可复用;剪映适合精修。