从小说到成片:AI 短剧制作全流程(六道工序逐一拆解)
从小说到成片,AI 短剧固定走六道工序:① 解析拆集 ② 参考图 ③ 分镜脚本(每集 6–10 段,每段 4–15 秒)④ 逐段生成视频 ⑤ 配音 ⑥ 整集合成。第四道占总成本八成以上,前三道决定它会不会返工;一集 90 秒的剧机器时间约 30–40 分钟,人工审校另计。
六道工序总览
| 工序 | 进什么 | 出什么 | 常用工具 | 典型失败 | 机器耗时 |
|---|---|---|---|---|---|
| ① 解析拆集 | 小说全文或剧本 | 角色表、场景表、道具表、分集大纲 | 一站式工具;通用大模型 + 模板 | 外貌写得抽象、后几集变薄 | 3–5 分钟 / 整本 |
| ② 参考图 | 角色表、场景表、画面风格 | 白底全身定妆照、无人空景、道具图 | 即梦、SeedDream、Midjourney | 参考图带光效,被每个镜头继承 | 10–60 秒 / 张 |
| ③ 分镜脚本 | 本集大纲、原文片段、资产表 | 段级脚本:机位、动作、台词、布光 | 一站式工具;通用大模型 + 模板 | 段切太碎、台词秒数给多 | 1–3 分钟 / 集 |
| ④ 逐段生成 | 段脚本、参考图、音色 | 4–15 秒视频片段 | 可灵、海螺、通义万相、Seedance、Vidu、PixVerse | 变脸、乱入、口型归属错、审核拒绝 | 3–10 分钟 / 段 |
| ⑤ 配音 | 角色表、台词 | 音色绑定或参考音频 | 剪映、MiniMax TTS、ElevenLabs | 音色跨集漂移、免费版无商用授权 | 分钟级 |
| ⑥ 合成 | 段视频、片头片尾、字幕 | 9:16 成片 | 一站式一键合成;剪映 / CapCut | 混模型段编码不一致、漏 AI 标识 | 云端 1 分钟内 |
耗时一列是本刊 2026 年 8–9 月用一站式工具跑 3 集样稿的实测区间,随排队与模型波动,不是厂商数据。六道工序的顺序不能换:参考图依赖角色表,分镜依赖参考图与大纲,生成依赖前三者。
工序一:解析拆集——决定整部剧的骨架
进:小说全文(5–20 万字常见)或已有剧本。出:四张表——角色表(脸型、眉眼、鼻唇、肤色、发型、体型、年龄感,外加一个疤或饰品之类的静态锚点)、场景表(空间结构、材质、光源位置,不带剧情残留)、道具表、分集大纲(每集含冲突、情绪高点、集尾钩子)。
工具:SceneMixer、LibTV、小云雀这类一站式工具会在解析阶段自动产出角色表和分集大纲;也可以拿豆包、通义千问、Kimi 等通用大模型配一份提示词模板手工做,代价是四张表要自己维护、后面每道工序都要手动对齐。
典型失败:① 外貌写成「英俊冷峻」,图像模型无法还原;② 场景描述混进剧情(「桌上有打翻的酒」),空景就带着道具;③ 长篇一次输出预算烧完,前几集详细、后几集变薄甚至 JSON 截断——长篇要分两阶段:先出骨架,再逐集扩写。
耗时:整本 3–5 分钟。这一道最便宜,也最值得反复改:改角色表是免费的,改成片是全价。
工序二:参考图——是参考,不是海报
进:角色表、场景表、用户选的画面风格与画幅。出:每个角色一张白底正面全身定妆照(9:16)、每个场景一张无人空景(跟随成片画幅)、关键道具白底图。
工具:即梦、SeedDream 5.0、Midjourney,以及千问图像。一站式工具通常内置其中一两个,按角色表批量出图。中文形制词(马面裙、盘领袍)在中文母语的图像模型上还原度更高。
典型失败:把参考图当海报做——加了逆光、雾、电影感调色。参考图里烘进去的光会被这个角色和场景的每一个镜头继承,然后跟分镜里逐镜的布光指令打架。正确标准是中性:白底、方向主光、正面、无表情;场景写清三层纵深和光源在哪,不做氛围。
耗时:每张 10–60 秒;一部剧 8–15 个角色、10–20 个场景,批量出图 10–20 分钟。
工序三:分镜脚本——段要长、镜要短
进:本集大纲、本集对应的原文片段、角色与场景表。出:段级脚本。一个「段」= 一次视频模型调用,4–15 秒;一段里再切 3–6 个分镜。每个分镜写清景别与机位、画面里有谁、动作、台词与说话人、布光方位与色温。
工具:一站式工具自动出脚本并允许逐段编辑;用通用大模型也能写,但要按目标视频模型的提示词习惯改写,且每一集都要把角色表、场景表重新喂一遍。模板见分镜脚本模板。
典型失败:① 段切太碎(4 秒一段),调用次数翻倍、上游也更容易忽略段内剪辑;② 写结果不写原因(「光打亮她的鼻梁」成片就是鼻梁上一团黄);③ 台词秒数给多,模型用复读台词填时间——中文按约 5 字/秒估,18 字给 4 秒;④ 点名「其余人出画」,反而提高乱入概率。
耗时:机器 1–3 分钟/集;人工审校 10–30 分钟/集,是整条流程里最值得花的人工。
工序四:逐段生成——钱和返工都在这里
进:段脚本 + 该段涉及角色的定妆照与脸部裁切 + 场景空景 + 音色。出:一条 4–15 秒的片段,成片档位 1080P/2K,草片档位 720P/768P。
工具:可灵、海螺(MiniMax H3)、通义万相 3.0、Seedance 2.0、Vidu、PixVerse。对短剧重要的不是单条多惊艳,而是三件事:吃不吃参考图、听不听段内切点、口型归属对不对。
| 模型 | 官方牌价 | 单次时长 | 来源 |
|---|---|---|---|
| Seedance 2.0(火山方舟) | 含视频输入 28 元/百万 token,约 1 元/秒 | 4–15 秒 | 新浪财经,2026-03-04;火山方舟文档 |
| 通义万相 3.0(阿里云百炼) | 480P 0.3 / 720P 0.6 / 1080P 1.2 元/秒 | 最长 30 秒 | 阿里云百炼,2026-09-02 查阅 |
| MiniMax H3(国际站) | 768P $0.08/秒、2K $0.13/秒;参考图前 5 张免费、之后 $0.04/张;参考音频免费 | 价格页未列 | MiniMax,2026-09-02 查阅 |
表里是上游牌价;平台积分价通常是牌价的 2–3 倍,含毛利与重生成余量,见价格总表。
典型失败:变脸(参考链路断了或参考图带情绪光)、多人同框乱入、口型给了不在画面里的人、内容审核拒绝(血腥、尸体等措辞)。首次可用率通常只有五到七成,每重生成一段就是再付一次。
耗时:每段 3–10 分钟,随排队浮动;一集 8 段并行约 15–20 分钟。
工序五:配音——预置音色比逐角色生成便宜
进:角色表里的音色描述、每段台词。出:两条路线之一——音色描述(写在分镜里,由带原生音频的视频模型音画同出)或参考音频(每个角色绑定一段 3–8 秒样本,生成时一起送入)。
工具:剪映 / CapCut 的文字转语音;MiniMax 的 T2A 接口(speech-2.8-turbo 国际站牌价 $60/百万字符);ElevenLabs(Free 档每月 1 万 credits 但无商用授权,Starter $6/月起含商用授权,ElevenLabs 官网,2026-09-02 查阅)。一站式工具多数改成从几十个预置音色里按性别、年龄、语言匹配,比逐角色生成音色便宜两个数量级,也不占「音色槽位」类的隐藏计费。
典型失败:音色跨集漂移(每集重新生成而不是绑定同一份样本);用了免费档的音色做商用;参考音频超过上游限制被静默丢弃。
耗时:分钟级。
工序六:合成与交付
进:按顺序排好的段视频、片头片尾、字幕文件、AI 标识。出:9:16、1080×1920、H.264、单集不超过 2 分钟的成片。
工具:LibTV、SceneMixer 等一站式工具提供一键整集合成;剪映 / CapCut 负责字幕、片头片尾与转场。云端拼接 1 分钟内;本地 ffmpeg 重编码在 2 核小机器上会把机器拖死。
典型失败:① 一集里混了两家模型的段,编码参数不一致被迫全集重编码;② 字幕与台词对不上(分镜改了、字幕没改);③ 漏加 AI 标识——《人工智能生成合成内容标识办法》2025 年 9 月 1 日起要求显式标识(画面可见)与隐式标识(文件元数据)同时具备(国家网信办,2025-03-14),上传红果、抖音时还要再勾选一次。
耗时:云端 1 分钟内。
一部 10 集剧的账:成本与时间
成本有三种口径,别混用。① 纯牌价:10 集 × 90 秒 = 900 秒,按万相 3.0 720P 每秒 0.6 元是 540 元,按 Seedance 2.0 约 1 元/秒是 900 元,不含重生成;② 媒体口径:虎嗅的「一分钟 60 块」(虎嗅)接近纯牌价,第一财经的「成本千元一分钟」(第一财经)含人工与重生成,区间差一个量级;③ 海外厂商口径:invideo 自称的案例是 10 集、3 人、3 天,约 $1,000/集(invideo,2026-07-24,厂商自称)。前三道工序合计通常不超过几十元,账几乎全在第四道。
时间:机器时间串行约 5–7 小时、并行 2–3 小时;人工审校(分镜每集 10–30 分钟、成片挑段重生成)通常是机器时间的两倍以上。细账见成本拆解。
关键数字与来源
| 指标 | 数值 | 来源 | 日期 |
|---|---|---|---|
| Seedance 2.0 单次生成时长 | 4–15 秒 | www.volcengine.com | 2026-09-02 |
| Seedance 2.0 官方定价(含视频输入) | 28 元/百万 token,约 1 元/秒 | finance.sina.com.cn | 2026-03-04 |
| 通义万相 3.0 官方牌价 | 720P ¥0.6/秒、1080P ¥1.2/秒,最长 30 秒 | help.aliyun.com | 2026-09-02 |
| MiniMax H3 官方国际价 | 768P $0.08/秒、2K $0.13/秒 | platform.minimax.io | 2026-09-02 |
| ElevenLabs 最低含商用授权档位 | Starter $6/月 | elevenlabs.io | 2026-09-02 |
| invideo 厂商自称制作成本 | 约 $1,000/集(10 集、3 人、3 天) | invideo.io | 2026-07-24 |
常见问题
六道工序里哪一步最花钱?
第四道逐段生成,占总成本八成以上:每一秒都是视频模型调用,首次可用率五到七成,重生成再付一次。前三道(解析、参考图、分镜)合计通常只占几个百分点,但决定第四道要不要返工。
只有故事梗概、没有小说,能走这条流程吗?
能,但第一道会变成「AI 写剧本」:先把梗概扩成分集剧本,再进解析。梗概越短,角色外貌和场景就越依赖模型编造,后面变脸的概率越高。建议至少把主角外貌和主要场景写具体再解析。
能跳过参考图直接生成视频吗?
技术上能,代价是角色跨段跨集不一致。参考图是一致性的物理基础:没有它,模型每一段都在重新想象「这个人长什么样」。想省钱可以少出道具图,角色定妆照和主场景空景不能省。
一集要多久?
按本刊实测:解析 3–5 分钟(整本一次)、参考图批量 10–20 分钟(整部一次)、分镜 1–3 分钟/集、8 段并行生成 15–20 分钟、合成 1 分钟内。单集机器时间约 30–40 分钟,人工审校另加 30 分钟到 1 小时。
分镜脚本一定要 AI 写吗?
不一定,但要按段级格式写:每段 4–15 秒、写清机位/谁在画面里/动作/台词/布光。人工写的好处是节奏可控;AI 写的好处是自动带上角色表和场景表的措辞,不会前后集叫法不一致。多数人的做法是 AI 出初稿、人工改。
只用可灵或海螺能做完整流程吗?
能出片,做不了「流程」。单点视频工具只覆盖第四道,角色表、参考图管理、分镜、合成都要自己搭,跨集一致性也要自己维护参考图。三集以内的短片可以硬做,几十集就需要一站式工具或自建工作流。
成片怎么加 AIGC 标识?
两层:画面可见的显式标识(片头或角标写明 AI 生成)和文件元数据里的隐式标识,2025 年 9 月 1 日起都是硬要求;2026 年 9 月 1 日起广电总局还要求每集明显位置加提示标识。上传平台时再勾选「AI 生成」。见AIGC 标识。
资料来源
- https://finance.sina.com.cn/tech/roll/2026-03-04/doc-inhpvpqk3838479.shtml
- https://www.volcengine.com/docs/82379/2298881
- https://help.aliyun.com/zh/model-studio/wan3-0-video
- https://platform.minimax.io/docs/guides/pricing-paygo
- https://elevenlabs.io/pricing
- https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm
- https://www.huxiu.com/article/4845532.html
- https://www.yicai.com/news/103084978.html
- https://invideo.io/blog/how-to-make-ai-micro-drama/