首页科普 › 从小说到成片:AI 短剧制作全流程(六道工序逐一拆解)

从小说到成片:AI 短剧制作全流程(六道工序逐一拆解)

从小说到成片,AI 短剧固定走六道工序:① 解析拆集 ② 参考图 ③ 分镜脚本(每集 6–10 段,每段 4–15 秒)④ 逐段生成视频 ⑤ 配音 ⑥ 整集合成。第四道占总成本八成以上,前三道决定它会不会返工;一集 90 秒的剧机器时间约 30–40 分钟,人工审校另计。

六道工序总览

工序进什么出什么常用工具典型失败机器耗时
① 解析拆集小说全文或剧本角色表、场景表、道具表、分集大纲一站式工具;通用大模型 + 模板外貌写得抽象、后几集变薄3–5 分钟 / 整本
② 参考图角色表、场景表、画面风格白底全身定妆照、无人空景、道具图即梦、SeedDream、Midjourney参考图带光效,被每个镜头继承10–60 秒 / 张
③ 分镜脚本本集大纲、原文片段、资产表段级脚本:机位、动作、台词、布光一站式工具;通用大模型 + 模板段切太碎、台词秒数给多1–3 分钟 / 集
④ 逐段生成段脚本、参考图、音色4–15 秒视频片段可灵、海螺、通义万相、Seedance、Vidu、PixVerse变脸、乱入、口型归属错、审核拒绝3–10 分钟 / 段
⑤ 配音角色表、台词音色绑定或参考音频剪映、MiniMax TTS、ElevenLabs音色跨集漂移、免费版无商用授权分钟级
⑥ 合成段视频、片头片尾、字幕9:16 成片一站式一键合成;剪映 / CapCut混模型段编码不一致、漏 AI 标识云端 1 分钟内

耗时一列是本刊 2026 年 8–9 月用一站式工具跑 3 集样稿的实测区间,随排队与模型波动,不是厂商数据。六道工序的顺序不能换:参考图依赖角色表,分镜依赖参考图与大纲,生成依赖前三者。

工序一:解析拆集——决定整部剧的骨架

进:小说全文(5–20 万字常见)或已有剧本。出:四张表——角色表(脸型、眉眼、鼻唇、肤色、发型、体型、年龄感,外加一个疤或饰品之类的静态锚点)、场景表(空间结构、材质、光源位置,不带剧情残留)、道具表、分集大纲(每集含冲突、情绪高点、集尾钩子)。

工具:SceneMixerLibTV小云雀这类一站式工具会在解析阶段自动产出角色表和分集大纲;也可以拿豆包、通义千问、Kimi 等通用大模型配一份提示词模板手工做,代价是四张表要自己维护、后面每道工序都要手动对齐。

典型失败:① 外貌写成「英俊冷峻」,图像模型无法还原;② 场景描述混进剧情(「桌上有打翻的酒」),空景就带着道具;③ 长篇一次输出预算烧完,前几集详细、后几集变薄甚至 JSON 截断——长篇要分两阶段:先出骨架,再逐集扩写。

耗时:整本 3–5 分钟。这一道最便宜,也最值得反复改:改角色表是免费的,改成片是全价。

工序二:参考图——是参考,不是海报

进:角色表、场景表、用户选的画面风格与画幅。出:每个角色一张白底正面全身定妆照(9:16)、每个场景一张无人空景(跟随成片画幅)、关键道具白底图。

工具:即梦、SeedDream 5.0、Midjourney,以及千问图像。一站式工具通常内置其中一两个,按角色表批量出图。中文形制词(马面裙、盘领袍)在中文母语的图像模型上还原度更高。

典型失败:把参考图当海报做——加了逆光、雾、电影感调色。参考图里烘进去的光会被这个角色和场景的每一个镜头继承,然后跟分镜里逐镜的布光指令打架。正确标准是中性:白底、方向主光、正面、无表情;场景写清三层纵深和光源在哪,不做氛围。

耗时:每张 10–60 秒;一部剧 8–15 个角色、10–20 个场景,批量出图 10–20 分钟。

工序三:分镜脚本——段要长、镜要短

进:本集大纲、本集对应的原文片段、角色与场景表。出:段级脚本。一个「段」= 一次视频模型调用,4–15 秒;一段里再切 3–6 个分镜。每个分镜写清景别与机位、画面里有谁、动作、台词与说话人、布光方位与色温。

工具:一站式工具自动出脚本并允许逐段编辑;用通用大模型也能写,但要按目标视频模型的提示词习惯改写,且每一集都要把角色表、场景表重新喂一遍。模板见分镜脚本模板

典型失败:① 段切太碎(4 秒一段),调用次数翻倍、上游也更容易忽略段内剪辑;② 写结果不写原因(「光打亮她的鼻梁」成片就是鼻梁上一团黄);③ 台词秒数给多,模型用复读台词填时间——中文按约 5 字/秒估,18 字给 4 秒;④ 点名「其余人出画」,反而提高乱入概率。

耗时:机器 1–3 分钟/集;人工审校 10–30 分钟/集,是整条流程里最值得花的人工。

工序四:逐段生成——钱和返工都在这里

进:段脚本 + 该段涉及角色的定妆照与脸部裁切 + 场景空景 + 音色。出:一条 4–15 秒的片段,成片档位 1080P/2K,草片档位 720P/768P。

工具:可灵海螺(MiniMax H3)通义万相 3.0、Seedance 2.0、ViduPixVerse。对短剧重要的不是单条多惊艳,而是三件事:吃不吃参考图、听不听段内切点、口型归属对不对。

模型官方牌价单次时长来源
Seedance 2.0(火山方舟)含视频输入 28 元/百万 token,约 1 元/秒4–15 秒新浪财经,2026-03-04火山方舟文档
通义万相 3.0(阿里云百炼)480P 0.3 / 720P 0.6 / 1080P 1.2 元/秒最长 30 秒阿里云百炼,2026-09-02 查阅
MiniMax H3(国际站)768P $0.08/秒、2K $0.13/秒;参考图前 5 张免费、之后 $0.04/张;参考音频免费价格页未列MiniMax,2026-09-02 查阅

表里是上游牌价;平台积分价通常是牌价的 2–3 倍,含毛利与重生成余量,见价格总表

典型失败:变脸(参考链路断了或参考图带情绪光)、多人同框乱入、口型给了不在画面里的人、内容审核拒绝(血腥、尸体等措辞)。首次可用率通常只有五到七成,每重生成一段就是再付一次。

耗时:每段 3–10 分钟,随排队浮动;一集 8 段并行约 15–20 分钟。

工序五:配音——预置音色比逐角色生成便宜

进:角色表里的音色描述、每段台词。出:两条路线之一——音色描述(写在分镜里,由带原生音频的视频模型音画同出)或参考音频(每个角色绑定一段 3–8 秒样本,生成时一起送入)。

工具:剪映 / CapCut 的文字转语音;MiniMax 的 T2A 接口(speech-2.8-turbo 国际站牌价 $60/百万字符);ElevenLabs(Free 档每月 1 万 credits 但无商用授权,Starter $6/月起含商用授权,ElevenLabs 官网,2026-09-02 查阅)。一站式工具多数改成从几十个预置音色里按性别、年龄、语言匹配,比逐角色生成音色便宜两个数量级,也不占「音色槽位」类的隐藏计费。

典型失败:音色跨集漂移(每集重新生成而不是绑定同一份样本);用了免费档的音色做商用;参考音频超过上游限制被静默丢弃。

耗时:分钟级。

工序六:合成与交付

进:按顺序排好的段视频、片头片尾、字幕文件、AI 标识。出:9:16、1080×1920、H.264、单集不超过 2 分钟的成片。

工具:LibTV、SceneMixer 等一站式工具提供一键整集合成;剪映 / CapCut 负责字幕、片头片尾与转场。云端拼接 1 分钟内;本地 ffmpeg 重编码在 2 核小机器上会把机器拖死。

典型失败:① 一集里混了两家模型的段,编码参数不一致被迫全集重编码;② 字幕与台词对不上(分镜改了、字幕没改);③ 漏加 AI 标识——《人工智能生成合成内容标识办法》2025 年 9 月 1 日起要求显式标识(画面可见)与隐式标识(文件元数据)同时具备(国家网信办,2025-03-14),上传红果、抖音时还要再勾选一次。

耗时:云端 1 分钟内。

一部 10 集剧的账:成本与时间

成本有三种口径,别混用。① 纯牌价:10 集 × 90 秒 = 900 秒,按万相 3.0 720P 每秒 0.6 元是 540 元,按 Seedance 2.0 约 1 元/秒是 900 元,不含重生成;② 媒体口径:虎嗅的「一分钟 60 块」(虎嗅)接近纯牌价,第一财经的「成本千元一分钟」(第一财经)含人工与重生成,区间差一个量级;③ 海外厂商口径:invideo 自称的案例是 10 集、3 人、3 天,约 $1,000/集(invideo,2026-07-24,厂商自称)。前三道工序合计通常不超过几十元,账几乎全在第四道。

时间:机器时间串行约 5–7 小时、并行 2–3 小时;人工审校(分镜每集 10–30 分钟、成片挑段重生成)通常是机器时间的两倍以上。细账见成本拆解

关键数字与来源

指标数值来源日期
Seedance 2.0 单次生成时长4–15 秒www.volcengine.com2026-09-02
Seedance 2.0 官方定价(含视频输入)28 元/百万 token,约 1 元/秒finance.sina.com.cn2026-03-04
通义万相 3.0 官方牌价720P ¥0.6/秒、1080P ¥1.2/秒,最长 30 秒help.aliyun.com2026-09-02
MiniMax H3 官方国际价768P $0.08/秒、2K $0.13/秒platform.minimax.io2026-09-02
ElevenLabs 最低含商用授权档位Starter $6/月elevenlabs.io2026-09-02
invideo 厂商自称制作成本约 $1,000/集(10 集、3 人、3 天)invideo.io2026-07-24

常见问题

六道工序里哪一步最花钱?

第四道逐段生成,占总成本八成以上:每一秒都是视频模型调用,首次可用率五到七成,重生成再付一次。前三道(解析、参考图、分镜)合计通常只占几个百分点,但决定第四道要不要返工。

只有故事梗概、没有小说,能走这条流程吗?

能,但第一道会变成「AI 写剧本」:先把梗概扩成分集剧本,再进解析。梗概越短,角色外貌和场景就越依赖模型编造,后面变脸的概率越高。建议至少把主角外貌和主要场景写具体再解析。

能跳过参考图直接生成视频吗?

技术上能,代价是角色跨段跨集不一致。参考图是一致性的物理基础:没有它,模型每一段都在重新想象「这个人长什么样」。想省钱可以少出道具图,角色定妆照和主场景空景不能省。

一集要多久?

按本刊实测:解析 3–5 分钟(整本一次)、参考图批量 10–20 分钟(整部一次)、分镜 1–3 分钟/集、8 段并行生成 15–20 分钟、合成 1 分钟内。单集机器时间约 30–40 分钟,人工审校另加 30 分钟到 1 小时。

分镜脚本一定要 AI 写吗?

不一定,但要按段级格式写:每段 4–15 秒、写清机位/谁在画面里/动作/台词/布光。人工写的好处是节奏可控;AI 写的好处是自动带上角色表和场景表的措辞,不会前后集叫法不一致。多数人的做法是 AI 出初稿、人工改。

只用可灵或海螺能做完整流程吗?

能出片,做不了「流程」。单点视频工具只覆盖第四道,角色表、参考图管理、分镜、合成都要自己搭,跨集一致性也要自己维护参考图。三集以内的短片可以硬做,几十集就需要一站式工具或自建工作流。

成片怎么加 AIGC 标识?

两层:画面可见的显式标识(片头或角标写明 AI 生成)和文件元数据里的隐式标识,2025 年 9 月 1 日起都是硬要求;2026 年 9 月 1 日起广电总局还要求每集明显位置加提示标识。上传平台时再勾选「AI 生成」。见AIGC 标识

资料来源

本文提到的工具

延伸阅读