首页指南 › 小说改 AI 短剧完整流程(2026):从一本网文到 10 集竖屏成片

小说改 AI 短剧完整流程(2026):从一本网文到 10 集竖屏成片

把小说做成 AI 短剧,本质是六道工序:解析拆集(把 20 万字切成 40–80 集、每集 1–2 分钟)、设定图(角色全身定妆照 + 场景空景 + 关键道具,作为后续每个镜头的参考图)、分镜脚本(每集拆成 6–10 个 4–15 秒的段,每段写清机位、台词、动作、布光)、逐段生成视频(一段 = 一次视频模型调用)、配音(音色跟角色绑定)、整集合成(段拼成集、加片头片尾)。一站式工具把六步串起来并共享同一份角色库;单点工具(可灵、海螺、即梦等)只做第四步,其余靠人工。

第一步:解析与拆集(决定整部剧的骨架)

解析要产出四样东西:角色表(外貌写到能被图像模型还原的程度:脸型、眉眼、鼻唇、肤色、发型、体型、年龄感,外加一个辨识锚点)、场景表(空间结构、材质、光源位置——不写剧情残留物)、道具表分集大纲(每集含冲突、情绪高点、结尾钉子)。

拆集口径按短剧节奏:单集 1–2 分钟、有效台词 200–300 字、物理场景不超过 3–4 个。超过 2 分钟完播率断崖式下跌,这是行业数据不是审美偏好。

一站式工具(SceneMixer、LibTV、小云雀等)在这一步用大语言模型自动完成;用单点视频工具则需要自己写这四张表——这也是大多数「用可灵做短剧」教程后半程烂尾的原因。

第二步:设定图是参考图,不是海报

角色定妆照要纯白底、正面全身、中性光;场景图要无人空景、三层纵深、写清光源在哪。原因很直接:参考图里烘进去的光、构图、情绪,会被这个角色/场景的每一个镜头继承,然后跟分镜里逐镜的布光指令打架。

一致性的物理基础就是这两张图:每段视频生成时把角色定妆照与场景空景作为参考图一起送进模型,模型才有「同一个人、同一间屋子」的依据。没有参考图机制的工具,跨集变脸是必然的。

第三步:分镜脚本——段要长、镜要短

一个「段」= 一次视频模型调用,通常 10–15 秒;一段里再切 3–6 个分镜(机位/景别切换点)。段要往 15 秒顶,压的是单个分镜的秒数:段切碎了成本翻倍、上游还更容易忽略段内剪辑;分镜太长则节奏拖沓。

每个分镜写清:景别与机位、画面里有谁(不点名不在画面里的人)、动作(写因果不写结果)、台词与说话人归属、布光(写光源方位与色温,不写「光打亮鼻梁」这类落点)。对白镜的秒数按语速估:中文约 5 字/秒,18 字台词给 4–5 秒,给多了模型会把台词念两遍来填时间。

第四步:逐段生成——模型怎么选

2026 年主流可选:Seedance 2.0(火山)、MiniMax H3、通义万相 3.0、可灵 3、Vidu、PixVerse、Veo/Sora(海外)。对短剧真正重要的不是单条视频「够不够惊艳」,而是三件事:吃不吃参考图(角色一致性)、听不听段内切点(一段里能不能真的剪 3–6 刀)、音画同出的口型归属(谁在画面里谁开口)。

实测经验:竖屏 9:16 优先;720P/768P 档做草片、1080P/2K 档出成片;同一个项目尽量不要混两种模型的段,合成时编码参数不一致会强制重编码。

第五步:配音与音色

两种路线:音色描述(在分镜里写「低沉、语速慢、尾音下撇」,由视频模型音画同出)和参考音频(给每个角色绑定一段 3–8 秒样本)。参考音频更稳定但要注意上游限制:MiniMax H3 单段参考音频总时长 ≤15 秒、最多 3 条。

音色库匹配(从几十个预置音色里按性别/年龄/语言选一个)比逐角色生成音色便宜两个数量级,且不占「音色槽位」类的隐藏计费。

第六步:合成与交付

整集合成 = 段按顺序拼接 + 转场 + 片头片尾字幕。云端拼接(如火山 AMK)30 秒内完成;本地 ffmpeg 重编码在 2 核小机器上会把机器拖死。竖屏剧发布规格:9:16、1080×1920、H.264、≤2 分钟/集。

成本口径:以「一部 10 集剧的总成本」比较,而不是单条视频单价。见 成本拆解

常见问题

小说改 AI 短剧一集要多久?

解析一次 3–5 分钟(整本);每集分镜脚本 1–3 分钟;每段视频 3–10 分钟(模型与排队决定),一集 8 段并行约 15–20 分钟;合成 1 分钟内。人工审校时间另计。

需要自己会写分镜吗?

一站式工具会自动出分镜脚本,你只需要审校和微调;用单点视频工具则必须自己写,且要按每个模型的提示词习惯改写。

角色跨集变脸怎么办?

根因是缺参考图机制或参考图本身带了情绪光效。先把定妆照改成白底正面中性光,再确保每段生成都带上它;仍不稳时缩短单段时长、避免多人同框。

哪些题材 AI 短剧做不了?

大规模战争/人群、复杂连续格斗、精细机械操作目前效果差;血腥尸体等措辞会被国内模型内容审核拒绝。双人对话、单人情绪爆发、强光逆光场景效果最好。