首页科普 › Seedance、可灵、海螺、万相、Veo、Sora:做短剧该选哪个视频模型(2026 年 9 月)

Seedance、可灵、海螺、万相、Veo、Sora:做短剧该选哪个视频模型(2026 年 9 月)

短剧选模型看三件事:台词能不能交给画面里正确的那张脸(原生音频 + 说话人归属)、一次调用吃几张参考图(角色跨集一致)、一段能不能剪出 3–5 个镜头。2026 年 9 月:对话戏选 Seedance 2.0 / 海螺 H3 / Veo 3.1;动作戏看参考视频能力(Seedance、万相 3.0);低成本量产用万相 3.0 低档草片,定稿再切 1080P

先说结论:按任务选,不按热度选

六家模型在 2026 年 9 月都能出像样的单条视频。差别在短剧真正用到的几个硬指标:谁来说这句台词能带几张参考图一段最长多少秒什么措辞会被拒每秒多少钱。这些官方文档都写得清楚,不用靠感觉。

三条结论。第一,台词多的戏只考虑有原生音频且能指定说话人的模型:Seedance 2.0、海螺 H3、Veo 3.1、可灵 3.0。第二,角色跨集一致性由参考图上限和规则决定:Seedance 9 张、海螺 9 张、万相 10 张、Vidu 7 个主体、Veo 3 张;Sora 的参考图只当首帧,且含人脸的图会被拒,带定妆照的流程走不通。第三,单段能出 30 秒(万相 3.0)不等于更好,段越长,模型越容易合并你计划的切点。

决策表:能力维度

模型(渠道)原生音频 / 说话人归属参考图 / 参考音视频首尾帧单段时长分辨率审核
Seedance 2.0(火山方舟 API / 即梦)有,generate_audio,口型随台词图 ≤9 张;视频 ≤3 段;音频 ≤3 段有(first_frame / last_frame)4–15 秒480P / 720P(以方舟当前文档为准)较严
海螺 H3(api.minimax.io 国际站 / api.minimaxi.com 大陆站)有,原生语音;参考音频可锁音色图 ≤9 张(前 5 张免费);参考音频 ≤3 段、合计 ≤15 秒;首帧与参考图互斥首帧有,与参考图二选一4–15 秒768P / 2K(480P 仅 H3-Max)
通义万相 3.0(百炼 wan3.0-video / 高速版 -prime)有,audio 参数默认开图 ≤10 张;视频 ≤5 段、合计 ≤15 秒;音频 ≤5 段有(first_frame / last_frame)2–30 秒480P / 720P / 1080P最严(绿网,血腥尸体措辞直接 DataInspectionFailed)
可灵 VIDEO 3.0(可灵 App / 开放平台)有,Native Audio 可指定角色说话,多语言多图 + 元素 + 视频参考(张数上限用户指南未列)3–15 秒(旧版 API 5 / 10 秒)720P / 1080P(std / pro)
Vidu Q3(vidu.cn / platform.vidu.com)有(viduq3 / -turbo 音画同出)参考主体 ≤7 个(图或文字)本次核查页未列1–16 秒540P / 720P / 1080P
Veo 3.1(Gemini API / Vertex / Flow)有,原生音频图 ≤3 张有(首帧 + 末帧)8 秒为主,可延长720p / 1080p / 4K严(真人面孔等)
Sora 2(OpenAI API / App)有,原生音频input_reference 只作首帧;含人脸的输入图被拒只有首帧API seconds = 4 / 8 / 12720p;1080p 需 sora-2-pro最严(真人、人脸图、版权角色)

「说话人归属」指模型能否把台词交给你点名的角色,而不是画面里最大的那张脸。只有可灵 3.0 在用户指南里明写「指定角色说话」;海螺 H3 靠参考音频间接锁定;其余靠提示词里的说话人标注,命中率取决于写法。

决策表:价格与可用性

模型按秒价格(官方口径)渠道说明大陆海外
Seedance 2.0¥28 / 百万 token(方舟牌价);公开报道折算 720P 5 秒约 ¥2.3token 数随分辨率与时长变化,没有固定每秒价;Seedance 2.5 加价 50%API + 即梦App 可用;API 渠道以当前模型列表为准
海螺 H3768P $0.08 / 秒;2K $0.13 / 秒;480P(H3-Max)$0.05 / 秒国际站价格页;参考图第 6 张起 $0.04 / 张;大陆站人民币价另列
万相 3.0480P ¥0.3 / 秒;720P ¥0.6 / 秒;1080P ¥1.2 / 秒阿里云发布口径;8 月 24 日–9 月 23 日百炼 API 7 折;高速版同价百炼阿里云国际站以当前列表为准
可灵 3.0公开报道:App 5 秒 720P 约 ¥4开放平台 API 价格页需登录,本次未取到官方数字是(klingai.com/global)
Vidu Q3Q3-pro 1080P 24 积分 / 秒($0.12);720P $0.10;540P $0.045;Q3-turbo 1080P $0.0651 积分 = $0.005;音频 +15 积分 / 条;错峰半价vidu.cn
Veo 3.1标准 $0.40 / 秒(720p / 1080p)、4K $0.60;Fast $0.10 / $0.12 / $0.30;Lite $0.05 / $0.08Gemini API 价格页;含音频;失败不计费无合规直连
Sora 2sora-2 720p $0.10 / 秒;sora-2-pro 720p $0.30、1024p $0.50、1080p $0.70OpenAI 价格页;Batch 半价

两点提醒。火山按 token 计价,同一模型 480P 和 720P 每秒 token 数不同,别把「每秒 ¥1」当固定数。海螺、Vidu 的大陆站与国际站是两套价目表和两套模型目录,不要拿美元价直接换算。第三方 API 中转报价常低于官方,但分辨率与参考图数量可能被裁剪,本文不采用。

口型与说话人归属:原生音频是分水岭

一集 90 秒里通常有 40–60 秒是台词。没有原生音频的模型要先出无声片再补口型,多一步就多一次不一致,成本也翻倍。所以做对话戏,先把没有原生音频的选项划掉

有了原生音频,下一个问题是「谁在说」。SinCoSphere 编辑部在生产线路上的测试里,对话戏最常见的返工是台词被交给画面里最显眼的那张脸,而不是剧本里的说话人。可灵 3.0 用户指南明写可指定角色说话;海螺 H3 允许绑 3 段以内、合计 15 秒的参考音频,音色对了归属基本就对;Seedance 2.0 与 Veo 3.1 靠提示词——每句台词前写说话人和他此刻在画面里的位置,并且不要在另一个人的特写里放这句台词。

还有一条硬规则:段的秒数减去台词秒数,富余超过 2 秒又没写收尾动作,模型会把台词再念一遍。中文按每秒约 5 字折算,富余的秒数要写成动作。

多人同框与参考图:一致性由谁兜底

角色跨集不变脸,靠每一段生成都带上定妆照。所以参考图的数量上限规则比画质更重要。

  • Seedance 2.0:9 张图 + 3 段视频 + 3 段音频。双人对话 = 两张定妆照 + 一张场景图 + 一两张道具图,够用。
  • 海螺 H3:9 张图,前 5 张免费。首帧与参考图互斥,用了首帧就带不了定妆照。
  • 万相 3.0:10 张图 + 5 段视频,上限最高。
  • Vidu Q3:7 个主体,图和文字都算。
  • Veo 3.1:3 张。两个角色加一个场景就满了。
  • Sora 2:参考图只当首帧,含人脸的图被拒。定妆照流程走不通。

多人同框是所有模型的共同弱项:超过 4 人,脸会互相「借」特征。解法在分镜层——三人以上的戏拆成双人正反打加一个不带脸部细节的远景。这不是换模型能解决的。

单段时长与段内剪辑:30 秒不等于更好

「段」是一次生成调用的产物,「分镜」是段里的一个机位。理想是段往 10–15 秒顶、每段 3–5 个分镜,切点由模型在段内完成,调用次数少、拼接点也少。

万相 3.0 单段上限 30 秒,Vidu Q3 16 秒,Seedance 2.0 / 海螺 H3 / 可灵 3.0 都是 15 秒,Veo 3.1 以 8 秒为主,Sora 2 API 给 4 / 8 / 12 秒三档。数字大不代表可用:SinCoSphere 一次 30 秒段测试里,计划的 8 个切点只执行了 6 个(单样本,只作提醒)。段越长,模型自己编导的空间越大。

建议:对白戏一段 10–15 秒;动作戏一段 5–8 秒、机位不超过 2 个;钉子和反转揭示单独成段。Veo 3.1 的 8 秒段对短剧偏短,一集 90 秒要 11–12 次调用,这是它在短剧场景的主要短板,不是画质。

分辨率、审核与可用性

竖屏短剧发布规格是 1080×1920。草片用 480P / 720P,定稿再切 1080P 或 2K,是通用的省钱办法。万相 3.0 三档齐全;海螺 H3 是 768P 与 2K(480P 只有 H3-Max);Veo 3.1 到 4K,短剧用不上。

审核是被低估的变量。阿里绿网最严:分镜里出现「血」「尸体」「断肢」「开放伤口」,请求直接返回 DataInspectionFailed,不扣钱但排队时间白等。修法是把暴力写成因果两端——倒地、闭眼、深色污渍、破碎的镜面——不写创口。火山略宽但也拒真人明星脸;Sora 2 拒真人、拒含人脸的输入图、拒版权角色,六家里最严。

可用性分两层。大陆直连:火山方舟、百炼、海螺大陆站、可灵、Vidu。海外:海螺国际站、可灵国际站、Vidu 国际站、Veo(Gemini API / Vertex / Flow)、Sora。Veo 与 Sora 在大陆没有合规直连渠道,团队在大陆的话只当出海版本的备选。

三种场景的推荐组合

对话戏(正反打、台词密集):大陆选 Seedance 2.0,开 generate_audio,每段 10–15 秒、3–5 个分镜,两张定妆照 + 一张场景图作参考;要音色稳定换海螺 H3 绑参考音频,记住首帧与参考图互斥。海外选 Veo 3.1(Fast 档 $0.10 / 秒草片、标准档定稿),或可灵 3.0 国际站用「指定角色说话」。

动作戏(追逐、对峙、打斗):看参考视频能力。Seedance 2.0 带 3 段、万相 3.0 带 5 段参考视频,能借一段动作素材的运镜与节奏。段 5–8 秒,一段 1–2 个机位;三人以上不同框;开门、摔杯这类刚体动作拆成两个分镜写起止状态。避开精细手部与连续格斗。

低成本量产(日更、先跑通再打磨):大陆用万相 3.0 的 480P(¥0.3 / 秒)或 720P(¥0.6 / 秒)出草片,全集审完只把要留的段切 1080P(¥1.2 / 秒)重生成。一集 90 秒草片约 ¥27–54。海外同样思路用 Veo 3.1 Lite($0.05 / 秒)或 Vidu Q3-turbo 540P 错峰价。量产前先把解析层的暴力措辞清干净,否则失败率吃掉省下的钱。

关键数字与来源

指标数值来源日期
MiniMax H3 768P 按秒价$0.08 / 秒(2K $0.13 / 秒)platform.minimax.io2026-09-02
万相 3.0 单段时长范围2–30 秒(无视频输入时)help.aliyun.com2026-09-02
Seedance 2.0 参考素材上限图 ≤9 张、视频 ≤3 段、音频 ≤3 段,最长 15 秒developer.volcengine.com2026-09-02
Veo 3.1 Fast 720p 按秒价$0.10 / 秒(标准档 $0.40 / 秒)ai.google.dev2026-09-02
Sora 2 API 时长参数seconds = 4 / 8 / 12developers.openai.com2026-09-02
Vidu Q3-pro 1080P 按秒价24 积分 / 秒(1 积分 = $0.005)platform.vidu.com2026-09-02

常见问题

做短剧到底该选哪一个?

没有单一答案。对话多选有原生音频且能指定说话人的(Seedance 2.0、海螺 H3、可灵 3.0、Veo 3.1);动作多选吃参考视频的(Seedance 2.0、万相 3.0);要省钱选万相 3.0 低档草片再切 1080P。大陆团队把 Veo / Sora 当出海备选。

Seedance 2.0 每秒到底多少钱?

火山方舟按 token 计价(¥28 / 百万 token),480P 和 720P 的 token 数不同,没有固定「每秒价」。公开报道折算 720P 5 秒约 ¥2.3。Seedance 2.5 加价 50%。

万相 3.0 能出 30 秒,一段就够一场戏吗?

不建议。段越长,模型越可能合并你计划的切点;SinCoSphere 一次 30 秒段测试里 8 个切点只执行了 6 个(单样本)。对白戏 10–15 秒、动作戏 5–8 秒一段更稳。

海螺 H3 的首帧和参考图为什么不能一起用?

官方文档规定互斥。做短剧默认用参考图(带定妆照保证角色一致),需要钉死衔接画面的段再单独用首帧。

Sora 2 为什么不适合带定妆照的流程?

OpenAI 文档写明 input_reference 只作首帧,含人脸的输入图被拒,真人和版权角色不能生成。它适合无固定角色的短片。

为什么分镜里写了「血迹」就失败?

阿里绿网对血腥、尸体、断肢等措辞直接返回 DataInspectionFailed。把暴力写成因果两端(倒地、闭眼、深色污渍)即可通过,其他国内模型用同一写法也更稳。

可灵的 API 价格为什么没写?

可灵开放平台价格页需登录,本次未取到官方数字,只引用公开报道的 App 折算(5 秒 720P 约 ¥4)。接 API 以登录后的价格页为准。

资料来源

本文提到的工具

延伸阅读