Seedance、可灵、海螺、万相、Veo、Sora:做短剧该选哪个视频模型(2026 年 9 月)
短剧选模型看三件事:台词能不能交给画面里正确的那张脸(原生音频 + 说话人归属)、一次调用吃几张参考图(角色跨集一致)、一段能不能剪出 3–5 个镜头。2026 年 9 月:对话戏选 Seedance 2.0 / 海螺 H3 / Veo 3.1;动作戏看参考视频能力(Seedance、万相 3.0);低成本量产用万相 3.0 低档草片,定稿再切 1080P。
先说结论:按任务选,不按热度选
六家模型在 2026 年 9 月都能出像样的单条视频。差别在短剧真正用到的几个硬指标:谁来说这句台词、能带几张参考图、一段最长多少秒、什么措辞会被拒、每秒多少钱。这些官方文档都写得清楚,不用靠感觉。
三条结论。第一,台词多的戏只考虑有原生音频且能指定说话人的模型:Seedance 2.0、海螺 H3、Veo 3.1、可灵 3.0。第二,角色跨集一致性由参考图上限和规则决定:Seedance 9 张、海螺 9 张、万相 10 张、Vidu 7 个主体、Veo 3 张;Sora 的参考图只当首帧,且含人脸的图会被拒,带定妆照的流程走不通。第三,单段能出 30 秒(万相 3.0)不等于更好,段越长,模型越容易合并你计划的切点。
决策表:能力维度
| 模型(渠道) | 原生音频 / 说话人归属 | 参考图 / 参考音视频 | 首尾帧 | 单段时长 | 分辨率 | 审核 |
|---|---|---|---|---|---|---|
| Seedance 2.0(火山方舟 API / 即梦) | 有,generate_audio,口型随台词 | 图 ≤9 张;视频 ≤3 段;音频 ≤3 段 | 有(first_frame / last_frame) | 4–15 秒 | 480P / 720P(以方舟当前文档为准) | 较严 |
| 海螺 H3(api.minimax.io 国际站 / api.minimaxi.com 大陆站) | 有,原生语音;参考音频可锁音色 | 图 ≤9 张(前 5 张免费);参考音频 ≤3 段、合计 ≤15 秒;首帧与参考图互斥 | 首帧有,与参考图二选一 | 4–15 秒 | 768P / 2K(480P 仅 H3-Max) | 中 |
| 通义万相 3.0(百炼 wan3.0-video / 高速版 -prime) | 有,audio 参数默认开 | 图 ≤10 张;视频 ≤5 段、合计 ≤15 秒;音频 ≤5 段 | 有(first_frame / last_frame) | 2–30 秒 | 480P / 720P / 1080P | 最严(绿网,血腥尸体措辞直接 DataInspectionFailed) |
| 可灵 VIDEO 3.0(可灵 App / 开放平台) | 有,Native Audio 可指定角色说话,多语言 | 多图 + 元素 + 视频参考(张数上限用户指南未列) | 有 | 3–15 秒(旧版 API 5 / 10 秒) | 720P / 1080P(std / pro) | 中 |
| Vidu Q3(vidu.cn / platform.vidu.com) | 有(viduq3 / -turbo 音画同出) | 参考主体 ≤7 个(图或文字) | 本次核查页未列 | 1–16 秒 | 540P / 720P / 1080P | 中 |
| Veo 3.1(Gemini API / Vertex / Flow) | 有,原生音频 | 图 ≤3 张 | 有(首帧 + 末帧) | 8 秒为主,可延长 | 720p / 1080p / 4K | 严(真人面孔等) |
| Sora 2(OpenAI API / App) | 有,原生音频 | input_reference 只作首帧;含人脸的输入图被拒 | 只有首帧 | API seconds = 4 / 8 / 12 | 720p;1080p 需 sora-2-pro | 最严(真人、人脸图、版权角色) |
「说话人归属」指模型能否把台词交给你点名的角色,而不是画面里最大的那张脸。只有可灵 3.0 在用户指南里明写「指定角色说话」;海螺 H3 靠参考音频间接锁定;其余靠提示词里的说话人标注,命中率取决于写法。
决策表:价格与可用性
| 模型 | 按秒价格(官方口径) | 渠道说明 | 大陆 | 海外 |
|---|---|---|---|---|
| Seedance 2.0 | ¥28 / 百万 token(方舟牌价);公开报道折算 720P 5 秒约 ¥2.3 | token 数随分辨率与时长变化,没有固定每秒价;Seedance 2.5 加价 50% | API + 即梦 | App 可用;API 渠道以当前模型列表为准 |
| 海螺 H3 | 768P $0.08 / 秒;2K $0.13 / 秒;480P(H3-Max)$0.05 / 秒 | 国际站价格页;参考图第 6 张起 $0.04 / 张;大陆站人民币价另列 | 是 | 是 |
| 万相 3.0 | 480P ¥0.3 / 秒;720P ¥0.6 / 秒;1080P ¥1.2 / 秒 | 阿里云发布口径;8 月 24 日–9 月 23 日百炼 API 7 折;高速版同价 | 百炼 | 阿里云国际站以当前列表为准 |
| 可灵 3.0 | 公开报道:App 5 秒 720P 约 ¥4 | 开放平台 API 价格页需登录,本次未取到官方数字 | 是 | 是(klingai.com/global) |
| Vidu Q3 | Q3-pro 1080P 24 积分 / 秒($0.12);720P $0.10;540P $0.045;Q3-turbo 1080P $0.065 | 1 积分 = $0.005;音频 +15 积分 / 条;错峰半价 | vidu.cn | 是 |
| Veo 3.1 | 标准 $0.40 / 秒(720p / 1080p)、4K $0.60;Fast $0.10 / $0.12 / $0.30;Lite $0.05 / $0.08 | Gemini API 价格页;含音频;失败不计费 | 无合规直连 | 是 |
| Sora 2 | sora-2 720p $0.10 / 秒;sora-2-pro 720p $0.30、1024p $0.50、1080p $0.70 | OpenAI 价格页;Batch 半价 | 否 | 是 |
两点提醒。火山按 token 计价,同一模型 480P 和 720P 每秒 token 数不同,别把「每秒 ¥1」当固定数。海螺、Vidu 的大陆站与国际站是两套价目表和两套模型目录,不要拿美元价直接换算。第三方 API 中转报价常低于官方,但分辨率与参考图数量可能被裁剪,本文不采用。
口型与说话人归属:原生音频是分水岭
一集 90 秒里通常有 40–60 秒是台词。没有原生音频的模型要先出无声片再补口型,多一步就多一次不一致,成本也翻倍。所以做对话戏,先把没有原生音频的选项划掉。
有了原生音频,下一个问题是「谁在说」。SinCoSphere 编辑部在生产线路上的测试里,对话戏最常见的返工是台词被交给画面里最显眼的那张脸,而不是剧本里的说话人。可灵 3.0 用户指南明写可指定角色说话;海螺 H3 允许绑 3 段以内、合计 15 秒的参考音频,音色对了归属基本就对;Seedance 2.0 与 Veo 3.1 靠提示词——每句台词前写说话人和他此刻在画面里的位置,并且不要在另一个人的特写里放这句台词。
还有一条硬规则:段的秒数减去台词秒数,富余超过 2 秒又没写收尾动作,模型会把台词再念一遍。中文按每秒约 5 字折算,富余的秒数要写成动作。
多人同框与参考图:一致性由谁兜底
角色跨集不变脸,靠每一段生成都带上定妆照。所以参考图的数量上限和规则比画质更重要。
- Seedance 2.0:9 张图 + 3 段视频 + 3 段音频。双人对话 = 两张定妆照 + 一张场景图 + 一两张道具图,够用。
- 海螺 H3:9 张图,前 5 张免费。首帧与参考图互斥,用了首帧就带不了定妆照。
- 万相 3.0:10 张图 + 5 段视频,上限最高。
- Vidu Q3:7 个主体,图和文字都算。
- Veo 3.1:3 张。两个角色加一个场景就满了。
- Sora 2:参考图只当首帧,含人脸的图被拒。定妆照流程走不通。
多人同框是所有模型的共同弱项:超过 4 人,脸会互相「借」特征。解法在分镜层——三人以上的戏拆成双人正反打加一个不带脸部细节的远景。这不是换模型能解决的。
单段时长与段内剪辑:30 秒不等于更好
「段」是一次生成调用的产物,「分镜」是段里的一个机位。理想是段往 10–15 秒顶、每段 3–5 个分镜,切点由模型在段内完成,调用次数少、拼接点也少。
万相 3.0 单段上限 30 秒,Vidu Q3 16 秒,Seedance 2.0 / 海螺 H3 / 可灵 3.0 都是 15 秒,Veo 3.1 以 8 秒为主,Sora 2 API 给 4 / 8 / 12 秒三档。数字大不代表可用:SinCoSphere 一次 30 秒段测试里,计划的 8 个切点只执行了 6 个(单样本,只作提醒)。段越长,模型自己编导的空间越大。
建议:对白戏一段 10–15 秒;动作戏一段 5–8 秒、机位不超过 2 个;钉子和反转揭示单独成段。Veo 3.1 的 8 秒段对短剧偏短,一集 90 秒要 11–12 次调用,这是它在短剧场景的主要短板,不是画质。
分辨率、审核与可用性
竖屏短剧发布规格是 1080×1920。草片用 480P / 720P,定稿再切 1080P 或 2K,是通用的省钱办法。万相 3.0 三档齐全;海螺 H3 是 768P 与 2K(480P 只有 H3-Max);Veo 3.1 到 4K,短剧用不上。
审核是被低估的变量。阿里绿网最严:分镜里出现「血」「尸体」「断肢」「开放伤口」,请求直接返回 DataInspectionFailed,不扣钱但排队时间白等。修法是把暴力写成因果两端——倒地、闭眼、深色污渍、破碎的镜面——不写创口。火山略宽但也拒真人明星脸;Sora 2 拒真人、拒含人脸的输入图、拒版权角色,六家里最严。
可用性分两层。大陆直连:火山方舟、百炼、海螺大陆站、可灵、Vidu。海外:海螺国际站、可灵国际站、Vidu 国际站、Veo(Gemini API / Vertex / Flow)、Sora。Veo 与 Sora 在大陆没有合规直连渠道,团队在大陆的话只当出海版本的备选。
三种场景的推荐组合
对话戏(正反打、台词密集):大陆选 Seedance 2.0,开 generate_audio,每段 10–15 秒、3–5 个分镜,两张定妆照 + 一张场景图作参考;要音色稳定换海螺 H3 绑参考音频,记住首帧与参考图互斥。海外选 Veo 3.1(Fast 档 $0.10 / 秒草片、标准档定稿),或可灵 3.0 国际站用「指定角色说话」。
动作戏(追逐、对峙、打斗):看参考视频能力。Seedance 2.0 带 3 段、万相 3.0 带 5 段参考视频,能借一段动作素材的运镜与节奏。段 5–8 秒,一段 1–2 个机位;三人以上不同框;开门、摔杯这类刚体动作拆成两个分镜写起止状态。避开精细手部与连续格斗。
低成本量产(日更、先跑通再打磨):大陆用万相 3.0 的 480P(¥0.3 / 秒)或 720P(¥0.6 / 秒)出草片,全集审完只把要留的段切 1080P(¥1.2 / 秒)重生成。一集 90 秒草片约 ¥27–54。海外同样思路用 Veo 3.1 Lite($0.05 / 秒)或 Vidu Q3-turbo 540P 错峰价。量产前先把解析层的暴力措辞清干净,否则失败率吃掉省下的钱。
关键数字与来源
| 指标 | 数值 | 来源 | 日期 |
|---|---|---|---|
| MiniMax H3 768P 按秒价 | $0.08 / 秒(2K $0.13 / 秒) | platform.minimax.io | 2026-09-02 |
| 万相 3.0 单段时长范围 | 2–30 秒(无视频输入时) | help.aliyun.com | 2026-09-02 |
| Seedance 2.0 参考素材上限 | 图 ≤9 张、视频 ≤3 段、音频 ≤3 段,最长 15 秒 | developer.volcengine.com | 2026-09-02 |
| Veo 3.1 Fast 720p 按秒价 | $0.10 / 秒(标准档 $0.40 / 秒) | ai.google.dev | 2026-09-02 |
| Sora 2 API 时长参数 | seconds = 4 / 8 / 12 | developers.openai.com | 2026-09-02 |
| Vidu Q3-pro 1080P 按秒价 | 24 积分 / 秒(1 积分 = $0.005) | platform.vidu.com | 2026-09-02 |
常见问题
做短剧到底该选哪一个?
没有单一答案。对话多选有原生音频且能指定说话人的(Seedance 2.0、海螺 H3、可灵 3.0、Veo 3.1);动作多选吃参考视频的(Seedance 2.0、万相 3.0);要省钱选万相 3.0 低档草片再切 1080P。大陆团队把 Veo / Sora 当出海备选。
Seedance 2.0 每秒到底多少钱?
火山方舟按 token 计价(¥28 / 百万 token),480P 和 720P 的 token 数不同,没有固定「每秒价」。公开报道折算 720P 5 秒约 ¥2.3。Seedance 2.5 加价 50%。
万相 3.0 能出 30 秒,一段就够一场戏吗?
不建议。段越长,模型越可能合并你计划的切点;SinCoSphere 一次 30 秒段测试里 8 个切点只执行了 6 个(单样本)。对白戏 10–15 秒、动作戏 5–8 秒一段更稳。
海螺 H3 的首帧和参考图为什么不能一起用?
官方文档规定互斥。做短剧默认用参考图(带定妆照保证角色一致),需要钉死衔接画面的段再单独用首帧。
Sora 2 为什么不适合带定妆照的流程?
OpenAI 文档写明 input_reference 只作首帧,含人脸的输入图被拒,真人和版权角色不能生成。它适合无固定角色的短片。
为什么分镜里写了「血迹」就失败?
阿里绿网对血腥、尸体、断肢等措辞直接返回 DataInspectionFailed。把暴力写成因果两端(倒地、闭眼、深色污渍)即可通过,其他国内模型用同一写法也更稳。
可灵的 API 价格为什么没写?
可灵开放平台价格页需登录,本次未取到官方数字,只引用公开报道的 App 折算(5 秒 720P 约 ¥4)。接 API 以登录后的价格页为准。
资料来源
- https://developer.volcengine.com/articles/7606009619928449070
- https://finance.sina.com.cn/tech/roll/2026-03-04/doc-inhpvpqk3838479.shtml
- https://news.qq.com/rain/a/20260211A02P8H00
- https://platform.minimax.io/docs/guides/pricing-paygo
- https://help.aliyun.com/zh/model-studio/wan3-video-generation-api-reference
- https://news.qq.com/rain/a/20260806A0E2YY00
- https://app.klingai.com/global/quickstart/klingai-video-3-model-user-guide
- https://platform.vidu.com/docs/reference-to-video
- https://platform.vidu.com/docs/pricing
- https://ai.google.dev/gemini-api/docs/video
- https://ai.google.dev/gemini-api/docs/pricing
- https://developers.openai.com/api/docs/guides/video-generation
- https://developers.openai.com/api/docs/api-reference/videos/create
- https://developers.openai.com/api/docs/pricing