AI 短剧配音怎么做:预置音色、声音克隆、音画同出三条路,以及口型对不上的原因
AI 短剧配音有三条路:预置音色库(按性别、语言、年龄从库里匹配,每个角色成本接近零)、声音克隆(按音色槽位或订阅收费,须取得声音权人同意并做标识)、音画同出(视频模型连台词一起生成,口型天然对齐,但重生成就要重付视频费)。口型对不上多数不是模型的问题:没写清谁在说话、台词秒数给错、或参考音色的腔调压过了表演提示。
三条路怎么选:一张表
先给结论:配角与旁白走预置库,主角视情况克隆,台词短的镜头用音画同出。三条路不互斥,一部剧通常混用。一个常见误区是把配音当成后期工序:三条路里有两条要在分镜阶段就定下来——音画同出要把台词写进提示词,参考音频要在生成前绑定到角色。下表的计费口径全部来自各家官网公开页,核查日期 2026-09-02。
| 路线 | 代表工具 | 计费口径(官网) | 长处 | 代价 |
|---|---|---|---|---|
| 预置音色库 | MiniMax 系统音色、剪映/CapCut 文本朗读、ElevenLabs 预置库、Azure 标准音色 | 按字符:MiniMax HD 包 ¥630/200 万字符;ElevenLabs v2 多语 1 字符 = 1 积分;CapCut 页面标注免费 | 零等待、可试听、跨集稳定 | 音色数有限;「腔」改不掉 |
| 声音克隆 | ElevenLabs IVC/PVC、火山声音复刻、MiniMax 快速复刻 | 按音色一次性或订阅 + 合成按字符;ElevenLabs PVC 自 Creator($22/月)起 | 独一无二,全剧复用 | 要授权与标识;PVC 需 30–180 分钟素材 |
| 音画同出 | Seedance 2.0、MiniMax H3、Veo 3.1、通义万相 | 藏在视频按秒价里,不单独计费 | 口型天然对齐,自带环境声 | 台词随画面一起重生成;语种与音色控制弱 |
路线一:预置音色库——便宜,但要会挑
预置库的钱在字符上,而短剧对白很短。一集 90 秒的竖屏剧,对白通常 250–400 字。按 MiniMax 中国站 HD 包价折算(¥630/200 万字符,约 ¥3.15/万字符,来源 MiniMax 价格页),一集不到 ¥0.15;Turbo 包 ¥360/200 万字符更低。国际站按量付费页列 HD 档 $100/百万字符(来源)。
其它库:剪映「文本朗读」/ CapCut Text to Speech 官网写明 200+ 音色,可按性别、年龄、风格、语言筛,页面标注免费(来源);ElevenLabs 预置库按积分计,Creator 档 $22/月含 121,000 积分(来源);Azure 标准音色覆盖 100+ 语言与地区,注意每个中文字按 2 个字符计费(来源)。
匹配顺序固定:性别 → 语言 → 年龄 → 听样本。做法上有两类:剪映、ElevenLabs 靠人在库里按标签挑;一站式短剧工具会替你匹配,例如 SceneMixer 按性别、语言、年龄从 MiniMax 系统音色库为每个角色自动配一条 3–8 秒样本,用户可重配或上传自己的。SinCoSphere 编辑部实测:库匹配的边际成本每角色约为零,而逐角色「生成音色」每个都要付槽位费。
路线二:声音克隆——先看授权,再看价格
克隆的价格差异在素材量与验证。ElevenLabs 官方文档写明:Instant Voice Cloning 需要 1–2 分钟干净音频,Starter($6/月)起可用;Professional Voice Cloning 需要 30–180 分钟素材、Creator 档起、必须通过身份验证且只能克隆自己的声音,微调耗时 3–6 小时(来源)。
火山引擎声音复刻按预付费音色槽位计,每个预付费音色支持 15 次训练上传、最新一次覆盖上次(计费说明);具体年费在文档站登录后可见,火山开发者社区文章给出的量级是「约 150 元/年/音色」(社区文章,非官方价表)。MiniMax 国际站快速复刻按音色计 $3/个;中国站包内赠送 10 个快速克隆音色。Azure 自定义音色是限制访问功能,需先申请。
合规两条,缺一不可。《民法典》第 1023 条第二款:对自然人声音的保护参照肖像权,未经同意不得制作、使用、公开(条文);《人工智能生成合成内容标识办法》2025-09-01 施行,合成音频要加显式或隐式标识(网信办)。实务上:给配音演员签书面授权,写清用途、期限、能否跨剧复用。
路线三:音画同出——口型最准,重来也最贵
视频模型自己出台词,口型天然对齐。四家的开关各不相同:Seedance 2.0 在创建任务时传 generate_audio 布尔参数,2.0、2.0 fast 与 1.5 pro 支持(火山方舟 API);MiniMax H3 接受参考音频,最多 3 段、总时长 ≤15 秒,且首帧图与参考图互斥(官方文档);Veo 3.1 官方定位是「带原生音频的视频生成」,对白写在引号里,音效与环境声分开描述(Gemini API);通义万相(wan2.5–3.0)的官方公式是「他说道:"好好学习,天天向上",语气轻松,语速适中,声音清亮,美式英文」,不要台词就写「无台词」(百炼提示词指南)。
代价有两条。第一,台词和画面是同一次生成:一个字念错、一句拖长,整段按秒重付。第二,语种与音色靠文字描述控制,精度低于 TTS——「低沉的中年男声」在库里是一个确定的音色,在视频模型里是一个概率分布。适用范围因此很清楚:台词 ≤8 秒、一次成功率高的镜头;长独白别用。
情绪、性别、年龄:硬过滤与「腔」
性别、语言、年龄是硬过滤,先筛掉再听。真正难的是「腔」:播音腔、客服腔、动画腔。它是音色本身的属性,写在情绪提示里改不掉。
SinCoSphere 编辑部实测过一个典型案例:给男主角配了一个新闻主播风格的预置音色,之后每一句台词——包括「压低声音」「带哭腔」「咬牙」这些表演提示——全部读成了播报。换成一个样本里本来就有起伏的音色,同样的提示立刻生效。参考音色样本的腔调会盖过表演提示,这是选库时最该听的东西,比「像不像」更重要。试听时听三样:句尾是上扬还是下坠、停顿落在标点还是意群、气声量有多少。三样都平直的,就是播报腔。
年龄要与外貌对上。角色设定 25 岁、音色样本是 45 岁的沉稳男声,观众会先注意到不对,再注意到剧情。情绪交给台词提示(语气、语速、停顿),腔交给换音色,两件事别混。
口型对不上的三个真正原因
一、说话人归属。模型让画面里离镜头最近、面积最大的那张脸动嘴。分镜里只写「台词:你别走」而没写谁说,多人同框时嘴动在错的人脸上是常态。改法:说话人先出现在画面描述里,只正向写「谁开口」,多人对话拆成反打镜头,一镜一人。
二、台词秒数不够或太多。SinCoSphere 的标定口径是中文约 5 字/秒、英文约 2.5 词/秒。15 字台词给 3 秒左右;给 2 秒,后半句压到下一镜头的人脸上;给 5 秒,模型会拖长音节或把台词念两遍来填时间。漂移在 3 秒内看不出,累积到一段 12 秒就明显了。详见 对白时长口径。
三、参考音色带节奏。H3 那 15 秒参考音频如果是朗读腔,模型连节奏一起学,成片里角色说话像念稿。样本要选对白,不选朗读。
还有一种不算「失败」的失败:路线一和路线二本来就没有口型。外挂 TTS 贴到已生成的画面上,嘴形与音频无关。要么用口型驱动工具重做嘴部,要么在分镜里用反打、背影、画外音把说话时的脸藏起来。
一集的配音钱长什么样
- 预置库:一站式工具多数不另收费;单独调 T2A,300 字按 ¥3.15/万字符约 ¥0.1。
- 克隆:一次性槽位费或订阅(按上文各家官网),加合成按字符;一部剧摊到每集可忽略。
- 音画同出:不单独计费,算在视频每秒价里;一段 10 秒重生成一次就是再付 10 秒。真正的配音成本是重生成率:一集里若三成台词镜头要重来一次,音画同出的实际配音支出就是这集视频费的三成,比任何 TTS 都贵。
结论:配音在一部剧的总支出里通常不到 1%(视频生成占 85% 以上,见 成本拆解)。别为省这 1% 去省授权和标识。
一套可以照做的流程
- 解析剧本时把每个角色的性别、年龄段、语言写进角色表。
- 先用预置库给全员匹配,逐个试听 3–8 秒样本,专门听「腔」。
- 主角评估是否克隆:先拿授权,再交素材;标识随片。
- 分镜里按 5 字/秒写台词秒数,每句写清说话人,多人对话拆反打。
- 台词 ≤8 秒的镜头用音画同出;长台词用 TTS + 反打或画外音。
- 出片前整集连听一遍:同一角色跨集腔调是否一致,年龄是否与脸对上。
关于分镜里怎么写台词与秒数,见 视频提示词写法;音画同出相关术语见 音画同出 与 参考音频。
关键数字与来源
| 指标 | 数值 | 来源 | 日期 |
|---|---|---|---|
| MiniMax T2A HD 包价(中国站) | ¥630 / 200 万字符,约 ¥3.15/万字符 | platform.minimaxi.com | 2026-09-02 |
| ElevenLabs Creator 档 | $22/月含 121,000 积分;Professional Voice Cloning 自此档起 | elevenlabs.io | 2026-09-02 |
| ElevenLabs 克隆素材要求 | Instant 1–2 分钟;Professional 30–180 分钟并需身份验证 | elevenlabs.io | 2026-09-02 |
| MiniMax H3 参考音频上限 | 最多 3 段,总时长 ≤15 秒 | platform.minimaxi.com | 2026-09-02 |
| 《人工智能生成合成内容标识办法》施行日期 | 2025-09-01 | www.cac.gov.cn | 2026-09-02 |
常见问题
预置音色会不会「撞声」?
会,尤其同性别同年龄段的角色。主角之间选库里差异明显的音色(音高、语速、气声量都不同),配角可以共用。
声音克隆要多少素材?
ElevenLabs 官方:Instant 1–2 分钟,Professional 30–180 分钟且需身份验证。火山按预付费槽位计,每个音色 15 次训练上传。素材要干净、无背景音乐、无混响。
能不能克隆某个明星或网红的声音?
不能。《民法典》第 1023 条把声音参照肖像权保护,未经同意不得制作、使用、公开。配音演员的声音也要书面授权,且合成内容要按标识办法加标识。
音画同出和 TTS 哪个便宜?
按字符算 TTS 便宜得多。音画同出不单独收费,费用是视频每秒价——重生成一次就再付一次。台词短、一次成功率高的镜头用音画同出划算;长台词用 TTS。
口型总慢半拍怎么办?
多数是秒数给多了。按中文 5 字/秒重排台词秒数,把富余的秒数交给动作或反应镜头,别让模型自己填时间。
同一角色出中英两个版本,音色怎么处理?
在库里选同性别、同年龄段的目标语种音色,不要让中文音色念英文——腔调会不对。克隆音色若支持多语,要逐句听有没有口音漂移。
资料来源
- https://platform.minimaxi.com/document/Price
- https://platform.minimax.io/docs/guides/pricing-paygo
- https://platform.minimaxi.com/document/video_generation
- https://www.capcut.com/tools/text-to-speech
- https://elevenlabs.io/pricing
- https://elevenlabs.io/docs/product-guides/voices/voice-cloning
- https://learn.microsoft.com/en-us/azure/ai-services/speech-service/text-to-speech
- https://www.volcengine.com/docs/6561/1359370
- https://developer.volcengine.com/articles/7633281901532282907
- https://www.volcengine.com/docs/82379/1520757
- https://ai.google.dev/gemini-api/docs/veo
- https://cloud.google.com/blog/products/ai-machine-learning/ultimate-prompting-guide-for-veo-3-1
- https://help.aliyun.com/zh/model-studio/text-to-video-prompt
- https://www.spp.gov.cn/spp/ssmfdyflvdtpgz/202008/t20200831_478416.shtml
- https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm