短剧出海译制:字幕、配音与本地化的坑——译文膨胀、口型错位、文化改写
短剧出海的本地化是三层活:剧本层改名字、称谓、场景与设定,要在解析拆集时做,改完流进设定图和分镜;字幕层只能改词面,管不了画面里的春联和人民币;配音层要面对中译英 30–50% 的译文膨胀——同一句话英文要多念一秒,口型和秒数就错位。处理顺序是缩译、拆句、重排秒数,最后才是重生成。
先说结论:本地化是三层,不是一层
把「翻译字幕」当成本地化,是出海短剧最常见的返工来源。一部剧里带文化信息的东西分布在三层,每层改法、时机、成本都不一样。下表按 SinCoSphere 编辑部的口径整理。
| 层 | 改什么 | 在哪一步做 | 成本量级 | 常见坑 |
|---|---|---|---|---|
| 剧本层 | 人名、称谓体系、地点与建筑、节日货币、制度背景(彩礼、户口、编制) | 解析拆集时,改完流进角色表、场景表、分镜 | 一次大模型调用,通常几元 | 拆集后再改 = 全部设定图与分镜重来 |
| 字幕层 | 词面:译文、度量衡、称谓的等效表达、字幕位置与行数 | 成片后 | 机翻近零;人工审校按集计 | 画面里的中文招牌、春联、人民币改不了 |
| 配音层 | 目标语种音色、台词秒数、口型 | 成片后贴配音,或在分镜里改秒数重生成台词镜头 | AI 配音按分钟;重生成按视频秒 | 译文膨胀导致口型漂移;源语音色念外语有口音 |
判断一个问题属于哪一层,只看一件事:它在不在画面里。在画面里的(招牌、钱、服装、建筑)只能剧本层解决;只在台词里的,字幕层就够。
字幕规格:每行字数、阅读速度、9:16 安全区
TikTok、YouTube Shorts 没有发布字幕阅读速度规范。行业通用的基准是 Netflix 的时序文本规范,各语种数值如下(简中、英文、日文)。
| 语种 | 每行上限 | 最多行数 | 阅读速度(成人 / 儿童) |
|---|---|---|---|
| 简体中文 | 16 字 | 2 | 9 字/秒 / 7 字/秒 |
| 英文 | 42 字符 | 2 | 20 字符/秒 / 17 字符/秒 |
| 日文(横排) | 13 全角字 | 2 | 4 字/秒 |
这些是 16:9 横屏的上限。竖屏 1080 px 宽,字号 56–64 px 时一行只放得下 12–14 个汉字、30 个左右英文字符,实际要按 Netflix 上限的七到八成排。
安全区方面,平台同样没有统一官方页,第三方模板指南的常见口径是:TikTok 在 1080×1920 里顶部 108–150 px、底部 320–440 px、右侧 120–180 px 会被界面盖住;YouTube Shorts 顶部约 120 px、底部约 300 px(模板指南一、模板指南二,均非平台官方)。可执行的结论:字幕放在画面高度 65–75% 处、居中、不超过两行,底部 25% 与右侧 180 px 不放任何文字。
译文膨胀:英文版口型为什么对不上
中文到英文,字面信息量不变,念出来的时间变长。SinCoSphere 的标定口径是中文约 5 字/秒、英文约 2.5 词/秒。一句「你根本不知道我为你放弃了什么。」15 字,中文念 3 秒;直译「You have absolutely no idea what I have given up for you.」12 词,要 4.8 秒,膨胀 60%;缩译成「You don't know what I gave up for you.」9 词,3.6 秒,膨胀 20%。经验区间就是 30–50%。
膨胀落在哪里取决于配音怎么做。外挂配音:英文音频比中文画面里的嘴长一秒,要么加速(超过 1.15 倍就不像人话),要么让配音压到下一镜头。音画同出:直接用英文重生成台词镜头,口型是对的,但这一镜要按秒重付。
三种处理按优先级排:① 缩译——压缩的是词不是意思,去掉「absolutely」「really」这类填充词,把从句拆成短句;② 拆句——一个镜头出两条字幕,各占一半秒数,阅读速度就回到 20 字符/秒以下;③ 重排秒数——在分镜里给这句多 1–1.5 秒,重生成这一镜,而不是把字幕阅读速度硬推到 25 字符/秒。多语种同时出片时,分镜的秒数按最长的那个语种排,中文版留白给反应镜头。见 对白时长口径。
AI 配音的三种选择与成本口径
一站式译制服务。腾讯云媒体 AI 的一篇文章给出的口径是:100 集 × 9 语种 = 900 集成品,全流程约 2,433 元,单集综合成本约 2.7 元,48 小时交付;分项为去水印 3 元/分钟、ASR 0.03 元/分钟、大模型翻译 0.60 元/分钟、OCR 提取翻译 0.80 元/分钟、AI 配音 0.5–9 元/分钟(视模式)、字幕渲染 0.063 元/分钟、合规审核 0.08 元/分钟;同文对比人工翻译「200 元以上/集/语种」(来源,厂商口径,SinCoSphere 未复核)。
配音平台。ElevenLabs 官网价格页列出 Dubbing 按源音频分钟计积分:自动配音带水印 2,000 积分/分钟、不带水印 3,000、Dubbing Studio 带水印 5,000、不带水印 10,000;Creator 档 $22/月 121,000 积分,折算约 40 分钟不带水印自动配音,每分钟约 $0.55(来源)。
剪辑软件内置。剪映国际版 / CapCut 官网列有 AI Dubbing 与视频翻译功能,自动字幕支持 20+ 语言(来源);配音语种数以产品页当期为准。适合单集试水,不适合 100 集批量。
三条里没有一条解决口型:贴上去的配音都需要上一节的处理。音色如何选、克隆授权怎么办,见 AI 短剧配音。
文化改写:剧本层还是字幕层
需要改写的东西,按能否在字幕层解决分两类。
- 字幕层能解决:人名音译或改名、度量衡与货币换算、「总裁」「师兄」「嫂子」这类无对应称谓找等效表达、俗语换目标语俗语。
- 只有剧本层能解决:四合院、胡同、大学宿舍这类空间;春联、红包、人民币、手机支付码这类画面道具;彩礼、户口、编制这类制度前提;「高考」「相亲」这类观众要有生活经验才懂的情节机关。
剧本层的改写要在解析拆集时做,因为角色外貌、场景描述、道具清单都是解析的产物,改完才会流进设定图与分镜。有工具把这一步做成了选项:SceneMixer 在解析时提供目标地区预设(欧美、东亚、东南亚、拉美),角色姓名、族裔外貌、街景建筑、画面可见文字按目标地区改写,并且界面语言与输出语言分开设置。LibTV、小云雀 是否有对应功能官网未公开。没有这个选项的工具,做法是在解析前给剧本加一段「目标市场」说明,或解析后手工改角色表与场景表再重生成设定图。
一个判断题:男主的身份是「集团总裁」。字幕层译成 CEO 没问题;但如果剧情靠「家族企业继承」推动,欧美观众能接受,东南亚观众更熟悉,而这个设定在拉美市场的等效物可能是另一种家族结构——这是剧本层的选题问题,不是翻译问题。
配音后口型错位:三个原因,出海多一个
口型错位的三个通用原因——没写清谁在说话、台词秒数给错、参考音色的腔调压过表演提示——在 配音一文 里展开过。出海多一个:目标语种的语速本身不同。同样 3 秒的镜头,中文放 15 字,英文放 7–8 词,西班牙语音节更多还要再少。所以多语版本不能共用一套分镜秒数。
可执行的做法:主语种(通常是英语)决定分镜秒数;其它语种在字幕层缩译;口型敏感的近景台词镜头,用目标语种音画同出重生成一次,远景、反打、画外音镜头直接贴配音。这样每集只有 2–4 个镜头需要重生成,费用可控。
出片前的 QA 清单
- 每条字幕 ≤2 行,简中每行 ≤14 字、英文 ≤36 字符(竖屏按 Netflix 上限的八成)。
- 阅读速度:简中 ≤9 字/秒、英文 ≤20 字符/秒;超过就拆句。
- 字幕落在画面高度 65–75%,底部 25% 与右侧 180 px 无文字。
- 人名前后统一,一部剧一张译名表。
- 称谓:同一关系全剧同一译法(「哥」不能一会儿 brother 一会儿直呼其名)。
- 画面里的中文可见文字(招牌、短信、文件)是否已在剧本层处理;没处理的镜头要么重生成要么打码。
- 配音语速 ≤1.15 倍;超过的镜头回到缩译或重排秒数。
- 近景说话镜头逐个看口型;错位的进重生成清单。
- 目标市场的审核红线(宗教、政治、未成年人)逐集过一遍;国内发布仍需 AIGC 标识(标识办法)。
- 抽三集给母语者盲看,问「哪句没听懂、哪里出戏」。
市场数据:先去哪个市场
Sensor Tower 的 2026 Q1 短剧应用报告:全球下载量 8.5 亿以上,同比增 140%;应用内购收入约 7.5 亿美元,同比增 20%;东南亚占全球下载量 32%,拉美 23%,印度 22%,三地合计超过四分之三;东南亚用户日均使用约 40 分钟,高于全球均值 25 分钟(来源)。DataEye 研究院经 36 氪发布的口径:把内购、订阅、IAA 与站外内容合计,2025 年海外短剧市场规模约 40 亿美元,2026 年预期超过 50 亿美元(来源)。
下载量与收入不是一回事。报告里收入头部仍是 DramaBox 与 ReelShort(Q1 各约 1.4 亿美元),付费主力在英语市场;下载增量在东南亚、拉美与印度。译制的语种顺序因此是:英语先做(付费),印尼语、泰语、越南语、菲律宾语看下载增量,西班牙语与葡萄牙语覆盖拉美。渠道与分账见 发行渠道,出海整体路径见 竖屏短剧出海指南。
关键数字与来源
| 指标 | 数值 | 来源 | 日期 |
|---|---|---|---|
| 东南亚占全球短剧应用下载量(2026 Q1) | 32%(拉美 23%、印度 22%) | sensortower.com | 2026-09-02 |
| 全球短剧应用下载量(2026 Q1) | 8.5 亿以上,同比 +140%;内购收入约 7.5 亿美元 | sensortower.com | 2026-09-02 |
| 2025 年海外短剧市场规模(DataEye 口径) | 约 40 亿美元 | 36kr.com | 2026-09-02 |
| AI 译制成本(腾讯云媒体 AI,厂商口径) | 100 集 × 9 语种约 2,433 元,单集综合约 2.7 元 | cloud.tencent.com | 2026-09-02 |
| ElevenLabs Dubbing 积分消耗 | 自动配音 2,000–3,000 积分/分钟;Dubbing Studio 5,000–10,000 | elevenlabs.io | 2026-09-02 |
| Netflix 简中字幕规范 | 每行 16 字、最多 2 行、成人 9 字/秒 | partnerhelp.netflixstudios.com | 2026-09-02 |
常见问题
竖屏短剧字幕一行放几个字?
按 Netflix 上限的七到八成:简中 12–14 字、英文 30–36 字符,最多两行,放在画面高度 65–75% 处。超出就拆成两条。
中译英字幕比中文长多少?
念出来通常长 30–50%。中文 5 字/秒、英文 2.5 词/秒,15 字的中文台词直译成 12 词要多 1.8 秒。先缩译再拆句,最后才改分镜秒数。
AI 配音 100 集要多少钱?
厂商口径一例:腾讯云媒体 AI 称 100 集 × 9 语种约 2,433 元、48 小时交付(未复核)。ElevenLabs 按源音频分钟计积分,自动配音不带水印 3,000 积分/分钟。口型对齐都要另外处理。
人名要不要改成外国名?
看市场。欧美观众对音译中文名的记忆成本高,改名是常规做法;东南亚华人比例高的市场可以保留。无论哪种,一部剧一张译名表,前后统一。
画面里的中文招牌怎么办?
字幕层改不了。要么在剧本层设定目标市场后重生成场景与镜头,要么后期打码或替换。批量出海的剧应在解析时就选定目标地区。
同一部剧多语种版本能共用分镜秒数吗?
不能直接共用。以最长的语种(通常是英语或西语)定秒数,其它语种在字幕层缩译;近景台词镜头按语种各重生成一次,远景与画外音镜头贴配音即可。
资料来源
- https://sensortower.com/blog/state-of-short-drama-apps-2026-report
- https://36kr.com/p/3648633863893505
- https://cloud.tencent.com/developer/article/2676855
- https://elevenlabs.io/pricing
- https://www.capcut.com/tools/ai-dubbing
- https://www.capcut.com/tools/ai-video-translator
- https://partnerhelp.netflixstudios.com/hc/en-us/articles/215986007-Chinese-Simplified-Timed-Text-Style-Guide
- https://partnerhelp.netflixstudios.com/hc/en-us/articles/217350977-English-Timed-Text-Style-Guide
- https://partnerhelp.netflixstudios.com/hc/en-us/articles/215767517-Simplified-Chinese-Timed-Text-Style-Guide
- https://blitzcutai.com/blog/safe-zones-youtube-shorts-reels-tiktok
- https://creamate.ai/en/blog/tiktok-safe-zone-guide
- https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm