首页科普 › 短剧出海译制:字幕、配音与本地化的坑——译文膨胀、口型错位、文化改写

短剧出海译制:字幕、配音与本地化的坑——译文膨胀、口型错位、文化改写

短剧出海的本地化是三层活:剧本层改名字、称谓、场景与设定,要在解析拆集时做,改完流进设定图和分镜;字幕层只能改词面,管不了画面里的春联和人民币;配音层要面对中译英 30–50% 的译文膨胀——同一句话英文要多念一秒,口型和秒数就错位。处理顺序是缩译、拆句、重排秒数,最后才是重生成。

先说结论:本地化是三层,不是一层

把「翻译字幕」当成本地化,是出海短剧最常见的返工来源。一部剧里带文化信息的东西分布在三层,每层改法、时机、成本都不一样。下表按 SinCoSphere 编辑部的口径整理。

改什么在哪一步做成本量级常见坑
剧本层人名、称谓体系、地点与建筑、节日货币、制度背景(彩礼、户口、编制)解析拆集时,改完流进角色表、场景表、分镜一次大模型调用,通常几元拆集后再改 = 全部设定图与分镜重来
字幕层词面:译文、度量衡、称谓的等效表达、字幕位置与行数成片后机翻近零;人工审校按集计画面里的中文招牌、春联、人民币改不了
配音层目标语种音色、台词秒数、口型成片后贴配音,或在分镜里改秒数重生成台词镜头AI 配音按分钟;重生成按视频秒译文膨胀导致口型漂移;源语音色念外语有口音

判断一个问题属于哪一层,只看一件事:它在不在画面里。在画面里的(招牌、钱、服装、建筑)只能剧本层解决;只在台词里的,字幕层就够。

字幕规格:每行字数、阅读速度、9:16 安全区

TikTok、YouTube Shorts 没有发布字幕阅读速度规范。行业通用的基准是 Netflix 的时序文本规范,各语种数值如下(简中英文日文)。

语种每行上限最多行数阅读速度(成人 / 儿童)
简体中文16 字29 字/秒 / 7 字/秒
英文42 字符220 字符/秒 / 17 字符/秒
日文(横排)13 全角字24 字/秒

这些是 16:9 横屏的上限。竖屏 1080 px 宽,字号 56–64 px 时一行只放得下 12–14 个汉字、30 个左右英文字符,实际要按 Netflix 上限的七到八成排。

安全区方面,平台同样没有统一官方页,第三方模板指南的常见口径是:TikTok 在 1080×1920 里顶部 108–150 px、底部 320–440 px、右侧 120–180 px 会被界面盖住;YouTube Shorts 顶部约 120 px、底部约 300 px(模板指南一模板指南二,均非平台官方)。可执行的结论:字幕放在画面高度 65–75% 处、居中、不超过两行,底部 25% 与右侧 180 px 不放任何文字。

译文膨胀:英文版口型为什么对不上

中文到英文,字面信息量不变,念出来的时间变长。SinCoSphere 的标定口径是中文约 5 字/秒、英文约 2.5 词/秒。一句「你根本不知道我为你放弃了什么。」15 字,中文念 3 秒;直译「You have absolutely no idea what I have given up for you.」12 词,要 4.8 秒,膨胀 60%;缩译成「You don't know what I gave up for you.」9 词,3.6 秒,膨胀 20%。经验区间就是 30–50%

膨胀落在哪里取决于配音怎么做。外挂配音:英文音频比中文画面里的嘴长一秒,要么加速(超过 1.15 倍就不像人话),要么让配音压到下一镜头。音画同出:直接用英文重生成台词镜头,口型是对的,但这一镜要按秒重付。

三种处理按优先级排:① 缩译——压缩的是词不是意思,去掉「absolutely」「really」这类填充词,把从句拆成短句;② 拆句——一个镜头出两条字幕,各占一半秒数,阅读速度就回到 20 字符/秒以下;③ 重排秒数——在分镜里给这句多 1–1.5 秒,重生成这一镜,而不是把字幕阅读速度硬推到 25 字符/秒。多语种同时出片时,分镜的秒数按最长的那个语种排,中文版留白给反应镜头。见 对白时长口径

AI 配音的三种选择与成本口径

一站式译制服务。腾讯云媒体 AI 的一篇文章给出的口径是:100 集 × 9 语种 = 900 集成品,全流程约 2,433 元,单集综合成本约 2.7 元,48 小时交付;分项为去水印 3 元/分钟、ASR 0.03 元/分钟、大模型翻译 0.60 元/分钟、OCR 提取翻译 0.80 元/分钟、AI 配音 0.5–9 元/分钟(视模式)、字幕渲染 0.063 元/分钟、合规审核 0.08 元/分钟;同文对比人工翻译「200 元以上/集/语种」(来源,厂商口径,SinCoSphere 未复核)。

配音平台。ElevenLabs 官网价格页列出 Dubbing 按源音频分钟计积分:自动配音带水印 2,000 积分/分钟、不带水印 3,000、Dubbing Studio 带水印 5,000、不带水印 10,000;Creator 档 $22/月 121,000 积分,折算约 40 分钟不带水印自动配音,每分钟约 $0.55(来源)。

剪辑软件内置。剪映国际版 / CapCut 官网列有 AI Dubbing 与视频翻译功能,自动字幕支持 20+ 语言(来源);配音语种数以产品页当期为准。适合单集试水,不适合 100 集批量。

三条里没有一条解决口型:贴上去的配音都需要上一节的处理。音色如何选、克隆授权怎么办,见 AI 短剧配音

文化改写:剧本层还是字幕层

需要改写的东西,按能否在字幕层解决分两类。

  • 字幕层能解决:人名音译或改名、度量衡与货币换算、「总裁」「师兄」「嫂子」这类无对应称谓找等效表达、俗语换目标语俗语。
  • 只有剧本层能解决:四合院、胡同、大学宿舍这类空间;春联、红包、人民币、手机支付码这类画面道具;彩礼、户口、编制这类制度前提;「高考」「相亲」这类观众要有生活经验才懂的情节机关。

剧本层的改写要在解析拆集时做,因为角色外貌、场景描述、道具清单都是解析的产物,改完才会流进设定图与分镜。有工具把这一步做成了选项:SceneMixer 在解析时提供目标地区预设(欧美、东亚、东南亚、拉美),角色姓名、族裔外貌、街景建筑、画面可见文字按目标地区改写,并且界面语言与输出语言分开设置。LibTV小云雀 是否有对应功能官网未公开。没有这个选项的工具,做法是在解析前给剧本加一段「目标市场」说明,或解析后手工改角色表与场景表再重生成设定图。

一个判断题:男主的身份是「集团总裁」。字幕层译成 CEO 没问题;但如果剧情靠「家族企业继承」推动,欧美观众能接受,东南亚观众更熟悉,而这个设定在拉美市场的等效物可能是另一种家族结构——这是剧本层的选题问题,不是翻译问题。

配音后口型错位:三个原因,出海多一个

口型错位的三个通用原因——没写清谁在说话、台词秒数给错、参考音色的腔调压过表演提示——在 配音一文 里展开过。出海多一个:目标语种的语速本身不同。同样 3 秒的镜头,中文放 15 字,英文放 7–8 词,西班牙语音节更多还要再少。所以多语版本不能共用一套分镜秒数。

可执行的做法:主语种(通常是英语)决定分镜秒数;其它语种在字幕层缩译;口型敏感的近景台词镜头,用目标语种音画同出重生成一次,远景、反打、画外音镜头直接贴配音。这样每集只有 2–4 个镜头需要重生成,费用可控。

出片前的 QA 清单

  • 每条字幕 ≤2 行,简中每行 ≤14 字、英文 ≤36 字符(竖屏按 Netflix 上限的八成)。
  • 阅读速度:简中 ≤9 字/秒、英文 ≤20 字符/秒;超过就拆句。
  • 字幕落在画面高度 65–75%,底部 25% 与右侧 180 px 无文字。
  • 人名前后统一,一部剧一张译名表。
  • 称谓:同一关系全剧同一译法(「哥」不能一会儿 brother 一会儿直呼其名)。
  • 画面里的中文可见文字(招牌、短信、文件)是否已在剧本层处理;没处理的镜头要么重生成要么打码。
  • 配音语速 ≤1.15 倍;超过的镜头回到缩译或重排秒数。
  • 近景说话镜头逐个看口型;错位的进重生成清单。
  • 目标市场的审核红线(宗教、政治、未成年人)逐集过一遍;国内发布仍需 AIGC 标识(标识办法)。
  • 抽三集给母语者盲看,问「哪句没听懂、哪里出戏」。

市场数据:先去哪个市场

Sensor Tower 的 2026 Q1 短剧应用报告:全球下载量 8.5 亿以上,同比增 140%;应用内购收入约 7.5 亿美元,同比增 20%;东南亚占全球下载量 32%,拉美 23%,印度 22%,三地合计超过四分之三;东南亚用户日均使用约 40 分钟,高于全球均值 25 分钟(来源)。DataEye 研究院经 36 氪发布的口径:把内购、订阅、IAA 与站外内容合计,2025 年海外短剧市场规模约 40 亿美元,2026 年预期超过 50 亿美元(来源)。

下载量与收入不是一回事。报告里收入头部仍是 DramaBox 与 ReelShort(Q1 各约 1.4 亿美元),付费主力在英语市场;下载增量在东南亚、拉美与印度。译制的语种顺序因此是:英语先做(付费),印尼语、泰语、越南语、菲律宾语看下载增量,西班牙语与葡萄牙语覆盖拉美。渠道与分账见 发行渠道,出海整体路径见 竖屏短剧出海指南

关键数字与来源

指标数值来源日期
东南亚占全球短剧应用下载量(2026 Q1)32%(拉美 23%、印度 22%)sensortower.com2026-09-02
全球短剧应用下载量(2026 Q1)8.5 亿以上,同比 +140%;内购收入约 7.5 亿美元sensortower.com2026-09-02
2025 年海外短剧市场规模(DataEye 口径)约 40 亿美元36kr.com2026-09-02
AI 译制成本(腾讯云媒体 AI,厂商口径)100 集 × 9 语种约 2,433 元,单集综合约 2.7 元cloud.tencent.com2026-09-02
ElevenLabs Dubbing 积分消耗自动配音 2,000–3,000 积分/分钟;Dubbing Studio 5,000–10,000elevenlabs.io2026-09-02
Netflix 简中字幕规范每行 16 字、最多 2 行、成人 9 字/秒partnerhelp.netflixstudios.com2026-09-02

常见问题

竖屏短剧字幕一行放几个字?

按 Netflix 上限的七到八成:简中 12–14 字、英文 30–36 字符,最多两行,放在画面高度 65–75% 处。超出就拆成两条。

中译英字幕比中文长多少?

念出来通常长 30–50%。中文 5 字/秒、英文 2.5 词/秒,15 字的中文台词直译成 12 词要多 1.8 秒。先缩译再拆句,最后才改分镜秒数。

AI 配音 100 集要多少钱?

厂商口径一例:腾讯云媒体 AI 称 100 集 × 9 语种约 2,433 元、48 小时交付(未复核)。ElevenLabs 按源音频分钟计积分,自动配音不带水印 3,000 积分/分钟。口型对齐都要另外处理。

人名要不要改成外国名?

看市场。欧美观众对音译中文名的记忆成本高,改名是常规做法;东南亚华人比例高的市场可以保留。无论哪种,一部剧一张译名表,前后统一。

画面里的中文招牌怎么办?

字幕层改不了。要么在剧本层设定目标市场后重生成场景与镜头,要么后期打码或替换。批量出海的剧应在解析时就选定目标地区。

同一部剧多语种版本能共用分镜秒数吗?

不能直接共用。以最长的语种(通常是英语或西语)定秒数,其它语种在字幕层缩译;近景台词镜头按语种各重生成一次,远景与画外音镜头贴配音即可。

资料来源

本文提到的工具

延伸阅读