AI 短剧常见翻车现场:口型不对、手指、台词念两遍、动作重演——成因与修法
AI 短剧的翻车多数不是模型不行,而是写法把模型引到了错的地方。十二种常见问题里,八种在分镜层修(说话人、复读、乱入、刚体动作、承接、姿态词、调色词、段长),两种在设定图层修(场景残留、参考图光效),一种在解析层修(年龄词),一种在模型层修(审核措辞与选型)。排查顺序永远是先分层对账,再重生成。
先看总表
| # | 症状 | 机理 | 修法 | 哪层修 |
|---|---|---|---|---|
| 1 | 台词从画面里另一张脸嘴里出来 | 模型把台词交给当前最显眼的脸,提示词没绑定说话人 | 每句前写说话人 + 此刻在画面里的位置;别在别人的特写里放台词;能绑参考音频就绑 | 分镜层(+ 模型层) |
| 2 | 同一句台词念两遍 | 段的秒数 > 台词秒数,富余秒数没有出口 | 按 5 字 / 秒折算;富余 ≥2 秒必写收尾动作 | 分镜层 |
| 3 | 不该在场的角色出现在画面里 | 模型没有「出画」概念,名字出现就画 | 只正向写画面里有谁;不写「X 不在」 | 分镜层 |
| 4 | 门自己开、杯子自己碎 | 刚体运动只渲染起止两态,过程缺失 | 拆成两个分镜写起止状态,或写清「手推 → 门开」的因果 | 分镜层 |
| 5 | 上一段结尾的动作在下一段开头再做一遍;道具回到原位 | 段之间没有状态记忆,承接句又写了动作动词 | 承接写成既成状态;每段重申道具当前状态 | 分镜层 |
| 6 | 手指多、少、粘连 | 手部自由度高、训练样本少 | 少给手部特写;手持道具或放画外;不写「手指」二字 | 分镜层 |
| 7 | 每个镜头的地上都有血、镜子都是碎的 | 场景图把剧情残留物烘了进去,被每个镜头继承 | 场景图只画中性空景;残留物写在分镜里 | 设定图层 |
| 8 | 成年角色越画越年轻 | 外貌里有「婴儿肥」「稚气」「少年感」等年龄暗示词 | 外貌只写骨相与静态特征,写明年龄段 | 解析层 |
| 9 | 写了「上身前倾」,出来是俯拍全身 | 姿态词被当成机位指令,模型拉远拉高去展示姿态 | 先写景别与机位,姿态只写可见的上半身 | 分镜层 |
| 10 | 皮肤油亮、HDR 感、脸上一块黄光 | 「cinematic / teal-orange / 8K」唤起高对比调色先验;布光写成了落点 | 删调色黑话;只写光源位置与介质,不写光落在哪 | 分镜层 + 设定图层 |
| 11 | 30 秒段里计划的切点被合并 | 长段给模型太多自行编导的空间 | 段 10–15 秒、3–5 个分镜;关键切点单独成段 | 分镜层 + 模型层 |
| 12 | 请求直接被拒(DataInspectionFailed) | 血 / 尸体 / 断肢 / 创口等措辞触发审核 | 暴力只写因果两端;解析层不产出此类词 | 分镜层 + 解析层 |
四层的定义:解析层是角色外貌、场景描述、分集大纲;设定图层是定妆照、场景空景、道具图;分镜层是每段的机位、台词、动作、布光;模型层是选哪个模型、开哪些参数。
声音:说话人错位与台词复读
说话人错位。症状是台词从画面里另一个人嘴里出来,常见于正反打里切到听者特写时。机理是原生音频模型把台词交给当前最显眼的那张脸,除非提示词把「谁说」绑死。SinCoSphere 编辑部在生产线路上的测试里,这是对话戏排第一的返工原因。
修法三条:每句台词前写说话人和他此刻在画面里的位置;不把 A 的台词放进 B 的特写,要反应镜头就明写「画外音」;能绑参考音频的模型(海螺 H3 最多 3 段、合计 15 秒)就绑,音色对了归属基本就对。
台词复读。症状是一句话念完停一拍又念一遍。机理是时间没有出口:7 秒分镜里台词只有 4.5 秒,又没写台词之后做什么,模型就用复读填满 2.5 秒。修法是按中文约 5 字 / 秒折算,富余 2 秒以上必须写收尾动作——转身、放下杯子、看向门。
出场与承接:乱入、动作重演、道具复位
画外角色乱入。症状是本该不在场的角色出现在画面里。机理是模型没有「出画」概念,名字一出现就要画,点名反而提高乱入概率。修法只有一条:只正向写画面里有谁。要交代 B 在门外,写「门缝下有一道影子」,别写 B。
动作在下一段重演。症状是上一段结尾她推门进屋,下一段开头又推了一次。机理是段之间没有状态记忆,承接句一旦写了动作动词,模型就再演一次。修法是承接写成既成状态:「门已开,她站在门内两步处」。
道具复位。症状是上一段摔碎的杯子,下一段又完好地立在桌上。机理相同:每段独立生成,状态不延续。修法是每段重申道具当前状态(「桌上那只已碎的杯子」)。
动作与手:门自己开、手指畸形
刚体动作只有起止态。症状是门自己开、杯子在手碰到之前就碎了。在海螺 H3 上复现最稳定(SinCoSphere 生产线路测试):刚体运动被渲染为开始态和结束态,中间过程缺失,看起来像「自己动」。修法是拆成两个分镜写起止:「她的手搭在门把上,门关着」→「门已开一半,她半个身子在门内」;或把因果写进同一句「手掌推门,门随之向内开」。不要写「门开了」。
手指畸形。症状是六根手指、手指粘连、握杯穿模。机理是手部自由度高、样本少,所有视频模型共此弱项。修法是躲:少给手部特写;需要手的戏让它握住道具(杯、伞柄、门把),道具能约束手型;或者让手落在画面边缘或口袋里。提示词里不要出现「手指」二字。
参考图:场景图烘入残留、年龄漂移
场景图烘入剧情残留。症状是同一场景的每个镜头地上都有血、镜子都是碎的,哪怕剧情还没走到。机理是场景空景图是这个场景所有镜头的共同参考,画进去的任何东西都被每段继承。修法在设定图层:场景图只画中性空景——空间结构、材质、三层纵深、光源在哪——不画剧情产物;残留物写在需要它的那个分镜里。
年龄漂移。症状是三十岁的角色越画越像二十岁。机理在解析层:外貌描述带了「婴儿肥」「稚气」「少年感」这类年龄暗示词,图像模型把它们当年龄指令,每次生成都往年轻拉。修法是外貌只写骨相与静态特征——脸型、眉眼、鼻唇、肤色、发型、体型——写明年龄段(「35 岁上下」),删掉一切形容气质的词。
提示词:姿态词变俯拍、调色黑话与光斑
「上身前倾」变俯拍全身。症状是写了中近景对话,成片是高角度全身。机理是姿态词被当成构图要求:要让「前倾」看得见,模型就把机位抬高拉远。修法是顺序——先写景别与机位(「中近景,平视,肩线以上」),再写姿态,且只写这个景别里看得见的部分(「肩膀微向前压」)。
油腻皮肤与 HDR 感。症状是皮肤像打了蜡、蓝橙对撞。机理是「cinematic」「teal-orange」「8K」「masterpiece」是早期图像模型的触发词,会唤起一套高对比调色先验。修法是删掉整套调色词,只写光源与介质(「窗外阴天的散射光从左侧进来」),加一句质感要求「自然肤质、无塑料感」。
光斑。症状是额头或鼻梁上糊一团黄。机理是布光写成了落点(「暖光打亮她的额头」),模型就在那个部位刷一块亮。修法是写原因不写结果:光源在哪、什么色温、经过什么介质,不写光落在谁身上;不用「暖黄」这类高饱和色词。
长段与审核:30 秒段丢切点、绿网拒绝
长段丢切点。症状是一段里计划了 8 个镜头,成片只有 6 个。机理是段越长,模型自行编导的空间越大。万相 3.0 允许单段 30 秒,SinCoSphere 一次 30 秒段测试里 8 个计划切点执行了 6 个(单样本,只作提醒)。修法在分镜层:段 10–15 秒、3–5 个分镜;钉子、反转揭示单独成段。别为了「一段更长」选模型。
审核拒绝。症状是请求直接失败,百炼返回 DataInspectionFailed,不扣费但排队时间白等。机理是阿里绿网对「血」「尸体」「断肢」「开放伤口」零容忍。修法两层:分镜层把暴力写成因果两端——倒地、闭眼、深色污渍、破碎的镜面——不写创口本身;解析层从源头不产出这类词。
排查顺序:先分层对账,再重生成
看到翻车先别重生成。重生成是全价,改分镜是免费的。按下面的顺序对账。
- 正文对账:成片和该段分镜逐句对照。台词归属、动作动词、点名的角色、姿态词、调色词,哪一项在分镜里就是错的?
- 布景对账:打开该场景的空景图。残留物、强调色、情绪光是不是烘在图里?是就换图。
- 参考图对账:打开定妆照与解析层外貌文本,删年龄词、气质词、表情词。
- 模型对账:以上都对了仍复现,才是模型层——换有原生音频与说话人归属的模型、缩短段长,或接受该模型的已知弱项(手、刚体、多人同框)绕开写。
一个经验:同一种翻车在两个模型上都出现,几乎一定是写法问题;只在一个模型上出现,才值得怀疑模型。
关键数字与来源
| 指标 | 数值 | 来源 | 日期 |
|---|---|---|---|
| 万相 3.0 审核失败错误码 | DataInspectionFailed(单段时长 2–30 秒) | help.aliyun.com | 2026-09-02 |
| Seedance 2.0 单段上限 | 最长 15 秒;参考图 ≤9 张 | developer.volcengine.com | 2026-09-02 |
| MiniMax H3 参考图计费 | 前 5 张免费,之后 $0.04 / 张 | platform.minimax.io | 2026-09-02 |
| Veo 3.1 参考图上限 | 最多 3 张 | ai.google.dev | 2026-09-02 |
| Sora 2 输入图限制 | 含人脸的输入图被拒;不生成真人 | developers.openai.com | 2026-09-02 |
常见问题
口型对不上,是不是模型的问题?
先分两种。台词从错的人嘴里出来,是说话人归属没绑定,改分镜(每句写说话人 + 位置)。嘴型节奏不对,多半是段长与台词秒数不匹配导致复读或拖长,按 5 字 / 秒重新折算。
台词念两遍怎么办?
给富余秒数一个出口。台词 4.5 秒、分镜 7 秒,剩下 2.5 秒必须写收尾动作。不写,模型就复读填满。
为什么写了「某某不在画面里」他反而出现了?
模型没有「出画」概念,名字出现就画。只正向写画面里有谁;要交代画外的人,用影子、声音、门缝下的光,不写名字。
门自己开了,怎么写才对?
刚体动作只渲染起止两态。拆成两个分镜写起止状态,或在同一句里写因果「手掌推门,门随之向内开」。不要写「门开了」。
场景图里能不能画剧情残留物?
不能。空景图是这个场景所有镜头的共同参考,画进去的血迹和碎镜子会出现在每一个镜头里。残留物写在需要它的分镜里。
为什么角色越画越年轻?
解析层的外貌文本里有年龄暗示词(婴儿肥、稚气、少年感、清纯)。删掉,只写骨相与静态特征,写明年龄段。
分镜里写「血」被拒了,还能做暴力戏吗?
能。写因果两端不写创口:倒地、闭眼、深色污渍、破碎的镜面、颤抖的手。阿里绿网对「血 / 尸体 / 断肢」零容忍。
资料来源
- https://help.aliyun.com/zh/model-studio/wan3-video-generation-api-reference
- https://developer.volcengine.com/articles/7606009619928449070
- https://platform.minimax.io/docs/guides/pricing-paygo
- https://ai.google.dev/gemini-api/docs/video
- https://developers.openai.com/api/docs/guides/video-generation
- https://app.klingai.com/global/quickstart/klingai-video-3-model-user-guide