首页科普 › 给视频模型写提示词:写原因不写结果,以及别再堆「大师级 8K」

给视频模型写提示词:写原因不写结果,以及别再堆「大师级 8K」

给视频模型写提示词只有一条主规则:写产生画面的原因,不写画面的结果。布光写光源的位置、质感、色温,不写「光打亮她的额头」;动作写接触点、重量、终态,不写「动作流畅」;对白写说话人与秒数(中文约 5 字/秒),不写「情绪饱满」。「大师级、8K、体积光」是 CLIP 时代的遗产——可灵、Veo、万相的官方指南没有一家让你堆词,给的都是句子槽位。

三家官方公式说的是同一件事

可灵的公式是「主体 + 主体运动 + 场景 +(镜头语言 + 光线 + 氛围)」;Google 给 Veo 3.1 的公式是「[镜头] + [主体] + [动作] + [环境] + [风格与氛围]」;阿里百炼给万相的基础公式是「主体 + 场景 + 运动」,进阶再加「美学控制 + 风格化」。三张表的每一个槽位都是一件可以用一句话描述的事实,没有一个槽位叫「画质词」

「masterpiece, best quality, 8K, ultra detailed」是 Stable Diffusion 1.5 时代 CLIP 编码器上的词表统计学:那一代模型的训练标注里这些词和高分图片共现,堆上去有用。现代视频模型用大语言模型式的文本编码器读整句话,这些词的边际收益接近零,而且会挤掉真正有信息的槽位——MiniMax H3 单条 text 上限 7000 字符,但模型的注意力不会平均分给每个字。

所以主规则只有一条:写产生画面的原因,不写画面的结果。下面按布光、动作、对白三类展开。

布光:写光源,不写落点

实测里最稳定复现的一类错误:提示词写「暖黄光打亮她的额头与鼻梁」,成片额头和鼻梁就糊一团黄,位置精确对应提示词点名的部位,像手电筒怼着照。模型把「落点」当成「在这个位置刷一块东西」来执行。

改法是把光写成它的原因:暖白吊灯自画面右上方斜下打柔光,窗外冷调天光作补光,人物右脸亮、左脸暗。光源位置、质感(硬/软)、色温三样写齐,落在哪里由模型自己算。Veo 官方示例也是这个形式——「harsh fluorescent overhead lights」「the green glow of the monochrome monitor」,写的是光源与质感,不是落点。

三条配套:不写明暗交界线——明暗过渡是渐变,写「交界」会画出硬边;色温不用高饱和色词——3200K 打在皮肤上是暖白,写「黄」得到黄颜料;体积光、丁达尔、god rays 写成介质——「包厢空气里浮着一层未散的烟」,模型知道光穿过烟会怎样。

动作:接触点、重量、地面关系、终态

「他愤怒地推开门」缺四样东西,模型会各猜一个。

  • 接触点:手掌抵在门板的哪个高度,还是肩膀撞。
  • 重量:门是实木还是空心,推的时候身体有没有前倾发力。
  • 地面关系:脚站在门槛内还是外,推的同时有没有迈步。
  • 终态:门开到什么角度、人停在哪、手还搭不搭在门上。

终态最关键。视频是有终点的,没写终态模型自己挑一个,常见结果是回到起始姿势或把动作无限重复。一段里有多个分镜时,每个分镜的终态就是下一个分镜的起态,写清楚它,段内切换才不跳。

「流畅」「自然」「有力」是结果词,删掉。

对白:说话人归属与秒数

谁开口,写清楚。画面里两个人,不写归属,口型会给错人。万相官方要求台词按「角色说:'具体内容'」格式,Veo 官方示例是「A woman says, 'We have to leave now.'」。

秒数按语速估。中文约 5 字/秒,英文约 2.5 词/秒:18 字台词给 4–5 秒,句尾每多一个标点加约 0.75 秒。给多了有一个非常稳定的怪象:7 秒镜头里 4.5 秒台词、没有收尾动作,模型会把台词再念一遍填时间。解法是每段末尾写一个无位移的收尾拍——放下杯子、目光移开、指尖停在桌沿。给少了,后半句会压到下一个镜头的人脸上。

万相的官方声音公式:人声 = 说话内容 + 情绪 + 语调 + 语速 + 音色 + 口音,示例是 他说道:"好好学习,天天向上",语气轻松,语速适中,声音清亮,美式英文;音效 = 音源材质 + 行为 + 环境音。Veo 的写法是台词加引号,音效前缀 SFX:,环境音前缀 Ambient noise:。两家的共同点:语气、语速是台词外面的修饰,不放进引号。

不该写的五样东西

  1. 否定词。「没有雾」「不要多余的人」会把雾和人送进条件里。Google 给 Veo 的官方建议是描述你要排除的效果,比如写「一片没有建筑和道路的荒地」,而不是「no man-made structures」。要排除什么,就正向写它的反面。
  2. 「无对白」。它不是万相的控制词。官方写法是「无台词」(英文 No dialogue)、「无背景音乐」(No background music);写「无对白」模型只会当成普通描述。
  3. 「」里的表演提示。万相以引号作台词分隔,「(冷笑)」会被念出来。表演提示写在引号外,用「语气冷淡,语速慢」这种官方公式里的槽位。
  4. 每个镜头都运镜。固定镜头是默认值,只在有叙事理由时写推、拉、移;万相的控制词是「固定镜头」「镜头推进」「镜头左移」。镜镜都动,剪出来像广告。
  5. 朝纵深方向的面向。「她转身走向画面深处」会给你三秒后脑勺。面向写画面左/右,纵深用「走到窗边停下」这种位置终态表达。

第六样前面已经说过:SD 触发词。可灵、Veo、万相的官方指南没有一家收录 masterpiece、8K、subsurface scattering、volumetric lighting。

前后对照表

要什么写结果(改掉)写原因(这样写)
布光暖黄光打亮她的额头与鼻梁暖白吊灯自画面右上方斜下打柔光,窗外冷调天光作补光
氛围光体积光,丁达尔效应,电影感包厢空气里浮着一层未散的烟,吊灯的光穿过烟
动作他愤怒地推开门,动作有力流畅他右掌拍在门板中央推开实木门,身体前倾,跨过门槛一步停下,门开到约 90°
对白她说了一句台词,情绪饱满(7 秒)她说道:"这件事你早就知道。"语气压低,语速慢;说完目光移开落在杯沿(4.5 秒)
排除不要雾,不要多余的人空气干净通透,画面里只有她一个人
镜头镜头缓慢推进,环绕,电影级运镜固定镜头,中景,人物在画面右三分之一
画质masterpiece, 8K, ultra detailed(删掉;用胶片、镜头焦段、景深描述画法)

左栏每一条都在告诉模型「结果长什么样」,右栏每一条都在告诉模型「是什么造成的」。前者模型只能硬画,后者模型会算。

各模型脾气表

模型官方公式台词与声音参考素材指代备注(官方)
可灵主体 + 主体运动 + 场景 +(镜头语言 + 光线 + 氛围)元素库按元素引用元素 = 2–4 张不同角度图
Veo 3.1[镜头] + [主体] + [动作] + [环境] + [风格与氛围]台词加引号;SFX: / Ambient noise: 前缀不写 no / don't,描述要排除的效果
通义万相 2.7–3.0主体 + 场景 + 运动(+ 美学控制 + 风格化)人声 = 内容 + 情绪 + 语调 + 语速 + 音色 + 口音;「无台词」「无背景音乐」图1 / 视频1(英文 Image 1 / Video 1)参考图 + 参考视频 ≤5;「固定镜头」「生成单镜头」控制词
Seedance 2.0主题 + 视觉风格 + 画面细节与动态 + 格式要求(火山引擎文章)官方文章未细述图1 / 图2多模态参考与首尾帧为独立场景
MiniMax H3content 数组:text + 参考素材参考音频 ≤3 段、合计 ≤15 秒按顺序单条 text ≤7000 字符;参考与首尾帧互斥

共同点比差异多:都是槽位公式、都用自然语言、参考素材都按序号或名字指代。差异集中在声音——万相与 Veo 有明确的台词格式,其余以参考音频或音色描述为主。换模型时只需换台词格式与参考指代,主体、动作、光的写法不变。

一个可执行的分镜写法

  1. 段头:地点、起始画面状态(谁在画面左/右、姿态、手里拿什么)、光源一句(位置 + 质感 + 色温)、固定镜头或有理由的运镜。
  2. 分镜逐行:秒数 / 景别与机位 / 画面里有谁做什么(接触点、重量、终态)/ 台词(说话人 + 引号内容 + 引号外的语气语速)/ 与段头不同的光才写。
  3. 收尾拍:台词说完后一个无位移的小动作,吃掉富余秒数。
  4. 自检:删掉所有结果形容词(流畅、震撼、电影感、8K);否定句全部改成正向;对白秒数按 5 字/秒复核;面向没有朝纵深;参考素材按该模型的指代格式点名。

关键数字与来源

指标数值来源日期
万相 官方声音公式人声 = 说话内容 + 情绪 + 语调 + 语速 + 音色 + 口音;无台词写「无台词」,无背景音乐写「无背景音乐」help.aliyun.com2026-09-02
万相 提示词基础公式主体 + 场景 + 运动;进阶加美学控制 + 风格化help.aliyun.com2026-09-02
Veo 3.1 否定描述官方建议描述要排除的效果,如「a desolate landscape with no buildings or roads」,而不是「no man-made structures」cloud.google.com2026-09-02
可灵 提示词公式主体 + 主体运动 + 场景 +(镜头语言 + 光线 + 氛围)kling.ai2026-09-02
MiniMax H3 提示词上限单条 text ≤7000 字符;参考音频 ≤3 段、合计 ≤15 秒platform.minimax.io2026-09-02
万相 2.7 参考指代中文提示词用「图1」「视频1」指代参考素材,英文 Image 1 / Video 1help.aliyun.com2026-09-02

常见问题

提示词越长越好吗?

不。每个槽位一句事实。MiniMax H3 单条 text 上限 7000 字符,但 200–400 字覆盖五个槽位通常足够;超过之后新增的多半是形容词,只会稀释有信息的部分。

用英文写比中文效果好吗?

看模型母语。可灵、万相、Seedance 的官方指南本身是中文,骨相词、语气词不要翻成英文近义词;Veo 的官方指南是英文。用模型的母语写。

有独立的 negative prompt 参数还要不要用?

有的模型提供独立负面参数,可以放风格类排除项。但不要把否定句写进正向提示词——Veo 官方明确建议改为描述要排除的效果。

为什么台词会念两遍?

秒数给多了又没有收尾动作。7 秒镜头 4.5 秒台词,富余的 2.5 秒模型没有出口,就把台词再念一遍。按 5 字/秒重算秒数,或在段尾补一个无位移的收尾拍。

「电影感」怎么写?

写产生电影感的原因:焦段与景深(85mm 浅景深)、光源与介质、色彩纪律(低饱和、单一强调色)、固定机位。cinematic 这个词本身没有可执行信息。

一段里多个镜头怎么写?

每个分镜一行,带秒数与景别机位,只写画面里有谁,上一镜的终态是下一镜的起态。万相还提供「生成单镜头」控制词做反向约束。

资料来源

本文提到的工具

延伸阅读