给视频模型写提示词:写原因不写结果,以及别再堆「大师级 8K」
给视频模型写提示词只有一条主规则:写产生画面的原因,不写画面的结果。布光写光源的位置、质感、色温,不写「光打亮她的额头」;动作写接触点、重量、终态,不写「动作流畅」;对白写说话人与秒数(中文约 5 字/秒),不写「情绪饱满」。「大师级、8K、体积光」是 CLIP 时代的遗产——可灵、Veo、万相的官方指南没有一家让你堆词,给的都是句子槽位。
三家官方公式说的是同一件事
可灵的公式是「主体 + 主体运动 + 场景 +(镜头语言 + 光线 + 氛围)」;Google 给 Veo 3.1 的公式是「[镜头] + [主体] + [动作] + [环境] + [风格与氛围]」;阿里百炼给万相的基础公式是「主体 + 场景 + 运动」,进阶再加「美学控制 + 风格化」。三张表的每一个槽位都是一件可以用一句话描述的事实,没有一个槽位叫「画质词」。
「masterpiece, best quality, 8K, ultra detailed」是 Stable Diffusion 1.5 时代 CLIP 编码器上的词表统计学:那一代模型的训练标注里这些词和高分图片共现,堆上去有用。现代视频模型用大语言模型式的文本编码器读整句话,这些词的边际收益接近零,而且会挤掉真正有信息的槽位——MiniMax H3 单条 text 上限 7000 字符,但模型的注意力不会平均分给每个字。
所以主规则只有一条:写产生画面的原因,不写画面的结果。下面按布光、动作、对白三类展开。
布光:写光源,不写落点
实测里最稳定复现的一类错误:提示词写「暖黄光打亮她的额头与鼻梁」,成片额头和鼻梁就糊一团黄,位置精确对应提示词点名的部位,像手电筒怼着照。模型把「落点」当成「在这个位置刷一块东西」来执行。
改法是把光写成它的原因:暖白吊灯自画面右上方斜下打柔光,窗外冷调天光作补光,人物右脸亮、左脸暗。光源位置、质感(硬/软)、色温三样写齐,落在哪里由模型自己算。Veo 官方示例也是这个形式——「harsh fluorescent overhead lights」「the green glow of the monochrome monitor」,写的是光源与质感,不是落点。
三条配套:不写明暗交界线——明暗过渡是渐变,写「交界」会画出硬边;色温不用高饱和色词——3200K 打在皮肤上是暖白,写「黄」得到黄颜料;体积光、丁达尔、god rays 写成介质——「包厢空气里浮着一层未散的烟」,模型知道光穿过烟会怎样。
动作:接触点、重量、地面关系、终态
「他愤怒地推开门」缺四样东西,模型会各猜一个。
- 接触点:手掌抵在门板的哪个高度,还是肩膀撞。
- 重量:门是实木还是空心,推的时候身体有没有前倾发力。
- 地面关系:脚站在门槛内还是外,推的同时有没有迈步。
- 终态:门开到什么角度、人停在哪、手还搭不搭在门上。
终态最关键。视频是有终点的,没写终态模型自己挑一个,常见结果是回到起始姿势或把动作无限重复。一段里有多个分镜时,每个分镜的终态就是下一个分镜的起态,写清楚它,段内切换才不跳。
「流畅」「自然」「有力」是结果词,删掉。
对白:说话人归属与秒数
谁开口,写清楚。画面里两个人,不写归属,口型会给错人。万相官方要求台词按「角色说:'具体内容'」格式,Veo 官方示例是「A woman says, 'We have to leave now.'」。
秒数按语速估。中文约 5 字/秒,英文约 2.5 词/秒:18 字台词给 4–5 秒,句尾每多一个标点加约 0.75 秒。给多了有一个非常稳定的怪象:7 秒镜头里 4.5 秒台词、没有收尾动作,模型会把台词再念一遍填时间。解法是每段末尾写一个无位移的收尾拍——放下杯子、目光移开、指尖停在桌沿。给少了,后半句会压到下一个镜头的人脸上。
万相的官方声音公式:人声 = 说话内容 + 情绪 + 语调 + 语速 + 音色 + 口音,示例是 他说道:"好好学习,天天向上",语气轻松,语速适中,声音清亮,美式英文;音效 = 音源材质 + 行为 + 环境音。Veo 的写法是台词加引号,音效前缀 SFX:,环境音前缀 Ambient noise:。两家的共同点:语气、语速是台词外面的修饰,不放进引号。
不该写的五样东西
- 否定词。「没有雾」「不要多余的人」会把雾和人送进条件里。Google 给 Veo 的官方建议是描述你要排除的效果,比如写「一片没有建筑和道路的荒地」,而不是「no man-made structures」。要排除什么,就正向写它的反面。
- 「无对白」。它不是万相的控制词。官方写法是「无台词」(英文 No dialogue)、「无背景音乐」(No background music);写「无对白」模型只会当成普通描述。
- 「」里的表演提示。万相以引号作台词分隔,「(冷笑)」会被念出来。表演提示写在引号外,用「语气冷淡,语速慢」这种官方公式里的槽位。
- 每个镜头都运镜。固定镜头是默认值,只在有叙事理由时写推、拉、移;万相的控制词是「固定镜头」「镜头推进」「镜头左移」。镜镜都动,剪出来像广告。
- 朝纵深方向的面向。「她转身走向画面深处」会给你三秒后脑勺。面向写画面左/右,纵深用「走到窗边停下」这种位置终态表达。
第六样前面已经说过:SD 触发词。可灵、Veo、万相的官方指南没有一家收录 masterpiece、8K、subsurface scattering、volumetric lighting。
前后对照表
| 要什么 | 写结果(改掉) | 写原因(这样写) |
|---|---|---|
| 布光 | 暖黄光打亮她的额头与鼻梁 | 暖白吊灯自画面右上方斜下打柔光,窗外冷调天光作补光 |
| 氛围光 | 体积光,丁达尔效应,电影感 | 包厢空气里浮着一层未散的烟,吊灯的光穿过烟 |
| 动作 | 他愤怒地推开门,动作有力流畅 | 他右掌拍在门板中央推开实木门,身体前倾,跨过门槛一步停下,门开到约 90° |
| 对白 | 她说了一句台词,情绪饱满(7 秒) | 她说道:"这件事你早就知道。"语气压低,语速慢;说完目光移开落在杯沿(4.5 秒) |
| 排除 | 不要雾,不要多余的人 | 空气干净通透,画面里只有她一个人 |
| 镜头 | 镜头缓慢推进,环绕,电影级运镜 | 固定镜头,中景,人物在画面右三分之一 |
| 画质 | masterpiece, 8K, ultra detailed | (删掉;用胶片、镜头焦段、景深描述画法) |
左栏每一条都在告诉模型「结果长什么样」,右栏每一条都在告诉模型「是什么造成的」。前者模型只能硬画,后者模型会算。
各模型脾气表
| 模型 | 官方公式 | 台词与声音 | 参考素材指代 | 备注(官方) |
|---|---|---|---|---|
| 可灵 | 主体 + 主体运动 + 场景 +(镜头语言 + 光线 + 氛围) | — | 元素库按元素引用 | 元素 = 2–4 张不同角度图 |
| Veo 3.1 | [镜头] + [主体] + [动作] + [环境] + [风格与氛围] | 台词加引号;SFX: / Ambient noise: 前缀 | — | 不写 no / don't,描述要排除的效果 |
| 通义万相 2.7–3.0 | 主体 + 场景 + 运动(+ 美学控制 + 风格化) | 人声 = 内容 + 情绪 + 语调 + 语速 + 音色 + 口音;「无台词」「无背景音乐」 | 图1 / 视频1(英文 Image 1 / Video 1) | 参考图 + 参考视频 ≤5;「固定镜头」「生成单镜头」控制词 |
| Seedance 2.0 | 主题 + 视觉风格 + 画面细节与动态 + 格式要求(火山引擎文章) | 官方文章未细述 | 图1 / 图2 | 多模态参考与首尾帧为独立场景 |
| MiniMax H3 | content 数组:text + 参考素材 | 参考音频 ≤3 段、合计 ≤15 秒 | 按顺序 | 单条 text ≤7000 字符;参考与首尾帧互斥 |
共同点比差异多:都是槽位公式、都用自然语言、参考素材都按序号或名字指代。差异集中在声音——万相与 Veo 有明确的台词格式,其余以参考音频或音色描述为主。换模型时只需换台词格式与参考指代,主体、动作、光的写法不变。
一个可执行的分镜写法
- 段头:地点、起始画面状态(谁在画面左/右、姿态、手里拿什么)、光源一句(位置 + 质感 + 色温)、固定镜头或有理由的运镜。
- 分镜逐行:秒数 / 景别与机位 / 画面里有谁做什么(接触点、重量、终态)/ 台词(说话人 + 引号内容 + 引号外的语气语速)/ 与段头不同的光才写。
- 收尾拍:台词说完后一个无位移的小动作,吃掉富余秒数。
- 自检:删掉所有结果形容词(流畅、震撼、电影感、8K);否定句全部改成正向;对白秒数按 5 字/秒复核;面向没有朝纵深;参考素材按该模型的指代格式点名。
关键数字与来源
| 指标 | 数值 | 来源 | 日期 |
|---|---|---|---|
| 万相 官方声音公式 | 人声 = 说话内容 + 情绪 + 语调 + 语速 + 音色 + 口音;无台词写「无台词」,无背景音乐写「无背景音乐」 | help.aliyun.com | 2026-09-02 |
| 万相 提示词基础公式 | 主体 + 场景 + 运动;进阶加美学控制 + 风格化 | help.aliyun.com | 2026-09-02 |
| Veo 3.1 否定描述 | 官方建议描述要排除的效果,如「a desolate landscape with no buildings or roads」,而不是「no man-made structures」 | cloud.google.com | 2026-09-02 |
| 可灵 提示词公式 | 主体 + 主体运动 + 场景 +(镜头语言 + 光线 + 氛围) | kling.ai | 2026-09-02 |
| MiniMax H3 提示词上限 | 单条 text ≤7000 字符;参考音频 ≤3 段、合计 ≤15 秒 | platform.minimax.io | 2026-09-02 |
| 万相 2.7 参考指代 | 中文提示词用「图1」「视频1」指代参考素材,英文 Image 1 / Video 1 | help.aliyun.com | 2026-09-02 |
常见问题
提示词越长越好吗?
不。每个槽位一句事实。MiniMax H3 单条 text 上限 7000 字符,但 200–400 字覆盖五个槽位通常足够;超过之后新增的多半是形容词,只会稀释有信息的部分。
用英文写比中文效果好吗?
看模型母语。可灵、万相、Seedance 的官方指南本身是中文,骨相词、语气词不要翻成英文近义词;Veo 的官方指南是英文。用模型的母语写。
有独立的 negative prompt 参数还要不要用?
有的模型提供独立负面参数,可以放风格类排除项。但不要把否定句写进正向提示词——Veo 官方明确建议改为描述要排除的效果。
为什么台词会念两遍?
秒数给多了又没有收尾动作。7 秒镜头 4.5 秒台词,富余的 2.5 秒模型没有出口,就把台词再念一遍。按 5 字/秒重算秒数,或在段尾补一个无位移的收尾拍。
「电影感」怎么写?
写产生电影感的原因:焦段与景深(85mm 浅景深)、光源与介质、色彩纪律(低饱和、单一强调色)、固定机位。cinematic 这个词本身没有可执行信息。
一段里多个镜头怎么写?
每个分镜一行,带秒数与景别机位,只写画面里有谁,上一镜的终态是下一镜的起态。万相还提供「生成单镜头」控制词做反向约束。
资料来源
- https://help.aliyun.com/zh/model-studio/text-to-video-prompt
- https://help.aliyun.com/zh/model-studio/wan-video-to-video-api-reference
- https://cloud.google.com/blog/products/ai-machine-learning/ultimate-prompting-guide-for-veo-3-1
- https://docs.cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide
- https://kling.ai/quickstart/klingai-video-o1-user-guide
- https://kling.ai/quickstart/klingai-element-library-3-user-guide
- https://platform.minimax.io/docs/api-reference/video-generation-v2-create
- https://www.volcengine.com/article/40840