Google 那份 Veo 提示词页面摆出七个可以直接照着写的要素,整套方法用那一页自己的话说就一句:你补的细节越多,对最终成片的控制就越强。

有一件事得先说清楚,多数教程都跳过了。那一页的标题写的是 Veo 3,不是 Veo 3.1。Google 对 Veo 3.1 提示词能力的公开描述只有半句话——提示词遵循更强。所以下面这七个要素,我们按「Google 明文写下的结构」来对待,其余的推断会单独标出来。

Google 到底公布了什么

Veo 3.1 的公告在能力上很慷慨,在提示词上很吝啬。它写了更丰富的音频、更强的叙事控制、更真实的质感,还补了一句:这个模型构建在 Veo 3 之上,提示词遵循更强,把图片转成视频时的视听质量也更好。

关于 Veo 3.1 怎么响应提示词,官方说法到此为止。没有公式,没有模板,也没有字数上限。结构在另一份提示词指南里,能力清单在模型页上:1080p 与 4K 输出、镜头与运动控制、场景延展,以及用参考图保持角色一致性。

Google 点名的七个要素

镜头景别与运动、风格、光线、角色描述、地点、动作、对白。指南把景别与运动写成一个问句,问的是你希望画面怎么框、摄影机在镜头里怎么动,而不是一句命令。这个细节值得留意:镜头调度是一等输入,不是装饰。

角色描述配了一组对照。写「二十多岁、波浪棕发、脸上有浅浅雀斑的女性」,比写「一个棕发女性」更具体。同一个主体,模型能用的信息量不一样。

社区版本丢掉的两个要素

多数第三方教程把七个压成五块:主体、镜头、光线、音频、技术。这个映射离得不远,却合并了两个 Google 分开处理的东西。对白单独占一个要素,因为 Veo 能生成语音,你可以给角色一个话题,也可以给它确切的词。音频也单独成节,指南说音频提示写在行内或单独一段都行。

把这两块在自己的模板里分开,就不会再写出镜头完美、却没人开口的提示词。

官方七个对社区五块:差别在哪

社区那一块对应的官方要素分开之后会变什么
主体角色描述写出具体身体特征,比写关系词有用
镜头景别与运动景别和运动是一个要素,不是两个
光线光线砍掉这块,画面看上去就是平的
音频对白,加上音频提示说话和空间底噪是两个独立决定
技术没有对应要素时长和分辨率来自使用入口,不来自提示词

最后一行最诚实。Google 没有公布任何提示词级别的参数块,所以把时长和分辨率当成设置项,别写进提示词正文。

实例一:一条文生视频提示词,逐行拆开

Google 官方 Veo 3.1 示例拼图:摄影棚里的舞者、烛火与黏土人偶、原野上策马的人、华丽长廊里的女子,画面中央压着白色 Veo 3.1 字样
Google 官方 Veo 示例 Google

指南页上 Google 自己那条示例提示词,是衡量信息密度的好标尺。它写的是一位老水手的中景:蓝色针织帽在眼睛上投下阴影,浓密的花白胡子挡住下巴,他手里握着烟斗,朝栏杆外翻涌的灰海比划了一下——接着他开口说话,台词放在引号里。

看看是什么在起作用。一个景别,一件点名了材质的衣物,一个颜色,一处具体的阴影,一个动作,一片被描述过的海。每一样都是摄影机能拍下来的东西。

景别与运动:中景,缓慢推近,机位在胸口高度
风格:纪实自然主义,手持,35mm
光线:左侧阴天日光,不加补光,帽子下压出深阴影
角色:六十多岁的男性,蓝色针织水手帽,浓密花白胡子
地点:木质拖网船甲板,栏杆外是翻涌的灰海
动作:他用烟斗朝水面比划,然后扶住栏杆稳住身体
对白:「这片海,是一股力量,一股狂野不驯的蛮劲。」

七行,七个要素,没有一样是画面拍不出来的。

案例二:锁住一个角色,再加一句台词

第二类提示词返工最多:同一个角色要在好几段片子里反复出现。模型页把「用参考图保持角色一致性」列为受支持的控制方式,于是提示词的任务变了——不再描述这个人是谁,而是描述要拿他做什么。

把附带的参考图用作这个角色。她的脸、头发和大衣都要和参考图完全一致。只换环境:清晨空无一人的站台,薄雾,没有其他人。景别:远景,她朝镜头走来,在站台边缘停下。不要对白。

这个版本能成立有两个原因。身份由参考图承担,提示词就不必再花字数重描一张它改不好的脸。最后那句说明了画面里没有什么,模型才不会自己往站台上填人。

最容易失败的三种提示词,各改一处

镜头乱跑。把景别和运动写成同一条指令,给运动一个方向和速度,而不是一个形容词。「缓慢推近」约束住了镜头,「电影感」没有。

画面干净但空。去找那种只写情绪、跳过物理世界的散文式提示词。补上摄影机应该看见的具体物件——一个台面、一件衣物、一个光源。

声音没出来的时候

指南的建议是把想要的声音明确写出来,让音频和画面互相匹配,写在行内或者单独一段都行。一点声音都没有,通常意味着提示词只描述了画面。

还有一句提醒,写进任何对白教程都合适。Google 在模型页上说,生成自然且连贯的口语语音,尤其较短的片段,仍是持续开发中的领域。台词写出来,然后看结果,别假设它一定成。

Google 没有公布的部分

四个空缺,你会在别处看到它们被填得很笃定。

没有公布提示词长度或 token 上限。没有记录负面提示词的语法——指南讨论的是该写什么,不是该禁什么。要素的排列顺序没有规定。生成时长也不是提示词参数:模型页的基准脚注只写了 Veo 视频长八秒,Flow 的 Extend 被描述为能到一分钟以上。

这些都不妨碍你写出好提示词。它只意味着一份信心十足、声称有官方字数上限或负面提示词字段的模板,写的是作者自己的工作流。

常见问题

有官方的 Veo 3.1 提示词指南吗? 已发布的那份指南标题是给 Veo 3 写的。Veo 3.1 自己的文档只说了提示词遵循更强,结构留给那一页。

提示词该用英文写吗? Google 发布的指南和示例都是英文,也没有公布语言规则。写得多具体,比用什么语言写更重要。

一次生成能有多长? 模型页的基准脚注说 Veo 视频长八秒,Flow 的公告把 Extend 描述为生成更长的视频,可以到一分钟以上。官方没有公布完整的时长选项。

我的角色在两段片子里变了样,该改哪里? 把身份交给参考图,并写明必须保持一致,就像上面第二条提示词那样。上手教程讲的是同一套思路,只是换成第一条片子。

一条片子要多少钱? 模型页和公告都没有价格。API 与价格指南整理了 Google 确实公布过的数字。

Veo 3.1 能在哪里用? Google 点名了 Flow、Gemini 应用、Gemini API 和 Vertex AI。想先在文本模型里练提示词,Gemini 提示词指南讲的是通用写法。

七个要素各写一遍,把说话和空间底噪当成两个独立决定,哪一条拍歪了就只改那一行。专题页收着这篇指南引用过的那些页面。