搜「Veo 3.1 教程」时,最先要绕开的不是提示词,而是名字本身。「Veo」同时是一家体育赛事自动摄像机公司的名字,在某些查询里它排在 Google 前面。下面所有内容都只讲 Google 的 Veo 3.1 和 Flow。
第二个坑是数字。中文教程里流传着「单段 5 到 15 秒」「自动配乐」「AI Studio 免费额度」这类说法,而这三条都能在 Google 自己的页面上找到反例:官方模型页印的是「Veo videos are 8 seconds long.」;官方点名的声音只有音效、环境底噪和对白,音乐不在其中;免费额度没有出现在本文能打开的任何一个官方页面上。这篇只写官方页面上印着的东西,没印的就直说没印。
Veo 3.1 跑在哪几个入口
模型页列了六个入口:Gemini app、Flow、Google Vids、Google AI Studio、Gemini API,以及 Gemini Enterprise Agent Platform。2026 年 1 月的更新把 YouTube Shorts 和 YouTube Create 也加了进来,这是 YouTube 那一侧第一次拿到 Ingredients to Video。
这份清单就是官方的全部答案。Flow 是创作工具所在的界面,API 和 Vertex AI 是给代码走的路。
把提示词写成一个镜头
Veo 一次出八秒。官方那句「Veo videos are 8 seconds long.」说得没有余地,由此推出一条实用结论:提示词里塞了三件互不相关的事,你只会拿到其中一件。
一个动作、一个运镜想法、一个地点。想法需要第二个节拍,就再生成一次,而不是把句子写长。上手教程把第一条视频从头到尾走了一遍。
官方点名的七个要素
提示词指南按顺序列了七个要素:景别与运镜、风格、光线、角色描述、地点、动作、对白。官方要求的是混着用,不是每个都填,而它给整页定调的是这一句:「The more detail you add, the more control you’ll have over the final output.」
七个里有两条权重更高。角色描述吃具体度——指南自己举的对照是「a woman in her twenties with wavy brown hair and light freckles」对「a brown-haired woman」。对白则是 Google 处理方式与众不同的那一条:你可以「either pick a topic for characters to talk about, or give characters specific things to say」,也就是给一个话题让模型自己编词,或者把要说的话直接给出。
下面这个空模板,就是两个示例要填进去的东西:
景别与运镜:...
风格:...
光线:...
角色:...
地点:...
动作:...
对白:...
音频:...
一个节拍一个动作
面对快节奏画面,指南给了一条更硬的写法:「For ultimate control over fast-paced scenes, leave nothing to chance. You can direct every element of the shot with highly-detailed prompts.」
这跟「一个动作」并不冲突。细节描述的是这一帧长什么样,动作仍然只发生一次。区别在于:高细节的提示词是在说泥水怎么溅起来,而不是说溅完之后还发生了别的事。
哪些设置是官方印出来的
有三个设置背后有官方原句。输出「in 1080p and 4K」。Ingredients to Video 支持原生 9:16。每次生成八秒。
分辨率那句带着限制:「upscaling to 1080p and 4K is only available in Flow, the Gemini API and Vertex AI」。价格与免费额度那篇讲的是这些入口各自怎么收费、哪些不收费。
其余你会读到的——时长档位、质量档位、免费生成次数——都出现在厂商页或转售页上,而不是 Google 的页面上。那些页面可能在如实描述它们自己的产品,但那些数字仍然是它们的。提示词指南同样没有公布字数上限、负面提示词语法,也没有排查章节。
两个实战示例

下面两条提示词都按八秒写,用的就是上面那个要素顺序,因为这个顺序是 Google 公布过的。
示例一:一条产品镜头
景别与运镜:特写,固定机位,轻微手持晃动
风格:纪录片式产品素材,50mm
光线:右侧硬光,身后深阴影
角色:只有一双手,画面里不出现脸
地点:一块不锈钢台面
动作:盖子转开、松开,然后被放到钢面上
对白:无
音频:密封圈崩开一声,金属碰钢面,背后是安静的厨房
示例二:一条竖版镜头
景别与运镜:竖版 9:16,中景,缓慢推近
风格:时尚编辑片,细颗粒
光线:画面左侧窗光,不加补光
角色:穿湿橙色外套的快递员,帽子戴着
地点:一条有顶的走廊,柱子外面在下雨
动作:她看了一眼包裹面单,然后走进雨里
对白:无
音频:雨打屋顶,一组脚步声,远处有台面包车怠速
这两条提示词我们没有跑过,也不声称它们能出什么效果。它们展示的只是顺序和颗粒度,而这两样恰好是官方指引真正提供的东西。
怎么迭代才不浪费生成次数
提示词指南没有排查章节,所以能给的建议本身就窄。
一次只改一个变量
Google 在结尾给了它唯一点名的一个迭代工具:「These tips will help you craft a great prompt, but you can also use Gemini to help you expand on the prompt and include more detail.」注意这是扩写,不是修错:画面太单薄时有用,运镜本身就选错时没用。
一条片段没出好,先判断问题在画面还是在提示词。主体认错了,是提示词问题。主体一直在动导致看不清,是长度问题,因为你手上只有八秒。声音又是另一个问题,音频提示词那篇写得更细。
中文提示词里真正起作用的部分
Google 没有公布对白语言清单,也没有公布任何关于提示词语言的指引。七个要素的名字是英文页面上的英文标签,所以任何中文译法——包括本文用的那一套——都只是阅读辅助,不是官方术语。
官方印出来的是更窄、也更有用的一条:音频「can be integrated into your prompt, or included in a separate section」,说明这套结构翻译过去之后仍然成立。至于中文提示词是不是比英文更容易出片,我们没有测过,官方页面也没有任何一句这么说过。
常见问题
一条 Veo 3.1 片段有多长? 官方公布的长度是八秒。更长的部分来自 Extend,它从前一段的最后一秒接着生成。
必须付费才能用吗? 模型页列出了可用入口,但没有给价格。以你实际要用的那个入口当下的条款为准,不要以教程的转述为准。
可以用中文写提示词吗? 没有任何官方页面禁止,要素结构也能翻译过去。但 Google 没有公布语言清单。
Veo 会生成配乐吗? 官方点名的是音效、环境底噪和对白,音乐不在其中,也不是七个要素里的任何一条。
把提示词写成一个镜头,只点你真正在意的要素,每一条说法都回头核对它出自哪个页面。