Google Veo 3.1 是 Google 构建在 Veo 3 之上的视频模型。它改的同样是习惯:写提示词时像给摄影师交代镜头那样交代一个镜头,并且在同一个提示词里把声音也一起要了。
下面讲四件事:现在能在哪些入口用它、第一条视频怎么做出来、一份完整可复制的实战提示词,以及官方没讲的部分。全文只用 Google 官方页面上的说法。
Veo 3.1 是什么
Google 的模型页把 Veo 3.1 介绍为它领先的视频生成模型,面向电影人和叙事创作者,支持文生视频、图生视频以及文本生成音视频。2025 年 10 月的公告说得更具体:Veo 3.1 构建在 Veo 3 之上,提示词遵循能力更强,把图片转成视频时的视听质量也更好。
Veo 3 是另一个模型,我们核对过的页面上没有两代并排的参数表,官方公开的是下面这份能力清单。
| 能力 | 官方页面的说法 |
|---|---|
| 输出 1080p 与 4K | 同一条片子既能交剪辑,也能当大屏母版 |
| 原生音频 | 对白、环境音和音效随画面一起生成,不是后期配的 |
| Ingredients to Video | 用参考图锁定角色或风格,现在也带音频 |
| Frames to Video | 给开始和结束两张图,生成中间那段过渡 |
| Extend | 从上一支片的末尾一秒接着往下接,可到一分钟以上 |
| Insert 与 Remove | 增删画面里的元素;Remove 在 2025 年还是「即将推出」 |
现在能在哪些入口用它
Google 的模型页列了六个入口:Gemini 应用、Flow、Google Vids、AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。2026 年 1 月的更新又把 YouTube Shorts 带了进来。
| 入口 | 官方页面写在这个入口下的能力 |
|---|---|
| Gemini 应用 | Veo 3.1、改进后的 Ingredients to Video、原生竖屏输出 |
| Flow | 完整创作能力,含 Extend 与 Insert,以及 1080p 和 4K |
| Google Vids | 工作向视频编辑器里的 Veo,Ingredients to Video 陆续上线 |
| Gemini API 与 Vertex AI | 同一模型供代码与企业使用,支持 1080p 和 4K |
| YouTube Shorts | 带原生 9:16 的 Ingredients to Video,面向竖屏短视频 |
想在代码里调用,Veo 3.1 API 接入指南写了请求怎么送到模型。
还有一句能省钱:不少网站用积分套餐转售 Veo 3.1,那些价格属于那家网站,不属于 Google。
第一条视频:分步做出来

第一次跑通是把流程走一遍,不是出最好的那条。
- 把镜头写成一句话。主体、动作,然后它发生在哪儿。
- 说清摄影机在做什么。固定机位和缓慢推近是两个请求。
- 在同一个提示词里要声音。对白、环境音、音效都写进去。
- 点名哪些东西不能变。这一句就是「改」和「重抽」的分界线。
- 每轮只改一处。整段重写会让你找不到是哪个词带来的变化。
每轮改一处跑三轮,比一次写更长的提示词有用。应用还不熟,可以先看 Gemini 上手教程。
实战示例:一条竖屏短片,主角每次都还是同一个人
要做的是发在竖屏信息流里的一条短片:一位制作者把陶瓷杯转向镜头,说一句台词。难点在手和杯子必须和静帧一致,这正是 Ingredients to Video 的用途。Google 在 2026 年 1 月为这个能力公布了原生 9:16,竖屏是官方选项,不是裁出来的。
Ingredients:图一是制作者本人,脸、头发和围裙保持不变;图二是那只陶瓷杯,釉色和杯口那两处磕碰保持不变。
Shot:从中景缓慢推近到特写,机位在胸口高度,轻微手持晃动,浅景深。
Action:她拿起杯子,转向镜头转过四分之一圈,再放回台面。
Dialogue:她看着镜头说:「每一只出来都不太一样。」
Ambience:安静的工作室室内底噪,她身后有只水壶在轻响。
SFX:杯子落回木台面时,陶瓷碰木头的那一下干响。
Light:左侧一扇大窗户,柔和偏冷,身后一盏暖灯把她和墙分开。
Format:原生 9:16,1080p,不要文字,不要水印。
结果能站住,是因为每一块都在回答不同的问题。Ingredients 那两行先锁死身份。对白、环境音和音效是三个分开的请求,少了一声磕碰,也不会把台词一起带走。
第二个例子只动一块:「保持制作者、杯子和光线不变。把工作室换成一面素混凝土墙,光改成高窗进来的晨光。推镜、台词、声音都不变。」两轮下来,这个角色不用再被描述一次。
参考图和提示词一样重要。Google 自己的建议是先用 Nano Banana Pro 把参考图做干净,Nano Banana Pro 教程讲了这套流程。
发出去之前,按最终尺寸看一遍。
一份能反复用的提示词结构
上面两条片子共用同一副骨架,正是它让好结果能被复现,而不是撞运气。
每次都值得写的几块
Google 的原生音频是和画面一起生成的,只写画面的提示词只答了一半。下面这几块来自官方对能力的描述,不是固定模板;画面那一半的词汇可以看 Gemini 提示词指南。
主体与动作:画面里是谁或什么,这几十秒里它发生了什么变化
摄影机:景别、运动,以及机位在哪里
光线:光源、方向和色温
对白:说话的人,然后是引号里的那句台词
环境音与音效:先说空间,再说和某个动作绑定的那一下声音
约束:哪些必须和参考图完全一致
格式:画幅比例、分辨率,以及不要出现什么
音频这一块最容易漏
对白是第一次写提示词最容易漏的一块,也是官方明确留了保留的一块。Google 说,自然且连贯的语音,尤其较短的语音片段,仍在持续改进。台词写短,点明说话的人,再用引号把话框起来。
限制、费用,以及官方尚未公布的部分
Google 把限制写在自己的页面上:语音是它反复提到的一项;1080p 和 4K 超分只在 Flow、Gemini API 和 Vertex AI 提供;输出带 SynthID 水印。Insert 已在 Flow 上线,Remove 在 2025 年 10 月的公告里仍是「即将推出」,当时都不在 API 里。
费用这件事,诚实的答案很短:我们核对过的官方页面上没有每秒价格、没有免费额度、也没有订阅档位,本文不印任何数字。
常见问题
要试一下必须付钱吗? 我们核对过的页面没给免费额度,也没有价格。Gemini 应用仍然是最短的第一步。
一条片子最长能多长? Google 的基准脚注用的是 8 秒片段,官方没有公布统一时长。Extend 从上一支片的末尾一秒接着生成,一串可以到一分钟以上。
能直接做竖屏吗? 在 Ingredients to Video 里可以:Google 在 2026 年 1 月公布了原生 9:16。其他模式没有对应的公告。
为什么我的对白音频不稳? 短语音片段是 Google 自己点名的短板。
这套流程学一次:每轮只改一处,点明说话的人,参考图锁死,这模型就不再像老虎机。