Google Veo 3.1 是 Google 构建在 Veo 3 之上的视频模型。它改的同样是习惯:写提示词时像给摄影师交代镜头那样交代一个镜头,并且在同一个提示词里把声音也一起要了。

下面讲四件事:现在能在哪些入口用它、第一条视频怎么做出来、一份完整可复制的实战提示词,以及官方没讲的部分。全文只用 Google 官方页面上的说法。

Veo 3.1 是什么

Google 的模型页把 Veo 3.1 介绍为它领先的视频生成模型,面向电影人和叙事创作者,支持文生视频、图生视频以及文本生成音视频。2025 年 10 月的公告说得更具体:Veo 3.1 构建在 Veo 3 之上,提示词遵循能力更强,把图片转成视频时的视听质量也更好。

Veo 3 是另一个模型,我们核对过的页面上没有两代并排的参数表,官方公开的是下面这份能力清单。

能力官方页面的说法
输出 1080p 与 4K同一条片子既能交剪辑,也能当大屏母版
原生音频对白、环境音和音效随画面一起生成,不是后期配的
Ingredients to Video用参考图锁定角色或风格,现在也带音频
Frames to Video给开始和结束两张图,生成中间那段过渡
Extend从上一支片的末尾一秒接着往下接,可到一分钟以上
Insert 与 Remove增删画面里的元素;Remove 在 2025 年还是「即将推出」

现在能在哪些入口用它

Google 的模型页列了六个入口:Gemini 应用、Flow、Google Vids、AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。2026 年 1 月的更新又把 YouTube Shorts 带了进来。

入口官方页面写在这个入口下的能力
Gemini 应用Veo 3.1、改进后的 Ingredients to Video、原生竖屏输出
Flow完整创作能力,含 Extend 与 Insert,以及 1080p 和 4K
Google Vids工作向视频编辑器里的 Veo,Ingredients to Video 陆续上线
Gemini API 与 Vertex AI同一模型供代码与企业使用,支持 1080p 和 4K
YouTube Shorts带原生 9:16 的 Ingredients to Video,面向竖屏短视频

想在代码里调用,Veo 3.1 API 接入指南写了请求怎么送到模型。

还有一句能省钱:不少网站用积分套餐转售 Veo 3.1,那些价格属于那家网站,不属于 Google。

第一条视频:分步做出来

Google 官方 Veo 3.1 公告卡:多张生成画面拼成的拼贴,包含彩色球池、黑白舞蹈、蜡烛与黏土小人、草原上的骑马者,以及暖调室内人像,中间压着白色 Veo 3.1 字标
Google

第一次跑通是把流程走一遍,不是出最好的那条。

  1. 把镜头写成一句话。主体、动作,然后它发生在哪儿。
  2. 说清摄影机在做什么。固定机位和缓慢推近是两个请求。
  3. 在同一个提示词里要声音。对白、环境音、音效都写进去。
  4. 点名哪些东西不能变。这一句就是「改」和「重抽」的分界线。
  5. 每轮只改一处。整段重写会让你找不到是哪个词带来的变化。

每轮改一处跑三轮,比一次写更长的提示词有用。应用还不熟,可以先看 Gemini 上手教程

实战示例:一条竖屏短片,主角每次都还是同一个人

要做的是发在竖屏信息流里的一条短片:一位制作者把陶瓷杯转向镜头,说一句台词。难点在手和杯子必须和静帧一致,这正是 Ingredients to Video 的用途。Google 在 2026 年 1 月为这个能力公布了原生 9:16,竖屏是官方选项,不是裁出来的。

Ingredients:图一是制作者本人,脸、头发和围裙保持不变;图二是那只陶瓷杯,釉色和杯口那两处磕碰保持不变。
Shot:从中景缓慢推近到特写,机位在胸口高度,轻微手持晃动,浅景深。
Action:她拿起杯子,转向镜头转过四分之一圈,再放回台面。
Dialogue:她看着镜头说:「每一只出来都不太一样。」
Ambience:安静的工作室室内底噪,她身后有只水壶在轻响。
SFX:杯子落回木台面时,陶瓷碰木头的那一下干响。
Light:左侧一扇大窗户,柔和偏冷,身后一盏暖灯把她和墙分开。
Format:原生 9:16,1080p,不要文字,不要水印。

结果能站住,是因为每一块都在回答不同的问题。Ingredients 那两行先锁死身份。对白、环境音和音效是三个分开的请求,少了一声磕碰,也不会把台词一起带走。

第二个例子只动一块:「保持制作者、杯子和光线不变。把工作室换成一面素混凝土墙,光改成高窗进来的晨光。推镜、台词、声音都不变。」两轮下来,这个角色不用再被描述一次。

参考图和提示词一样重要。Google 自己的建议是先用 Nano Banana Pro 把参考图做干净,Nano Banana Pro 教程讲了这套流程。

发出去之前,按最终尺寸看一遍。

一份能反复用的提示词结构

上面两条片子共用同一副骨架,正是它让好结果能被复现,而不是撞运气。

每次都值得写的几块

Google 的原生音频是和画面一起生成的,只写画面的提示词只答了一半。下面这几块来自官方对能力的描述,不是固定模板;画面那一半的词汇可以看 Gemini 提示词指南

主体与动作:画面里是谁或什么,这几十秒里它发生了什么变化
摄影机:景别、运动,以及机位在哪里
光线:光源、方向和色温
对白:说话的人,然后是引号里的那句台词
环境音与音效:先说空间,再说和某个动作绑定的那一下声音
约束:哪些必须和参考图完全一致
格式:画幅比例、分辨率,以及不要出现什么

音频这一块最容易漏

对白是第一次写提示词最容易漏的一块,也是官方明确留了保留的一块。Google 说,自然且连贯的语音,尤其较短的语音片段,仍在持续改进。台词写短,点明说话的人,再用引号把话框起来。

限制、费用,以及官方尚未公布的部分

Google 把限制写在自己的页面上:语音是它反复提到的一项;1080p 和 4K 超分只在 Flow、Gemini API 和 Vertex AI 提供;输出带 SynthID 水印。Insert 已在 Flow 上线,Remove 在 2025 年 10 月的公告里仍是「即将推出」,当时都不在 API 里。

费用这件事,诚实的答案很短:我们核对过的官方页面上没有每秒价格、没有免费额度、也没有订阅档位,本文不印任何数字。

常见问题

要试一下必须付钱吗? 我们核对过的页面没给免费额度,也没有价格。Gemini 应用仍然是最短的第一步。

一条片子最长能多长? Google 的基准脚注用的是 8 秒片段,官方没有公布统一时长。Extend 从上一支片的末尾一秒接着生成,一串可以到一分钟以上。

能直接做竖屏吗? 在 Ingredients to Video 里可以:Google 在 2026 年 1 月公布了原生 9:16。其他模式没有对应的公告。

为什么我的对白音频不稳? 短语音片段是 Google 自己点名的短板。

这套流程学一次:每轮只改一处,点明说话的人,参考图锁死,这模型就不再像老虎机。