用 Veo 3.1 生成视频。
Google Veo 3.1 是 DeepMind 当前的视频生成模型。给它一段文字、一张图或一组参考图,它输出一段短片,并在同一遍生成里连对白、音效与环境音一起产出。
本页的能力、基准结论与使用渠道均取自 Google DeepMind 自家的 Veo 模型页;图库里的静帧也是该页Google 自己发布的演示截图。价格与可用性由 Google 决定,可能随时变动。
Google 自家演示的画面
这六张是 Google 在 Veo 模型页的 showcase 区里配在自己演示片段旁的静帧,下面每一句提示词也都是 Google 为那段片段写的。它们是厂商自己的演示,不是我们生成的作品。
示例图片版权归 Google 所有,此处署名转载: Google DeepMind 的 Veo 模型页
Google 自己怎么介绍 Veo 3.1
Google 把 Veo 3.1 定位为「我们领先的视频生成模型,为电影人和叙事者而生」,整页围绕一个主张展开:画面和声音一起来。下面的图库、控制项与基准结论都来自那一页。
画面与声音同一遍产出
对白、音效与环境音都是原生生成的,不是事后配上去的。Google 给它的原话是「video, meet audio」,好几条演示提示词直接把台词写进了提示词本身。
控制细到单个镜头
除文字提示词外,模型还接受场景、角色或物件的参考图,风格参考图,首帧与末帧,以及「拉远、推近、上移、右移」这类机位指令。
能改素材,不必重做
Google 记录了在已有画面上做外扩、往画面里加入物件、从画面里移除物件、用最后一秒续接片段,以及用自己的身体、面部和声音驱动角色表演。
两档分辨率各有用途
官方记录的输出是 1080p 与 4K。Google 把 1080p 说成适合要和其他素材剪在一起的那一档,4K 则留给纹理和细节。
Google 记录下来的控制项
Google 把这款模型的控制面分成若干标题,每一项都配一段片段演示。连起来看,它们回答的是一个很实际的问题——我到底能控制什么;下面每一项都是模型页上的一个标题,不是我们的引申。
素材合成(Ingredients to video)
你给场景、角色或物件的参考图,镜头围着这些参考搭起来。该页在这一节的提示词,用同一组参考分别要了一支广告、一支电影预告和一支音乐录影带。
套用风格(Match your style)
风格参考图负责画面观感,于是那些难以言传的质感——纸艺立体模型、绘画、某种调色——可以直接递一张图过去,而不用写成文字。
角色保持一致
角色参考图能让同一个角色的外观在分镜之间稳住,这是「多镜头成片」和「一堆互不相干的片段」之间的分界线。
延长场景
片段可以从最后一秒继续往下接,观感和声音保持一致;该页演示了把多条提示词这样串成一段更长的作品。
机位控制
构图与运动是明确设定的,而不是写在提示词里碰运气。该页列出四个:拉远、推近、上移、右移。
首帧与末帧
给两张图就能定义一次转场,中间的运动由模型补齐。
外扩、加入与移除物件
外扩把画幅向外撑开,让同一段素材适配不同比例的屏幕;另有单独的开关往场景里加入物件或把物件去掉,模型会一并考虑比例、交互与阴影。
角色与运动控制
表演可以用你自己的肢体、面部和声音来驱动;物件的运动可以靠画出你想要的路径来定义。
1080p 与 4K 输出
Google 记录了两档输出分辨率,并说明各自适合什么:1080p 是更利落的成片文件,4K 则用在纹理和细节比体积更重要的场合。
Google 就 Veo 3.1 公布了什么
这里只放 Google 自己页面上说过的内容。模型页没给的数字——比如单段最长时长、每秒价格——这张表不会替它补上。
- 开发方
- Google DeepMind
- 当前模型
- Veo 3.1
- 类别
- 视频生成
- 输出
- 带原生音频的视频
- 输出分辨率
- 1080p 与 4K
- 官方记录的输入
- 文字提示词、图片、参考图、视频
- 官方记录的控制项
- 素材合成、风格参考、角色一致、场景延长、机位控制、首末帧、外扩、物件的加入与移除、角色与运动控制
- 水印
- SynthID
- 面向普通用户
- Gemini、Google Flow、Google Vids
- 面向开发者
- Google AI Studio、Gemini API
- 基准页更新时间
- 2025 年 10 月
- 官方承认的不足
- Google 表示,自然且连贯的口播音频——尤其是较短的口语片段——仍是开发中的课题。
官方列出的入口
Veo 3.1 是托管模型,每条路径都建在别人的账号上。Google 在模型页列了五个入口,下面每一行链接指向的都是 Google 自己指的那一个。
关于 Veo 3.1 的高频问题
Veo 3.1 是什么?
Google DeepMind 当前的视频生成模型。它用一段文字、一张图或一组参考图,生成带对白、音效与环境音的短片,声音和画面在同一遍里产出。
Veo 会连音频一起生成吗?
会,而且这是它最主打的卖点。Google 的原话是「video, meet audio」,图库整节都围绕这一点,好几条演示提示词直接把台词写进了提示词,而不是留给后期配音。
Veo 3.1 的输出分辨率是多少?
官方记录为 1080p 与 4K。Google 把 1080p 说成更适合剪辑的一档,4K 则用在纹理和细节上。
Veo 3.1 能改我已有的视频吗?
能对素材上手。官方记录的控制包括外扩画幅、加入物件、移除物件、用最后一秒续接片段,以及指定一次转场的首帧与末帧。
Veo 3.1 的片段有多长?
模型页没有给出单一的最大时长。它把「延长场景」写成做长片的办法,而各项对比测试的脚注里,评测片段是 6 秒或 8 秒。
Veo 的输出带水印吗?
带。Google 表示用 Veo 生成的视频会打上 SynthID——它用于标记和识别 AI 生成内容的技术;输出还会经过安全评估与记忆化检查再发布。
在哪些地方可以用 Veo 3.1?
Google 列了五个入口:Gemini、Google Flow、Google Vids、Google AI Studio 和 Gemini API。没有自托管或开放权重的路径。
最新 Google Veo 3.1 文章
浏览所有已发布的 Google Veo 3.1 文章,包括入门介绍、实用指南和开发者文档。
-
Veo 3.1 与 Sora 2 对比:两家官方页面各自还确认了什么
Google 官方写明 Veo 3.1 单条 8 秒、1080p 与 4K、原生音频;OpenAI 官方页面写明 Sora 产品已不再提供。本文只用两家一手页面做对比。
阅读文章 -
Veo 3.1 与可灵 3.0 对比:两家官方各自公布了什么
Google 官方写明 Veo 3.1 单条 8 秒、1080p 与 4K;快手官方写明可灵 3.0 支持 3 到 15 秒,并公布每秒积分单价。本文只用两家一手页面。
阅读文章 -
Veo 3.1 提示词指南:Google 亲口点名的七个要素
Google 为 Veo 写下七个提示词要素,对 Veo 3.1 本身只有一句话。本文给出这七个要素、完整示例提示词,以及官方没有公布的部分。
阅读文章 -
Veo 3.1 价格与免费额度:官方公布了哪些数字
Google 为 Veo 3.1 公布了三档 AI 方案、每月 Flow Credits 与 Vertex AI 按条单价。本文逐项给出数字与出处,并标出官方未公布的部分。
阅读文章 -
Veo 3.1 怎么用:从第一条视频到能接着往下写
Veo 3.1 现在能在哪几个入口用、第一条视频怎么一步步做出来、一份把镜头、光线和声音都写全的实战提示词,以及官方没公布的部分。
阅读文章 -
Veo 3.1 API 计费与 Vertex AI 接入
Veo 3.1 API 的双入口计费对照:官方公布的按秒与按条单价、可直接运行的 curl 与 Python 请求,以及 Gemini API 与 Vertex AI 的 model id 差异。
阅读文章