Google 在 2026 年 1 月的这次更新没有新增模型。它重做的是其中一个能力——把参考图变成视频片段的 Ingredients to Video——并把它推到了此前够不到的入口上。
一个命名提醒:同样这三个词,另一家厂商用在一个完全无关的功能上。本文只写 Google 的这一项。
这次更新到底改了什么
定义没动。Ingredients to Video 就是 Google 说的那句「capability that lets you create videos based on reference images」,改的是它的产出。
先说着力程度。官方写这次更新「makes videos more expressive and creative, even with simple prompts」,又说「even with short prompts, you can generate dynamic and engaging videos based on ingredient images」。如果你一直在用又长又细的提示词去补参考图的不足,这两句值得拿去试。
再说一致性,官方给了两条。身份这一条:「Keep your characters looking the same even as the setting changes, making it easier to tell a full narrative by having the same character appear across multiple scenes.」融合这一条:「Combine disparate elements — like characters, objects, textures and stylized backgrounds — into a cohesive, high-impact clip.」
有一件事官方没说,而教程一直在替它编。没有任何一个 Google 页面公布过参考图的数量上限,第三方把它写成「最多三张」,当成规格在传。真正的上限以 Flow 面板当下显示的为准,不要从博客文章里抄。提示词指南讲的是这些图该写进什么样的结构里。
Flow 里的三条图像路径
从一张图出发,Flow 有三条路,选错是最常见的翻车原因。
单张参考图
最窄的一条。模型页的说法是给 Veo「reference images of a scene, a character, or an object to guide its generation」。只有一件事必须保住、其余都可以谈的时候,才用它。
Frames to Video(首尾帧)
给一张首帧、一张尾帧,中间的运动由模型补出来。这是插值,不是合成,所以它不适合「把这个人放到那个地方」——它的两张图是同一个场景的两个时刻。上手教程走的是同一套工具。
Ingredients to Video(参考图组)
这条是组合式的。你给出一个角色、一件物体、一种材质、一个风格化背景,由提示词说明它们怎么碰到一起。1 月那次更新给每一个位置都加了一致性承诺,多段叙事这才成立,而不是只碰运气出一帧。
两条路径的判据很短:同一个场景的两个时刻走首尾帧,两样本该同框的不同东西走参考图组。
先把参考图组准备好
大多数失败在打开提示词框之前就已经定了。
每张图只装一个元素。一张人像背后是热闹街景,等于给模型两个互相打架的答案去回答「主体到底是谁」。
让光线先谈拢。棚拍平光的主体丢进夜景,一眼就是贴上去的。要么挑本来就一致的两张图,要么在提示词里把光线写明,让模型有权限重新打光。
上传之前先把映射写下来:
图 1 — 角色: 是谁,紧裁特写,一个明确的光线方向
图 2 — 物体: 角色手里拿着或用着的东西
图 3 — 场景: 在哪,外加要沿用的材质或色调
提示词句: <图 1> + <图 2>,在 <图 3> 里,然后是动作
Google 自己给的建议是:这些图干脆生成出来。公告里的 pro tip 是「use the new Nano Banana Pro (Gemini 3 Pro Image) in the Gemini app or Flow to create your ingredient images,which you can then use to create stunning videos」。先用图像模型做一张角色设定图,是官方教的做法,不是民间绕路。
两个实战示例

下面两条提示词都按 8 秒写,因为这是 Google 唯一公布过的长度:「Veo videos are 8 seconds long.」
示例一:一条街景
参考图
图 1 — 人物:三十多岁的女性,肩部以上特写,左侧柔和窗光
图 2 — 场景:雨后夜里的城市街道,积水里全是霓虹倒影
图 3 — 道具:一张折起来的纸地图,暖色纸张质感,没有可读文字
提示词
图 1 里的女性走在图 2 的街道上,手里拿着图 3 的地图。中景,镜头缓慢跟拍,浅景深。
她停下脚步,从地图上抬起头,说「就是这条街」。音频:夜间环境声,浅水里的脚步声。
示例二:竖版产品特写
参考图
图 1 — 主体:一把陶瓷茶壶,白背景拍摄,右侧硬光
图 2 — 材质:亚麻桌布纹理,自然日光
图 3 — 场景:带窗的浅色厨房墙面,晨光从画面左侧来
提示词
图 1 的茶壶特写,放在图 2 的亚麻布上,背景是图 3 的墙面。竖版 9:16 构图,
固定机位,轻微手持晃动。水汽升起,壶盖抬起一次后落回。
音频:低沉的沸腾声,壶盖轻响,安静的房间底噪。
这两条提示词我们没有跑过,也不声称它们能出什么效果。两段文字只做了一件事:按上面的映射点名每一张图、给每一张图一个职责,剩下的篇幅全部留给参考图装不下的动作。声音的处理和任何 Veo 片段一样,音频提示词那篇写得更细。
序列,而不是单段
跨场景的一致性只在第二段之后才有意义,而把它接起来靠的是 Extend。Flow 公告里的说法是,它做出的视频「lasting for a minute or more, that connect to and continue the action from your original clip」,而每一段都是从前一段的最后一秒接着生成的。参考图组保持不变,角色就能在场景更换的同时保住那张脸。
官方那句限制在这里同样适用:「creating videos with natural and consistent spoken audio, particularly for shorter speech segments, remains an area of active development」。序列要靠台词撑的话,就把台词写短、写少。
竖版输出与 4K 升采样
竖版是这个能力头一回支持的东西。Google 写「for the first time, ‘Ingredients to Video’ supports generating videos in a native 9:16 aspect ratio」,出来的就是「full-screen vertical storytelling without cropping or quality loss」——原生渲染,不是横版裁出来的。
升采样这句脚注决定了你能在哪干活:「upscaling to 1080p and 4K is only available in Flow, the Gemini API and Vertex AI」。API 与价格那篇讲的正是按秒计费、而不是点个按钮的那条路。
可用面也是同一个分法。官方说这次更新「launching in the Gemini app, YouTube, Flow, Google Vids, the Gemini API and Vertex AI」,所有片段都带 SynthID 水印。
常见问题
参考图最多能放几张? 没有任何 Google 页面公布过数字。第三方教程写的「三张」是它们自己的口径,不是官方规格;官方的用词只有「multiple reference images」这一句。
它和首尾帧是一回事吗? 不是。首尾帧接的是同一个场景的两个时刻;参考图组是把不同的元素组装成一个原本不存在的场景。
能出竖版或者 4K 吗? 两样都有官方说明。原生 9:16 随 2026 年 1 月的更新上线;1080p 和 4K 升采样只在 Flow、Gemini API 和 Vertex AI 提供。
参考图必须本来就是同一个场景吗? 官方没有这个要求,但光线和角度本来就接近的两张图,模型要做的协调工作更少。这两条一致性说的是把一个元素稳住,不是把两张互相矛盾的图调和起来。
数时刻而不是数元素来选路径,给每一张图一个职责,提示词里就只剩下动作要写了。