Google Nano Banana Pro 是 Google 构建在 Gemini 3 之上的图像模型。它改的是两个习惯:写提示词时描述一个场景,而不是把形容词堆成关键词;改图时只描述那一处差异。
下面讲四件事:现在能在哪用、第一张图怎么做出来、一个把产品照改成影棚质感的完整示例,以及官方讲过什么、没讲过什么。全文只用 Google 官方页面上的说法。
Nano Banana Pro 是什么
Google DeepMind 的模型页把它描述为构建在 Gemini 3 之上,用于生成和编辑图像,做到官方所说的影棚级精度与控制。官方那篇提示词技巧文章称它是 Google 迄今最先进的图像模型。
更早的 Nano Banana 是另一个模型。我们核对过的 Google 页面上没有两代并排的参数表,别处的对比表都是作者自己整理的。官方真正公开的是一份能力清单,它才是判断这东西合不合用的依据。
| 官方公开的能力 | 落到实际工作里意味着什么 |
|---|---|
| 构建在 Gemini 3 之上 | 世界知识更足,只靠描述也能让物体看着合理 |
| 可输出 1K、2K、4K | 同一句提示词,草图与可印刷成品都能出 |
| 单次构图最多输入 14 张图,随界面不同 | 产品、模特、背景可以一起给 |
| 单个流程最多保持 5 个人物、14 个物体一致 | 小规模角色能稳住,管不住一整个人群 |
现在能在哪里用它
官方公告的说法是:Gemini 应用里现在就能用,AI Studio、Vertex 等入口正在陆续上线。这两句之间的差别就是你所在的那个界面,最省事的做法是从模型已经到位的地方开始。
想在代码里调用它,Nano Banana Pro API 接入指南讲了密钥、请求体和返回结果。
还有一句提醒能帮你省钱。大量网站用积分套餐的形式提供 Nano Banana Pro,那些价格属于那些网站,不属于 Google,它们背后路由到的模型也未必是官方描述的那一个。
第一张图:分步做出来

第一次跑图是把流程跑通,不是出你最好的一张图。
- 把场景写成一句话。先说主体,再说它在做什么,最后说它在哪儿。
- 写出哪些东西不能变。这一句就是「改图」和「重新抽一次」的分水岭。
- 先定格式。画幅比例和分辨率决定这图能不能当素材用。
- 如实看结果。记下是哪个元素跑偏了,而不是只判断喜不喜欢。
- 每轮只改一处。整段重写会让你永远不知道哪个词带来了变化。
每轮改一处跑三轮,比一次写更长的一段提示词有用。
实战示例:把一张普通产品图改成影棚质感
输入是一张手机拍的陶瓷马克杯:放在厨房桌面上,左侧是硬朗的窗户光,背景很杂。目标是不重拍也能得到一张够干净、能放上产品页的图。
保持杯子的形状、釉色、杯柄和杯口那两处磕碰完全不变,只改环境。把它放在哑光灰色影棚台面上,背景是平整的灰色幕布。左上方用一只大柔光箱打主光,右侧边缘补一道柔和的轮廓光,阴影轻轻落在右后方。85mm 镜头,f/8,产品摄影,白平衡中性,不要道具,不要文字,不要水印。
结果之所以站得住,关键在于提示词被拆成了两半。物体本身一点没动,釉色和磕碰都留在原处,因为提示词把它们点名为不变;真正变化的只有背景、光线和阴影。
第二个例子把同一个文件往前推一步。影棚版对了之后要一张生活场景版,同时完全不动物体:「保持马克杯的杯型、比例和釉色与参考图一致。把灰色背景换成浅橡木桌面,右侧窗外进来的晨光。仍然是 85mm 取景,不要文字,不要水印。」两轮下来,这个杯子不用再被描述一次。
图出来之后,按最终尺寸看一眼再发。Google 自己的模型页写明了它仍然吃力的地方:小尺寸人脸、准确拼写、画面细节。缩略图好看,和 4K 下标签能不能读,是两回事。
让成品可编辑的提示词结构
上面两个例子共用一个骨架,正是它让好结果能被复现,而不是变成一张再也抽不出来的运气图。
官方点名的六个要素
Google 那篇文章列的是主体、构图、动作、地点、风格、编辑指令。把它当清单用,别当模板背:前两项说这张图讲什么,中间两项决定它落在哪里,风格决定表面质感,编辑指令负责保护已经对的部分。大量失败的提示词,前几项都写得很足,唯独最后一项是空的。
值得补上的高级控制项
另外五个控制项解决剩下的大部分问题:画幅比例、镜头与光线、想原样渲染的文字放进引号、用事实约束排除不可能的细节,以及传多张参考图时说明每张的角色。最后一条在多图输入时最要紧,一张没标注用途的图,会让模型自己猜该照哪张抄。
主体:一只陶瓷马克杯,底部未上釉,杯口有两处磕碰
构图:居中,略高于视平线,右侧留出负空间
动作:静止放置在台面上
地点:哑光灰色影棚台面,无缝背景
风格:干净的产品摄影,85mm,左上方柔光主光
编辑指令:形状、釉色和磕碰与参考图保持一致
文字(原样渲染):"手工制作"
画幅比例:4:5 分辨率:2K
参考图 1:产品本体,保持物体不变
参考图 2:只取背景风格,不要复制它的主体
限制、费用,以及官方尚未公布的部分
Google 把限制写在自己的页面上。DeepMind 的模型页说它在小尺寸人脸、拼写准确度和画面细节上仍然吃力,输出带 SynthID 水印;文字方面,官方基准里单行文字错误率大部分低于 10%,这是好数字,但不是对你那张海报的承诺。
费用这件事,诚实的答案很短。我们核对过的官方页面上没有单张价格、没有免费额度、也没有订阅档位,所以本文不印任何数字。就本文列出的来源而言,Google 尚未公布这些数字。做预算前自己去看官方 Gemini API 定价页;聚合站上的积分价格,请当成那家网站自己的报价。
如果你是在几个模型之间做选择,可以看这份与 GPT Image 的对比,它按任务类型给结论。
常见问题
要试一下必须付钱吗? 我们核对过的 Google 页面没给免费额度,这里也没有可靠数字。Gemini 应用是最短的第一步;第三方网站写着免费的积分方案,是那家网站自己的套餐。
为什么图里的字总拼错? 拼写是官方承认的短板。要渲染的文字写短、放进引号,并放大到实际使用尺寸下仍然清楚。
最多能传几张参考图? 官方公告的说法是单次构图最多 14 张,具体数量随界面不同。API 接入指南写了这部分输入放进请求的哪个位置。
发出去之前要人工看一遍吗? 要。生成只是第一步,尤其画面里有人脸、品牌名或价格的时候。
把流程学会一次,每轮只改一处,物体锁定不动,这模型就不再像老虎机。