Google Nano Banana Pro 是 Google 构建在 Gemini 3 之上的图像模型。它改的是两个习惯:写提示词时描述一个场景,而不是把形容词堆成关键词;改图时只描述那一处差异。

下面讲四件事:现在能在哪用、第一张图怎么做出来、一个把产品照改成影棚质感的完整示例,以及官方讲过什么、没讲过什么。全文只用 Google 官方页面上的说法。

Nano Banana Pro 是什么

Google DeepMind 的模型页把它描述为构建在 Gemini 3 之上,用于生成和编辑图像,做到官方所说的影棚级精度与控制。官方那篇提示词技巧文章称它是 Google 迄今最先进的图像模型。

更早的 Nano Banana 是另一个模型。我们核对过的 Google 页面上没有两代并排的参数表,别处的对比表都是作者自己整理的。官方真正公开的是一份能力清单,它才是判断这东西合不合用的依据。

官方公开的能力落到实际工作里意味着什么
构建在 Gemini 3 之上世界知识更足,只靠描述也能让物体看着合理
可输出 1K、2K、4K同一句提示词,草图与可印刷成品都能出
单次构图最多输入 14 张图,随界面不同产品、模特、背景可以一起给
单个流程最多保持 5 个人物、14 个物体一致小规模角色能稳住,管不住一整个人群

现在能在哪里用它

官方公告的说法是:Gemini 应用里现在就能用,AI Studio、Vertex 等入口正在陆续上线。这两句之间的差别就是你所在的那个界面,最省事的做法是从模型已经到位的地方开始。

想在代码里调用它,Nano Banana Pro API 接入指南讲了密钥、请求体和返回结果。

还有一句提醒能帮你省钱。大量网站用积分套餐的形式提供 Nano Banana Pro,那些价格属于那些网站,不属于 Google,它们背后路由到的模型也未必是官方描述的那一个。

第一张图:分步做出来

Nano Banana Pro 生成样例拼图,把可读的文字排版与摄影质感的主体放在一起
Google 官方示例 Google

第一次跑图是把流程跑通,不是出你最好的一张图。

  1. 把场景写成一句话。先说主体,再说它在做什么,最后说它在哪儿。
  2. 写出哪些东西不能变。这一句就是「改图」和「重新抽一次」的分水岭。
  3. 先定格式。画幅比例和分辨率决定这图能不能当素材用。
  4. 如实看结果。记下是哪个元素跑偏了,而不是只判断喜不喜欢。
  5. 每轮只改一处。整段重写会让你永远不知道哪个词带来了变化。

每轮改一处跑三轮,比一次写更长的一段提示词有用。

实战示例:把一张普通产品图改成影棚质感

输入是一张手机拍的陶瓷马克杯:放在厨房桌面上,左侧是硬朗的窗户光,背景很杂。目标是不重拍也能得到一张够干净、能放上产品页的图。

保持杯子的形状、釉色、杯柄和杯口那两处磕碰完全不变,只改环境。把它放在哑光灰色影棚台面上,背景是平整的灰色幕布。左上方用一只大柔光箱打主光,右侧边缘补一道柔和的轮廓光,阴影轻轻落在右后方。85mm 镜头,f/8,产品摄影,白平衡中性,不要道具,不要文字,不要水印。

结果之所以站得住,关键在于提示词被拆成了两半。物体本身一点没动,釉色和磕碰都留在原处,因为提示词把它们点名为不变;真正变化的只有背景、光线和阴影。

第二个例子把同一个文件往前推一步。影棚版对了之后要一张生活场景版,同时完全不动物体:「保持马克杯的杯型、比例和釉色与参考图一致。把灰色背景换成浅橡木桌面,右侧窗外进来的晨光。仍然是 85mm 取景,不要文字,不要水印。」两轮下来,这个杯子不用再被描述一次。

图出来之后,按最终尺寸看一眼再发。Google 自己的模型页写明了它仍然吃力的地方:小尺寸人脸、准确拼写、画面细节。缩略图好看,和 4K 下标签能不能读,是两回事。

让成品可编辑的提示词结构

上面两个例子共用一个骨架,正是它让好结果能被复现,而不是变成一张再也抽不出来的运气图。

官方点名的六个要素

Google 那篇文章列的是主体、构图、动作、地点、风格、编辑指令。把它当清单用,别当模板背:前两项说这张图讲什么,中间两项决定它落在哪里,风格决定表面质感,编辑指令负责保护已经对的部分。大量失败的提示词,前几项都写得很足,唯独最后一项是空的。

值得补上的高级控制项

另外五个控制项解决剩下的大部分问题:画幅比例、镜头与光线、想原样渲染的文字放进引号、用事实约束排除不可能的细节,以及传多张参考图时说明每张的角色。最后一条在多图输入时最要紧,一张没标注用途的图,会让模型自己猜该照哪张抄。

主体:一只陶瓷马克杯,底部未上釉,杯口有两处磕碰
构图:居中,略高于视平线,右侧留出负空间
动作:静止放置在台面上
地点:哑光灰色影棚台面,无缝背景
风格:干净的产品摄影,85mm,左上方柔光主光
编辑指令:形状、釉色和磕碰与参考图保持一致
文字(原样渲染):"手工制作"
画幅比例:4:5    分辨率:2K
参考图 1:产品本体,保持物体不变
参考图 2:只取背景风格,不要复制它的主体

限制、费用,以及官方尚未公布的部分

Google 把限制写在自己的页面上。DeepMind 的模型页说它在小尺寸人脸、拼写准确度和画面细节上仍然吃力,输出带 SynthID 水印;文字方面,官方基准里单行文字错误率大部分低于 10%,这是好数字,但不是对你那张海报的承诺。

费用这件事,诚实的答案很短。我们核对过的官方页面上没有单张价格、没有免费额度、也没有订阅档位,所以本文不印任何数字。就本文列出的来源而言,Google 尚未公布这些数字。做预算前自己去看官方 Gemini API 定价页;聚合站上的积分价格,请当成那家网站自己的报价。

如果你是在几个模型之间做选择,可以看这份与 GPT Image 的对比,它按任务类型给结论。

常见问题

要试一下必须付钱吗? 我们核对过的 Google 页面没给免费额度,这里也没有可靠数字。Gemini 应用是最短的第一步;第三方网站写着免费的积分方案,是那家网站自己的套餐。

为什么图里的字总拼错? 拼写是官方承认的短板。要渲染的文字写短、放进引号,并放大到实际使用尺寸下仍然清楚。

最多能传几张参考图? 官方公告的说法是单次构图最多 14 张,具体数量随界面不同。API 接入指南写了这部分输入放进请求的哪个位置。

发出去之前要人工看一遍吗? 要。生成只是第一步,尤其画面里有人脸、品牌名或价格的时候。

把流程学会一次,每轮只改一处,物体锁定不动,这模型就不再像老虎机。