任何修图工具都有两张清单:它会改什么,它会保住什么。Nano Banana Pro 的官方文档把两张清单都写了出来,于是大部分工作就变成了「照着对的句式写一句话」。

Nano Banana Pro 修图:先给结论

一句话说清你要改什么,再用同一句话里的另一部分说清什么不能动。Google 自己给的示例就是这么写的:一边是「Turn this scene into nighttime」,另一边是「keep the can exactly the same」。

只写前半句,模型就有权把其余部分重新画一遍。

Google 公布的唯一一条规则:直接、具体

提示词指南把这条写得很干脆:「For modifying an existing image, be direct and specific. (e.g., change the man’s tie to green, remove the car in the background)」两个动词,两个名词,没有一个形容氛围的词。

如果改动依赖你上传的参考图,同一页还有第二条规则:「clearly define the role of each. (e.g., “Use Image A for the character’s pose, Image B for the art style, and Image C for the background environment.”)」指明哪张图负责哪件事,是「编辑」和「重做」的分界线。

Google 官方示例:Nano Banana Pro 让同一件服装在多个生成素材里保持一致
Google

把「要改的」和「要保的」分开写

Google 的模型页把支持的修图动作列了出来:调整调色与光向、把画面从白天改成夜晚、用景深把焦点挪到别的主体上、切换画幅比。围绕这些动作,官方给的提示词都带一句「锁定」的话,而且措辞高度一致:「keep the can exactly the same」、「The character, remains exactly locked in its current position」。

所以可用的句式只有两段:改 X。保 Y。

写进 Y 之外的部分,模型都可以动。

官方承认的修图局限

两张页面都没有把修图说成无损。模型页写明,遮罩编辑、大幅度改光、多图融合「may sometimes produce unnatural results, visual artifacts, or disjointed scenes」。小脸、拼写、细节是长期记录在案的弱项。提示词指南把这一点又对修图重复了一遍:「Advanced editing tasks like blending or lighting changes can sometimes produce unnatural artifacts.」

按这个前提安排节奏:一轮只做一个有意义的改动,看过结果再提下一个。

小步走还有一个好处,画面坏掉时你能立刻判断是哪句指令干的。

案例:三个可以直接照抄的编辑

三个编辑,指令原文都来自 Google 公布的示例,另外补上每个例子假设的原始场景和产出的样子。

案例一:白天改成夜晚

原始场景:一张下午平光下拍的风景照,天空还很亮,画面里没有灯具之类的光源。

指令原文:「Turn this scene into nighttime」

产出的样子:构图不变,天空压暗,换成夜间的光照。因为这句指令完全没提主体,所以也没有任何东西被保住——这正是 Google 为昼夜转换点名的风险。如果有哪个元素不能动,就在同一句里加一句锁定。

案例二:把焦点挪到花上

原始场景:一张人像,人物站在前景的花丛后面,前后景差不多一样清晰。

指令原文:「Focus on the flowers」

产出的样子:同一张画面,景深被推到前景,花变锐利,背景软下去。这是模型页列出的支持项之一,用景深把焦点换到不同主体上。注意这句话有多省:两个字就带完了整次编辑。

案例三:翻译照片里的文字

原始场景:一张产品照,三只黄蓝配色的罐子,标签上是英文文案。

指令原文:「translate all the English text on the three yellow and blue cans into Korean, while keeping everything else the same」

产出的样子:罐子还是那三只,标签文案换成韩文,版式和风格保留下来——开发者公告把这件事描述为保住「original artistic style or layout」。语法和语感上要有心理准备,官方把翻译列为已知弱项,最好请母语者过一眼。

照片里的文字与语言

文字是修图和「正确」两者交汇的地方。指南给的建议是,把文字内容和呈现方式都写出来:「The headline “URBAN EXPLORER” rendered in bold, white, sans-serif font at the top.」开发者公告讲了同一件事的商业版本:菜单、招牌、文件这类元素可以通过图生图直接换语言,画面风格原地不动。

每一个渲染出来的词,都要读过才算数。模型页把拼写准确列为长期弱项,指南也重复了一遍。

值得反复用的提示词骨架

四个位置,按顺序填。第一是改动本身,用祈使句写。第二是锁定,写明不能动的是什么。

第三是相机与光线,画面依赖这些时才写——指南建议像摄影师一样指挥它:「A low-angle shot with a shallow depth of field (f/1.8)」、「Golden hour backlighting creating long shadows」。第四是画布,输出格式有要求时才写:「A 9:16 vertical poster」、「A cinematic 21:9 wide shot」。

这个骨架就是从官方示例里拆出来的。Nano Banana Pro 提示词指南讲了框架的其余部分,上手教程说了修图入口在哪。如果你还在两代模型之间选,Nano Banana Pro 与 Nano Banana 的对比有一张对照表。想用代码做同样的编辑,从 API 指南开始。

常见问题

它只能生成新图,不能改我已有的照片吗? 能改。Google 把 Nano Banana Pro 描述为图像生成与编辑模型,指南里专门给了修改已有图片的指令写法。

最有用的一条规则是什么? 直接、具体,并且在同一句里说明什么必须保持不变。

它能把照片里的文字翻译成别的语言吗? 能,而且会保留版式与风格。语法和文化语感可能出偏差。

同一个人物在多轮编辑里能保持一致吗? 模型页支持最多 5 个角色,同时说明角色一致性可靠但不保证。

改画幅比会连带把主体重画吗? 不一定。模型页给的写法是「change aspect ratio to 1:1 by reducing background. The character, remains exactly locked in its current position」。

改一次要多少钱? 本次查阅的官方页面没有公布,所以这里不给数字。

把「要保的」也写出来,别只写「要改的」。