Google 给 Nano Banana Pro 发了三份提示词文档,三份对提示词各部分该怎么叫,说法并不统一。网上多数教程默默挑一份,当成唯一版本讲下来。差别本来不大,直到你要找一套能反复套用的模板,却翻出三种叫法。

这一页把三份并列摊开,挑出 Google 讲得最多的那套框架,再做一件官方页面都没做的事:把同一条提示词重写前后摆在一起。

三份官方文档到底说了什么

官方页面它点名的要素最擅长的地方
blog.google 上的七条技巧文章主体、构图、动作、场景、风格、编辑指令镜头、光线、文字,以及每张参考图的角色
Cloud 的「终极提示词指南」主体、动作、场景与语境、构图、风格按任务分的公式,涵盖编辑与参考图
DeepMind 的提示词页面风格、主体、环境、动作、构图编辑已有图片,一次只改一个要素

命名并没有对齐

主体、动作、风格在三份清单里都出现。构图三份都有,位置却一直在挪。场景到了 DeepMind 那页被叫成 setting。差别属于用词习惯,读法完全一致:点明主体,说清它在做什么,放进某个环境,定好画面构成,再定风格。

有一处缺口比叫法重要得多。三份清单都要求写编辑指令,而这一格恰好是新手最容易空着的地方。

撑起每条提示词的规则

Google 的 Cloud 指南把原则说得很直白:提示词用一个有力的动词开头,直接告诉模型你要做的那件事。

同一页还有两条规则,都能帮你少跑几轮。写具体,因为细节才是模型拿来推理的材料。正面描述,指南自己举的例子是 empty street 能落地,no cars 通常不行。

正面描述比堆否定更管用

把一句禁令删掉,改成对场景本身的描述,看看画面会怎么变。

较弱:桌上一只咖啡杯,没有杂物,没有人,没有文字
更好:一只素面陶瓷咖啡杯放在光秃的橡木桌上,晨光从左侧进来,身后是空房间

Cloud 指南把这个过程描述成对话:用后续提示词慢慢调,而不是推倒重来。一轮只动一个地方,你才知道是哪个词造成了变化。

框架一:文生图

Google 官方示例:一张把小豆蔻茶做法画成成品信息图的卡片,带标题、食材图示与编号步骤
Google 官方示例,出自官方提示词指南 Google

Google 公布的不带参考图的生成公式是 [主体] + [动作] + [场景/语境] + [构图] + [风格]。把它当成按顺序填的五个格子,不是要写五句话。

主体:一只陶瓷咖啡杯,杯底未上釉
动作:静止放着,一缕热气细细升起
场景:空房间里的光秃橡木桌
构图:居中,略高于视线,右侧留白
风格:编辑类产品摄影,50mm,左上柔光

注意具体感落在哪里:不在形容词上,而在被点名的物体、表面和光向。这些才是模型能执行的东西。

框架二:基于参考图的提示词

提供图片的时候,Google 的公式换了形状:[参考图] + [关系指令] + [新场景]。关系指令是整个诀窍,它在告诉模型每张输入图用来做什么。

Cloud 指南自己的例子,是把餐巾纸草图当结构、布料样片当质感,再要求渲染一把高保真 3D 扶手椅,放在洒满阳光的极简客厅里。结构来自一张图,表面来自另一张,新场景只用文字描述。

每张输入图都要贴标签。第二张不写清楚,模型就得猜该照哪张学,而猜是「看着合理但结果不对」最常见的原因。

框架三:编辑类提示词

Google 的编辑思路,指南里叫语义遮罩:你用语词划定这块区域,而不是动手去画。那页用粗体印出来的要求是,必须明确说出哪些部分保持完全不变。

杯子保持原样:同样的形状、同样的釉色、同样的把手、杯沿上同样那两处磕碰。只改环境。把它放在哑光灰色影棚台面上,背景是无缝背板,左上方一盏大柔光箱打光。85mm,f/8,中性白平衡,不要道具,不要文字,不要水印。

官方例子短到极点——「把照片里的男人去掉」。改动没有歧义、其余部分显然没被碰过时,短句就够用。一旦模型要自己判断「其余部分」指什么,它就开始失效。

文字、字体与其他语言的提示

Google 官方示例:一只土拨鼠坐在木柴堆上,四周是木头刻字拼出的一句绕口令
Google 官方示例,出自官方提示词指南 Google

文字渲染是它拉开差距的地方,Google 也把规则写了出来。要渲染的词放进引号里。字体要指名,写成粗体无衬线体或霓虹灯草书招牌,别指望模型猜中。Google 说它支持十多种语言的文字生成,翻译的做法是要求本地化,而不是重新出一张图。

同一份指南里还有个先写文字的技巧值得抄:先在对话里把文案敲定,再要一张带上这段文字的画。把句子生成和画面绘制挤在一步里,注意力就被拆成两份。

案例:五条提示词的重写

下面这段重写,是同一个请求写了两遍。第一版是人们真正会敲进去的写法,第二版把官方点名的格子填满。

含糊:把这张产品照修得专业一点

可执行:瓶子保持原样,包括标签上的文字和玻璃上的水珠。只改环境和光。把它放在湿润的深色石板上,背景无缝炭灰色,左上方一盏大柔光箱,右边缘一圈柔和轮廓光,影子轻轻向右落。85mm 镜头,f/8,编辑类产品摄影,不要道具,不要额外文字。

另外两条重写走的是同样的两步。

  • 「让它更有电影感」换成真正的变量:黄金时段逆光拉出长长的影子,电影调色配上低饱和的青绿色。
  • 「把背景去掉」先换成保留清单:保留主体、它的比例和边缘细节;只把背景换成无缝浅灰。

这个模式看过两遍就很难漏掉。含糊的提示词点出一个感觉。可执行的提示词点出一个不变的东西、一个被改变的变量,以及两者为什么可以拆开。

Nano Banana Pro 现在还会做错什么

Google 自己的模型页面列出了它还不擅长的部分:小尺寸人脸、拼写准确、精细细节。提示词页面补充说,即使提示词很短,生成的图像质量也很高,控制力来自一点点往上加细节。

把这当成一份检查清单。如果你的画面依赖缩略图尺寸下的一张脸、一长串文字或者细密的重复图案,发布前先看满尺寸的结果。

成本只能给个短回答:官方提示词页面没有单张价格,也没有免费额度,所以这里不给任何数字。围绕提示词的流程,上手指南会带你做完第一张图,API 指南则说明提示词在请求里的位置。

常见问题

该用哪套框架? 用 Google 为你的任务公布的那一套。文生图、参考图、编辑各有各的公式,差别在中间,不在两头。专题页把相关模型页面收在一处。

提示词必须用英文写吗? Google 记录了十多种语言的文字生成,并把本地化当成正经任务。写得具体比用什么语言更要紧。

支持负面提示词吗? Cloud 指南推荐正面描述,还举了 empty street 胜过 no cars 的例子。那是建议,不是有文档支撑的负面提示词语法,官方页面也没有公布这种语法。

一次能放多少张参考图? 官方公告说一次构图最多 14 张,数字因界面而异。API 指南说明了这个输入放在哪里。

写提示词之前要不要先跟 GPT Image 比一比? 如果选择还没定,模型对比按任务把两个模型分开排,比给错的模型写提示词省事。

填满五个格子,点明不能变的东西,然后每轮只动一个元素。整套方法就这么多,剩下的拼接工作,官方页面留给你自己做。