拍头像这件事,对图像模型的要求和拍风景完全不一样:图里的人必须还是那个人。Google 把机制和失败模式都写了出来,于是大部分工作变成了判断提示词该锁住什么、又该放开什么。
Nano Banana Pro 头像:先给结论
传一张干净的人像参考图,然后写两句话。第一句守住身份,第二句换掉风格。
Google 自己给的示例就是一句话干完两件事:让画面里那位男性「should retain his original features and expression」,同时往他脸上打一道带方向的硬光。
只写第二句,模型就有权重画这张脸。这就是大家说的那种「像,但更像一个更好看的陌生人」。
Google 对保住一张脸的官方说法
DeepMind 的模型页给出了上限:模型可以「maintain the consistency and resemblance of up to five characters and the fidelity of up to fourteen objects in a single workflow」。这是一次工作流之内的上限,不是对你手上那张照片的承诺。
同一页的局限章节写得同样直接:「The model excels at character consistency, but it may not always get it right.」小脸另有一条,模型「can still struggle with small faces, accurate spelling, and fine details in images」。提示词指南又把这条对编辑场景重复了一遍:跨编辑的角色一致性「may vary」。
三句话放在一起,可用的规则就浮出来了。一致性属于一次会话,而不属于这个模型本身。同一次会话里始终用同一张参考图、同一套服装,成功率就撑得住。
给每张上传的图一个职责
提示词指南对参考图有一条规则:「clearly define the role of each」。它自己的例子点了三张图、三件事,一张管姿势、一张管画风、一张管背景环境。
做头像一般两张就够。主体那张负责脸,第二张负责光线或背景,而且这件事要在提示词里说出来。不写,模型会把几张图平均掉;写了,每张图才有一个不能越界的范围。
先写身份锁定,再写风格改动
动笔之前,先把两张清单分开。
要改的:服装、背景、光向、调色、构图、画幅比。模型页把这几项都列在支持的动作里。
要保的:脸、发型,如果眼镜本身就是识别特征就包括眼镜,还有任何让人一眼认得出的标记。
Google 的锁定句很短、反复出现,而且是有意为之。一句是「keep the can exactly the same」,另一句是「The character, remains exactly locked in its current position」。
还有一句提醒。网上流传的「preserve face 100%」并不是 Google 的措辞,官方文档里找不到这句话。要抄就抄模型页公布的那种朴素写法。
案例:三个可以直接照抄的头像提示词
三个提示词,各自建在 Google 公布的一句话上,再把参考图的职责补进去。补充的部分在每个代码块下面都标了出来。

案例一:给一张现成人像换光
起点:一张曝光正常的人像,背景干净,脸部放大之后依然清晰。
Use the uploaded portrait as the only identity reference. Keep the face, the hairstyle and the glasses unchanged. Generate an image with an intense chiaroscuro effect. The man should retain his original features and expression. Introduce harsh, directional light, appearing to come from above and slightly to the left, casting deep, defined shadows across the face. Only slivers of light illuminating his eyes and cheekbones, the rest of the face is in deep shadow
中间那段明暗对照法的描写是 Google 模型页上的原文,开头一句是提示词指南要求的参考图职责。产出的样子是同一张脸上更暗、更硬的调子。把图缩到缩略图那么大再看眼睛,人脸漂移最先出现在那里。
案例二:一张参考,三种裁切
起点:同一张参考图,要分别用在简历、头像和频道横幅上。
Keep the uploaded reference as the exact same person in all three images. change aspect ratio to 1:1 by reducing background. The character, remains exactly locked in its current position
锁定那一句是 Google 原文。模型页在自己的示例里列了九个画幅比,其中包含 1:1、4:3、5:3、1.85:1、2.39:1、2.75:1、4:1、9:16 和 1:4。产出的样子是主体原地不动、背景被裁掉,而不是脸被重画。Google 并没有公布一份完整的支持清单。
案例三:一张团队照,六个人
起点:六张分开拍摄的个人照,用于团队页面,房间不同、日期也不同。后半段是 Google 原文,把「时尚大片」那个词换成你团队真正想要的调子就行。
Use the six uploads as identity references, one person per image, no mixing of features. Put these six people into a single image, they should fit into a stunning award-winning shot in the style of a fashion editorial. the identity of all six people and their attire must stay consistent throughout but they can and should be seen from different angles and distances in as is most natural and suitable to the scene
官方写明的上限是一次工作流五个角色,六个人已经超过了。产出的样子是一张六个人都认得出的画面,也就是同一个问题的困难版本。要么分组生成再合成,要么接受多抽几次。
方形头像是个不同的问题
1:1 的裁切会先把边距拿走,而人脸丢掉头顶或者下巴尖,往往就丢在边距上。所以改画幅比和锁定主体要写在同一个句子里,像上面第二个案例那样。
安全区不是一个能在文档里设置的参数。如果平台会把头像裁成圆形,就让脸居中,并且在提示词里明确要求四周留出空间。然后按用户真正看到的尺寸检查一遍:一张 4K 头像如果在 40 像素宽的时候糊成一团,它就没有完成它该完成的活。
这套提示词背后的完整框架,Nano Banana Pro 提示词指南讲得更全,上手教程说了参考图从哪里上传。修图那一篇处理的是手上已有的照片,Nano Banana Pro 与 Nano Banana 的对比说明该用哪一代模型。想用代码做同样的事,接着看 API 指南。
常见问题
头像真的会像我吗? 常常像,但不保证。Google 写的是模型「excels at character consistency, but it may not always get it right」。
该传几张参考图? 一次工作流最多十四张图,角色上限五个。参考图的职责句比张数更重要。
一张参考图能不能同时出方形头像和竖版裁切? 能。把改画幅比和 Google 的锁定句写进同一条指令。
要不要写「preserve face 100%」? 不用。官方文档里没有这种写法,改用模型页公布的朴素锁定句。
把图缩到 40 像素宽再看一次眼睛,再决定要不要发布工作室版本。