FLUX.2 来自 Black Forest Labs,Nano Banana Pro 是 Google 的 Gemini 3 Pro Image。两家都公布了模型页,而且回答了一部分同样的问题:模型能吃几张参考图、输出什么分辨率、文字渲染做到了什么程度。这篇就把这些同题项并排放在一起。

下面只出现官方发布过的说法,也没有给任何一方写每张图的价格——一家厂商没公布的单价,这里就不写。

两家的官方描述

Black Forest Labs 把 FLUX.2 写成「面向生产环境的图像生成与编辑」,4MP 照片级输出、多图参考控制,并且是一个模型族而不是单一权重。官方总览列了五个档位:[max] 主打顶级画质并支持接地检索,[pro] 面向规模化生产,[flex] 针对排版与细小细节,[klein] 是带开放权重的亚秒级推理,[dev] 是仅本地部署的开放权重档。生成与编辑被写成同一个模型,而不是两道工序。

Google 的模型页开头就一句话:「Nano Banana Pro(Gemini 3 Pro Image)是一个图像生成与编辑模型」,构建在 Gemini 3 之上,并列出了它能用的入口——Gemini 应用、Google AI Studio、Gemini API 与 Gemini Enterprise Agent Platform。

差异从哪里开始

一边是可以挑选、还能部分下载的档位家族,另一边是只能通过 Google 产品触达的托管模型。下面大多数差异都源于这一点。

双方都公布的维度,逐行对照

维度FLUX.2(Black Forest Labs)Nano Banana Pro / Gemini 3 Pro Image(Google)
输出分辨率最高 4MP;两条边为 16 的倍数,最短边 64 像素,多数场景建议不超过 2MP输出 1k、2k 或 4k 分辨率
参考图数量[max]、[pro]、[flex] 走 API 最多 8 张、playground 最多 10 张;[klein] 最多 4 张;[dev] 建议 6 张一次合成最多 14 张图,随入口不同
角色一致性官方把多图参考写成跨场景保持身份最多 5 个角色、14 个物体的保真度
文字渲染「复杂排版与 UI 样机现在可以在生产环境里稳定工作」「多种语言的一流文字渲染」
同一模型内编辑生成与编辑写在同一个模型里官方定位就是图像生成与编辑模型
可下载权重[klein] 4B 为 Apache 2.0,[klein] 9B 为非商用许可,[dev] 为仅本地部署的开放权重所引官方页面没有公布可下载权重
溯源标记所引官方页面没有公布所有图像都带 SynthID 水印
计价基准按输出百万像素公布;[pro] 文生图每 MP 0.03 美元起所引官方页面没有公布每张图价格
正面基准对比没有公布没有公布

怎么读这张表

表里有三类行。一类是两家都公布的,可以直接对照;一类只有一家公布,这类行只能告诉你该往哪看,不能裁决胜负;还有一类是两家都没公布的基准对比行。谁要是直接告诉你哪家更强,他用的数字两家厂商都没签过字。

参考图与一致性

Black Forest Labs 按档位给出上限,还给了算法:[pro] 的输入加输出预算共 9MP,所以输出 1MP 能放 8 张参考图,2MP 能放 7 张。Google 的提示词指南用另一种说法要求同一件事:「使用上传图片时,明确说明每一张的角色。」它的官方一致性数字形状不同——一个工作流里最多 5 个角色、14 个物体。

两家都把没标注的参考图当成错误,也都没有公布这种一致性在真实使用里能维持到什么比例。

文字渲染与排版

排版是两家都喊得最响的能力,但喊法不是同一种。

Black Forest Labs 把文字放在模型页的中心位置,并专门写了一个档位:[flex] 被描述为针对排版、擅长保住细小细节。Google 写的是「多种语言的一流文字渲染」,并配了一条本地化流程,官方自己的例子是把三个罐子上的文字翻成韩文。

有一处不对称值得直说。Black Forest Labs 没有公布任何分语种的文字渲染准确率。Google 的模型页确实公布了它自己那张单行文字错误率图表,但图里的 FLUX 对比项是 FLUX.1 Kontext [max]——上一代产品,所以那不是 FLUX.2 的数字,而且是 Google 自己的测量。

开放权重、部署与溯源标记

这是两份文档差异最大的一条轴,通常被压缩成一个「开源」。

  • [klein] 4B 以 Apache 2.0 完全开放,[klein] 9B 走 FLUX 非商用许可。
  • [dev] 官方写的是面向本地开发与研究的开放权重,不提供托管 API。
  • [max]、[pro]、[flex] 是托管档位;这几条路走法在 FLUX.2 主题页FLUX.2 API 接入指南里。
  • Google 在所引页面上没有公布可下载权重,并且给每张图打 SynthID 水印;Black Forest Labs 的模型页没有公布对应机制。

开放权重不等于免费随便用:许可以外的商业部署能不能做,是由许可证决定的。

实战示例:同一份需求,两种写法

需求两边一样:把一件产品放进场景里,并且让标签和素材完全一致。两家各自公布了自己的示例。

Black Forest Labs 这条发布在模型页上,结果就是上面那张图。

Black Forest Labs 官方示例:一只装满胶囊的玻璃罐,胶囊上的标志与提供的参考图完全一致
Black Forest Labs
The jar in image 1 is filled with capsules exactly same as image 2 with the exact logo

官方放出的成品是一张影棚风格的罐子照片,胶囊上带着原样不变的标志。注意这句话里少了什么:没有风格句,也没有光照句,因为两者都来自参考图。整条指令就是两张输入,加上它们之间的关系。

Google 那条发布在提示词页上。

translate all the English text on the three yellow and blue cans into Korean, while keeping everything else the same

它旁边的结果保留了罐子和版式,只把标签上的语言换掉。有意思的是最后那个从句。

两条官方成品说明了什么

两条示例都是参考图驱动的,也都明确写出了不能改动的部分——一边是「exactly same」,另一边是「keeping everything else the same」。这是两家共用的手法,也是官方材料的终点:没有哪家拿对方的提示词跑过自己的模型,所以谁也支撑不了「哪家更能保住标签」这个结论。

两家都没有公布的部分

  • 两家都没有公布针对这两个模型的正面基准或偏好评分。
  • Black Forest Labs 没有公布分语种的文字渲染准确率;Google 那张图对比的是上一代 FLUX。
  • Black Forest Labs 的模型页没有公布溯源水印;Google 没有公布可下载权重。
  • 两家都没有公布对方模型的每张图价格。第三方转售价是那家网站自己的数字。
  • 两家都没有公布平均要重跑几次才能得到可用结果。

FLUX.2 主题页收了 Black Forest Labs 的页面,Nano Banana Pro 资料页收了 Google 的。这篇对比用到的材料都在两边。

常见问题

哪家更强? 官方文档没有回答这个问题。一边是可以挑选、带开放权重选项的档位家族,另一边是带世界知识与 SynthID 标记的托管模型。

能跑在自己的硬件上吗? FLUX.2 可以,有两个档:[klein] 走 Apache 2.0 或非商用许可,[dev] 开放权重且不提供托管 API。Google 没有公布可下载权重。

两边都支持参考图吗? 都支持。FLUX.2 在 [max]、[pro]、[flex] 上走 API 最多 8 张、playground 最多 10 张,[klein] 4 张,[dev] 建议 6 张。Google 写的是一次合成最多 14 张图。

随便挑一个开始行吗? 想要第一张图,跟着 FLUX.2 上手教程走一遍就知道流程;Google 那一侧的入口在 Nano Banana Pro 资料页里。

只对照两家都填了的那些行,把只有一家填的行当成方向而不是结论,然后按你自己的约束来定:出图要跑在哪里,以及哪些东西必须一点不改。