FLUX.2 klein 是这个家族里你真正能下载的那一部分。Black Forest Labs 为它发布了四个本地变体,分成两套许可证,通过 Hugging Face 分发。至于本地部署的其余细节,都取决于你的显卡能装下四个里的哪一个。

下面出现的数字只来自厂商和 ComfyUI 项目自己的页面。两边都没写的地方,本文直接标出来,而不去第三方教程里借一个。

FLUX.2 klein 到底发布了什么

四个变体,两套许可证

模型页在两种尺寸上各列了一个蒸馏版和一个 Base 版。4B 这一对是 Apache 2.0,也是 FLUX.2 里唯一允许在没有 API 合同的情况下商用的许可证。9B 这一对挂在 FLUX Non-Commercial License 下:4B 是你用来做产品的那一个,9B 是你用来做研究的那一个。

Base 指的是未蒸馏。总览页把这些变体描述为保留完整训练信号的基础模型,面向微调、LoRA 训练和自定义管线,并且补了一句规划时最关键的话——Base 模型作为开放权重供本地开发使用,不在公共 API 上提供。

官方公布的显存数字

厂商给出的不止一个数字,而且来自不同的官方页面。总览页说 4B 能在消费级显卡上运行,大约 13GB 显存。模型页的表格则是按变体逐一列出的:

变体许可证显存RTX 5090 上的速度
FLUX.2 [klein] 4BApache 2.08.4 GB约 1.2 秒
FLUX.2 [klein] 4B BaseApache 2.09.2 GB约 17 秒
FLUX.2 [klein] 9BFLUX Non-Commercial19.6 GB约 2 秒
FLUX.2 [klein] 9B BaseFLUX Non-Commercial21.7 GB约 35 秒

把 4B 的两个数字当成一个区间看:一个是全精度下的建议值,一个是表格值。两个页面都没解释这个差距,所以把 8.4 GB 当成下限、13 GB 当成目标更稳妥。

训练的最低配置比推理高。训练页要求微调 4B Base 使用 12GB 显存的 NVIDIA 显卡加 32GB 内存,微调 9B Base 则需要 22GB 显存加 64GB 内存。

把文件放进正确的目录

每个文件放在哪里

权重来自 Hugging Face 上的 Black Forest Labs 组织,模型页直接给了入口。9B 的仓库前面有一道协议:ComfyUI 的教程让你先访问 BFL 仓库、接受协议,再下载。

ComfyUI 官方文档公布了两种尺寸的目录结构,文件名必须看准,因为 fp8 版本和全精度版本不能混用:

ComfyUI/
└── models/
    ├── text_encoders/
    │   └── qwen_3_4b.safetensors
    ├── diffusion_models/
    │   ├── flux-2-klein-4b-fp8.safetensors
    │   └── flux-2-klein-base-4b-fp8.safetensors
    └── vae/
        └── flux2-vae.safetensors

9B 的目录把文本编码器换成 qwen_3_8b_fp8mixed.safetensors,扩散模型则是 flux-2-klein-9b-fp8.safetensorsflux-2-klein-base-9b-fp8.safetensors。两个尺寸共用同一个 VAE 文件。ComfyUI 的页面还提醒,工作流模板随较新的版本一起发布,版本太旧时打开工作流会缺节点。

按变体设置采样器

蒸馏版跑四步

蒸馏版被蒸馏到四步推理,官方的亚秒级速度就是从这儿来的。Base 版没有蒸馏,需要正常的步数和真正的引导。把两者搞混是本地跑崩最常见的原因:在 Base 权重上跑四步出的是噪点,在蒸馏权重上跑四十步只是浪费时间。

还有一条 klein 独有的规则:它不带提示词增强,你输入什么,模型就看到什么。总览页明确要求写详细、具体的提示词,FLUX.2 提示词指南里的结构建议在这里全都适用。

12GB 显卡上的两个示例

下面两个例子都假设你用的是蒸馏版 4B、一块 12GB 显卡和较新的 ComfyUI。加载对应的内置模板——第一个用 image_flux2_klein_text_to_image,第二个用 image_flux2_klein_image_edit_4b_distilled——然后把提示词贴进去。

示例一:一张产品图

A matte ceramic coffee cup on a weathered oak table, shot from a low three-quarter angle, one hard window light from the left casting a long soft shadow, visible clay texture and a thin unglazed rim, muted cream and walnut palette, shallow depth of field, no text and no logo.

四步、1024 × 1024,这正是总览页公布的蒸馏版步数。提示词里写清了光的方向、材质和色域,因为上游没有任何环节会替你补上这些。

示例二:换背景

Keep the chair from image 1 exactly as it is, including the weave and the shadows under the legs. Replace the room from image 1 with the concrete gallery from image 2, match the light direction of image 2, and add a soft floor reflection under the chair.

把两张参考图分别拖进工作流的 LoadImage 节点,保持同样的四步,并且用编号指代每张图。这个编号习惯就是多参考编辑的全部诀窍,而 klein 最多接受四张参考图。

一台台式电脑显示器上显示着由方框连接的节点图,一支箭头指向一张渲染好的风景图块。
本站自绘示意图,非官方示例:桌面上的节点图连到一张渲染出的风景图。 AI Tool Blog

上手教程讲的是走 API 的路子,价格一文里有各档费率,FLUX.2 有没有免费额度那篇讲 playground。

本地到哪儿为止,API 从哪儿接

本地在边际成本和隐私上获胜,因为没有任何数据离开这台机器。它输在 4B 模型做不到的两件事上:一个是带联网搜索的 [max],另一个是官方称为「最新质量与速度改进首先落地」的预览端点。本地权重就是一个快照,再怎么配置也不会变成预览版。

Base 变体把这条分界线划得更清楚。如果你打算微调,它才是本地部署的真正理由:训练页给出的数字是 LoRA 文件通常 10 到 200MB,在消费级显卡上跑一到三小时,学习率 8e-5 到 1e-4,步数 1500 到 3000。这些在托管 API 上都没有,那边只提供蒸馏版。

常见问题

8GB 显卡能跑 FLUX.2 klein 吗? 官方数字从蒸馏版 4B 的 8.4 GB 起,8GB 低于已公布的下限,官方也没有描述过 8GB 的配置。

先下载哪个变体? 先下 Apache 2.0 的蒸馏版 4B:最快、最小,也是唯一能商用的 klein 版本。

4B 和 9B 需要各自的 VAE 吗? 不需要。ComfyUI 的目录结构里两者共用 flux2-vae.safetensors

为什么下载 9B 时要先接受什么? 9B 权重挂在 FLUX Non-Commercial License 下,ComfyUI 的指南让你先去 BFL 仓库接受协议。

klein 本地最多吃几张参考图? 四张,和 API 给 klein 的上限一致。

有纯 CPU 的路子吗? 官方没有给纯 CPU 推理任何数字或支持口径,所以没有可引用的内容。