Black Forest Labs 自己公布了 FLUX.2 的提示词规则,而且写得比多数厂商都具体:一个有名字的四段式结构、一条明确的词序规则、三档长度、五条让文字真正读得出来的写法,以及一条算「一次请求能塞几张参考图」的算式。
下面每一条结论都挂在官方原句上,官方没说的地方也照实标出来。需要的是上手流程而不是提示词的话,FLUX.2 上手教程讲了这篇跳过的部分。
官方提示词指南写明的结构
官方有两页文档在讲 FLUX.2 怎么读提示词,用的却不是同一副骨架。[pro] 与 [max] 的提示词指南给的是四段;另一页 Building a Good Prompt 给的是一套八槽模板,把相机参数、光线、颜色单独拆出来。两页都出自 Black Forest Labs,先记四段,因为指南后面所有内容都建立在它之上。
| 提示词部分 | 官方原文给的定义 |
|---|---|
| Subject | The main focus (person, object, character) |
| Action | What the subject is doing or their pose |
| Style | Artistic approach, medium, or aesthetic |
| Context | Setting, lighting, time, mood, or atmospheric conditions |
官方把这四段写成一个加法,而不是一个清单。
Subject + Action + Style + Context
Subject: The main focus (person, object, character)
Action: What the subject is doing or their pose
Style: Artistic approach, medium, or aesthetic
Context: Setting, lighting, time, mood, or atmospheric conditions
词序比用词更早决定结果
指南里有一句话管住了其余全部内容:FLUX.2 更看重排在前面的东西。官方给的优先级顺序是主体、关键动作、关键风格、必要上下文、次要细节。Building a Good Prompt 从另一头说同一件事——先把主体写清楚,再补主要动作,最后才在真的能改善画面时加入氛围与视觉方向。它对灌水的判断很直接:具体细节有用,废话有害。
提示词该写多长
三档,而不是一个上限。
| 档位 | 词数 | 官方写的适用场景 |
|---|---|---|
| 短 | 10–30 | 快速概念与风格探索 |
| 中 | 30–80 | 大多数项目通常最合适 |
| 长 | 80+ | 需要详细规格的复杂场景 |
把中间那档当默认值。长档留给「规格本身就是重点」的场景——多个主体、固定版式、品牌色——而不是留给没人删所以变长的提示词。上限是 32K token,那是天花板,不是邀请。
文字渲染:官方列出的五条
模型页把排版能力放在最前面,提示词指南把它压成了五个动作。
- 把要渲染的字放进引号里。官方自己的例子是引号里的霓虹灯招牌「OPEN」。
- 说明这些字在画面里相对于其他元素的位置。
- 描述字形:优雅的衬线体、粗重的工业字、手写体。
- 说明字号,从大标题一直写到小正文。
- 给出颜色,并且用 HEX 色值给。
引号是最常被跳过的一步
把字符串标出来,才是把「描述一个渲染效果」变成模型可以单独处理的一条指令。同一条规则也适用于品牌文字,所以标志的字形和颜色一次就能写在同一句里。
用 HEX 色值控制颜色
颜色在这里是一等输入:在色值前面写上 color 或 hex 两个词,模型就会尽量精确匹配。渐变色给两个色值,一个起点一个终点;结构化 JSON 提示词还能给每个主体单独带一个 colors 数组。
色值必须绑到一个物体上
这句话值得记住:色值只有明确关联到具体物体时才最有效,像「在某处用 #FF0000」这种模糊说法可能得到前后不一致的结果。把色值挂到一个名词上——花瓶、抱枕、天空——否则模型会自己决定放在哪。
多图参考怎么写

把多张图里的元素合成到一张图、同时保住身份一致,是模型页最靠前的能力。官方点名的场景有:同一张脸跨造型的时尚拍摄、包装不变而场景变化的产品合成图、室内布局,以及一个系列里的角色连续。
一次请求能放几张参考图
数量取决于档位和入口,官方给的是算式而不是一个固定值。[pro] 的输入加输出总预算是 9MP,所以输出 1MP 时能放 8 张参考图,输出 2MP 时能放 7 张。上限方面,[max]、[pro]、[flex] 走 API 是 8 张、playground 是 10 张,[klein] 是 4 张,[dev] 官方建议最多 6 张。
标注才是关键动作,数量不是。官方要求你说明每张输入是干什么用的——图一是主体、图二是风格、图三是背景——因为第二张图不标注,模型就只能自己猜。FLUX.2 API 指南讲了这些输入在请求里的位置。
实战示例:两条官方成品提示词与官方成品
下面两条都是 Black Forest Labs 自己发布的提示词,结果图也由官方放在旁边。这里没有一条是我们改写的。
第一条是产品广告,它的重点在于文字必须站得住。
Samsung Galaxy S25 Ultra product advertisement, 'Ultra-strong titanium' headline, 'Shielded in a strong titanium frame, your Galaxy S25 Ultra always stays protected' subtext, close-up of phone edge showing titanium frame, dark gradient background, clean minimalist tech aesthetic, professional product photography
官方放出的成品是一张深色渐变的产品图,两段文字都活了下来:标题按海报尺寸排出来,下面那行更长的副文案也保持清晰。起作用的是两处写法。字符串加了引号,所以它们是以渲染指令的形式进入提示词的;机型名放在了最前面,而词序规则说那正是模型权重最高的位置。
第二条产出的就是上面那张合成图。
Replace the children in the image with the animals from images 2, 3, 4, 5, and 6. Adjust them to the space and style so they sit naturally in the scene. Adjust the proportions of the animals to each other and to the space.
把它当成一次标注练习来读:每张输入都被交代了贡献什么,位置那句负责占位,比例那句则防止某只动物以错误的尺寸出现。六张输入也在 [max]、[pro] 和 [flex] 的官方上限之内。
两条提示词的共同点
按官方自己的分档,两条都不算长;两条都以模型要执行的动作开头;两条都没有出现禁止句。最后一点不是巧合——指南写得很清楚,FLUX.2 不支持负向提示词,所以该写「不要多余文字」的地方,改成描述画面里应该有什么。
官方页面没有公布的部分
官方文档在机制上写得很细,在结果上很安静。
- 指南里没有任何分语种的文字渲染准确率,所以「哪种语言渲染得最好」这件事无法追溯到厂商。
- 官方页面没有公布任何评分,也没有公布与别家模型的正面基准对比。
- 官方没有公布免费 API 额度;官方页面上那个免费入口是 playground 试用,和免费额度是两回事。
- [klein] 明确没有 prompt upsampling,其余档位官方没有给出对应说明。
想看原始材料而不是这篇解读,FLUX.2 主题页把这些页面收在了一起。
常见问题
FLUX.2 支持负向提示词吗? 不支持。官方指南要求改写成画面里应该有什么——写「全程锐利对焦」而不是「不要模糊」,写「空场景」而不是「不要有人」。
四段式和八槽模板该抄哪一套? 先用 Subject、Action、Style、Context 四段;等场景需要把相机参数、光线和颜色单独拆开时,再换八槽模板。
HEX 色值写在哪里? 紧跟 color 或 hex 两个词之后,并且挂在一个具体的物体上。没有物体可挂的色值就是官方点名的翻车写法。
最多能放几张参考图? [max]、[pro]、[flex] 走 API 最多 8 张、playground 最多 10 张,[klein] 最多 4 张,[dev] 官方建议最多 6 张。用 [pro] 时按输入输出共用的 9MP 预算来算。
按顺序写满那四段,把要渲染的字加引号,把每个色值挂到物体上,把每张参考图标注清楚。这就是官方指南写的方法,其余文档都在主题页里。