Ideogram 自己的提示词指南没打算卖你一条公式。它给的是一个顺序:八个部分,并且很直接地提醒,整条提示词里最值得写对的是第一句。下面就是这套结构,加上官方给文字定下的几条实践与限制、两组官方示例提示词的原文,以及官方始终没回答的问题。
官方提示词指南到底写了什么
这份指南是一个页面,下面挂着十个小节,而它的编号不值得信:目录把”处理否定项”叫第 5 节,翻到那一页却把自己标成第 6 节。按标题找,不要按数字找。页面上也没有发布日期,只写着”上次更新于 4 个月前”,所以本文的所有细节都以我们 2026-09-15 的这次阅读为准。
官方文档里的提示词结构,逐块拆开
指南命名的八个部分
每个部分拿到的是一个用途,而不是一个字数。
| 部分 | 官方给出的用途 |
|---|---|
| 图像概述 | 用一句话说清整张图 |
| 主体细节 | 颜色、形状、材质、质感,以及你要写的字 |
| 姿态或动作 | 主体在做什么 |
| 次要元素 | 环绕主体的道具与环境细节 |
| 场景 | 发生在哪里,室内还是室外 |
| 光线 | 光是什么样子,画面该有什么情绪 |
| 取景 | 机位、景别、主体放在哪 |
| 技术增强项 | 镜头、虚化、笔触、渲染风格 |
有两行比其余的更重。官方说,如果你只写一句,那一句就该是图像概述;需要出现在画面里的字,官方把它放进主体细节,加引号,放前面。
把它们拼成一条提示词
模板就是一行:
[Image summary]. [Main subject details], [Pose or action], [Secondary elements],
[Setting & Background], [Lighting & Atmosphere], [Framing & Composition], [Technical enhancers]
顺序不是装饰。靠前的部分对模型更重要,所以主体和要渲染的文字都该往前放。长度也有天花板:大约 150 到 160 个词,折合约 200 token。超过以后,官方直说后面的内容可能被忽略。
Ideogram 希望文字怎么写

画面里的文字是这个模型被卖的那个能力,而官方给的方法平实得有点意外:用完整句子和标点写提示词,把想出现的字加引号说出来,再描述它周围的场景。它自己的第一个例子就是墙上的一张海报,上面写着 “Everything you can imagine is real.”
指南给出的五条实践
- 用能看见的方式描述文字本身。
- 把文字放在提示词前部。
- 用引号把确切的字括起来。
- 文字多了就切块,每块给各自的位置说明。
- 降低画面其余部分的复杂度。
文字渲染在哪里出问题
官方列了三条限制,一条都没含糊。文字越长,拼错、变形、缺字的概率越高;它拿合影打比方,人越多越可能有人眨眼。这个模型不是用来排版整篇文档的,长段落要在之后由图形工具补。文字渲染在英文上最准,非拉丁文字被描述成”常常不可预测”。
意外的一条在另一节:字体名没法指定。你只能描述字形,官方还补了一句,模型从来没加载过那款字体,它学的是样式看起来该是什么样。
拼错了也有出口:多生成几次;把长词换成短的同义词;用编辑器直接改写再用高图强度 remix;或者上传一张已经带目标文字的图当起点。
示例:两组官方提示词组装
官方把前面那些块拼成了三条完整提示词,其中两条能看清同一副骨架在做不同的事。
示例一:香水瓶
A product photo of a men's perfume bottle named "Nightlife for men" in a sleek studio setup. The bottle is tall and rectangular with dark glass, a matte black cap, and silver lettering. The text "Nightlife for men" appears on the label in bold, modern font. The bottle stands upright with a slight reflection on the surface below. A wristwatch and a pair of sunglasses sit nearby, adding a masculine vibe. The scene is set on a smooth black surface with blurred city lights in the background. Lighting is moody and cool, with soft blue highlights and deep shadows. The bottle is centered in the frame, captured at eye level.
每个槽位按顺序填满,产品名出现了两次,都带引号,都在第二句里,模型没有理由去猜那几个字。
示例二:Rhinos 队徽
A logo design for a local football team called "Rhinos" in green, blue, and white. The main graphic shows a strong, stylized rhino head viewed from a three-quarter angle, with sharp lines and a bold expression. The word "Rhinos" appears in large, blocky letters beneath the icon. Stars and shield shapes accent the logo without crowding it. The background is flat white, with no scene or setting. The color palette is vivid, with deep blue outlines, white highlights, and green fills.
同一副骨架,换了一批约束。队徽没有场景可写,场景那一栏就换成纯白底,技术增强项换成矢量线条的锐利而不是景深。品牌名只有一个短词,还加了引号——官方那页把这种情形评为最稳的一类。
官方当成「修法」公布的改写对照
官方的常见问题页做了一件厂商文档少做的事:把坏提示词和改好的并排印出来。
| 它命名的毛病 | 别这么写 | 改成这样 |
|---|---|---|
| 空洞形容词 | 一片美丽的森林 | A dense forest with tall pine trees and soft rays of sunlight filtering through the branches |
| 抽象概念 | 一个希望的象征 | A single flower blooming through a crack in the concrete |
两个习惯从这张表里掉出来:眼睛验证不了的形容词,换成眼睛能看见的东西;互相打架的描述,选一个而不是两边都要。同一页还提到,画幅比例会悄悄改写取景,所以想要哪一块画面就直接写出来。这些提示词敲在哪儿、旁边有哪些设置,上手指南写了。
JSON 提示词、纯文本,以及指南没有交代的部分
开源权重采用的 caption 结构
Ideogram 4.0 是用结构化 caption 训出来的,不是用句子,而开源权重仓库把这份结构公开了。顶层三个字段:一句概述、一个可选风格块,以及一个必须存在的构图拆解,里面先写背景,再列元素。每个元素要么是物体,要么是文字项,两者都能带一个边界框,写成四个数字,坐标归一化到 0 到 1000。
两条规则最容易被忽略:键的顺序是硬要求,取决于 caption 类型;颜色必须写成大写的六位十六进制,风格块里最多 16 个,每个元素最多 5 个。
两条输入路径,两套相反的规则
搜索结果在这里最容易把人带偏。仓库明确写着,把纯文本提示词直接喂给模型不行,还可能触发安全警告,因为权重期待的是 caption。这条对托管服务不成立:在应用和 API 里,Magic Prompt 会先把你的句子扩写成完整 caption,纯文本能在那边跑通就是这个原因。同一个模型,两条输入路径,两套相反的规则。Ideogram API 指南写了请求走的是哪一条。
指南没交代的部分值得点名:
- 没有准确率。本文打开的页面里,没有任何一份公布过某种语言的文字渲染成功率。
- 没有参数量,也没有像素换算。仓库描述的是结构而不是规模,边界框是归一化坐标,没有说它怎么落到具体分辨率上。
Ideogram 主题页收着我们其余的 Ideogram 内容。
常见问题
一定要写 JSON 吗? 在应用和 API 里不用。Magic Prompt 会替你扩写自然语言句子,整套结构章节也是按纯文本写的。开源权重那一侧,模型等的就是 caption。
为什么字老是拼错? 长度是官方写明的首因,非拉丁文字是第二条。把行写短、保持英文、往前放。
能指定某款字体吗? 不能按名字指定,改描述字形。