Ideogram 4.0 是 Ideogram 当前的图像模型,也是这条线里第一代以开源权重发布的模型。它改的习惯很窄:你不再只描述画面,而是描述一个版式,包括那几个必须读得清的字。

这篇讲四件事:4.0 能在哪些入口用、第一张图怎么做出来、一份完整的实战提示词,以及官方没公布的部分。

Ideogram 4.0 是什么

官方模型页用一句话定义它:4.0 是 Ideogram 当前的模型,主打提示词还原度、清晰锐利的字体、可靠的编辑、原生透明、风格控制,以及设计级的输出质量。

下面那句更值得记住:它用「描述—结构化—重建」的循环训练,先把场景、背景、文字和物体读成结构化数据,再学着从这份表示重建图像。边界框是和平实的语言描述一起训出来的。

官方写明的能力官方页面的说法
画面里的文字从发布起就在文字渲染上领先,4.0 又加上边界框版式控制
版式控制元素位置来自与自然语言描述配对训练的边界框
可编辑产物透明抠图与可编辑文字图层已经可用
开源权重可下载、微调并在自己的硬件上运行
早期模型3.0、3.0(3 月 26 日)、2a、2.0、1.1、1.0

官方说生成结果是可编辑的文件,不是一张扁平画面。

现在能在哪些入口用它

官方文档列了 4.0 的四个公开入口:应用、API、面向智能体与内部工具的 MCP,以及开源权重。

入口官方页面写在这个入口下的能力
应用在浏览器或手机应用里出图,按订阅计费
API端点结构见 developer.ideogram.ai,按图计费
MCP官方列为面向智能体与内部工具的入口
开源权重可下载自托管,商用授权随部署规模而定

有一处最容易混:官方文档写明订阅与 API 账号是分开的,付款与计费各自独立,应用里买的套餐不给 API 充值。

想在代码里调用,Ideogram API 接入指南写了请求结构。

第一张图:分步做出来

Ideogram 4.0 官方示例:深绿色桌布上摊开的 CONCHA 品鉴菜单卡,小字清晰可读
Ideogram

第一次跑通是把流程走一遍,不是出最好的那张图。

  1. 注册账号。邮箱注册也能用,但不含免费积分。
  2. 用户名按永久处理:登录方式、绑定邮箱和用户名都改不了。
  3. 提示词控制在约 150 词(约 200 token)以内,主体放最前面。
  4. 设好模型、比例、风格和参考图,并核对所选模型的支持能力。
  5. 生成、查看、下载。格式含 JPEG、PNG 或 WebP,透明输出禁用 JPEG。

比例是一组预设,从竖版 1:3、9:16 到方形 1:1,再到宽版 3:1;API 里用 x 分隔,16:9 写成 16x9。Style Reference 最多三张参考图,模式有 Auto、General、Realistic、Design。

纯文本是官方支持的路径。Magic Prompt 能把一句话自动扩写成完整的 JSON caption,应用里敲的那句话就是这样到达一个用结构化 caption 训练的模型。

实战示例:一张产品图,两行文字

要做的是台面上的一袋咖啡,产品名要清晰可读,下面加一行短字。画面越复杂越不利于排字,所以场景保持干净。

A matte black coffee bag standing on a concrete counter, studio light from the left.
Text on the front of the bag, in a clean sans-serif, reading "MORNING BLEND".
A smaller line underneath reading "Small batch".
Warm grey background, soft shadow, product photograph, shallow depth of field, 4:5.

每一行都在回答不同的问题。文字放前面、加引号、写得短,正好是官方五条实践里的三条。

结果沿着同一份官方限制分开。引号里那行只有两个词,所以站得住;第二行是长度开始收费的地方,因为文字越长越容易拼错。

第二个例子只动一块:「保持两行文字和位置不变,把影棚换成透过店窗的日光,台面换成木桌。」字没改,这就是测试版式能不能站住的最便宜办法。

顺序比总长度更重要,结构化路径也一样:官方 JSON 指南写明键的顺序有意义。

一份能反复用的提示词结构

上面两个例子共用同一副骨架,正是它让好结果能被复现,而不是撞运气。

每次都值得写的几块

Ideogram 一次就把画面和文字一起画出来,不提字的提示词等于把标题交给模型。下面几块来自官方提示词指南。

主体:画面里是什么,用看得见的方式描述
文字:确切的字,加引号,放在提示词前部
位置:文字和主要物件落在哪里
风格:照片或美术风格,有的话写上媒介、光线和配色
格式:画幅比例,以及分辨率档
排除:不要出现什么,改写成「应该出现什么」
约束:复用参考图时必须保持一致的部分

文字渲染在哪里出问题

官方指南列了三条限制和一个意外。文字越长越容易拼错。整篇文档级的排版不是它的用途。文字渲染在英文上最准,非拉丁文字常不可预测。意外的是:无法按字体名指定,只能描述字形。

拼错有几条出口:重新生成;把词变短;用 Canvas 的文字工具直接改写,官方文档把它写成「提示词改不了字」时的答案。

限制、费用,以及官方尚未公布的部分

Upscale 是付费档功能,最多把分辨率提升两倍,并会裁切到最接近的支持比例。输出分辨率更麻烦:模型页只写「写实的 2K 图像」,没有像素表,确切像素取决于模型、尺寸档和端点。

费用这件事,本文不碰数字。官方按图给 API 定价,分三档质量,订阅与积分额度放在 live pricing 页,而且官方明确说不要依赖文档里的静态表格做购买决定。不变的是结构:API 按图计费,订阅与 API 账号互不相通。

一句排名提醒:模型页引用了第三方榜单成绩,DesignArena 在列。那是厂商转述的第三方结果,不是独立审计。

Ideogram 主题页收着我们其余的 Ideogram 内容,GPT Image 2.5 与 Ideogram 对比把两个模型在排版和交付上拆开比。

常见问题

试一下要付钱吗? 官方没有公布免费积分数量,而是指向 live pricing 页;明确说的只有一条:邮箱注册不含免费积分。

生成的图能留着吗? 下载格式是 JPEG、PNG 或 WebP,透明输出禁用 JPEG。API 出的图链接会过期,得自己存。

为什么字老是拼错? 两条官方限制是主因:字串越长失败越多,非拉丁文字不可预测。把行写短、保持英文、加引号。

可以用中文写提示词吗? 自然语言可以,Magic Prompt 会把它扩写成 JSON caption。字能不能落对是另一个问题,官方指南很直接:英文最准。加引号的规则看我们的文字排版指南

把顺序做对一次——文字在前、加引号——这个模型就不再像老虎机。