GPT Image 2.5 确实能在图里写出中文字,但没有任何官方页面承诺这些字一定正确,而这两句话之间的距离,正是大多数教程含糊过去的地方。

官方材料里真正有的,是一条限制和一组提示词约束,这两样都比一句”保证”有用。

官方文档到底写了什么中文相关的内容

先看写下来的东西,因为外围报道比原始材料自信得多。

  • 发布公告共十个章节,没有一节讨论文字渲染或排版质量
  • 公告全文没有点名任何语言:没有中文、日文、韩文,也没有任何非拉丁文字
  • 最接近的线索出现在一张示例图的替代文本里,提到了日文文字,而那是图片说明,不是能力声明
  • 八页的系统卡里 typography 出现零次,同样没有点名语言
  • 系统卡唯一相关的能力句是模型”提升了信息图的准确性与版式”
  • 流传的”官方针对中文渲染做了优化”,在两份文档里都找不到对应表述

这不是说中文就会出错,而是说上限从未被公开,所以你要围绕提示词规则制定做法,而不是围绕一个保证。

官方确实写明的四条限制

API 指南里有一节 Limitations,这是官方唯一讨论图内文字质量的地方。

  • 文字渲染:“尽管有显著改善,模型在文字的精确位置与清晰度上仍可能不稳定”
  • 延迟:“复杂提示词最长可能需要两分钟处理”
  • 一致性:模型”在多次独立生成之间,可能偶尔难以保持反复出现的角色或品牌元素的视觉一致性”
  • 构图控制:“尽管指令遵循有改善,模型在结构化或对布局敏感的构图中,仍可能难以精确放置元素”

第一条值得读两遍。改善不等于可靠,而密集的小字恰恰是清晰度最先失守的地方。

把确切的文字放进引号

官方 Codex 图像生成页对这件事讲得最清楚,几乎可以照抄。

  • 图内文字要短,并且”把确切的文字放进引号里”
  • 大小写按你要的固定下来,不要交给模型决定
  • 字体、字号、颜色、位置都要写成明确约束
  • “遇到不常见的名称,在准确度重要时把字母逐字拼出来”,生僻字和地名同理
  • 明确说明是否允许出现其它文字,避免冒出多余的字母
  • 提示词指南里同样是这句:把字面文字放进引号或全部大写,难拼的词逐字母拼写

官方给的示例提示词可以直接照这个形状写:“只加入标题 “SPRING WORKSHOP”,用大号加粗白色无衬线体,居中放在画面上三分之一处。标题保持一行。”

把字串压短,并显式声明语言

长度是你最能直接控制的变量,而语言几乎没人写下来。

  • 短胜于全:一行主标题加一行短副标题,远比一段正文活得下来
  • 一条指令对应一行文字,让每个字串有自己的位置
  • 显式声明语言,例如”所有文字使用简体中文”,不要指望模型自己判断
  • 语言与字形可能不一致时两个都写,这种歧义应该由你消除
  • 密集小字就是官方点名的失效场景,所以宁可把字放大、把字数砍掉

这些规则并不是中文专属:德语标题或韩文标签能不能完整出图,看的是同一条规则。

海报、卡片与界面文字的工作流

可重复的顺序比更长的提示词有用,因为你能看清是哪一步改动了结果。

  • 先从模板起步,让版式一开始就是对的,做法见GPT Image 2.5 模板功能
  • 文案在工具外写好再粘进去,别让模型重打一遍字符
  • 一张图连续两次不对,就把版式需求和文字需求拆开分别发
  • 每轮只处理一段文字,而不是一次要整组海报
  • 先用文字把区域划出来再加字,留给模型的位置决策越少越好
  • 做系列内容时把引号里的字串存成文件,每次粘贴同一份文案

字还是写错时怎么办

改文字指令,而不是重画整张图,因为画面其余部分通常是对的。

  • 就地用评论把那几个字改掉,而不是重新生成,这正是GPT Image 2.5 评论标注改图的用途
  • 每次只动一个变量:先字串,再位置,最后字体约束
  • 先砍长度再动其它设置,因为官方点名的弱点就是清晰度
  • 有两个字反复互换时,在提示词里逐字母把这几个字拼出来
  • 接受第二遍修改,提示词指南本身就是这么写的:“小幅调整措辞或版式通常能提升可读性”

实操示例:给海报写一行短短的中文标题

文字渲染是官方记录最薄的一块,所以流程必须偏保守。举一张只需要一行中文标题的海报。

繁复的装饰边框之下,请柬上的字依然清晰可读
装饰越繁复,越要看清字 OpenAI
  • 字符要放进引号里,不要写成描述,例如「春日限定」
  • 在同一句里把语言和字形说清楚,例如:标题用简体中文写「春日限定」,请精确渲染这四个字。
  • 字符串尽量短。四个字是安全长度,一整句不是
  • 说清文字的位置和大小:“居中放在画面上三分之一处,是画面里最宽的元素。”
  • 先渲染一次,逐字读一遍结果,错了就一次改一个字

上面那张图是个有用的参照:繁复的边框之所以成立,正是因为框里的字仍然读得清。字符串回来不对时,原因通常是——你描述边框的篇幅,比描述字符的篇幅多得多。

如果文字必须落进你已经画好的版式里,提供这套结构的方法见 GPT Image 2.5 Sketch 教程。

常见问题

GPT Image 2.5 现在还会把中文写错吗?

没有任何官方页面给出准确率数字,API 指南还提醒文字的位置与清晰度仍可能不稳定。所以把每个字串当成需要检查的东西,而不是被保证的东西,密集版式要预留一次修正。

为什么有文章说官方已经解决中文文字问题?

发布公告和系统卡里都没有任何语言相关的能力表述。流传的说法在两份文档中都不存在,所以那是第三方观感,不是官方立场。

一张图里的文字能写多长?

官方指导是图内文字要短。一行主标题加一行短副标题是现实的做法,而一段密集正文,正是 API 指南点名的不稳定场景。

可以指定繁体字吗?

可以。像声明语言一样显式写出字形,并把确切字符放进引号。字形和语言是两条独立约束,两条都写,模型就不必自己猜。

图内文字不是中文的特殊难题,而是同一条规则的最严格情形:放进引号、压短、显式指定位置、就地修正。