GPT Image 2.5 可以拿几张图拼出一张成品,合影、把产品放进你给的房间里、照着一张图的风格重做,走的都是同一套机制。

这套机制是参考图编排,不是一个”合并”按钮,而且规则散在官方三个页面上,不在同一处。

一次能给几张图,规则写在哪

发布公告和帮助中心都没说你能传几张,这个沉默本身就是要先弄明白的事。

  • 帮助中心写的是上传”一张已有的图片”,模板流程里则是”加一张参考图”,两处都是单数
  • 把张数规则写清楚的是 API 参考:编辑端点”接收一张或多张源图与一段提示词,返回编辑或扩展后的图片”
  • 以 JSON 发送时,图片是数组字段,每个元素带 file_id 或 image_url
  • 对 GPT image 系列模型,这个数组最多接受 16 张
  • 以 multipart 表单发送时,每张图是 png、webp 或 jpg,单张小于 50MB
  • 传多张图时,遮罩(mask)只作用于第一张

16 张是上限而不是目标。多一张输入,就多一处模型可能看错的地方,张数越多保真度越低。

每张输入图只安排一个职位

OpenAI 说 GPT Image 2.5 更擅长基于参考照片”在新场景、新风格和新构图里改造熟悉的主体”,而用上这条的前提,是别把几张图当成可以互换的素材。

  • 第一张图负责身份:那张脸、那个产品、那个具体物件
  • 第二张图负责风格:线条、配色、光线、质感
  • 第三张往后负责版式、材质或环境
  • 在提示词里按序号点名,例如”第一张图是产品照,第二张图是风格参考”
  • 明说借用什么、保留什么,否则模型会把几张图平均掉
  • 位置词只在必要时加:前景、背景、左侧、右侧

官方 Codex 图像生成页给的是同一句指导:按顺序标出每张图,再说明它们之间怎么配合。

常见的几种合成,各自的写法

多图需求大多落在几种固定形状里,每种要的句子不一样。

  • 分开拍的人像合成合影:身份优先,一人一张输入,共用同一套场景与光线描述,只说一遍
  • 把产品放进你给的房间:产品管身份,房间管版式,光源要写进提示词
  • 照着另一张图重做现有主体:主体管身份,第二张图只提供风格,并明确排除它的内容
  • 换背景:一张主体图加一张背景图,再补一句”不要移动主体”
  • 多个物件的平铺图:按顺序把物件列出来并给出数量,数数本来就是弱项

注意这里只有一种是在让模型凭空造东西,其余都是摆位置,而摆位置正好是参考图擅长的部分。

为什么脸和产品会走样

跨次生成的一致性是一条官方写明的限制,不是靠提示词能绕开的毛病。

  • 发布公告称主体保真度更好,而 API 指南仍提醒模型”在多次独立生成之间,可能偶尔难以保持反复出现的角色或品牌元素的视觉一致性”
  • input_fidelity 控制模型在多大程度上努力贴合输入图的人脸特征,默认值是 low
  • 提到 high 会更贵也更慢,所以把它花在管身份的那张图上,而不是每张都用
  • 两轮之间的机位与裁切措辞保持一致,同时改两处就分不清是哪一处动了
  • 画面已经很接近时,去改它,而不是重新生成
  • 脸必须认得出来时,一轮最多放两个人是稳妥的默认值

“先改后重生成”这个习惯,也是让角色稳定下来的同一个习惯,我们在GPT Image 2.5 形象一致性里专门写过。

发布公告承诺了什么,没承诺什么

把官方公布的内容和外围解读分开看,能少走弯路。

  • 公告承诺的是参考照片的保真度,并说 API 团队做”参考驱动的工作流”更可靠了
  • 它没有给过任何输入张数上限
  • 它没有说明怎么在提示词里区分多张图
  • 它没有承诺某张脸会被一模一样地还原
  • API 指南里的四条限制,对多图请求同样有效

超出这份清单的说法都是第三方测试结论,而不是官方口径,包括流传的”几张脸全部对得上”。

合成结果不对时该怎么办

官方四条限制里有两条,偏偏在多图场景最要命。

  • 构图控制:“尽管指令遵循有改善,模型在结构化或对布局敏感的构图中,仍可能难以精确放置元素”
  • 延迟:“复杂提示词最长可能需要两分钟处理”
  • 把需求压到每轮只改一处,而不是重写整份需求
  • 结果发糊时,减少一张输入,而不是再加一张
  • 加人物之前先用文字把区域划出来,让每个主体有各自的地址
  • 沿用上一轮有效的参考图顺序,顺序本身也在干活

画面大体没问题、只有一小处要修时,就地用评论标注,比整份重发更划算,这正是GPT Image 2.5 评论标注改图的用途。

实操示例:把人和产品放进同一张图

只要两个输入都很重要,合成就开始变难。举一个产品图:一只手握着咖啡罐,背景是一面素墙,罐子来自一张产品图,手则写在文字里。

漂浮的人物悬在倒置城市之上,一帧画面由两个元素构成
两个元素,一个构图 OpenAI
  • 给每个输入只派一个任务,发之前先把任务写下来:产品图负责罐子,文字负责手和墙面
  • 把交接处写清楚:“手握住罐身中部,手指包住前侧边缘。”
  • 光线只说一次,并同时作用于两个输入:“左上方单一柔光源,手和罐子上的衰减一致。”
  • 先出第一版,之后一次只改一样:握法、角度或光线,不要三样一起改
  • 把产品自身的细节跟提供的原图对一遍,因为 logo 和标签文字是最先漂的

交接那句是最常被漏掉的部分,也正是手最后悬在物体旁边、而不是握住它的原因。两个输入各自都成立,是那句话把它们绑在一起。

让同一个主体在多次尝试中保持稳定的相关问题,见 GPT Image 2.5 角色一致性 教程。

常见问题

GPT Image 2.5 一次最多能合成几张图?

API 参考里编辑端点最多 16 张输入图。ChatGPT 界面没有公布对应数字,所以按”最多几张参考图”来用,具体以你自己客户端的实际表现为准。

多图合成只能在 API 里做吗?

两边都能用,但只有 API 写明了张数。在 ChatGPT 里你附一张参考图并描述要改什么,官方页面描述这套流程用的是单数。

能不能一边合成两张照片,一边只改其中一个区域?

可以。先把输入发过去,再把指令收窄到某个区域。选区不是像素级的,所以改动会略微超出你圈的范围。

为什么第二个人出来像第一个人?

模型把两张参考图平均了。给每张输入图一个不同的职位,在提示词里按序号点名,并把管身份的那张放在第一位。

多图合成说到底是记账:少放几张、每张只干一件事、每轮只改一处。