分镜之所以失败,原因和一场戏失败一样:节拍没有拆开。你让模型画「一张追逐戏的漫画页」,多半会得到一张挤满三件事、却一件都看不明白的图。

本文只讲需求怎么写:写提示词前先定什么、官方哪些控制项对应哪个决定、改一格怎样才不必重画整条。

先把故事拆成节拍,再谈提示词

节拍是「变化」,不是「时刻」。「玛拉在跑」是一个状态;「玛拉发现门锁上了」才是节拍。

  • 先用大白话把节拍写成编号清单,清单里一个画面词都不要有
  • 一个节拍对应一格;一个节拍要两格才够,说明它本来就是两个节拍
  • 一次做六到九格比较顺;再往后,后面的格子会开始偏离前面
  • 每个节拍都要写清「什么变了」:位置、认知,还是主动权在谁手上

这一步在纸上做。它最便宜,却决定后面所有工作成不成立。

先定交付物:分镜格还是漫画页

同一个关键词底下其实是两种东西。

  • 分镜格负责节奏与机位。可以很草,通常一个字都不写
  • 漫画页在分镜之上加版面、分格线、对话气泡与阅读顺序
  • 漫画页是分镜的下游:节拍没拆开,气泡就无处可放
  • 两者都是位图,不是分层的可编辑文件,OpenAI 文档也没说过相反的话

现在就把这件事定下来:漫画页的需求更长,两种混着写只会白白浪费生成次数。

一格一格地写

每格六个字段,按格子编号写成清单。

  • 景别——「远景」「中景」「手部特写」
  • 主体——画面里是谁,每次都写同一个说法
  • 动作——一个动词,一个节拍
  • 地点——通篇用同一批名词描述同一个地点
  • 光线——时间与方向,故事没变就一直不变
  • 排除项——不要文字、不要多余角色、不要边框

你没写的部分都会被替你补上,而「一格塞两个动作」是画面糊掉最常见的原因。往现有画面里再塞一个人是另一个问题,见多图合成

用画幅、景别与 Sketch 定构图

三个官方控制项承担了构图工作。

  • GPT Image 2.5 可用任意宽高比出图:用宽高比选择器,或直接在提示词里写明比例
  • 就算选了比例也要在提示词里再写一遍,免得竖条格和横幅格互相串味
  • Sketch 让你直接在 ChatGPT 里画图作为最终图的参考,是交代「人站在哪」最省事的办法,见用 Sketch 作画
  • Sketch 是移动端功能;网页端就用文字描述版式

镜头词比形容词有用得多。「低角度、手部特写」能定住的镜头,「有张力」永远定不住。

让同一角色跨格不漂

一格不难,难的是六格看完还是同一个人。

  • 先出第一格,再把它作为参考图喂回去出下一格,而不是重新描述一遍角色
  • 官方写得很直接:模型更擅长依据参考照片工作,特征细节更可能被保留
  • 每格只改提示词里的一行,不一致才一眼看得出来
  • 服装和体型每次都写同一批词,措辞一漂,出来就是另一个人
  • 这跟「让同一个主体被认得出」是同一个问题,见保持人物一致

两个可执行案例:一场追逐与一次对话

两例都用上面那六个字段。照原文跑,再一次只改一行。

一张电影感的叙事分镜格,单人剪影置于超现实风景之中
一格只讲一件事,画面才读得懂 OpenAI
  • 三拍追逐(2:3 竖版)。 第 1 格:「远景,2:3 竖版。一个穿红色夹克的快递员在夜市小巷里奔跑,背面视角,低角度,头顶挂着灯泡,地面湿漉。只要一个人物,不要文字。」第 2 格:「同一条小巷,同一件红夹克,侧面中景,正在翻越一个摊位,灯泡不变,不要其他人,不要文字。」第 3 格:「同一条巷子、同一件夹克,手部特写,手正按下门把手,光线不变,不要文字。」按这个顺序核对:三格里夹克和体型是否一致、门的位置有没有变、每格是不是只有一个动作。
  • 两格对话(16:9 横版)。 第 1 格:「远景,16:9。两个人隔着咖啡小桌对坐,背对明亮的窗户形成剪影,桌上有两只杯子,不要文字。」第 2 格:「特写,16:9。同一张桌子,紧拍两只手和杯子,同样的逆光,不要露脸,不要文字。」核对桌子和杯子和第 1 格是否对得上,以及第 2 格读起来是不是同一个瞬间,而不是换了个场景。

文字该留在版面里,不该留在画里。

只改一格,不重画整条

为了修一格去重跑一整条,角色就是这么丢的。

  • 可直接在图片上添加评论做更聚焦的编辑,这是官方给出的「指向某一区域」的办法
  • 第二条路径是不用选区工具,直接在对话面板描述要改什么
  • 官方把局限写得很直白:高亮并不总是精确,编辑可能超出选中区域,所以每次改完都要看相邻两格
  • 多轮一致性是官方明写的改进项:继续编辑时,先前的改动更可能保持一致

完整流程见图片评论编辑

漫画分镜仍然会翻车的地方

这几种要提前准备,任何提示词都消不掉。

  • 重复道具会漂:同一条巷子、同一张桌子要逐格看,别只看整组
  • 格内文字:塞进去的字越多,越可能拼错,而官方没有公布任何准确率数字
  • 复杂运镜:一个镜头里装两件事只会被平均掉,拆成两格
  • 群像格:一格里人一多,脸和手最先撑不住

诚实的工作流是两个来回:先拆节拍出图,再修格子。控制项见 GPT Image 2.5 总览

常见问题

GPT Image 2.5 能一次生成一整页漫画吗?

能生成一张「长得像漫画页」的图,但那是一张画,不是分好格、气泡可读的版面。把故事拆成节拍、逐格生成,整条才立得住。

一次该规划多少格?

一次六到九格比较顺。再往后,后面的格子会偏离前面的,修图的时间会超过生成的时间。

怎么让每一格都是同一个角色?

先出第一格,再把它作为参考图喂回去出下一格,每格只改提示词里的一行。官方写明模型更擅长保留参考照片里的主体。

能只修一格、不动其他格吗?

可以。用选区工具标出区域,或者在图片上添加评论,描述要改什么,然后检查相邻格子——官方说明编辑可能溢出选中范围。