Midjourney 自己写的提示词规矩比讲它的教程还短:提示词要短、要覆盖官方点名的那几类元素、参数一律放末尾。V8.2 之后多了一条:用 Edit Model 时,你可以直接下指令,而不是只描述画面。
官方页面到底怎么规定写法
定义只有一句:提示词就是「你用来说清想要什么图像或视频的那段文字或短语」。官方提示词基础页剩下的内容都是这句的推论。
最响的一条规矩,恰恰是教程最容易埋掉的:简短、简单的提示词通常能生成最好的画面,要用清楚的短语描述你想看到的东西,避免堆长清单和详细指令,那会让流程困惑。
官方不跟你讲道理,直接摆一对例子。反例是「给我画一堆盛开的加州罂粟,让它们亮起来、变成鲜艳的橙色,用彩色铅笔画成插画风格」;正例是「彩色铅笔插画:明亮的橙色加州罂粟」。同一张画,被删掉的是请求语气、动词和那层包装。
底下还压着两条小建议:用具体数字而不是复数,描述你想要的而不是你不想要的。Midjourney 快速上手教程把第一次出图的步骤写全了。
官方点名的七类元素,以及它背后的取舍
官方把值得覆盖的方面列完就停住了,这也正是它能塞进一句话里的原因。
| 元素 | 官方页面提的问题 | 建议用词 |
|---|---|---|
| 主体 | 谁或什么? | 人物、动物、角色、物件 |
| 媒介 | 以什么形式呈现? | 照片、油画、插画、雕塑 |
| 环境 | 在哪里? | 室内、户外、水下、城市里 |
| 光线 | 什么样的光? | 柔光、环境光、阴天、霓虹、影棚灯 |
| 色彩 | 什么色调? | 鲜艳、低饱和、单色、柔彩 |
| 情绪 | 要唤起什么感受? | 俏皮、平静、阴郁、有活力 |
| 构图 | 画面怎么取景? | 肖像、头像特写、近景、俯视 |
填满七格的代价,同一节写得很直接:细节越少,变化越多,但对结果的控制也越弱。两个元素加一种情绪换来探索空间,七类元素再加一个参数换来能重复的成品。
描述还是指令:V8.2 划出的分岔
Edit Model 页面里那句话,改变了提示词该怎么写。官方原文大意是:Midjourney 传统的提示词写法是描述你想创造的画面或场景,而不下达方向或指令;但有了 Edit Model,你现在可以在提示词里给出具体指令。
但这句话的另一面是:不挂参考图时,「把这张图里的女孩变成真人」这类动词没有作用对象,它只能被当成描述来读。
四张参考图,以及 Discord 里的 --edit
Edit Model 接受最多四张参考图,并取代了 Omni Reference 与 Character Reference,所以老教程里的 --cref 和 --oref 讲的是一条已经不存在的路径。官网上把图挂到提示词上,Discord 里则在末尾加 --edit。官方写明两条边界:不与 --tile 兼容,改图结果也不能再走 Remix。
画幅比跟随第一张参考图
改图任务继承的是第一张挂上去的图的形状,不是你保存的默认画幅比,所以输出要换比例时,--ar 得写进提示词里。想让指令权重更大,官方给的办法是加 --raw,它会去掉 Midjourney 额外加的风格加工。
参数:决定提示词能不能跑起来的三条规则
参数承载设置项:--ar、--stylize、--chaos、--no、--raw、--version 以及三个速度开关。官方参数列表把格式压成了三条规则。
三条格式规则
- 参数放在末尾,写在提示词文本之后。
- 提示词文本与第一个双横线之间留一个空格。
- 参数值里不要出现逗号、句号或其他标点。
官方还给了四个会翻车的写法:poppies--ar 2:3(双横线前没空格)、poppies - - ar 2:3(两条横线之间多了空格)、poppies --ar 2:3,(参数里带标点)、--ar 2:3 poppies(提示词跑到参数后面)。每一个都只差一个字符,每一个都会当成别的东西执行。Midjourney API 接入指南把这三条规则写成了批量出图前先跑的本地检查。
官方确实公布了的数字
只有两个参数值公布到了具体数字。Stylize 默认 100,可以在 0 到 1000 之间调。画幅比默认 1:1,--ar 不能带小数——要写 139:100,不能写 1.39:1。
案例:同一个主体的两种写法

下面两条例子写的是同一个主体,输出的差别跟着写法的差别走。
案例一:纯描述式提示词,不挂图
a bookshop window at closing time, rain on the glass, warm interior light, one figure inside shelving a stack, muted palette, calm mood, 35mm documentary feel --ar 16:9
四张变体一起返回。提示词很短,空出来的部分由默认风格填补:光线在四张里都是暖的,人物都在店内,取景则四处游走——一张退到整间店面,另一张切到书架。「rain on the glass」和「warm interior light」是真正起作用的两处,去掉任何一处色调都会平下来。标准档一次提示词的官方成本是 0.8 GPU 分钟。
案例二:挂一张参考图的指令式提示词
make this girl into a real character --ar 2:3
这是官方 Edit Model 页给出的示例,挂在一张手绘参考图上。官方公布的前后对比里,姿态、服装和取景都不变,画出来的人从插画变成摄影质感:指令改的是处理方式,参考图兜住了指令没提到的全部信息。同一页还用「let’s see this image from the front」和「let’s see this image from behind」把一张参考图变成两个视角。Edit Model 的官方成本是标准档 1 分钟、HD 档 2.3 分钟。
官方没有公布的提示词规则
下面每一条,网上都能找到某个数字把它填上。
- 提示词长度上限,无论按词、字符还是 token 计。
--chaos的取值范围,以及七类元素该按什么顺序写:官方都只点名,没给规则。- 任何官方提示词公式。七类元素是清单而不是模板,网上流传的结构图都是别人对这份清单的总结。
- 指令与描述混在同一条 Edit Model 提示词里时的解析规则。
- 任何一页的「最后更新」日期。Midjourney 主题页把带日期的版本事实收在一处。
常见问题
官方有提示词公式吗? 没有。官方给的是七项清单和一条长度偏好,从不排先后。
我可以下指令而不描述吗? 用 Edit Model 可以。不挂参考图时,指令没有作用对象。
--cref 和 --oref 被什么取代了? Edit Model。参数列表现在标注 Omni Reference 在 V8.X 已被它取代。
一个词或一个表情真的能出图吗? 官方说法是可以,提示词甚至可以只有一个词或一个表情。
为什么提示词写长了,画面反而更平? 细节少换多样性,细节多换控制力,长提示词会压缩 Midjourney 探索的范围。快速上手教程里的第一张图就能看到同样的效应。