“一只猫,赛博朋克,高质量,8K。”
这句话没有错,模型也确实会给你一只看起来挺贵的猫。问题是:猫在画面哪里?它正在做什么?这是头像、海报,还是商品广告?文字要放在哪?如果第一张不满意,下一轮又该改什么?
这些问题没有答案时,Prompt 更像一句愿望。OpenAI Cookbook 的 GPT Image Generation Models Prompting Guide 想做的,是把愿望改写成可以执行、检查和迭代的视觉说明。
先说结论:
好的图像 Prompt 不靠神秘关键词取胜,而是先定义要交付什么,再说明场景、主体、关键细节与约束;生成后每次只改一个主要变量,并反复声明不能漂移的部分。
把它想成给摄影师、设计师或插画师的一份 Brief(制作说明)会更直观。你不只是在回答“画什么”,还在回答“这张图拿来做什么、怎样算对、哪些地方不能动”。
数据快照
- 最后核验:2026-08-03
- 主要对象:2026-04-21 发布的 OpenAI Cookbook 指南及其 GitHub
main分支 Notebook- 指南示例模型:
gpt-image-2- 本文不复跑 Notebook,也不比较模型成功率;文中的结构模板是对官方方法的分析性整理,不是 OpenAI 规定的固定语法
#关键词没有失效,失效的是“把关键词当控制面板”
早期的图像 Prompt 很容易写成搜索框:
cute cat, realistic, high quality, 4k这组词表达了对象和模糊的质量偏好,却把大量决定权留给模型。模型需要自己猜场景、动作、构图、光线、媒介和用途。生成结果不好时,我们也很难判断该改哪个变量,只好继续追加 masterpiece、ultra detailed,像是再按两次电梯按钮就能让它来得更快。
Cookbook 给出的原则并不是“Prompt 必须很长”。它明确说明:短 Prompt、自然段、JSON-like 结构、指令式写法和标签式写法都可以工作;生产环境更应该选择容易扫读和维护的模板,而不是追求聪明的语法。真正重要的是意图和约束是否清楚。
所以,关键词仍然有用。watercolor、top-down、soft diffuse light 都是有效的视觉信号。问题只是它们不能替你回答:最终要交付一张什么图?
#先定义成品,再描述画面
同一只猫,做聊天表情、宠物食品广告和儿童绘本插图,Prompt 不应该只是换几个风格词。用途会改变画面比例、留白、细节密度、文字位置和模型可以自由发挥的范围。
Cookbook 建议按照“背景或场景 → 主体 → 关键细节 → 约束”的稳定顺序组织信息,并把广告、UI Mockup、信息图等用途一并写入 Prompt。本文把这套方法整理成下面七个问题。
表 1:从 Cookbook Prompting Fundamentals 整理出的视觉制作说明字段;字段顺序可调整,不是固定语法
| 字段 | 要回答的问题 | 示例 |
|---|---|---|
| 交付目标 | 这张图用在哪里 | 方形聊天表情、竖版海报、移动端 UI Mockup |
| 场景 | 事情发生在什么环境 | 公寓窗台、雨后街道、纯白摄影棚 |
| 主体与动作 | 谁在做什么 | 灰褐色狸花猫趴着观察窗外 |
| 构图 | 元素如何占据画面 | 猫占画面约 70%,正面近景,左侧留白 |
| 光线与氛围 | 光从哪里来,画面是什么情绪 | 左侧柔和晨光,低对比度,安静 |
| 媒介与质感 | 它看起来像什么载体 | 自然手机照片、平面矢量图、水彩插画 |
| 约束 | 什么不能出现,什么不能改变 | 无文字、无边框、保持花纹和眼睛颜色 |
这七项的价值不在于凑齐表格,而在于把模糊偏好变成能检查的条件。简单任务可以只写三四项;布局、文字或身份一致性很重要时,再把对应字段写细。
例如,我们把开头那只猫改成一张聊天表情:
Deliverable:A square 1:1 reaction image for a messaging app.
Scene and subject:A gray-brown tabby cat sitting on an apartment windowsill,looking mildly annoyed and unimpressed.
Composition:Close-up portrait, eye-level view.The cat occupies about 70% of the frame.Keep the background simple and softly blurred.
Lighting and medium:Soft indoor morning light from the left.Natural, slightly imperfect phone-photo texture.
Constraints:No text, stickers, borders, watermark, or exaggerated cartoon features.Keep the M-shaped forehead marking, green eyes, and white chest fur consistent.这段 Prompt 不保证一次生成就完美,但失败会变得更容易诊断:构图不对就改构图,身份漂移就重申角色锚点,照片太像棚拍就收紧媒介与光线。控制来自可分解,而不是来自字数。
#摄影语言控制观感,不负责模拟光学实验
“85mm 镜头、f/1.4、浅景深”是图像 Prompt 里常见的一组词。它们有用,因为能给模型一个关于取景距离、背景虚化和人像观感的高层提示。但这里很容易从“有用”滑到“精确”。
Cookbook 特别提醒:详细的相机参数可能被模型宽松理解,更适合控制整体观感和构图,不应该被当成精确的物理模拟。因此,与其只写一串器材参数,不如把真正需要的视觉结果也写出来:
Medium close-up at eye level.The face is sharp, the background is softly blurred,with natural skin texture and subtle film grain.光线也是同样的道理。beautiful lighting 只表达“希望好看”,soft coastal daylight from the left, low contrast, natural shadows 才说明光的方向、硬度和结果。器材名是捷径,视觉现象才是目标。
#约束不是负面词列表,而是编辑范围
生成新图时,约束负责阻止模型顺手加戏;编辑已有图片时,它还要划出“允许修改”的边界。
Cookbook 在虚拟试衣、天气变化、物体移除、室内家具替换和多图合成中反复使用同一类表达:
Change only X.Preserve A, B, and C.Keep everything else unchanged.例如,把白天街景改成雪夜,真正的任务不是“生成一张雪夜街景”,而是:只改变天气、光线、阴影、空气与地面湿度,同时保留人物身份、物体位置、透视和相机角度。前一句描述创作,后一句才定义编辑。
这也解释了为什么 no watermark 只是约束的一小部分。更重要的约束通常是“不变量”:角色的脸、产品标签、Logo 形状、页面布局、箭头方向、文字内容、镜头位置。只告诉模型不要什么,却不告诉它必须保留什么,编辑仍然可能一路漂走。
#一次写完不是目标,小步收敛才是工作流
Prompt 越长,互相冲突的要求越难排查。Cookbook 的建议很务实:先用干净的基础 Prompt 得到方向,再通过小而单一的修改逐步收敛,例如“让光线更暖”“移除多余的树”“恢复原来的背景”。关键细节开始漂移时,要重新写明,而不是假设模型永远记得第一轮的全部约束。
图 1:从视觉目标到可验收结果的迭代闭环;每轮只修改一个主要变量,并重新声明不变量
flowchart LR A["定义交付目标"] --> B["写基础 Prompt"] B --> C["生成或编辑"] C --> D["按约束检查"] D -->|"不符合"| E["修改一个变量"] E --> F["重申不变量"] F --> C D -->|"符合"| G["保存结果与 Prompt"]
这条闭环比“寻找终极 Prompt”更适合生产:失败原因更容易定位,修改效果更容易比较,已经正确的部分也不必每轮重新抽奖。
如果画面里包含文字,还可以把验收条件继续拆细:把原文放进引号,要求只出现一次,说明字体类别、颜色、位置和对比度。对于不常见的品牌名,Cookbook 甚至建议逐字母拼写。即使如此,文字仍然应该在交付前人工核对;“Prompt 写了必须正确”不是验收结果。
#不同任务需要不同的说明,而不是同一套华丽词汇
Cookbook 用信息图、广告、漫画、UI Mockup、科学示意图、产品图和精细编辑展示了一个共同规律:先说清楚产物的功能,再补视觉语言。
表 2:不同图像任务最值得写清的控制点;根据 Cookbook 用例归纳
| 任务 | 首要控制点 | 容易遗漏的约束 |
|---|---|---|
| 广告 | 品牌定位、受众、场景、准确文案 | 无额外文字、无无关 Logo、文案只出现一次 |
| 漫画 | 每格一个清晰的动作节点 | 格数、顺序、角色一致性、对白留白 |
| UI Mockup | 页面层级、间距、真实组件和状态 | 避免概念艺术感,画面要像可用界面 |
| 信息图或科学图 | 受众、教学目标、必需标签、连接关系 | 避免小字和装饰噪声,核对事实准确性 |
| 产品图 | 产品几何、材质、标签清晰度、接触阴影 | 不重新设计产品,不改标签,不加水印 |
| 精细编辑 | 明确唯一修改对象 | 保持身份、构图、透视、光线和周围物体 |
这里最值得注意的是 UI Mockup 和信息图。把它们写成“漂亮、现代、科技感”,模型可能给你一张设计概念图;把真实组件、数据、标签、层级和画布写进去,才更接近可讨论的设计稿。Prompt 从审美描述变成了 Artifact Spec(产物规格)。
#Prompt 之外,还有模型参数和人工验收
视觉制作说明能提高可控性,却不能替代完整工作流。
截至指南的 2026-04-21 快照,OpenAI 推荐新工作流默认使用 gpt-image-2。指南建议延迟敏感或高吞吐任务先评估 quality="low";小字、密集信息图、近距离人像、身份敏感编辑和高分辨率输出,则应比较 medium 或 high。这说明质量、延迟、尺寸和输入保真度也是控制面,不能指望 Prompt 单独补偿所有参数选择。
另外,Cookbook 展示的是提示模式和示例,不是每种任务的准确率 Benchmark。它能证明这些结构是官方推荐的实践入口,不能证明某个模板在所有素材、语言、尺寸和模型版本上都稳定成功。真正进入生产,还需要保存输入、Prompt、参数和输出,针对自己的任务建立验收样本。
一个最小的检查清单可以是:
- 主体、动作和空间关系是否正确;
- 必须出现的文字是否逐字一致;
- 人物身份、产品几何和品牌元素是否保留;
- 有没有多余文字、水印、物体或装饰;
- 本轮修改是否只影响预期变量;
- 同一 Prompt 在多个样本上是否仍然可接受。
#总结
这篇 Cookbook 真正带来的变化,不是发明了一套新的 Prompt 咒语,而是把图像生成变成一项可以拆解的制作工作。
先定义交付物,再描述场景、主体、构图、光线与媒介;用约束划出创作和编辑边界;生成后一次只改一个主要变量,并重申不能变化的部分。你仍然可以使用关键词、镜头语言和风格词,但它们服务的是视觉目标,不是替代目标。
如果下一张图不知道怎么写 Prompt,可以先不问“还缺哪个高级词”,改问三个问题:这张图拿来做什么?怎样才算对?哪些地方绝对不能动?
这三个答案写清楚以后,Prompt 才从一句愿望,变成了一份模型和人都能检查的视觉制作说明。