/ By 煎鱼 / #image-generation #prompt #OpenAI #Cookbook解读 / Markdown

Cookbook解读|图像生成 Prompt 为什么更像一份视觉制作说明

从 OpenAI GPT Image Prompting Guide 出发,拆解目标、场景、构图、约束与迭代如何组成一份可维护的视觉制作说明。

“一只猫,赛博朋克,高质量,8K。”

这句话没有错,模型也确实会给你一只看起来挺贵的猫。问题是:猫在画面哪里?它正在做什么?这是头像、海报,还是商品广告?文字要放在哪?如果第一张不满意,下一轮又该改什么?

这些问题没有答案时,Prompt 更像一句愿望。OpenAI Cookbook 的 GPT Image Generation Models Prompting Guide 想做的,是把愿望改写成可以执行、检查和迭代的视觉说明。

先说结论:

好的图像 Prompt 不靠神秘关键词取胜,而是先定义要交付什么,再说明场景、主体、关键细节与约束;生成后每次只改一个主要变量,并反复声明不能漂移的部分。

把它想成给摄影师、设计师或插画师的一份 Brief(制作说明)会更直观。你不只是在回答“画什么”,还在回答“这张图拿来做什么、怎样算对、哪些地方不能动”。

数据快照

  • 最后核验:2026-08-03
  • 主要对象:2026-04-21 发布的 OpenAI Cookbook 指南及其 GitHub main 分支 Notebook
  • 指南示例模型:gpt-image-2
  • 本文不复跑 Notebook,也不比较模型成功率;文中的结构模板是对官方方法的分析性整理,不是 OpenAI 规定的固定语法

#关键词没有失效,失效的是“把关键词当控制面板”

早期的图像 Prompt 很容易写成搜索框:

cute cat, realistic, high quality, 4k

这组词表达了对象和模糊的质量偏好,却把大量决定权留给模型。模型需要自己猜场景、动作、构图、光线、媒介和用途。生成结果不好时,我们也很难判断该改哪个变量,只好继续追加 masterpieceultra detailed,像是再按两次电梯按钮就能让它来得更快。

Cookbook 给出的原则并不是“Prompt 必须很长”。它明确说明:短 Prompt、自然段、JSON-like 结构、指令式写法和标签式写法都可以工作;生产环境更应该选择容易扫读和维护的模板,而不是追求聪明的语法。真正重要的是意图和约束是否清楚

所以,关键词仍然有用。watercolortop-downsoft diffuse light 都是有效的视觉信号。问题只是它们不能替你回答:最终要交付一张什么图?

#先定义成品,再描述画面

同一只猫,做聊天表情、宠物食品广告和儿童绘本插图,Prompt 不应该只是换几个风格词。用途会改变画面比例、留白、细节密度、文字位置和模型可以自由发挥的范围。

Cookbook 建议按照“背景或场景 → 主体 → 关键细节 → 约束”的稳定顺序组织信息,并把广告、UI Mockup、信息图等用途一并写入 Prompt。本文把这套方法整理成下面七个问题。

表 1:从 Cookbook Prompting Fundamentals 整理出的视觉制作说明字段;字段顺序可调整,不是固定语法

字段要回答的问题示例
交付目标这张图用在哪里方形聊天表情、竖版海报、移动端 UI Mockup
场景事情发生在什么环境公寓窗台、雨后街道、纯白摄影棚
主体与动作谁在做什么灰褐色狸花猫趴着观察窗外
构图元素如何占据画面猫占画面约 70%,正面近景,左侧留白
光线与氛围光从哪里来,画面是什么情绪左侧柔和晨光,低对比度,安静
媒介与质感它看起来像什么载体自然手机照片、平面矢量图、水彩插画
约束什么不能出现,什么不能改变无文字、无边框、保持花纹和眼睛颜色

这七项的价值不在于凑齐表格,而在于把模糊偏好变成能检查的条件。简单任务可以只写三四项;布局、文字或身份一致性很重要时,再把对应字段写细。

例如,我们把开头那只猫改成一张聊天表情:

Deliverable:
A square 1:1 reaction image for a messaging app.
Scene and subject:
A gray-brown tabby cat sitting on an apartment windowsill,
looking mildly annoyed and unimpressed.
Composition:
Close-up portrait, eye-level view.
The cat occupies about 70% of the frame.
Keep the background simple and softly blurred.
Lighting and medium:
Soft indoor morning light from the left.
Natural, slightly imperfect phone-photo texture.
Constraints:
No text, stickers, borders, watermark, or exaggerated cartoon features.
Keep the M-shaped forehead marking, green eyes, and white chest fur consistent.

这段 Prompt 不保证一次生成就完美,但失败会变得更容易诊断:构图不对就改构图,身份漂移就重申角色锚点,照片太像棚拍就收紧媒介与光线。控制来自可分解,而不是来自字数。

#摄影语言控制观感,不负责模拟光学实验

“85mm 镜头、f/1.4、浅景深”是图像 Prompt 里常见的一组词。它们有用,因为能给模型一个关于取景距离、背景虚化和人像观感的高层提示。但这里很容易从“有用”滑到“精确”。

Cookbook 特别提醒:详细的相机参数可能被模型宽松理解,更适合控制整体观感和构图,不应该被当成精确的物理模拟。因此,与其只写一串器材参数,不如把真正需要的视觉结果也写出来:

Medium close-up at eye level.
The face is sharp, the background is softly blurred,
with natural skin texture and subtle film grain.

光线也是同样的道理。beautiful lighting 只表达“希望好看”,soft coastal daylight from the left, low contrast, natural shadows 才说明光的方向、硬度和结果。器材名是捷径,视觉现象才是目标。

#约束不是负面词列表,而是编辑范围

生成新图时,约束负责阻止模型顺手加戏;编辑已有图片时,它还要划出“允许修改”的边界。

Cookbook 在虚拟试衣、天气变化、物体移除、室内家具替换和多图合成中反复使用同一类表达:

Change only X.
Preserve A, B, and C.
Keep everything else unchanged.

例如,把白天街景改成雪夜,真正的任务不是“生成一张雪夜街景”,而是:只改变天气、光线、阴影、空气与地面湿度,同时保留人物身份、物体位置、透视和相机角度。前一句描述创作,后一句才定义编辑。

这也解释了为什么 no watermark 只是约束的一小部分。更重要的约束通常是“不变量”:角色的脸、产品标签、Logo 形状、页面布局、箭头方向、文字内容、镜头位置。只告诉模型不要什么,却不告诉它必须保留什么,编辑仍然可能一路漂走。

#一次写完不是目标,小步收敛才是工作流

Prompt 越长,互相冲突的要求越难排查。Cookbook 的建议很务实:先用干净的基础 Prompt 得到方向,再通过小而单一的修改逐步收敛,例如“让光线更暖”“移除多余的树”“恢复原来的背景”。关键细节开始漂移时,要重新写明,而不是假设模型永远记得第一轮的全部约束。

图 1:从视觉目标到可验收结果的迭代闭环;每轮只修改一个主要变量,并重新声明不变量

flowchart LR
  A["定义交付目标"] --> B["写基础 Prompt"]
  B --> C["生成或编辑"]
  C --> D["按约束检查"]
  D -->|"不符合"| E["修改一个变量"]
  E --> F["重申不变量"]
  F --> C
  D -->|"符合"| G["保存结果与 Prompt"]

这条闭环比“寻找终极 Prompt”更适合生产:失败原因更容易定位,修改效果更容易比较,已经正确的部分也不必每轮重新抽奖。

如果画面里包含文字,还可以把验收条件继续拆细:把原文放进引号,要求只出现一次,说明字体类别、颜色、位置和对比度。对于不常见的品牌名,Cookbook 甚至建议逐字母拼写。即使如此,文字仍然应该在交付前人工核对;“Prompt 写了必须正确”不是验收结果。

#不同任务需要不同的说明,而不是同一套华丽词汇

Cookbook 用信息图、广告、漫画、UI Mockup、科学示意图、产品图和精细编辑展示了一个共同规律:先说清楚产物的功能,再补视觉语言。

表 2:不同图像任务最值得写清的控制点;根据 Cookbook 用例归纳

任务首要控制点容易遗漏的约束
广告品牌定位、受众、场景、准确文案无额外文字、无无关 Logo、文案只出现一次
漫画每格一个清晰的动作节点格数、顺序、角色一致性、对白留白
UI Mockup页面层级、间距、真实组件和状态避免概念艺术感,画面要像可用界面
信息图或科学图受众、教学目标、必需标签、连接关系避免小字和装饰噪声,核对事实准确性
产品图产品几何、材质、标签清晰度、接触阴影不重新设计产品,不改标签,不加水印
精细编辑明确唯一修改对象保持身份、构图、透视、光线和周围物体

这里最值得注意的是 UI Mockup 和信息图。把它们写成“漂亮、现代、科技感”,模型可能给你一张设计概念图;把真实组件、数据、标签、层级和画布写进去,才更接近可讨论的设计稿。Prompt 从审美描述变成了 Artifact Spec(产物规格)。

#Prompt 之外,还有模型参数和人工验收

视觉制作说明能提高可控性,却不能替代完整工作流。

截至指南的 2026-04-21 快照,OpenAI 推荐新工作流默认使用 gpt-image-2。指南建议延迟敏感或高吞吐任务先评估 quality="low";小字、密集信息图、近距离人像、身份敏感编辑和高分辨率输出,则应比较 mediumhigh。这说明质量、延迟、尺寸和输入保真度也是控制面,不能指望 Prompt 单独补偿所有参数选择。

另外,Cookbook 展示的是提示模式和示例,不是每种任务的准确率 Benchmark。它能证明这些结构是官方推荐的实践入口,不能证明某个模板在所有素材、语言、尺寸和模型版本上都稳定成功。真正进入生产,还需要保存输入、Prompt、参数和输出,针对自己的任务建立验收样本。

一个最小的检查清单可以是:

  • 主体、动作和空间关系是否正确;
  • 必须出现的文字是否逐字一致;
  • 人物身份、产品几何和品牌元素是否保留;
  • 有没有多余文字、水印、物体或装饰;
  • 本轮修改是否只影响预期变量;
  • 同一 Prompt 在多个样本上是否仍然可接受。

#总结

这篇 Cookbook 真正带来的变化,不是发明了一套新的 Prompt 咒语,而是把图像生成变成一项可以拆解的制作工作。

先定义交付物,再描述场景、主体、构图、光线与媒介;用约束划出创作和编辑边界;生成后一次只改一个主要变量,并重申不能变化的部分。你仍然可以使用关键词、镜头语言和风格词,但它们服务的是视觉目标,不是替代目标。

如果下一张图不知道怎么写 Prompt,可以先不问“还缺哪个高级词”,改问三个问题:这张图拿来做什么?怎样才算对?哪些地方绝对不能动?

这三个答案写清楚以后,Prompt 才从一句愿望,变成了一份模型和人都能检查的视觉制作说明。

#参考资料

Share this post

Diagram
100%