---
title: 'Cookbook解读｜图像生成 Prompt 为什么更像一份视觉制作说明'
description: '从 OpenAI GPT Image Prompting Guide 出发，拆解目标、场景、构图、约束与迭代如何组成一份可维护的视觉制作说明。'
pubDate: 2026-08-03
slug: gpt-image-prompt-visual-brief
tags: [image-generation, prompt, OpenAI, Cookbook解读]
lang: zh-CN
draft: false
---

“一只猫，赛博朋克，高质量，8K。”

这句话没有错，模型也确实会给你一只看起来挺贵的猫。问题是：猫在画面哪里？它正在做什么？这是头像、海报，还是商品广告？文字要放在哪？如果第一张不满意，下一轮又该改什么？

这些问题没有答案时，Prompt 更像一句愿望。OpenAI Cookbook 的 [GPT Image Generation Models Prompting Guide](https://developers.openai.com/cookbook/examples/multimodal/image-gen-models-prompting-guide) 想做的，是把愿望改写成可以执行、检查和迭代的视觉说明。

先说结论：

> 好的图像 Prompt 不靠神秘关键词取胜，而是先定义要交付什么，再说明场景、主体、关键细节与约束；生成后每次只改一个主要变量，并反复声明不能漂移的部分。

把它想成给摄影师、设计师或插画师的一份 Brief（制作说明）会更直观。你不只是在回答“画什么”，还在回答“这张图拿来做什么、怎样算对、哪些地方不能动”。

> **数据快照**
>
> - 最后核验：2026-08-03
> - 主要对象：2026-04-21 发布的 OpenAI Cookbook 指南及其 GitHub `main` 分支 Notebook
> - 指南示例模型：`gpt-image-2`
> - 本文不复跑 Notebook，也不比较模型成功率；文中的结构模板是对官方方法的分析性整理，不是 OpenAI 规定的固定语法

## 关键词没有失效，失效的是“把关键词当控制面板”

早期的图像 Prompt 很容易写成搜索框：

```text
cute cat, realistic, high quality, 4k
```

这组词表达了对象和模糊的质量偏好，却把大量决定权留给模型。模型需要自己猜场景、动作、构图、光线、媒介和用途。生成结果不好时，我们也很难判断该改哪个变量，只好继续追加 `masterpiece`、`ultra detailed`，像是再按两次电梯按钮就能让它来得更快。

Cookbook 给出的原则并不是“Prompt 必须很长”。它明确说明：短 Prompt、自然段、JSON-like 结构、指令式写法和标签式写法都可以工作；生产环境更应该选择容易扫读和维护的模板，而不是追求聪明的语法。真正重要的是[意图和约束是否清楚](https://developers.openai.com/cookbook/examples/multimodal/image-gen-models-prompting-guide)。

所以，关键词仍然有用。`watercolor`、`top-down`、`soft diffuse light` 都是有效的视觉信号。问题只是它们不能替你回答：**最终要交付一张什么图？**

## 先定义成品，再描述画面

同一只猫，做聊天表情、宠物食品广告和儿童绘本插图，Prompt 不应该只是换几个风格词。用途会改变画面比例、留白、细节密度、文字位置和模型可以自由发挥的范围。

Cookbook 建议按照“背景或场景 → 主体 → 关键细节 → 约束”的稳定顺序组织信息，并把广告、UI Mockup、信息图等用途一并写入 Prompt。本文把这套方法整理成下面七个问题。

**表 1：从 Cookbook Prompting Fundamentals 整理出的视觉制作说明字段；字段顺序可调整，不是固定语法**

| 字段       | 要回答的问题               | 示例                                     |
| ---------- | -------------------------- | ---------------------------------------- |
| 交付目标   | 这张图用在哪里             | 方形聊天表情、竖版海报、移动端 UI Mockup |
| 场景       | 事情发生在什么环境         | 公寓窗台、雨后街道、纯白摄影棚           |
| 主体与动作 | 谁在做什么                 | 灰褐色狸花猫趴着观察窗外                 |
| 构图       | 元素如何占据画面           | 猫占画面约 70%，正面近景，左侧留白       |
| 光线与氛围 | 光从哪里来，画面是什么情绪 | 左侧柔和晨光，低对比度，安静             |
| 媒介与质感 | 它看起来像什么载体         | 自然手机照片、平面矢量图、水彩插画       |
| 约束       | 什么不能出现，什么不能改变 | 无文字、无边框、保持花纹和眼睛颜色       |

这七项的价值不在于凑齐表格，而在于把模糊偏好变成能检查的条件。简单任务可以只写三四项；布局、文字或身份一致性很重要时，再把对应字段写细。

例如，我们把开头那只猫改成一张聊天表情：

```text
Deliverable:
A square 1:1 reaction image for a messaging app.

Scene and subject:
A gray-brown tabby cat sitting on an apartment windowsill,
looking mildly annoyed and unimpressed.

Composition:
Close-up portrait, eye-level view.
The cat occupies about 70% of the frame.
Keep the background simple and softly blurred.

Lighting and medium:
Soft indoor morning light from the left.
Natural, slightly imperfect phone-photo texture.

Constraints:
No text, stickers, borders, watermark, or exaggerated cartoon features.
Keep the M-shaped forehead marking, green eyes, and white chest fur consistent.
```

这段 Prompt 不保证一次生成就完美，但失败会变得更容易诊断：构图不对就改构图，身份漂移就重申角色锚点，照片太像棚拍就收紧媒介与光线。控制来自可分解，而不是来自字数。

## 摄影语言控制观感，不负责模拟光学实验

“85mm 镜头、f/1.4、浅景深”是图像 Prompt 里常见的一组词。它们有用，因为能给模型一个关于取景距离、背景虚化和人像观感的高层提示。但这里很容易从“有用”滑到“精确”。

Cookbook 特别提醒：详细的相机参数可能被模型宽松理解，更适合控制整体观感和构图，不应该被当成精确的物理模拟。因此，与其只写一串器材参数，不如把真正需要的视觉结果也写出来：

```text
Medium close-up at eye level.
The face is sharp, the background is softly blurred,
with natural skin texture and subtle film grain.
```

光线也是同样的道理。`beautiful lighting` 只表达“希望好看”，`soft coastal daylight from the left, low contrast, natural shadows` 才说明光的方向、硬度和结果。器材名是捷径，视觉现象才是目标。

## 约束不是负面词列表，而是编辑范围

生成新图时，约束负责阻止模型顺手加戏；编辑已有图片时，它还要划出“允许修改”的边界。

Cookbook 在虚拟试衣、天气变化、物体移除、室内家具替换和多图合成中反复使用同一类表达：

```text
Change only X.
Preserve A, B, and C.
Keep everything else unchanged.
```

例如，把白天街景改成雪夜，真正的任务不是“生成一张雪夜街景”，而是：只改变天气、光线、阴影、空气与地面湿度，同时保留人物身份、物体位置、透视和相机角度。前一句描述创作，后一句才定义编辑。

这也解释了为什么 `no watermark` 只是约束的一小部分。更重要的约束通常是“不变量”：角色的脸、产品标签、Logo 形状、页面布局、箭头方向、文字内容、镜头位置。只告诉模型不要什么，却不告诉它必须保留什么，编辑仍然可能一路漂走。

## 一次写完不是目标，小步收敛才是工作流

Prompt 越长，互相冲突的要求越难排查。Cookbook 的建议很务实：先用干净的基础 Prompt 得到方向，再通过小而单一的修改逐步收敛，例如“让光线更暖”“移除多余的树”“恢复原来的背景”。关键细节开始漂移时，要重新写明，而不是假设模型永远记得第一轮的全部约束。

**图 1：从视觉目标到可验收结果的迭代闭环；每轮只修改一个主要变量，并重新声明不变量**

```mermaid
flowchart LR
  A["定义交付目标"] --> B["写基础 Prompt"]
  B --> C["生成或编辑"]
  C --> D["按约束检查"]
  D -->|"不符合"| E["修改一个变量"]
  E --> F["重申不变量"]
  F --> C
  D -->|"符合"| G["保存结果与 Prompt"]
```

这条闭环比“寻找终极 Prompt”更适合生产：失败原因更容易定位，修改效果更容易比较，已经正确的部分也不必每轮重新抽奖。

如果画面里包含文字，还可以把验收条件继续拆细：把原文放进引号，要求只出现一次，说明字体类别、颜色、位置和对比度。对于不常见的品牌名，Cookbook 甚至建议逐字母拼写。即使如此，文字仍然应该在交付前人工核对；“Prompt 写了必须正确”不是验收结果。

## 不同任务需要不同的说明，而不是同一套华丽词汇

Cookbook 用信息图、广告、漫画、UI Mockup、科学示意图、产品图和精细编辑展示了一个共同规律：先说清楚产物的功能，再补视觉语言。

**表 2：不同图像任务最值得写清的控制点；根据 Cookbook 用例归纳**

| 任务           | 首要控制点                           | 容易遗漏的约束                          |
| -------------- | ------------------------------------ | --------------------------------------- |
| 广告           | 品牌定位、受众、场景、准确文案       | 无额外文字、无无关 Logo、文案只出现一次 |
| 漫画           | 每格一个清晰的动作节点               | 格数、顺序、角色一致性、对白留白        |
| UI Mockup      | 页面层级、间距、真实组件和状态       | 避免概念艺术感，画面要像可用界面        |
| 信息图或科学图 | 受众、教学目标、必需标签、连接关系   | 避免小字和装饰噪声，核对事实准确性      |
| 产品图         | 产品几何、材质、标签清晰度、接触阴影 | 不重新设计产品，不改标签，不加水印      |
| 精细编辑       | 明确唯一修改对象                     | 保持身份、构图、透视、光线和周围物体    |

这里最值得注意的是 UI Mockup 和信息图。把它们写成“漂亮、现代、科技感”，模型可能给你一张设计概念图；把真实组件、数据、标签、层级和画布写进去，才更接近可讨论的设计稿。Prompt 从审美描述变成了 Artifact Spec（产物规格）。

## Prompt 之外，还有模型参数和人工验收

视觉制作说明能提高可控性，却不能替代完整工作流。

截至指南的 2026-04-21 快照，OpenAI 推荐新工作流默认使用 `gpt-image-2`。指南建议延迟敏感或高吞吐任务先评估 `quality="low"`；小字、密集信息图、近距离人像、身份敏感编辑和高分辨率输出，则应比较 `medium` 或 `high`。这说明质量、延迟、尺寸和输入保真度也是控制面，不能指望 Prompt 单独补偿所有参数选择。

另外，Cookbook 展示的是提示模式和示例，不是每种任务的准确率 Benchmark。它能证明这些结构是官方推荐的实践入口，不能证明某个模板在所有素材、语言、尺寸和模型版本上都稳定成功。真正进入生产，还需要保存输入、Prompt、参数和输出，针对自己的任务建立验收样本。

一个最小的检查清单可以是：

- 主体、动作和空间关系是否正确；
- 必须出现的文字是否逐字一致；
- 人物身份、产品几何和品牌元素是否保留；
- 有没有多余文字、水印、物体或装饰；
- 本轮修改是否只影响预期变量；
- 同一 Prompt 在多个样本上是否仍然可接受。

## 总结

这篇 Cookbook 真正带来的变化，不是发明了一套新的 Prompt 咒语，而是把图像生成变成一项可以拆解的制作工作。

先定义交付物，再描述场景、主体、构图、光线与媒介；用约束划出创作和编辑边界；生成后一次只改一个主要变量，并重申不能变化的部分。你仍然可以使用关键词、镜头语言和风格词，但它们服务的是视觉目标，不是替代目标。

如果下一张图不知道怎么写 Prompt，可以先不问“还缺哪个高级词”，改问三个问题：**这张图拿来做什么？怎样才算对？哪些地方绝对不能动？**

这三个答案写清楚以后，Prompt 才从一句愿望，变成了一份模型和人都能检查的视觉制作说明。

## 参考资料

- [OpenAI Cookbook：GPT Image Generation Models Prompting Guide](https://developers.openai.com/cookbook/examples/multimodal/image-gen-models-prompting-guide)
- [OpenAI Cookbook：`image-gen-models-prompting-guide.ipynb`](https://github.com/openai/openai-cookbook/blob/main/examples/multimodal/image-gen-models-prompting-guide.ipynb)
