All models

gpt-4o-image

OpenAIChatvisionimage_generation
0.2 Credits
Get your API key
gpt-4o-image

用文字与参考图片完成对话式视觉创作

gpt-4o-image 是面向 GPT-4o 图像创作的对话式兼容入口,适合将文字要求、参考照片与画面修改意图放在同一工作流中。它支持纯文字生图、参考图转换和多图合成,强项是理解详细创作指令、生成写实画面及在图像中融入文字,适合设计草稿、营销视觉和人物风格化创作。

OpenAI模型品牌
对话模型类型
视觉理解、图像生成任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

入口定位
对话式图像创作兼容入口,调用 ID 为 gpt-4o-image
输入方式
文字提示,或文字搭配 image_url 参考图片
创作模式
文生图、参考图转换、多图合成
原生图像能力
写实生成、详细指令遵循、图中文字生成
对话结果
Chat Completions 的 message.content 包含图片与下载链接
调用入口
/openai/chat/completions、/openai/responses、/aichat2/conversations、/aichat/conversations

原生能力描述对应 GPT-4o 图像生成;实际请求结构和结果读取方式由所选对话入口决定。

核心能力

了解 gpt-4o-image 能为你的工作带来什么。

把设计要求写进画面

不仅描述主体,还可以将构图、光线、色彩与需要出现的文字一起交给模型。GPT-4o 图像能力擅长理解详细指令,适合尝试标题与视觉元素共同构成的画面。提示时把必须出现的文案与可自由发挥的部分分开,便于检查成图是否符合设计意图。

围绕参考图做风格转换

将照片与修改要求一起提交,可以围绕已有画面进行转换,而不必完全依靠文字重新描述。典型操作包括把真人照片改成动漫风格,并增加帽子等视觉元素。明确哪些内容需要保留、哪些需要变化,更适合开展有针对性的创作。

组合多张图片的创作意图

同一条消息可以放入多张参考图片,再用文字说明它们在新画面中的关系。例如提供人物图和咖啡图,要求生成男生举杯准备饮用的画面。它适合按创作意图组合不同视觉素材,而不是将多图简单拼接;仍需检查人物、道具与动作细节。

适用场景

从具体任务出发,找到模型发挥作用的位置。

营销海报概念稿

输入活动主题、目标受众、主标题和画面氛围,要求生成带文案的视觉概念稿。可先集中探索主体与背景,再针对文字位置和视觉层级补充要求。交付物适合作为设计讨论材料,正式发布前再检查文案、品牌元素和排版细节。

人物风格化与头像创作

提供人物照片,说明希望采用的动漫风格、配饰与背景,生成头像或人物视觉草稿。把发型、服装等保留要求写清楚,同时指出允许变化的部分。适合需要沿用参考形象进行创作的任务,但不应将结果当作身份特征完全不变的复制品。

人物与道具场景合成

分别输入人物和道具参考图,再描述动作、视角及场景,例如人物拿着咖啡准备饮用。生成结果可用于内容配图或场景提案。提交时说明每张图负责提供什么信息,验收时重点检查道具外观、手部动作以及主体之间的空间关系。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

要交付图片,而不只是讨论图片

当任务终点是生成或转换图像时,选择 gpt-4o-image 的图文创作入口。若重点只是围绕图片进行理解与问答,应按视觉对话任务选择模型,不必把绘图作为默认流程。两者可以使用相似的消息形式,但请求中应明确写出生成图片的目标,避免创作意图不清。

与 DALL·E 3、GPT Image 的取舍

相较早期 DALL·E 3,GPT-4o 图像能力更强调详细指令、图像转换和画面文字表达。gpt-4o-image 适合以对话消息组织图文创作;如果应用已围绕专用图像生成或编辑接口构建,则应按对应 GPT Image 型号选型,不要将两个调用 ID 或其参数直接互换。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 画面文字生成是能力强项,但不等于所有文案都会逐字准确。涉及品牌名、活动日期或密集文字时,建议将文案单独列出,并在交付前检查拼写、遗漏和可读性;精确排版可以在成图后继续完成。
  • 参考图转换与多图合成应按创作结果验收,不宜理解为像素级保留或无损复制。人物特征、道具细节与动作关系都值得检查;对必须保留的元素应明确说明,必要时将成图重新作为参考提交修改。
  • Chat Completions 返回的是包含图片链接的对话内容,不是直接返回图片二进制。图片地址为临时链接,获得结果后应及时下载保存;应用应同时处理文本显示、图片展示和素材归档,避免把临时地址当作长期资产。

常见问题

解答使用 gpt-4o-image 时的常见疑问。

gpt-4o-image 是 OpenAI 独立发布的模型名吗?

这里的 gpt-4o-image 是对话式图像创作兼容入口。它用于组织 GPT-4o 图像生成工作流,不应当作另一个独立官方型号,也不应与 gpt-image-1 混用。选择它主要是为了通过对话消息提交要求并接收创作结果。

没有参考图,也能生成图片吗?

可以。纯文字生图只需明确描述想要的画面,例如未来城市的日落场景。建议写清主体、环境、风格与光线,并直接表达生成图片的要求;如果画面需要文字,再把具体文案单独列出,便于后续检查。

如何同时使用人物图和道具图?

在 Chat Completions 的同一条用户消息中组合文字块与多个 image_url 块,说明人物、道具和动作关系。比如要求人物举着参考咖啡杯准备饮用。参考图用于提供视觉信息,最终成图仍需检查外观和空间关系。

生成结果从哪个字段读取?

使用 /openai/chat/completions 时,从 choices 中读取 message.content,其中包含图片及下载链接。客户端需要识别其中的图片链接并展示,再下载保存文件;不要把整个 content 字符串当作图片数据直接写入文件。

接入时应该传 messages 还是 input?

取决于入口:Chat Completions 使用 model 与 messages,Responses 使用 model 与 input。托管会话入口则采用 question 或结构化 message 等方式。已有图文消息应用可以优先沿用 Chat Completions,避免混用不同入口的请求结构。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 gpt-4o-image 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。