Skip to main content
POST

简介

图片生成接口用于通过 POST /v1/images/generations 生成图片,支持文字生图、图生图和图片编辑等工作流。该端点采用 OpenAI Images API 兼容格式,当前主示例使用已校验成功的 gpt-image-2
请使用 GET /v1/models 返回的完整模型 ID,不要使用旧别名或简写名称。
Gemini 图片模型使用原生 Gemini 端点 POST /v1/models/{model}:generateContent,不使用 POST /v1/images/generations

API Base URL

认证

使用 Bearer Token:

请求体结构

string
required
要调用的图片模型 ID。建议在应用启动时调用 GET /v1/models 获取当前可用模型列表。
string
文字生图或图片编辑的提示词。
string
输出图片尺寸。常用值包括 1024x10241024x15361536x1024。部分模型支持更高分辨率或不同格式的尺寸值。
string
图片质量。GPT Image 系列常用值为 "low""medium""high"
integer
生成图片数量。GPT Image 系列支持 1-10
string
响应格式。仅在所选模型明确支持时传入,例如 "url""b64_json"gpt-image-2 当前不接受该参数,调用时请省略。
string
单张输入图片,支持图片 URL 或 Base64/Data URL。用于图生图或编辑工作流。
array
多张输入图片数组。用于多图融合或多参考图编辑。
string
输入保真度。GPT Image 图生图场景可使用 "auto""high""medium""low"
object
通义千问图片模型的原生输入对象。常见结构为 input.messages[].content[],内容可以包含 textimage
object
通义千问图片模型的参数对象,例如 sizeseedwatermarknegative_promptprompt_extendn
array
Seedream 系列的图片上下文输入。内容可以包含图片 URL、Data URL 或文本片段,具体能力取决于模型版本和账号渠道。

基础示例


模型专用参数

GPT Image

string
图片尺寸,支持 1024x10241024x15361536x1024
string
图片质量:"low""medium""high"
integer
生成图片数量,范围 1-10
string
输入保真度,仅在图生图或编辑模式下使用:"auto""high""medium""low"

通义千问

object
原生消息对象。文字生图传入 text,图片编辑同时传入 imagetext
object
生成参数对象:
  • size: 图片尺寸,例如 "1024*1024"
  • seed: 随机种子,范围 0-2147483647
  • watermark: 是否添加水印
  • prompt_extend: 是否启用提示词扩展
  • negative_prompt: 负面提示词
  • n: 输出图片数量

Seedream

string
图片尺寸。Seedream 4.x/5.x 常用 2048x20482304x17281728x23042560x14401440x2560 等 2K/4K 尺寸。
boolean
是否添加水印。
integer
随机种子,用于控制生成结果的随机性。取值范围为 0-2147483647
array
图片上下文输入。Seedream 4.x/5.x 通常支持单图或多图输入;实际可用性取决于模型版本和账号渠道。
string
组图功能开关:"disabled""auto"
object
提示词优化选项,例如 {"mode": "standard"}{"mode": "fast"}

支持的模型

以下模型来自 GET /v1/models 当前返回的图片相关模型清单。

GPT Image 系列

通义千问系列

Seedream 系列

Gemini 图片系列


最佳实践

模型选择

  • 新项目优先使用 gpt-image-2 作为 /v1/images/generations 的通用模型。
  • 需要中英文文字渲染时,优先测试 qwen-image-2.0-pro
  • 需要图片编辑时,优先测试 gpt-image-2qwen-image-edit-max
  • 需要 Gemini/Nano Banana 图片能力时,使用 Gemini 原生图片端点,而不是 Images API 端点。

提示词建议

  • 明确画面主体、风格、光线、构图和输出用途。
  • 需要文字渲染时,把要渲染的文字放在引号中。
  • 图生图时说明需要保留哪些元素、修改哪些元素。
  • 多图融合时明确每张参考图的角色,例如“第一张作为风格参考,第二张作为主体内容”。

常见问题

当前模型清单以 GET /v1/models 返回的完整模型 ID 为准。旧别名或简写名称可能无法路由到可用渠道。
当前 Gemini 图片模型通过原生 Gemini 端点调用:POST /v1/models/{model}:generateContentPOST /v1/images/generations 不适合作为 Gemini 图片模型的主调用路径。
GPT Image 系列使用 n 参数控制生成数量。通义千问和 Seedream 是否支持多张输出取决于模型和账号渠道。
取决于模型和参数。GPT Image 系列通常返回 b64_json,并且 gpt-image-2 当前不接受 response_format 参数;通义千问和 Seedream 的返回格式取决于模型实现和账号渠道。