Skip to main content
POST

簡介

圖片生成介面用於透過 POST /v1/images/generations 生成圖片,支援文字生圖、圖生圖和圖片編輯等工作流程。此端點採用 OpenAI Images API 相容格式,目前主要範例使用已驗證成功的 gpt-image-2
請使用 GET /v1/models 回傳的完整模型 ID,不要使用舊別名或簡寫名稱。
Gemini 圖片模型使用原生 Gemini 端點 POST /v1/models/{model}:generateContent,不使用 POST /v1/images/generations

API Base URL

認證

使用 Bearer Token:

請求體結構

string
required
要呼叫的圖片模型 ID。建議在應用程式啟動時呼叫 GET /v1/models 取得目前可用的模型列表。
string
文字生圖或圖片編輯的提示詞。
string
輸出圖片尺寸。常用值包括 1024x10241024x15361536x1024。部分模型支援更高解析度或不同格式的尺寸值。
string
圖片品質。GPT Image 系列常用值為 "low""medium""high"
integer
生成圖片數量。GPT Image 系列支援 1-10
string
回應格式。僅在所選模型明確支援時傳入,例如 "url""b64_json"gpt-image-2 目前不接受此參數,呼叫時請省略。
string
單張輸入圖片,支援圖片 URL 或 Base64/Data URL。用於圖生圖或編輯工作流程。
array
多張輸入圖片陣列。用於多圖融合或多參考圖編輯。
string
輸入保真度。GPT Image 圖生圖場景可使用 "auto""high""medium""low"
object
通義千問圖片模型的原生輸入物件。常見結構為 input.messages[].content[],內容可以包含 textimage
object
通義千問圖片模型的參數物件,例如 sizeseedwatermarknegative_promptprompt_extendn
array
Seedream 系列的圖片上下文輸入。內容可以包含圖片 URL、Data URL 或文字片段,具體能力取決於模型版本和帳號管道。

基礎範例


模型專用參數

GPT Image

string
圖片尺寸,支援 1024x10241024x15361536x1024
string
圖片品質:"low""medium""high"
integer
生成圖片數量,範圍 1-10
string
輸入保真度,僅在圖生圖或編輯模式下使用:"auto""high""medium""low"

通義千問

object
原生訊息物件。文字生圖傳入 text,圖片編輯同時傳入 imagetext
object
生成參數物件:
  • size: 圖片尺寸,例如 "1024*1024"
  • seed: 隨機種子,範圍 0-2147483647
  • watermark: 是否加入浮水印
  • prompt_extend: 是否啟用提示詞擴展
  • negative_prompt: 負面提示詞
  • n: 輸出圖片數量

Seedream

string
圖片尺寸。Seedream 4.x/5.x 常用 2048x20482304x17281728x23042560x14401440x2560 等 2K/4K 尺寸。
boolean
是否加入浮水印。
integer
隨機種子,用於控制生成結果的隨機性。取值範圍為 0-2147483647
array
圖片上下文輸入。Seedream 4.x/5.x 通常支援單圖或多圖輸入;實際可用性取決於模型版本和帳號管道。
string
組圖功能開關:"disabled""auto"
object
提示詞最佳化選項,例如 {"mode": "standard"}{"mode": "fast"}

支援的模型

以下模型來自 GET /v1/models 目前回傳的圖片相關模型清單。

GPT Image 系列

通義千問系列

Seedream 系列

Gemini 圖片系列


最佳實務

模型選擇

  • 新專案優先使用 gpt-image-2 作為 /v1/images/generations 的通用模型。
  • 需要中英文文字渲染時,優先測試 qwen-image-2.0-pro
  • 需要圖片編輯時,優先測試 gpt-image-2qwen-image-edit-max
  • 需要 Gemini/Nano Banana 圖片能力時,請使用 Gemini 原生圖片端點,而不是 Images API 端點。

提示詞建議

  • 明確畫面主體、風格、光線、構圖和輸出用途。
  • 需要文字渲染時,將要渲染的文字放在引號中。
  • 圖生圖時說明需要保留哪些元素、修改哪些元素。
  • 多圖融合時明確每張參考圖的角色,例如「第一張作為風格參考,第二張作為主體內容」。

常見問題

目前模型清單以 GET /v1/models 回傳的完整模型 ID 為準。舊別名或簡寫名稱可能無法路由到可用管道。
目前 Gemini 圖片模型透過原生 Gemini 端點呼叫:POST /v1/models/{model}:generateContentPOST /v1/images/generations 不適合作為 Gemini 圖片模型的主要呼叫路徑。
GPT Image 系列使用 n 參數控制生成數量。通義千問和 Seedream 是否支援多張輸出,取決於模型和帳號管道。
取決於模型和參數。GPT Image 系列通常回傳 b64_json,且 gpt-image-2 目前不接受 response_format 參數;通義千問和 Seedream 的回傳格式取決於模型實作和帳號管道。