Skip to main content
Gemini Nano Banana 2.1は、画質、テキスト描画、参照の一貫性、横長画像を重視した、画像生成および会話形式の編集モデルです。gemini-nano-banana-2.1を使用してください。チャット専用のGeminiモデルで代用しないでください。

モデル情報

これらはモデルの仕様です。ルートの利用可否、課金、ファイルアクセス、リクエストサイズの上限は、選択したチャネルに依存します。画像出力には、以下のネイティブGeminiエンドポイントを使用します。 POST https://api.mixroute.ai/v1/models/gemini-nano-banana-2.1:generateContent POST https://api.mixroute.ai/v1/models/gemini-nano-banana-2.1:streamGenerateContent?alt=sse

画像を生成

このエンドポイントでは、サイズとアスペクト比にネイティブのgenerationConfig.imageConfigフィールドを使用します。リクエストボディにmetadata、asset、OpenAIのsize/nフィールド、またはmodelフィールドを追加しないでください。モデルはURLで選択します。

リクエストフィールド

制限

  • アスペクト比には1:1、1:4、4:1、1:8、8:1、2:3、3:2、3:4、4:3、4:5、5:4、9:16、16:9、21:9があります。
  • 参照画像は最大14枚で、モデルのガイダンスでは最大4体のキャラクターと10個のオブジェクトに対応します。これらは入力の上限であり、完全な一貫性を保証するものではありません。
  • Vertexのインライン画像入力は、1枚あたり7 MBが上限です。PNG、JPEG、WebP、HEIC、HEIFに対応しています。その他のリクエスト制限がより厳しい場合があります。
  • 非対応のサンプリング/ランダム性のフィールドtemperature、topP、topK、seed、logprobsは省略してください。
  • 音声生成、任意の関数呼び出し、構造化されたJSON出力には対応していません。

編集と複数ターンでの使用

BASE64_IMAGE_DATAを、元のバイト列をBase64でエンコードしたものに置き換えてください。会話形式の編集では、前のcandidate.content全体をモデルのターンとして保持し、その後に次のユーザーのターンを追加します。すべてのthoughtSignature値を厳密に保持し、画像の履歴をテキストだけに置き換えないでください。

出力の読み取り

candidates[].content.parts[]を種類ごとに処理します。思考以外のinlineDataパートは、そのMIMEタイプとBase64デコード後のバイト列を使用して保存し、テキストパートは別途読み取ります。レスポンスに画像がない場合は、promptFeedbackとfinishReasonを確認する必要があります。HTTPの成功だけでは、画像が出力されたとは限りません。 ストリーミングではJSONのstreamフラグではなく、同じボディでstreamGenerateContent?alt=sseを使用します。SSEのdataイベントを解析し、各JSONイベント内の画像パートとテキストパートを処理してください。 画像の生成と編集 | 画像のストリーミング