01
Grok Imagine Image 2.0 API:複雑なプロンプトに忠実に従い文字を明瞭かつ正確に表現
大まかなプロンプト解釈から一歩先へ。Grok Imagine Image 2.0は複数要素の構図を設計し、詳細なビジュアル指示を守り、レイアウトやタイポグラフィが制作要件に含まれる画像でも読みやすい文字を生成します。
- 指定されたオブジェクト、照明、素材の細部を維持
- 構造化されたポスター、広告、インフォグラフィックを制作
- より明瞭な見出しと画像内ラベルを生成

透明な価格設定。隠れた費用はありません。使った分だけ支払えます。
| モデル | 仕様 | PoYo価格 | 公式価格 | 節約率 |
|---|---|---|---|---|
Low quality - 1K | $0.040/画像 8 クレジット /画像 | - | - | |
Medium quality - 1K | $0.060/画像 12 クレジット /画像 | - | - | |
Low quality - 2K | $0.060/画像 12 クレジット /画像 | - | - | |
Medium quality - 2K | $0.080/画像 16 クレジット /画像 | - | - | |
Input image surcharge | $0.010/画像 2 クレジット /画像 | - | - |
* 実際の料金は最終出力に基づきます。
高速で高コストパフォーマンスなGrok Imagine Image 2.0 API を使用するための完全なガイド
Grok Imagine Image 2.0は、複雑なプロンプト、明瞭な文字、正確な部分編集に対応するxAIの高忠実度画像生成・編集モデルです。
PoYo APIで提供中で、最大3枚の入力画像、5種類のアスペクト比、1Kまたは2K出力、lowまたはmedium品質、1回のリクエストで最大4枚の出力に対応します。
4つの機能例を通じて、画像生成、編集、複数参照の合成、柔軟なリフレーミングをご覧ください。
01
大まかなプロンプト解釈から一歩先へ。Grok Imagine Image 2.0は複数要素の構図を設計し、詳細なビジュアル指示を守り、レイアウトやタイポグラフィが制作要件に含まれる画像でも読みやすい文字を生成します。

02
Magic Wandとセグメンテーションにより、編集そのものが中心的なワークフローになります。被写体、商品、背景、細部を選択して変更内容を伝えるだけで、画像全体を作り直さずに残りの構図を安定して保てます。

03
異なる被写体、商品、スタイル、シーンの参照を一つのプロンプトにまとめられます。複数参照入力は手作業の合成を減らし、より一貫したキャンペーン、キャラクター、ビジュアルシステムの制作を支援します。

04
Smart Resizeは、正方形、縦長、横長の出力に合わせて構図を再設定し、画面を拡張します。一つの承認済みの方向性から、商品画像、SNSクリエイティブ、UI素材、ポスター、キャンペーン展開を少ない手作業で制作できます。

主役の商品を認識できる状態に保ちながら、商品写真、パッケージ案、色違い、きれいな切り抜き、ライフスタイルシーンを制作します。
より強い構図と素早い反復で、キャンペーンビジュアル、SNS投稿、サムネイル、各種フォーマットを制作します。
構造化された要件から、見出しやラベルが読みやすいポスター、標識、解説図、情報量の多いレイアウトを制作します。
コンセプト画像、ストーリーボード、ゲーム素材、イラストシーケンスを通じて、キャラクターの特徴や反復する細部、画風を維持します。
構造化された要件から、読みやすい視覚階層を持つモックアップ、インターフェース案、アイコンセット、プロップ、デザイン案を制作します。
画像全体を作り直さずに、選択した細部の調整、背景の差し替え、参照の合成、承認済み画像の展開を行えます。
3つのxAI画像モデルを生成品質、編集の深さ、参照画像、出力制御、動画ワークフローで比較します。Grok Imagine Image 2.0は納品品質の生成と正確なネイティブ編集、Grok Imagine Image Qualityは精細な1K・2K出力、Grok Imagineは高速なクリエイティブモード、参照画像のバリエーション、画像から動画への変換に適しています。
| 機能 | Grok Imagine Image 2.0 | Grok Imagine Image Quality | Grok Imagine |
|---|---|---|---|
| 最適な用途 | 納品品質の生成、ネイティブな部分編集、複数参照の合成 | 高忠実度の1K・2K生成と参照画像を使った編集 | 高速なアイデア制作、クリエイティブなバリエーション、画像から動画 |
| プロンプト追従と文字表現 | 複雑なプロンプト、明瞭な画像内文字、構造化されたレイアウト | 高いプロンプト追従、精細なディテール、安定した視覚品質 | Fun、Normal、Spicyの各モードでプロンプトを素早く解釈 |
| 生成と編集 | テキストから画像、Magic Wand、セグメンテーション、背景ツール、反復型部分編集 | テキストから画像生成と参照画像を使ったプロンプト編集 | 高速生成、クリエイティブモード、参照バリエーション、画像から動画 |
| 部分編集の精度 | Magic Wandとセグメンテーションで選択範囲だけを変更し残りの構図を維持 | プロンプトと参照画像でより広い範囲の編集を誘導 | 選択範囲の編集ではなく参照画像ベースのバリエーションを生成 |
| 参照画像 | 1つのワークフローで最大3枚 | 参照画像を使った編集向けの任意入力画像 | 参照画像は任意 |
| 出力制御 | Smart Resizeとインテリジェントな拡張に対応する5種類のアスペクト比 | 1Kまたは2K、lowまたはmedium品質 | 2:3、3:2、1:1の画像出力 |
| 動画ワークフロー | 静止画のみ。動画にはGrok Imagine Video 1.5を使用 | 画像生成と編集のみ | 同期音声付きの画像から動画へのワークフローを内蔵 |
同じPoYoアカウントと認証で画像、動画、音声などのAIモデルを利用できます。
PoYoの生成モデル間で送信、task ID、ステータス確認、結果取得の流れを再利用できます。
ステータスを照会するかWebhookコールバックを受け取り、完成画像を自動化フローへ接続できます。
承認済み画像をGrok Imagine Video 1.5などのPoYo動画モデルへ続けて渡せます。