guides

Qwen Image 3.0:知っておくべきすべてのこと

Poyo.ai Team
Updated
3 min read
Share:

Qwen Image 3.0の情報量豊富な画像生成と編集

Qwen Image 3.0は、Qwenチームが開発した第3世代の画像基盤モデルです。2026年7月21日に発表され、魅力的な単体画像を生成するだけでなく、新聞、教育用グラフィック、ストーリーボード、インターフェースコンセプト、注釈付き画像、その他の情報量が多いデザインなど、実用的な情報を含むビジュアルを生成することを目指して設計されています。

主なアップグレードには、4.5Kトークンの指示入力上限、最小 10ピクセル サイズのテキスト描画、12言語でのネイティブ描画対応20以上のフォント100以上のビジュアルスタイルへの対応、そして視覚情報や世界知識の活用強化が含まれます。このモデルはテキストと画像を入力として受け取り、画像生成と画像編集の両方を実行できます。

PoYoではQwen Image 3.0の2つの本番モデルID、1K/2K出力、公開料金を利用できます。上流の重み、ライセンス、ネイティブ最大解像度は未公開です。

Qwen Image 3.0の概要

機能確認済み情報
正式名称Qwen-Image-3.0
発表日July 21, 2026
モデルタイプ画像生成および編集基盤モデル
入力テキストと画像
出力画像
最大指示長4.5Kトークン
小さいテキストの描画約10pxまでのテキスト
言語12言語でのネイティブ描画
フォント20以上
ビジュアルスタイル100以上
QwenCloud上流モデルIDqwen-image-3.0-pro
PoYoモデルIDqwen-image-3, qwen-image-3-pro
PoYo API状態現在利用可能
PoYo出力1K, 2K
パラメータ数未公開
最大解像度未公開
オープンウェイトとライセンス未公開

公式リリースでは、このモデルを3つの概念で説明しています:Rich Content(豊富なコンテンツ)、Authentic Details(本物らしいディテール)、Deep Knowledge(深い知識)。Qwenはこれらを「Real」というより大きなテーマで表現しています。これは単なるフォトリアリズムではなく、実際の作業に十分役立つ、充実した情報を持つコンテンツを意味します。

Qwen Image 3.0の新機能とは?

これまでのQwen Imageシリーズでは、タイポグラフィや正確な画像編集能力によって評価を築いてきました。その後、Qwen Image 2.0では生成と編集を1つのモデルに統合し、ネイティブ2K出力に対応し、最大1Kトークンの指示入力を受け付けました。

Qwen Image 3.0は、1回のリクエストで処理できる情報量と複雑さを拡張しています。指示入力上限は1Kトークンから4.5Kトークンへ増加し、公式例では高密度なレイアウト、小さい文字、数式、多言語コンテンツ、知識豊富なグラフィックがより重視されています。

項目Qwen Image 2.0Qwen Image 3.0
指示入力長最大1Kトークン最大4.5Kトークン
生成と編集1つのモデルで統合両方に対応
ネイティブ解像度2Kを公開未公開
主な重点タイポグラフィ、意味的な指示追従、フォトリアリズム豊富なコンテンツ、細部表現、深い知識
高密度な小さい文字テキスト描画を改善約10pxで公式実演
複雑なレイアウトポスター、スライド、漫画、インフォグラフィック新聞、試験用紙、ストーリーボード、ネストされたインターフェース、マルチパネルグラフィック

この比較は、Qwen Image 3.0のすべての出力が自動的により正確になることを意味するものではありません。Qwenが発表した機能と位置付けを説明するものです。プロンプトごとの一貫性を測定するには、独立した再現可能なテストが必要です。

Rich Content:長いプロンプトと高密度レイアウト

4.5Kトークンの入力上限は、Qwen Image 3.0の最も明確な変更点の1つです。これにより、複数の領域、ラベル、関係性、視覚ルールを含む指示を、数文に圧縮することなく記述できます。

これは、画像内に4,500トークン分の文章が完全に正確に描画されることを意味するものではありません。コンテンツ、レイアウト、スタイル、タイポグラフィ、空間的関係の説明を含む、その長さの指示をモデルが受け取れることを意味します。

1回の生成でのマルチパネルビジュアル

公式例の1つでは、Qwen Image 3.0が1回の生成で完全な3×3教育用グリッドを作成します。約3.7Kトークンのプロンプトでは、幾何学、物理学、生物学、医学、文学、銀行、抽象代数学など9つの異なるテーマを説明しています。各パネルにはイラスト、数式、チャート、中国語と英語のテキスト、それぞれ独自の視覚的階層が含まれています。

この例が検証しているのは、単なるプロンプト長だけではありません。モデルは複数の概念を分離し、指定された領域に配置し、別のパネルの内容が混ざらないようにする必要があります。

この能力は以下の用途で役立つ可能性があります。

  • 教育用ポスターや教材
  • 編集記事の見開きや新聞風ページ
  • 製品比較グリッド
  • ショートドラマや広告用ストーリーボード
  • 試験用紙やワークシート
  • メニュー、カタログ、ビジュアルレポート

ネストされた画像とインターフェース

Qwenは垂直方向または入れ子構造の複雑さも示しています。あるプロンプトでは、Qwen Chatインターフェースを含むVS Codeインターフェースを配置し、その中にさらにWeChatインターフェースを含め、さらにその内部にコーヒーポスターを配置するようモデルに指示しています。

このような画像内画像タスクでは、意味的な入れ子構造、相対的なサイズ、インターフェース知識、複数階層のコンテンツを維持する能力が試されます。UIコンセプト、ソフトウェアイラスト、画面ベースの広告、編集グラフィックに特に関連します。

Authentic Details:小さい文字とリアルな質感

Qwenは「Authentic Details」を、タイポグラフィと物理的ディテールの両方を表す言葉として使用しています。このモデルは、高密度なテキストコンテンツを描画しながら、人、物体、素材をより自然に見せる細かな視覚的手掛かりを改善することを目指しています。

10ピクセルまでの小さい文字

Qwenによると、Qwen Image 3.0は約10pxサイズの読み取り可能なテキストを描画できます。公式例には以下が含まれます。

  • テキスト量の多いジンベエザメのインフォグラフィック
  • 複数列で構成された新聞ページ
  • 代数幾何学を扱う学術論文
  • 上付き文字、下付き文字、ギリシャ文字、波括弧、分数、複数行数式
  • 撮影した本のページに追加された手書き注釈

これはポスター、インターフェース、スライド、文書、技術図解において価値があります。ただし、可読性と正確性は同じではありません。文字列がタイポグラフィ的には自然に見えても、単語のスペルミス、誤った数字、壊れた数式が含まれる可能性があります。公開前には生成されたテキストと事実情報を必ず確認する必要があります。

写真的な細部表現

公式例では、肌の毛穴、一本一本の髪、微細な表情、紙、布、筆致など、繊細な質感にも焦点が当てられています。目的は、AI生成の人物画像や商品画像を見分ける要因となる、過度に滑らかで人工的な外観を減らすことです。

細部表現はフォトリアルな人物画像だけに重要なのではありません。以下の改善にも役立ちます。

  • ガラス、金属、革、布などの商品素材
  • 食品や飲料の写真表現
  • 編集・ライフスタイル画像
  • 歴史的作品や文書の復元
  • クローズアップ自然画像や科学イラスト

ディテールを意識した編集

Qwen Image 3.0はテキストから画像を生成するだけのモデルではありません。Qwenの編集デモでは、本のページにリアルな手書き学習ノートを追加したり、伝統絵画の損傷部分を修復しながら、元の墨の濃淡、羽毛の質感、構図、筆致を維持しようとしています。

これらの例は、モデルが既存画像の外観と高レベルの指示を組み合わせられる可能性を示しています。生成編集ツールと同様に、実運用では依頼した編集箇所以外が変更されていないか確認する必要があります。

Deep Knowledge:言語、スタイル、インターフェース、事実情報

Qwen Image 3.0の3つ目の柱は「Deep Knowledge」です。これは、単に認識可能な物体を生成するだけでなく、言語、インターフェースの慣習、芸術スタイル、分野知識に依存するビジュアルを生成する能力を表しています。

12言語でのネイティブ描画

Qwenは、このモデルが12言語でネイティブ描画に対応すると述べています。公開資料では中国語、英語、日本語、韓国語、スペイン語の例が示されていますが、12言語すべての公式一覧は提供されていません。

この区別は重要です。未公開の言語リストを推測して公開したり、すべての対応言語で同等の精度があると仮定したりするのは早計です。多言語キャンペーンでは、流暢な話者によるスペル、句読点、改行、文化的に適切なタイポグラフィの確認が必要です。

20以上のフォントと100以上のビジュアルスタイル

QwenCloudは20以上のフォント対応を掲載しており、リリース記事では100以上の芸術スタイルが説明されています。これらの機能により、単に「ポスター」や「イラスト」と指定するよりも、具体的なビジュアルシステムを定義できます。

より細かな制御には、タイポグラフィを以下の観点で指定すると効果的です。

  • 表示する正確なテキスト
  • 言語と文字体系
  • 見出し、小見出し、本文、ラベル、キャプション
  • セリフ体、サンセリフ体、手書き、ディスプレイ、技術系スタイル
  • 太さ、配置、色、間隔、階層

多くのスタイルに対応していることは、指定した商用フォントや存命アーティストのスタイルを正確に再現できることを保証しません。ブランドおよびライセンス確認は利用者の責任です。

リアルなインターフェース生成

Qwen Image 3.0は以下のような一般的なビジュアル構造を再現できます。

  • Webページ
  • ソフトウェアアプリケーション
  • ゲーム
  • ライブ配信ルーム
  • チャットインターフェース
  • モバイル風画面

これはビジュアルコンセプトやストーリーボード作成に役立ちます。ただし、出力が自動的に実用可能なUIコードになるわけではなく、アクセシビリティや操作基準への準拠を保証するものでもありません。

世界知識とWeb検索

公式例では、科学インフォグラフィックや注釈付き研究図を作成するために対象分野の知識が利用されています。ある例では、昆虫写真を保持したまま、分類情報、形態ラベル、拡大詳細、スケールバーを追加しています。

Qwenはオンライン検索による現在の天気グラフィック生成も示しています。これはモデル単体ではなく、ツール連携ワークフローとして理解する必要があります。Webアクセスが最新情報を提供し、画像モデルがそれをビジュアル化します。これは、基盤モデル自体が常に最新情報を保持していることを意味しません。

知識量が重要な出力は、信頼できる情報源と照合する必要があります。画像生成は、非常に説得力のある視覚表現で誤情報を提示する可能性があります。

Qwen Image 3.0で何を作成できるか?

このモデルが最も強みを発揮する可能性があるのは、ビジュアル品質と情報構造を同時に必要とする作業です。

インフォグラフィックと教育資料

長いプロンプトによって、複数のセクション、図、数式、注釈、説明テキストを定義できます。そのため、授業用ポスター、年表、科学解説資料、プレゼンテーション用グラフィックに有望です。

新聞や編集レイアウト

小さい文字、段組み、画像キャプション、紙の質感を同時に生成できます。結果はコンセプト画像、イラスト、下書きとして有用ですが、正確性が重要な場合は本文を手動で組版する必要があります。

ストーリーボードと漫画

拡張された指示長により、複数のカット、場所、動作、カメラアングル、キャプションを1つのプロンプトで説明できます。ただし、パネル間のキャラクター一貫性は前提にせず評価する必要があります。

UIとゲームコンセプト

一般的なインターフェースパターンの知識により、アプリ、ダッシュボード、ゲーム画面、ライブ配信グラフィックの初期アイデア作成を効率化できます。デザイナーは結果を完成したインターフェース仕様ではなく、ビジュアル参考として扱うべきです。

ECとマーケティングクリエイティブ

詳細な表面表現、構造化レイアウト、商品情報、多言語テキストの組み合わせにより、キャンペーンモックアップ、カタログページ、メニュー、商品説明資料を支援できます。

文書注釈と復元

画像編集では、既存画像にメモ、ラベル、図解、その他の文脈情報を追加できます。芸術作品の復元例は創造的な修復や再構築ワークフローも示していますが、歴史的価値のある資料は専門家による確認と明確な開示なしに変更すべきではありません。

Qwen Image 3.0へのアクセス方法

QwenCloudの上流モデルID:

qwen-image-3.0-pro

PoYoの本番リクエストでは次を使用します:

qwen-image-3
qwen-image-3-pro

両モデルはテキスト画像、画像画像、1K/2K、8比率、PNG/JPEG、プロンプト拡張、ネガティブプロンプト、seedに対応します。

{
  "parameters": {
    "prompt_extend": true
  }
}

モデルID、パラメータ、料金はPoYoの最新ドキュメントを確認してください。 PoYo API.

PoYoの標準モデルは1K/2Kともに1枚4.8 credits($0.024)です。Proは1Kが6.4 credits($0.032)、2Kが12 credits($0.06)で、入力画像1枚につき0.5 credits($0.0025)が加算されます。

より良いQwen Image 3.0プロンプトを書く方法

長い指示入力枠は、プロンプトを整理した場合に最も効果を発揮します。単に形容詞を増やすだけでは、出力品質が向上するとは限りません。

実用的な構成は以下です。

  1. 縦型教育ポスターや3列新聞など、目的とキャンバスを定義する。
  2. 全体の視覚的階層とグリッドを説明する。
  3. 各セクションを空間順に指定する。
  4. 表示する正確なテキストを引用符で囲む。
  5. タイポグラフィ、言語、相対的な文字サイズを定義する。
  6. 画像、素材、照明、スタイルを説明する。
  7. 重なってはいけない要素など、関係性と制約を指定する。
  8. 後で検証できる場合のみ、事実ラベルを要求する。

複雑なレイアウトでは、「Header」「Left column」「Center panel」「Footer」のようなセクション名を使う方が、整理されていない1つの段落より有効です。画像編集では、変更する内容と変更してはいけない内容の両方を明示してください。

現在の制限事項と未公開情報

Qwen Image 3.0は新しいモデルであり、リリース資料では完全な技術報告書や独立評価ではなく、選択された例が中心に紹介されています。以下の制限事項に注意してください。

  • QwenCloudのアクセス条件とは別に、PoYoでは2つの本番モデルIDを現在利用できます。
  • Qwenはパラメータ数や詳細なモデルアーキテクチャを公開していません。
  • Qwenはネイティブ最大解像度を公開していませんが、PoYoでは1Kと2Kの出力を選択できます。
  • PoYoの料金は公開済みです。平均レイテンシーとレート制限は最新ドキュメントを確認してください。
  • オープンウェイト提供、ライセンス、ローカル展開要件は不明です。
  • 約10pxのテキスト描画という主張は、完全なスペルや事実正確性を保証するものではありません。
  • 対応する12言語の完全な一覧は公開されていません。
  • 複雑な数式、科学ラベル、検索取得した事実情報は依然として人間による確認が必要です。
  • UI風画像は説得力があっても、論理的または技術的に有効なインターフェースとは限りません。
  • 公式デモ画像だけでは、繰り返し生成時の一貫性は測定できません。

Qwen Image 2.0の仕様をQwen Image 3.0にそのまま適用しないでください。特に、新モデルが同じパラメータ数、アーキテクチャ、解像度制限、展開プロファイルを持つことはQwenによって確認されていません。

Qwen Image 3.0は注目すべきモデルか?

はい。特に、これまで別々の画像生成ツール、レイアウトツール、手動タイポグラフィ調整を必要としていたワークフローにおいて注目されます。

Qwen Image 3.0の最も重要なアップグレードは、単一の画像品質スコアではありません。1つの生成画像に、より構造化された情報、小さくても読める文字、豊かな視覚的ディテール、幅広い対象知識を同時に持たせようとする点です。

PoYoは実運用可能なホスト型APIを提供しています。一方、重み、ライセンス、ハードウェア要件が未公開のため、ローカル推論については引き続き不明です。

PoYoでの料金と対応出力サイズは明確になりましたが、一貫性、速度、ネイティブ最大解像度、ローカル展開は個別に評価する必要があります。

よくある質問

Qwen Image 3.0とは何ですか?

Qwen Image 3.0は、Qwenによる第3世代の画像生成および画像編集向け基盤モデルです。情報量の多いレイアウト、細かな視覚表現、多言語テキスト、インターフェースシミュレーション、知識豊富なビジュアルコンテンツに重点を置いています。

Qwen Image 3.0はいつリリースされましたか?

Qwenチームは2026年7月21日にQwen Image 3.0を発表しました。

Qwen Image 3.0のプロンプト長はどのくらいですか?

Qwenによると、このモデルは最大4.5Kトークンの指示を受け付けます。これはプロンプト上限であり、4,500トークン分の文章を1つの画像内に正確に描画できることを保証するものではありません。

Qwen Image 3.0は小さい文字を生成できますか?

Qwenは、モデルが約10ピクセルまでのサイズで読み取り可能な文字を描画できると述べています。ただし、正確なスペル、数式、数字、事実情報は手動で確認する必要があります。

Qwen Image 3.0はどの言語に対応していますか?

Qwenは12言語でのネイティブ描画対応を発表しています。リリース資料では中国語、英語、日本語、韓国語、スペイン語などが示されていますが、完全な12言語一覧は公開されていません。

Qwen Image 3.0は画像編集ができますか?

はい。公式例では、手書き注釈の追加、写真への技術情報の付加、伝統芸術作品の欠損または損傷部分の復元が示されています。

Qwen Image 3.0はオープンソースですか?

Qwenはオープンウェイトやライセンスを公開していません。PoYoのホスト型APIが利用できることは、ローカル用の重みが公開されたことを意味しません。

Qwen Image 3.0 APIのモデル名は何ですか?

PoYoでは qwen-image-3qwen-image-3-pro を使用します。QwenCloudの qwen-image-3.0-pro と混同しないでください。

Qwen Image 3.0はどの解像度に対応していますか?

PoYoでは1Kと2Kを選択できます。これはモデルのネイティブ学習解像度や最大アーキテクチャ解像度を示すものではありません。

Qwen Image 3.0 · PoYo API

??

Share: