QWEN IMAGE 2.1 · 近日公開

統合生成と編集、ネイティブRGBA透明度、10枚画像のリファレンス制御

Qwen Image 2.1 API:統合画像生成とマルチリファレンス編集

単一のコンパクトな7Bモデルで高解像度画像の生成と編集を実現します。Qwen Image 2.1はテキストから画像生成と高度なマルチリファレンス編集を統合し、さらに単一ストリームDiffusion Transformer内でネイティブRGBA透明度サポートを追加しています。

ネイティブ2K解像度、最大10枚のリファレンスを使用したマルチ画像合成、Prefix KV cache高速化により、Qwen Image 2.1は開発者とクリエイターに商用ビジュアルワークフロー向けの効率的で実用可能な基盤を提供します。

Qwen Image 2.1 APIの主な機能

高精度なクリエイティブワークフローを実現する、統合2K生成と編集、ネイティブ透明画像、10枚画像のリファレンス制御。

01

統合画像生成と編集のためのQwen Image 2.1 API

クリエイターは、テキストから画像生成と画像編集のために別々のモデルを切り替える必要があり、統合の複雑さと遅延が増加することがあります。Qwen Image 2.1は、視覚的な作成と反復編集を単一の軽量7Bチェックポイントに統合します。単一のAPI呼び出しでネイティブ2K画像を生成するか、7つのアスペクト比全体で同等の忠実度を保ちながら既存画像を編集できます。

  • 7つのアスペクト比でネイティブ2K画像を生成
  • テキストから画像生成と画像編集を1つのモデルに統合
  • 複数モデルの切り替えとパイプラインのオーバーヘッドを削減
生成した灰色のリュックと生地をオリーブ色に変更した結果

02

透明アセットと被写体切り抜きのためのQwen Image 2.1 API

クリーンな透明アセットの制作には通常、エッジアーティファクトや色のにじみを引き起こす別途の背景除去ツールが必要です。Qwen Image 2.1はネイティブ64チャンネルRGBA VAEを搭載し、テキストプロンプトから直接透明画像を生成し、写真入力から被写体を抽出します。デザイナーと開発者は、ステッカー、デザイン要素、分離された商品画像を1ステップで生成できます。

  • テキストから直接ネイティブRGBA透明画像を生成
  • 標準RGB写真からクリーンな被写体を抽出
  • 追加の背景除去工程を不要にする
同じリュックの元写真と背景を透明にした切り抜き結果

03

10枚画像のリファレンス一貫性を実現するQwen Image 2.1 API

複雑なビジュアル構成やバーチャル試着では、複数入力を条件付けに使用する際、キャラクターの変化や質感劣化が頻繁に発生します。Qwen Image 2.1は、最大10枚のリファレンス画像に対応し、円形マーカー、ブラシ注釈、専用マスクによる領域編集も可能です。人物の顔、ファッション衣類、ブランド商品において、編集後も厳密なアイデンティティの忠実性を維持します。

  • 1つの構成内で最大10枚のリファレンス画像を結合
  • 円形、ブラシ、またはマスク領域で対象を指定して編集
  • 顔の特徴、商品テクスチャ、ブランド詳細を保持
人物と衣服の参照画像、および衣服だけを編集した結果

04

明瞭なバイリンガル文字とポスター制作のためのQwen Image 2.1 API

生成画像モデルは、商用グラフィックにおいて文字の崩れ、不正確な字形、判読不能な文字配置を頻繁に生成します。統合されたQwen3-VL-8Bエンコーダーを活用することで、Qwen Image 2.1はシーン内に自然に組み込まれた英語と中国語のバイリンガルタイポグラフィで卓越した品質を提供します。視点や照明に合わせて鮮明な文字を配置した商用ポスター、パッケージデザイン案、インフォグラフィックを生成できます。

  • 判読可能な英語と中国語のバイリンガルタイポグラフィを描画
  • 視覚的な文字をシーンの照明と遠近感に自然に合わせる
  • 商用ポスター、パッケージ、インフォグラフィックを制作
中国語と英語の案内表示を配置した図書館ガイド

05

高速かつコスト効率に優れた生成を実現するQwen Image 2.1 API

20B+の拡散モデルにおける大量のパラメータ数は、大きなVRAM使用量を必要とし、プロダクションパイプラインの反復サイクルを遅らせます。Qwen Image 2.1は、わずか7 billionのビジュアルパラメータのみを持つコンパクトな32-layer Single-Stream DiTを採用し、さらに40 denoising stepsにわたるPrefix KV cache再利用によって強化されています。視覚的な忠実度を損なうことなく、大幅に高速な推論速度と低いデプロイコストを実現します。

  • 効率的な7Bアーキテクチャでメモリ要件を削減
  • Prefix KVキャッシュによるマルチステップノイズ除去の高速化
  • 低いリソースコストで最高水準のベンチマークスコアを達成
連続する生成ステップでプロンプトの文脈を再利用する流れと出力画像

Qwen Image 2.1 APIのメリットを享受できるユーザーとは?

01

Eコマース商品撮影

プロフェッショナルな商用写真の生成、カタログ背景の置換、クリーンな商品切り抜きの作成を行いながら、商品の形状、ロゴ、質感を厳密に保持します。

02

ファッションとバーチャル試着

10枚の画像コンディショニングを使用して、モデル写真と衣類・アクセサリーの参照画像を組み合わせ、リアルなファッション合成画像やパーソナライズされたスタイリングを生成します。

03

グラフィックデザインと透明アセット

補助的な背景除去ツールに頼ることなく、プロンプトから直接ステッカー、分離されたビジュアル要素、透明PNGアセットを作成します。

04

ソーシャルメディアとデジタルマーケティング

読みやすいバイリンガルタイポグラフィと一貫性のあるブランドアセットを備えた、目を引くキャンペーンビジュアル、広告バナー、プロモーションポスターを制作します。

05

ストーリーボードとコンセプトアート

複数のショットアングルにわたるマルチリファレンスのアイデンティティアンカーを使用して、キャラクターシート、映画的なシーン構成、連続ストーリーボードを反復的に制作できます。

06

出版とエディトリアルレイアウト

タイポグラフィとビジュアルアートをシームレスに統合した構造化された構成で、書籍カバー、教育用インフォグラフィック、編集イラストを制作します。

Qwen Image 2.1とQwen Image 2.0 — モデル比較

Qwen Image 2.1は、従来のリリースで別々のチェックポイントが担当していた機能を統合し、ビジュアルパラメータを7Bに削減すると同時に、ネイティブRGBA透明性と10枚の画像参照制御を導入しています。

機能Qwen Image 2.1Qwen Image 2.0
ビジュアル生成モデルサイズ7B Single-Stream DiT(32層)約20Bパラメータ
生成+編集単一の統合チェックポイント個別チェックポイント(T2I vs Edit)
透明性サポート同一モデル内でネイティブ64チャンネルRGBA対応専用のレイヤーモデルが必要
参照画像容量最大10枚の参照画像限定(通常は1-3件の参照)
ネイティブ解像度ネイティブ2K(デフォルト2048×2048)1024×1024 / 後続チェックポイントでは2K
推論最適化ステップ間でのPrefix KVキャッシュ再利用標準的なマルチステップ再計算
Qwen-Image-Benchスコア60.28(最高評価のオープンモデル)52.06
VRAM要件~6–12 GB(量子化 / オフロード)24 GB以上を推奨

Qwen-Image-Benchのスコアと仕様は、公開されている技術評価およびドキュメントに基づいています。

Qwen Image 2.1 APIに関するよくある質問

Qwen Image 2.1とは何ですか?

Qwen Image 2.1は、テキストから画像生成と画像編集を統合的に実行するために設計された、Alibabaのオープンウェイト視覚基盤モデルです。7Bの視覚パラメータを備えた32個のSingle-Stream DiTレイヤーを採用し、ネイティブRGBA透過に対応しています。

Qwen Image 2.1は以前のQwen-Imageリリースとどのように異なりますか?

以前のバージョンでは、生成、編集、レイヤー化された透過処理のために別々のモデルが必要になることが多くありました。Qwen Image 2.1はこれらすべての機能を単一のコンパクトな7Bモデルに統合し、透過背景と最大10枚の参照画像をネイティブに処理できます。

APIで透過RGBA画像を生成するにはどうすればよいですか?

「This is an RGBA image with transparency」で始まるプロンプトを指定し、背景が透明であることを示してください。モデルのネイティブ64チャンネルRGBA VAEにより、二次的な切り抜き処理なしで透明なPNGまたはWebPファイルが出力されます。

Qwen Image 2.1は編集で何枚の参照画像をサポートしていますか?

Qwen Image 2.1は、1回の編集リクエストで最大10枚の参照画像をサポートし、複雑な複数キャラクターのシーン、バーチャル試着、詳細なインテリア構成において、高いアイデンティティ保持を実現します。

対応している出力解像度とアスペクト比は何ですか?

このモデルはネイティブ2K出力(1:1の場合のデフォルトは2048×2048)をサポートし、1:1、4:3、3:4、3:2、2:3、16:9、9:16など複数のアスペクト比を提供します。

Qwen Image 2.1はバイリンガル文字レンダリングにどのように対応していますか?

条件エンコーダーとしてQwen3-VL-8Bを搭載したQwen Image 2.1は、最先端の中国語・英語タイポグラフィ機能を備えており、3Dシーンに自然に組み込まれたブランドロゴ、看板、ポスターのテキストを正確に描画できます。

Qwen Image 2.1 APIはいつPoYoで利用可能になりますか?

Qwen Image 2.1は現在、PoYoでの高同時実行デプロイに向けて準備中です。今すぐAPIキーに登録して、モデルエンドポイントとプレイグラウンドが公開され次第、すぐに利用できるようにしましょう。

PoYoでQwen Image 2.1 APIをフォローする理由

01

統合型画像生成&編集

単一の効率化された開発ワークフローで、テキストから画像への生成、複数参照画像編集、ネイティブRGBA透過機能を評価できます。

02

包括的なモデルカタログ

Qwen Image 2.1をFLUX、Seedream、Grok Imagineなどの主要モデルと比較し、プロジェクトに最適なビジュアルパイプラインを選択できます。

03

高同時実行APIアーキテクチャ

PoYoの非同期タスクディスパッチと低レイテンシーインフラストラクチャにより、完全なステータスコールバックを備えた高速で信頼性の高い生成時間を実現します。

04

開発者優先の統合

標準SDKサポート、明確なOpenAPIドキュメント、迅速に対応する開発者向けツールを利用して、数分で画像生成を統合できます。