AI
Alibaba Qwen、画像生成・編集統合モデル「Qwen-Image-2.1」を公開――7BパラメータのDiffusion Transformerが1つのチェックポイントで多機能を実現
2026/09/23
Alibaba Qwen、画像生成・編集統合モデル「Qwen-Image-2.1」を公開
Alibaba の Qwen チームは、テキストから画像生成(text-to-image)、複数参照画像を用いた編集、ネイティブ RGBA 透過出力を1つのチェックポイントに統合した Qwen-Image-2.1 を公開した。モデルの重みは Hugging Face 上で公開されており、研究・評価目的での利用が可能。商用利用には Qwen による別途ライセンスの取得が必要とされている。
前世代との比較――20B から 7B へ
前世代の Qwen-Image は2025年8月に Apache 2.0 ライセンスのもと 20B モデルとして公開されており、編集機能は別チェックポイント(Qwen-Image-Edit)に分かれていた。Qwen-Image-2.1 はこの2つの役割を1つのモデルに統合しつつ、パラメータ数を約3分の1に削減したとされている。Qwen チームは同シリーズの中で「最もバランスが取れたコスト効率の高いモデル」と位置付けている。
ただし、容量計画上の注意点として、7B という数字は Diffusion Transformer 部分のみを指す。パイプライン全体では別途 Qwen3-VL 8B のテキストエンコーダーも読み込まれるため、実際の総パラメータ数はそれ以上になる点に留意が必要だ。
アーキテクチャ
公式 GitHub リポジトリによると、Qwen-Image-2.1 のパイプラインは以下の4コンポーネントで構成されている。
- Transformer(拡散変換器): 32 層・7B パラメータの Single-Stream 設計。ブロックCausal アテンションを採用。
- テキストエンコーダー: Qwen3-VL 8B。テキスト指示と条件画像を1つの表現に統合してエンコードする。
- VAE(変分オートエンコーダー): 64チャンネルの RGBA オートエンコーダー。16倍の空間圧縮とネイティブ透過処理に対応。
- スケジューラー: Flow Matching と Euler 離散スケジューリング、動的シフトを組み合わせて使用。
プレフィックス KV キャッシュによる高速化
速度面での特徴は、混合粒度アテンション(Mixed-Granularity Attention) にある。テキストトークンにはトークンレベルの Causal マスクを、画像トークンには画像ごとにチャンクレベルの双方向マスクをそれぞれ適用している。
条件プレフィックス(テキストおよび参照画像)はノイズの乗った潜在変数より前に配置されるため、デノイジングステップ全体を通じてキーと値が変化しない。モデルは最初のステップでのみ条件を計算し、その プレフィックス KV キャッシュを以降のすべてのステップで再利用する仕組みだ。参照画像が増えるほど節約効果が大きくなると報告されており、最大 10 枚の参照画像に対応している。
主な機能
- ネイティブ透過(RGBA)出力: テキストから RGBA 画像を生成し、透過レイヤーの編集や写真からの被写体抽出が可能。透過出力には固定のプロンプトテンプレートが推奨されている。
- 多参照編集: 最大 10 枚の参照画像を受け付ける。公式の README では、6枚の人物写真からのグループフォト生成や、5枚の参照からのコーディネート合成などの例が示されている。
- ローカル編集: 円、ペイントアノテーション、別途マスクを使用したエリア指定編集が可能。人物・製品のアイデンティティ保持にも対応する。
- ネイティブ 2K 解像度: デフォルトは 2048×2048 ピクセルで、最大 2752×1536 を含む 7 種類のアスペクト比をサポート。
- 画質向上: タイポグラフィ、ポートレートライティング、細部描写の改善が図られており、パノラマ・インフォグラフィック・ストーリーボード・バーチャル試着などのユースケースが挙げられている。
ベンチマーク結果
Qwen チームは自社内部ベンチマーク Qwen-Image-Bench 上での比較を公開している。同ベンチマークでは Qwen-Image-2.1 が総合スコア 60.28 を記録し、Nano Banana 2.0(59.82)や列挙されているすべてのオープンウェイトモデルを上回るとされている。32B のオープンモデルである FLUX 2 Max は 55.33 と報告されている。一方、クローズドモデルでは 6 モデルが上位に位置しており、首位は GPT Image 2.5 Sunburst の 67.01 だという。なお、このベンチマークは Qwen チーム自身が設計したものであり、第三者による独立した評価とは異なる点に留意されたい。
デプロイ・利用環境
リリース初日(Day 0)から Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V のサポートが提供されている。研究・評価目的であればオープンウェイトとして利用できるが、商用デプロイには Qwen との別途ライセンス契約が必要とされている。
モデルの重みは Hugging Face の Qwen/Qwen-Image-2.1 リポジトリで公開されており、アーキテクチャの詳細は公式 GitHub リポジトリにて確認できる。
出典: Alibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editing