透過PNGを1回の生成で作れるモデルの重みが、無償で公開されました。ところがライセンスファイルを開くと、無償で認められているのは研究と評価だけです。Qwen-Image-2.1が示しているのは、オープンウェイトという言葉の中身が、モデルごとに違うものになったという事実です。
AlibabaのQwenチームは2026年9月20日、画像生成と画像編集を1つのモデルで扱う「Qwen-Image-2.1」の重みを公開した。画像を描く部分は32層のDiTで7Bパラメータ、テキストエンコーダにはQwen3-VL 8Bを用いる。VAEは64チャンネルの潜在表現を扱うRGBAオートエンコーダで、透過画像の生成と編集に対応する。参照画像は最大10枚。
ネイティブ2K解像度を採用し、1:1では2048×2048、16:9では2752×1536など7種類の推奨サイズを示す。ライセンスはQwen Research License Agreementで、無償の利用は研究または評価目的に限られ、商用利用には別途ライセンスの取得を求める。配布はHugging FaceとModelScope。
From:
Qwen-Image-2.1
【編集部解説】
切り抜きの工程が、モデルの内側へ入る
画像生成AIで作った素材を実際の制作に載せるとき、多くの現場が同じ手順を踏んできました。生成された画像から被写体を切り抜き、背景を透明にして、ようやくレイアウトに置く。Qwen-Image-2.1は、この切り抜きの工程をモデルの内側へ引き取ります。
鍵になっているのはVAEです。画像を圧縮表現へ変換し復元する部分が、64チャンネルの潜在表現を扱うRGBAオートエンコーダになっており、アルファチャンネルは後処理で付け足すものではなく、モデルが最初から出力するものになりました。ステッカー、ロゴ、アイコン、商品の切り抜き。こうした素材を1回の生成で得られるようになると、制作の段取りそのものが変わります。
透過は生成だけの話ではありません。背景を透明に保ったまま人物の表情を変える、透過レイヤーの中の文字を書き換える、写真から被写体だけを取り出す。これらを同じモデルで扱えます。Qwenは2025年12月、画像を複数のRGBAレイヤーへ分解するQwen-Image-Layeredを公開しました。今回はRGBAという表現形式を、生成と編集を兼ねる1つのモデルの内側へ組み込んだ形です。
「7B」は、動かすモデル一式の大きさではない
発表で目を引くのは7Bという数字です。ただしこれは、画像そのものを描くDiT(拡散トランスフォーマー)部分のパラメータ数を指しています。公式実装を見ると、その外側に、指示文と参照画像を読み解くQwen3-VL 8Bが置かれ、さらに先ほどのVAEが続きます。ModelScopeでの総パラメータ表記は16.22B、配布ファイルは合計で約33GBです。
7Bは描く部分の軽さを示す数字であり、手元のGPUに載るかどうかを判断する数字とは別のものです。といって、約33GBという合計サイズがそのまま必要VRAMを示すわけでもありません。実行時に要するメモリは、精度、量子化、CPUオフロードを含む構成ごとに変わります。公式もCPUオフロードによる節約を案内しており、どう載せるかは利用者の設計に委ねられています。
60.28という点数が測っているもの
Qwenは発表にあたり、自社で構築したQwen-Image-Benchの比較図を示しました。Qwen-Image-2.1の総合点は60.28で、GoogleのNano Banana 2.0(59.82)をわずかに上回る一方、首位のGPT Image 2.5 Sunburst(67.01)とは6.73点の開きがあります。同じ図で32Bと表記されたFLUX.2 Max(55.33)を上回った点は、7Bという規模を考えると目を引きます。
この点数の性格は押さえておく価値があります。Qwen-Image-Benchは1000問のプロンプトに対し、品質、美しさ、指示との一致、現実世界の再現性、創作表現という観点で採点する仕組みで、採点役もQwen側が用意した評価モデルが担います。自社の物差しで測った自社の成績である以上、順位そのものより、どの集団に入ったかを読むほうが実用的です。GoogleやOpenAIの一部モデルと点数が近い層に、ダウンロードして動かせる選択肢が現れた。そう捉えるのが、この数字の適切な重さでしょう。
加えて、この比較は文章から画像を生成する評価です。2.1が新たに掲げる透過画像や10枚参照の編集がどこまで実用に耐えるかは、別の物差しで確かめることになります。日本語の文字描画についても、Qwen-Image-Benchのプロンプトは中国語と英語で構成されており、日本語での成績はこれから利用者が測っていく領域です。
重みが公開されたことと、使ってよい範囲は別の話
ここが今回、日本の制作現場にとって最も重要な点です。Qwen-Image-2.1のライセンスはApache 2.0ではありません。適用されるのはQwen Research License Agreementで、無償で与えられる権利の範囲は研究または評価目的に限られます。商用利用を望む場合は、Hangzhou Tongyi Laboratory Technology Co., Ltd.から別途ライセンスを取得する窓口が用意されています。
このモデルの本体・関連文書またはその出力・結果を使って別のAIモデルを作成・学習・微調整・改善し、それを配布または利用可能にする場合には、製品ドキュメントに「Built with Qwen」または「Improved using Qwen」と目立つ形で表示することが求められます。派生物や製品の主たる名称・識別子に「Qwen」を用いることはできませんが、「fine-tuned from Qwen Image」のような説明目的の使用は認められています。準拠法は中国法、専属管轄は杭州市の人民法院です。
Qwen-Imageシリーズを並べると、この判断が一直線ではないことがわかります。初代Qwen-ImageはApache 2.0で重みが公開されました。その後、2.0と3.0はクラウド経由で提供され、今回の2.1は重みつきの研究ライセンスで登場しました。その間もQwen-Image-2512のような日付つきの重み公開は続いており、約14か月で3つの立ち位置が並んだことになります。オープンウェイトという言葉が、そのまま自由に使えることを意味しない時代に入っています。モデルを選ぶ最初の作業が、ベンチマーク表ではなくライセンスファイルを開くことになる。導入判断の入口が、静かに移動しつつあります。
手元で確かめられることが開くもの
それでも、重みが手に入る意味は小さくありません。クラウド越しのAPIでは、どのプロンプト書き換えが効いたのか、どの工程で品質が変わったのかを切り分けにくいものです。手元で動かせるモデルなら、自分の素材と自分の基準で、工程ごとに確かめられます。
Qwenは短い指示を詳しい記述へ展開する補助モデルも、生成用と編集用に分けて公開しました。基盤はQwen3.5-VL 9Bで、どちらも任意の前処理です。指示文をどう書き換えるか、どの解像度で回すか、どこを量子化するか。そこまで利用者が選べます。
日本語の文字が意図どおりに出るか、商品の細部が編集を重ねても保たれるか。評価のための利用であれば、今日から試せます。そこで手応えをつかんだうえで商用の条件を相談する、という道筋は、クラウド専用のモデルにはなかったものです。制作工程の一部を手元へ戻す検討が、現実的な選択肢として机に乗りました。
【関連記事】
Alibaba「Qwen3.8-27B」公開|270億パラメータAIを量子化でノートPCでも実行可能に
同じAlibabaによるオープンウェイトのモデル。こちらはApache 2.0で、量子化によるローカル実行の条件を扱っている。
【編集部後記】
予告は9月17日でした。重みが出たのは20日です。基調講演も、ベンチマークの事前解禁もないまま、3日で本番が来ました。
その速さのなかで、いちばん静かに変わっていたのがライセンスファイルだったと思います。Apache 2.0から研究ライセンスへ。ダウンロードボタンの位置は変わらないので、押す前に開かないと気づきません。次に重みが公開されたとき、あなたは何から読むでしょうか。
【用語解説】
DiT(拡散トランスフォーマー)
拡散モデルの生成部分にトランスフォーマーを用いる構成。Qwen-Image-2.1では32層・7Bパラメータで、画像そのものを描く役割を担う。
VAE
画像を低次元の圧縮表現へ変換し、そこから画像へ戻す仕組み。生成モデルの入口と出口にあたる。
潜在表現
画像を圧縮した中間的なデータ。Qwen-Image-2.1のVAEは64チャンネルの潜在表現を扱う。
RGBA
赤・緑・青の3成分に、透明度を表すアルファを加えた画像形式。透過画像を扱う際の基本となる。
アルファチャンネル
RGBAのうち透明度を担う成分。従来は生成後の切り抜き処理で付与することが多かった。
テキストエンコーダ
指示文および参照画像を、生成部分が扱える表現へ変換する部品。本モデルではQwen3-VL 8Bが担う。
オープンウェイト
学習済みの重みが配布され、手元で実行できる状態を指す。利用条件はライセンスによって別に定まる。
Apache 2.0
商用利用・改変・再配布を広く認めるオープンソースライセンス。Qwen-Imageの初代などに適用されている。
Qwen Research License Agreement
Qwen-Image-2.1に適用されるライセンス。無償の権利を研究または評価の目的に限定する。
量子化
重みの数値精度を落としてメモリ使用量を減らす手法。ローカル実行の可否を左右する。
CPUオフロード
モデルの一部をCPU側のメモリへ退避させ、GPUメモリの消費を抑える手法。
Qwen-Image-Bench
Qwenが構築した画像生成の評価用ベンチマーク。1000件のプロンプトと5観点で採点する。
【参考リンク】
Qwen(外部)
Alibaba傘下のAI開発チームの公式サイト。言語・画像・音声の各モデルの発表記事と、ブラウザから試せるデモを公開している。
Qwen-Image-2.1(GitHub)(外部)
公式実装のリポジトリ。アーキテクチャの構成、推奨アスペクト比7種、透過画像を得るためのプロンプトの書式が記載されている。
Qwen-Image-2.1(Hugging Face)(外部)
モデルカードと重みの配布先。Diffusersからの呼び出し例と、CPUオフロードによるメモリ節約の設定が示されている。
Qwen-Image-2.1(ModelScope)(外部)
Alibaba系のモデル配布基盤。総パラメータ表記16.22Bと、合計で約33GBになる配布ファイルの一覧を確認できる。
Qwen Research License Agreement(外部)
Qwen-Image-2.1に適用されるライセンスの原文。非商用の定義、表示義務、名称の制限、準拠法と管轄が記されている。
Qwen-Image-Layered(外部)
2025年12月公開のモデル。画像を複数のRGBAレイヤーへ分解する。ライセンスはApache 2.0で重みも公開されている。
Qwen-Image-2512(外部)
Apache 2.0で重みが公開されている日付つきのスナップショット。商用も可能な系列で、クラウドでの提供と並走してきた。
Qwen-Image-Bench(外部)
Qwenが公開した画像生成の評価用データセット。1000件のプロンプトと、品質や指示との一致など5つの観点で構成される。
【参考記事】
画像生成AI「Qwen-Image-2.1」公開、7Bで透過画像に対応も商用不可(外部)
公開当日の記事。総パラメータ16.22B、ファイルサイズ約33GB、生成サイズなどの数値を網羅し、比較図も掲載している。
画像生成・編集AIの次期版「Qwen-Image 2.1」、オープンウェイト公開を予告(外部)
公開3日前の記事。開発者向けアカウントQwen Developersが、オープンウェイトでの公開を予告した段階を伝えている。
Qwen-Image 2.1は静かに登場:PE-I2Iリライターの内部(外部)
9月17日の告知がModelScope経由で50件の早期アクセス枠を提供するものであったことなど、公開の経緯を追っている。
Qwen-Image-2.1 vs GPT Image 2:無料の重み vs 課金メーター(外部)
課金型のAPIとローカル実行を、費用の面から比較している。33GBの内訳として、DiTが約14GBを占めるとしている。
Qwen-Image-2.1 vs Grok Imagine Image 2.0:所有かレンタルか(外部)
独立系のリーダーボードに未掲載である点を確認したうえで、発表元が自ら示したスコアをどう読むべきかを論じている。


















