Qwen-Image-2.1 まとめ:配布ファイル

2026年9月27日

このモデルについて

Qwen-Image-2.1 は、Alibaba の Qwen チームが公開した画像生成モデルです。文章から画像を作る機能と、既存の画像を編集する機能を1つのモデルにまとめているのが特徴で、画像を生成する部分は 7B パラメータ(32層の DiT)と、この種のモデルとしては小さめに作られています。最大で 2048×2048(1:1)など約400万画素の画像を出力できます。

公開元が挙げる主な改良点は次の4つです。

  • 透過画像(RGBA)をそのまま扱えます。 背景が透明な画像を文章から生成する、透過したレイヤーを編集する、写真から被写体を切り抜く、を同じモデルで行えます。ロゴ・アイコン・合成用の素材作りで、別途「背景除去」の工程が要りません。
  • 参照画像を最大10枚まで使えます。 人物や商品の見た目を保ったまま別の場面に置く、といった編集ができます。編集したい場所は、丸で囲む・書き込む・マスクを渡す、のどれでも指定できます。
  • 文字の描画、人物写真のライティング、細部の質感が改善されたとしています。
  • 軽量な構造(粒度を混ぜたアテンションと、プレフィックスの KV キャッシュ再利用)で、計算コストを抑えています。

補助モデル「PE」について: 同時に、短い依頼を画像生成向けの詳しいプロンプトに書き換える補助モデルが2つ公開されています。PE-T2I(文章から画像用)は、どの言語の短い依頼でも詳しい英語のプロンプトと推奨の縦横比に書き換え、PE-I2I(画像編集用)は、あいまいな編集指示と入力画像から、編集に使える具体的な指示を作ります。どちらも Qwen3.5-VL 9B を調整したモデルです。当サイトの公式モデルの記事と、下の「配布ファイル」の表は、画像生成の本体ではなく PE-I2I を扱ったものです。

何がすごいのか

モデルカードには、他のモデルと数値で比べた表は載っていません。そのため、ここでは性能の数値には触れず、機能の面で整理します。

  • 生成と編集と透過処理が1つのモデルで完結することが最大の特徴です。これまでは生成モデル・編集モデル・背景除去ツールを組み合わせていた作業を、1つのパイプラインで行えます。
  • 7B という生成部の小ささは、手元の GPU で動かすうえで有利です。ただし、テキストを理解する部分などを含めた全体の必要メモリは、使う形式によって変わります。

手元で動かすときのポイント

  • 公式の使い方は、diffusers の QwenImage21Pipeline です(執筆時点では diffusers を GitHub から最新版で入れる必要があります)。
  • コミュニティによる GGUF 版も出ています。当サイトの記事には、第三者が安全対策を外した「Uncensored」版も含まれますが、これは公式のモデルとは重みが異なる別物です。
  • ライセンスは独自の Qwen Research License で、研究・評価目的の利用に限られます。 商用利用には、公開元から別途ライセンスを受ける必要があります。再配布するときは、所定の表示を同梱する必要があります。

出典: Qwen/Qwen-Image-2.1・Qwen/Qwen-Image-2.1-PE-T2I・Qwen/Qwen-Image-2.1-PE-I2I のモデルカードとライセンス(2026-09-25 時点)。

当サイトの記録とデータ

当サイトが Qwen-Image-2.1 系統について公開した記事(3本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。

基本情報

項目 内容
元のモデル Qwen/Qwen-Image-2.1, Qwen/Qwen-Image-2.1-PE-T2I
公開元 Alibaba(Qwen)
ライセンス(モデルカード) other
記事数 3本

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

判定は Qwen/Qwen-Image-2.1-PE-I2I についてのものです。

配布ファイル

Qwen/Qwen-Image-2.1-PE-I2I で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
model-00001.safetensors 5.07GB
model-00002.safetensors 5.09GB
model-00003.safetensors 5.09GB
model-00004.safetensors 3.57GB

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-09-23 unsloth GGUF unsloth/Qwen-Image-2.1-GGUF Q3_K_XL 4.0GB(4GB VRAMで動作)
2026-09-23 unsloth FP8 unsloth/Qwen-Image-2.1-FP8 FP8 8.0GB(8GB VRAMで動作)

各リポジトリの量子化とファイルサイズ:

  • unsloth/Qwen-Image-2.1-GGUF の量子化: Q2_K 2.3GB / Q3_K_S 2.5GB / Q3_K_M 3.0GB / Q3_K_XL 3.4GB / Q4_K_S 3.6GB / Q4_K_M 3.9GB / Q5_K_S 4.2GB / Q5_K_M 5.0GB / Q6_K 5.8GB / Q6_K_XL 6.3GB / Q8_0 7.1GB / F16 13.3GB
  • unsloth/Qwen-Image-2.1-FP8 の量子化: FP8 6.6GB / INT8 6.8GB / FP8(Qwen-Image-2.1-text_encoder-FP8) 8.7GB

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。

記事(シリーズ自身のモデルを先に、新しい順)

公開日 モデル 種類 記事
2026-09-20 Qwen/Qwen-Image-2.1-PE-I2I 画像・動画・音声 画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応
2026-09-23 Viggle/Qwen-Image-2.1-viggle-turbo 画像・動画・音声 「Qwen-Image-2.1-viggle-turbo」4ステップの高速画像生成・編集モデル:必要VRAM 48GB〜
2026-09-21 abenzerps/Qwen-Image-2.1-Uncensored-GGUF 画像・動画・音声 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜

リポジトリ

最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。