画像生成モデル「Qwen-Image-2.1」のGGUF量子化版公開、ComfyUIでの導入手順

作例は配布元のモデルカードで公開されています。
基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | abenzerps/Qwen-Image-2.1-GGUF |
| 公開日 | 2026-09-21 |
| ライセンス | other |
| 配布形式 | GGUF / safetensors |
| 出典の種類 | 公開元の一次情報(個人による非公式量子化版であり公式一次情報ではない) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
作例は配布元のモデルカードで公開されています。
概要
テキストからの画像生成や高度な画像編集に対応する最新モデル「Qwen-Image-2.1」のGGUF量子化版リポジトリ「abenzerps/Qwen-Image-2.1-GGUF」が公開されたと報告されています。なお、本ニュースは開発元などによる公式な確認が取れていない未確認の情報であり、サードパーティによる非公式な量子化版の公開とされています。本モデルは、テキストから通常の画像やアルファチャンネル付きの透過画像(RGBA)を生成する機能のほか、既存の画像に対する編集や被写体の抽出などをローカルPC環境で実行可能にすることを目指して配布されているとのことです。
スペック
公開された情報および元モデル「Qwen-Image-2.1」の仕様に基づくスペックは以下の通りです。
- パラメータ数: ビジュアル生成コンポーネントにおいて7B(70億パラメータ)
- アーキテクチャ: 32層のSingle-Stream DiT(混合粒度アテンションおよびプレフィックスKVキャッシュ再利用構造を採用)
- 出力の仕様:
- 通常の画像生成およびアルファチャンネル付き透過画像(RGBA)の生成に対応 – 透過レイヤーの編集、写真からの被写体抽出、最大10枚の参照画像を使用した編集に対応 – サポートされているアスペクト比と解像度: – 1:1 (2048 x 2048) – 4:3 (2400 x 1792) – 3:4 (1792 x 2400) – 3:2 (2528 x 1696) – 2:3 (1696 x 2528) – 16:9 (2752 x 1536) – 9:16 (1536 x 2752)
- 推奨設定:
- 推論ステップ数: 40ステップ(元モデルのクイックスタートより)
- ライセンス: Qwen Research License(商用利用などの詳細な条件はライセンス規約に準拠します)
性能・品質
元モデルである「Qwen-Image-2.1」の開発元による説明では、前世代から以下の4つの主要な改善が行われ、品質と効率が向上したと主張されています。
- コンパクトかつ効率的: 軽量なアーキテクチャ設計により、低い計算コストでありながら強力な画像品質を提供するとされています。
- ネイティブな透明度対応: テキストからのRGBA透過画像生成、透過レイヤーの編集、写真からの被写体抽出を単一のモデルで統合的に処理できる点が特徴です。
- 多才な編集機能: 最大10枚の参照画像をサポートし、円指定、描画アノテーション、独立したマスクによるローカル編集が可能です。人物や製品のアイデンティティを維持した編集が行えるとされています。
- リアルな質感と洗練された美学: タイポグラフィ(文字レンダリング)、ポートレートのライティング、および微細なディテールが改善され、より視覚的に魅力的な結果が得られると報告されています。
また、今回公開されたGGUF量子化版リポジトリのモデルカードによると、本リリースは「Uncensored(検閲なし)」仕様として調整されていると報告されています。組み込みのセーフティチェッカーやコンテンツフィルターが搭載されておらず、プロンプトの拒否や出力画像のブラックアウトを伴わずに、成人向けコンテンツ(NSFW)やセンシティブな画像を直接生成することが可能であるとされています。そのため、出力される挙動は入力するプロンプトや実行環境に完全に依存すると説明されています。
なお、GGUF版の動作の安定性に関して、Q8_0量子化(qwen-image-2.1-Q8_0.gguf)ではGPUやComfyUIの環境によって形状不一致エラー([136] vs [128])が発生する場合があると報告されています。そのため、安定した動作を求めるユーザーに対しては、Q4_K_M、Q5_K_M、またはQ6_Kの各量子化バージョンの使用が推奨されています。
得意なこと・想定用途
元モデル「Qwen-Image-2.1」の仕様に基づき、本モデルが得意とする用途は多岐にわたるとされています。
具体的には、テキストプロンプトからの高品質な画像生成に加え、アルファチャンネルを含んだ透過画像(RGBA)のネイティブ生成が挙げられます。また、透過レイヤーを活かした画像編集や、写真からの被写体抽出(背景透過処理)といった作業にも適していると説明されています。
さらに、最大10枚までの参照画像をサポートしており、人物や製品のアイデンティティ(特徴)を維持したままでの画像編集が可能です。編集時には、円による範囲指定、手書きのアノテーション、個別のマスク画像を用いたローカル編集(部分編集)に対応しているため、ピンポイントな修正作業に向いているとされています。
テキストレンダリング(タイポグラフィ)の精度も向上しており、画像内への文字入れや、ポートレートにおけるライティング、微細なディテールの表現においても高い品質を発揮すると報告されています。
本GGUF版においては、組み込みのセーフティフィルターが適用されない「検閲なし(Uncensored)」の挙動を示すとされているため、プロンプトの拒否や出力のブラックアウトを回避し、成人向けコンテンツ(NSFW)を含むセンシティブな画像を直接生成したい用途にも適しているとされています。
類似モデルとの違い
関連する過去の記事として、画像生成モデル「abenzerps/Qwen-Image-2.1-Uncensored-GGUF」公開が挙げられます。前回の記事で紹介されたモデルと同様に、今回のリポジトリ「abenzerps/Qwen-Image-2.1-GGUF」で配布されているモデルも、実質的に検閲なし(Uncensored)の特性を備えていると説明されています。今回のリポジトリにおける最大の違いは、GGUF形式のトランスフォーマーモデルだけでなく、動作に必要なテキストエンコーダーやVAEといったコンパニオンファイルがすべて同一リポジトリ内にパッケージ化されて提供されている点です。これにより、ユーザーは複数の場所からファイルを個別に探す手間を省き、ComfyUI環境への導入をよりスムーズに行えるようになっているとされています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 7.1B(元モデル Qwen/Qwen-Image-2.1 の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4060 / 3060 Ti など 8GB | Q6_K | 5.5GB | 6.6GB |
| RTX 4070 / 3060 12GB など 12GB | Q8_0 | 7.1GB | 8.5GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
入手方法
本モデルおよび関連ファイルは、Hugging Faceのリポジトリから入手可能とされています。配布形式はGGUFおよびsafetensors形式です。
ComfyUIおよび拡張機能の「ComfyUI-GGUF」を組み合わせることで、ローカル環境で動作させることができるとされています。
ファイルの配置
ダウンロードしたファイルを、ComfyUIの以下のディレクトリ構造に従って配置します。
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen-image-2.1-Q4_K_M.gguf # GGUF量子化モデル(Q4_K_M推奨)
├── text_encoders/
│ └── qwen3vl_8b_bf16.safetensors # テキストエンコーダー(メモリ節約にはint8版を推奨)
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors # VAEファイル
ComfyUIのセットアップ
-
ComfyUI-GGUFの更新・インストール
Qwen-Image 2.1をネイティブサポートしているleejet/ComfyUI-GGUFリポジトリを、ComfyUIのcustom_nodesディレクトリにクローンします。bash cd ComfyUI/custom_nodes git clone https://github.com/leejet/ComfyUI-GGUF※古いcity96/ComfyUI-GGUFを使用していて「Unknown model architecture!」というエラーが発生する場合は、上記のleejet版にアップデートするか、変換スクリプトにModelQwenImageを追加する必要があるとされています。 -
ノードの構成
– Diffusion Model:Unet Loader (GGUF)ノードを追加し、ダウンロードしたGGUFファイルを選択します。 – Text Encoder: 標準のCLIPLoaderノードを追加し、テキストエンコーダー(qwen3vl_8b_bf16.safetensorsまたはint8版)を選択した上で、typeをqwen_imageに設定します。 – VAE: 標準のVAELoaderノードを追加し、qwen_image_2.1_vae_bf16.safetensorsを選択します。 -
ワークフローの適用
Comfy-Orgが提供する公式のワークフローテンプレート(Text-to-Image用、またはImage Edit用)をベースとして使用できます。ワークフロー内のデフォルトのUNETLoaderノードを、Unet Loader (GGUF)に置き換えることで動作させることができるとされています。
推奨の動作設定
サンプリング中の速度に直結するGGUF形式のDiffusionモデル本体はGPUのVRAM上に保持し、プロンプト処理時に1度だけ実行されるテキストエンコーダーはシステムRAM(CPU)にオフロードする構成が推奨されています。これにより、生成速度への影響をほぼ受けることなく、VRAMの消費を大幅に抑えることができると報告されています。また、VRAM容量が不足してエラーが発生する場合は、ComfyUIの起動引数に --lowvram を追加することが推奨されています。
関連記事
出典
更新履歴
- 2026-09-22: 公式の一次情報で内容を確認しました。出典にGGUF形式のQwen-Image-2.1モデルが存在し、記事の主張と一致する

