画像生成モデル「abenzerps/Qwen-Image-2.1-Uncensored-GGUF」公開

作例は配布元のモデルカードで公開されています。
訂正(2026-09-22): 本記事の内容は、その後の確認で出典の内容と食い違うことが判明しました。出典のモデルIDが「Qwen-Image-2.1-GGUF」であり、記事の「Uncensored」表記と矛盾する
記事は経緯を残すため公開したままにしています。
基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | abenzerps/Qwen-Image-2.1-Uncensored-GGUF |
| 公開日 | 2026-09-21 |
| ライセンス | other |
| 配布形式 | GGUF / safetensors |
| 出典の種類 | 未確認(一次情報で裏付けできていない)(非公式のサードパーティ製量子化版であり、公式一次情報ではない) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
作例は配布元のモデルカードで公開されています。
概要
テキストからの画像生成および画像編集に対応するモデル「Qwen-Image-2.1」の量子化モデルリポジトリ abenzerps/Qwen-Image-2.1-Uncensored-GGUF が公開されたと報告されています。なお、本ニュースは公式な確認が取れていない未確認の情報となります。
本モデルは、テキストプロンプトから通常の画像や透過画像(RGBA)を生成する機能や、既存の画像に対する編集、被写体抽出を行う機能を備えたテキスト対画像・画像編集モデルです。元モデルである Qwen/Qwen-Image-2.1 のベース重みを元にGGUF形式へと量子化されたもので、セーフティチェッカーやコンテンツフィルターが除去されているとされています。ComfyUIおよびComfyUI-GGUFを用いたローカル環境での実行が想定されています。
スペック
資料および元モデルの公開情報に基づくスペックは以下の通りです。
- パラメータ数: ビジュアル生成コンポーネントにおいて7B(32 Single-Stream DiT層)
- アーキテクチャ: Single-Stream DiT(混合粒度アテンションおよびプレフィックスKVキャッシュ再利用構造)
- 出力の仕様:
- 通常画像生成およびアルファチャンネル付き透過画像(RGBA)の生成に対応 – 透過レイヤーの編集、写真からの被写体抽出、最大10枚の参照画像を使用した人物や製品のアイデンティティ保持編集に対応 – 局所編集機能(円指定、ペイント注釈、別個のマスク指定)に対応 – サポートするアスペクト比と解像度例: 1:1 (2048×2048)、4:3 (2400×1792)、3:4 (1792×2400)、3:2 (2528×1696)、2:3 (1696×2528)、16:9 (2752×1536)、9:16 (1536×2752)
- 推奨ステップ数: 元モデルのパイプライン設定において40ステップ(num_inference_steps=40)
- 配布形式: GGUF形式(Q8_0、Q6_K、Q5_K_M、Q4_K_M、Q4_0等の量子化タイプ)、safetensors形式(テキストエンコーダーおよびVAE)
- ライセンス条件: Qwen Research License
性能・品質
本モデルに関する性能や品質の情報は、公開元のモデルカードおよび元モデルである Qwen/Qwen-Image-2.1 の情報に基づいて報告されています。定量的なベンチマーク評価の数値は記載されていませんが、生成品質や挙動に関して以下の特徴が示されています。
元モデルの性能面では、軽量で効率的な構造でありながら高い生成品質を備えているとされています。特に画像内のテキスト描画(タイポグラフィ)の精度向上、ポートレートにおける適切なライティング表現、および細部のテクスチャ描画の精緻化が達成されていると主張されています。また、単一のモデルでありながら透過生成と編集が統合されており、背景透過の指示を含むプロンプトから直接アルファチャンネルを持つ画像を生成できる点や、最大10枚の参照画像を組み合わせても被写体の特徴を損なわずに編集・生成を行える点が品質上の強みとして挙げられています。
一方で、今回報告された量子化版「abenzerps/Qwen-Image-2.1-Uncensored-GGUF」においては、セーフティチェッカーやコンテンツフィルターが組み込まれていません。プロンプトの拒否や画像の黒塗り(ブラックアウト)処理を行うことなく、成人向け(NSFW)を含むセンシティブな表現を直接生成する挙動を示すと説明されています。出力される成果物の傾向や品質は、入力されたプロンプトや実行環境に全面的に依存するとされています。
得意なこと・想定用途
元モデルであるQwen/Qwen-Image-2.1の機能性に基づき、本モデルはテキストからの標準的な画像生成のみならず、多角的な視覚表現タスクに対応するよう設計されていると報告されています。具体的な得意分野および想定される用途は以下の通りです。
- 透過画像(RGBA)のネイティブ生成: プロンプトで背景が透明である旨を指定することにより、透過アルファチャンネルを含むイラストやステッカー素材などの画像を直接生成できます。
- 統一された画像編集と被写体抽出: 既存の画像に対する背景変更や局所的な修正、写真からの特定の被写体の抽出作業を単一のモデルで行うことができます。
- アイデンティティを維持した複数参照生成: 最大10枚までの参照画像をサポートしており、人物の顔や製品のデザインの特徴を損なうことなく、例えば複数枚の人物写真から1枚の集合写真を生成するといった高度な編集が可能です。
- 精緻な描写と文字描画: ネオンサインや看板などの画像内テキスト(タイポグラフィ)の正確な描画、人物ポートレートにおける適切なライティング表現、精密なテクスチャ描写を得意としています。
- 多様なアスペクト比での出力: 正方形(1:1、2048×2048)のほか、4:3、3:4、3:2、2:3、16:9(2752×1536)、9:16(1536×2752)など、多種多様な縦横比に対応しています。
また、abenzerps氏による今回のGGUF量子化版ではコンテンツフィルターが解除されているため、システムによるプロンプトの拒否や出力の黒塗りを回避して自由な創作を行いたいローカル環境の技術者・クリエイター向けに提供されているとされています。さらにGGUF形式への変換により、メモリ使用量を抑えたローカル環境での柔軟な実行が可能となっています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 7.1B(元モデル Qwen/Qwen-Image-2.1 の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4060 / 3060 Ti など 8GB | Q6_K | 5.5GB | 6.6GB |
| RTX 4070 / 3060 12GB など 12GB | Q8_0 | 7.1GB | 8.5GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
入手方法
本モデルの関連ファイルは、Hugging Faceのリポジトリ abenzerps/Qwen-Image-2.1-Uncensored-GGUF にて公開されています。ダウンロードにあたってライセンスの同意手続きは不要(gated: false)とされています。
生成を実行するには、ComfyUI および ComfyUI-GGUF の環境が必要です。
1. 必要なファイルのダウンロードと配置
リポジトリから以下のファイルをダウンロードし、ComfyUIの所定のディレクトリへ配置します。
- 拡散モデル(GGUF):
qwen-image-2.1-Q4_K_M.ggufなどのGGUF量子化ファイルを1つ選択し、ComfyUI/models/diffusion_models/に配置します。推奨量子化形式はバランスに優れるQ4_K_Mとされています。 - テキストエンコーダー:
qwen3vl_8b_bf16.safetensorsまたはメモリ節約型のqwen3vl_8b_int8_convrot.safetensorsをComfyUI/models/text_encoders/に配置します。 - VAE:
qwen_image_2.1_vae_bf16.safetensorsをComfyUI/models/vae/に配置します。
2. ComfyUIのセットアップとノード設定
Qwen-Image 2.1をネイティブサポートしている leejet 氏によるカスタムノードリポジトリを利用します。
cd ComfyUI/custom_nodes
git clone https://github.com/leejet/ComfyUI-GGUF
※旧バージョンの city96/ComfyUI-GGUF で「Unknown model architecture!」エラーが発生する場合は、上記 leejet 版へ更新するか、コンバートスクリプトに ModelQwenImage を追加する必要があると報告されています。
ComfyUI上のノード構築は以下のように設定します。
- 拡散モデルノード:
Unet Loader (GGUF)ノードを追加し、ダウンロードした.ggufファイルを選択します。 - テキストエンコーダーノード: 標準の
CLIPLoaderノードを追加し、qwen3vl_8b_bf16.safetensors(またはint8版)を選択します。このときtypeをqwen_imageに設定してください。 - VAEノード: 標準の
VAELoaderノードを追加し、qwen_image_2.1_vae_bf16.safetensorsを選択します。
Comfy-Orgが提供する公式ワークフローテンプレート(Text-to-Image または Image Edit 用)を利用する場合は、標準の UNETLoader ノードを Unet Loader (GGUF) ノードに置き換えることで利用可能です。
3. メモリの最適化設定
モデルカードでは、サンプリング中の生成速度を損なわずにメモリ効率を高めるための推奨設定が紹介されています。
- オフロード設定: GGUF拡散モデルをGPUのVRAMに保持しつつ、テキストエンコーダーをシステムRAM(CPU)に配置・オフロードする運用が推奨されています。テキストエンコーディング処理はプロンプトあたり1回のみ実行されるため、生成速度にほとんど影響を与えることなくVRAM使用量を大幅に削減できるとされています。
- 推奨構成: 拡散モデルに
qwen-image-2.1-Q4_K_M.gguf、テキストエンコーダーにqwen3vl_8b_int8_convrot.safetensorsを組み合わせる構成が挙げられています。 - Low VRAMモード: VRAM不足によるエラー(OOM)が発生する場合は、ComfyUIの起動引数に
--lowvramを指定して実行することが推奨されています。
関連記事
出典
- https://huggingface.co/abenzerps/Qwen-Image-2.1-Uncensored-GGUF
- https://huggingface.co/Qwen/Qwen-Image-2.1
更新履歴
- 2026-09-22: 出典との食い違いが判明し、冒頭に訂正注記を追記しました。
この記事は未確認情報を含みます。 公式の一次情報で裏が取れ次第、更新履歴を追記して反映します。

