高速画像生成・編集モデル「Viggle/Qwen-Image-2.1-viggle-turbo」公開

高速画像生成・編集モデル「Viggle/Qwen-Image-2.1-viggle-turbo」公開

基本情報

項目 内容
リポジトリ Viggle/Qwen-Image-2.1-viggle-turbo
公開日 2026-09-22
ライセンス other
配布形式 safetensors
出典の種類 公開元の一次情報(公式HuggingFaceリポジトリの一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Viggleは、Qwen/Qwen-Image-2.1をベースとした、蒸留モデル「Viggle/Qwen-Image-2.1-viggle-turbo」のv0.1 previewを公開しました。このモデルは、Distribution Matching Distillation (DMD) を用いて学習された「生徒」モデルであり、テキストからの画像生成(text-to-image)および、1〜3枚のリファレンス画像を用いた指示ベースの画像編集(instruction-driven editing)の両方に対応しています。

最大の特徴は、ベースモデルが40回のトランスフォーマー・パスを必要とするのに対し、わずか4回のパスで生成を完了できる点にあります。また、Classifier-Free Guidance (CFG) を使用しない設計となっています。

スペック

資料に記載されているスペックは以下の通りです。

モデルの構成

本リポジトリには、用途に応じて選択可能な2種類のモデルが含まれています。

  • transformer/: フルファインチューニングされたトランスフォーマー。ベースのトランスフォーマーを直接置き換える形式で、LoRAよりも編集の忠実度が高いことから、現在は本モデルが推奨されています。
  • Qwen-Image-2.1-viggle-turbo-4step-lora-r64.safetensors: LoRAアダプター(rank 64)。実行時にベースのトランスフォーマーの上にロードして使用します。ダウンロードサイズは小さいですが、フルファインチューニング版と比較するとわずかに性能が劣るとされています。

推論設定

  • 推論ステップ数: 4ステップ
  • CFGスケール: 1.0(CFGを使用しない)
  • ネガティブプロンプト: 使用しない

出力解像度

学習時の主要な解像度領域は以下の通りです。

ratio 1024² area (T2I + editing) 1536² area (editing) 2048² area (T2I)
1:1 1024 × 1024 1536 × 1536 2048 × 2048
4:3 1184 × 896 1760 × 1344 2368 × 1760
3:4 896 × 1184 1344 × 1760 1760 × 2368
16:9 1376 × 768 2048 × 1152 2720 × 1536
9:16 768 × 1376 1152 × 2048 1536 × 2720
3:2 1248 × 832 1888 × 1248 2496 × 1664
2:3 832 × 1248 1248 × 1888 1664 × 2496

ライセンス

  • ライセンス: other

性能・品質

本モデルは現在v0.1のプレビュー版であり、開発途上の段階(work in progress)であると報告されています。公開元は、現時点のウェイトはベースモデルの完全な置き換えではなく、プレビューとして扱うよう注意を促しています。

品質に関する評価

モデルカードによると、4ステップでのText-to-imageは実用可能なレベルに達しています。しかし、複雑な画像編集タスクにおいては、40ステップのベースモデルと比較して品質が明らかに劣る場面があることが報告されています。

具体的には、以下のようなケースで品質の低下が確認されています。

  • 複数のリファレンス画像を用いた合成、フェイススワップ、アイデンティティを維持する編集、あるいは複数の制約を含む指示といった複雑な編集タスク。
  • 複雑な編集において、人物が重複したり、ゴースト(残像)のような図形が現れたりすることがある。
  • 「すべてを同じに保つ」といった指示を与えた際に、アイデンティティのドリフト(対象の特徴が変化してしまう現象)が発生する。
  • 小さな、あるいは長いレンダリングされたテキストが、ベースモデルよりも頻繁に崩れることがある。

また、2K解像度での出力については、教師モデルに対する検証が行われていないことも明記されています。なお、現時点での評価は公開元による定性的なものに留まっており、定量的なベンチマークスコアは示されていません。

得意なこと・想定用途

本モデルは、テキストからの画像生成(text-to-image)および、1〜3枚のリファレンス画像を用いた画像編集(image editing)を得意としています。特に、指示に基づいた画像編集においては、リファレンス画像の順序によってプロンプト内の <image1><image2> がどの画像に対応するかを制御できる仕様となっています。また、出力のアスペクト比を指定しない場合、最後のリファレンス画像のアスペクト比に従います。

学習時の主要な領域として、テキストからの画像生成では1024²および2048²の面積、画像編集では1024²および1536²の面積が用いられています。これら以外のサイズでも動作可能ですが、学習データの多くはこれらの解像度に基づいています。

類似モデルとの違い

本モデルは、ベースモデルであるQwen-Image-2.1の機能を、大幅なステップ数削減(40ステップから4ステップへ)によって高速化することを目指した蒸留モデルです。過去に公開されたunsloth、画像生成モデル「Qwen-Image-2.1-FP8」公開unsloth、画像生成モデル「Qwen-Image-2.1」のGGUF版を公開といった量子化版は、主に推論の軽量化やメモリ節約を目的としていますが、今回のViggleによるモデルは、DMD(Distribution Matching Distillation)技術を用いて、生成プロセスそのものを極端に短縮することに特化しています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 7.1B(元モデル Qwen/Qwen-Image-2.1 の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 6000 Ada / A6000 など 48GB BF16 30.8GB 37.0GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 この配布は LoRA 等のアダプタで、表は元モデル Qwen/Qwen-Image-2.1 を動かす要件です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

入手方法

モデルは以下の形式で配布されています。

  • transformer/: フルファインチューニングされたトランスフォーマー(bf16形式のsafetensors)
  • Qwen-Image-2.1-viggle-turbo-4step-lora-r64.safetensors: LoRAアダプター(rank 64, bf16形式のsafetensors)
  • peft/: PEFT形式のアダプター(F32形式)

リポジトリは Hugging Face 上の Viggle/Qwen-Image-2.1-viggle-turbo で公開されています。

利用には diffusers ライブラリが必要ですが、現時点では QwenImage21Pipeline が正式リリース版に含まれていないため、特定のコミットハッシュを指定した git+https://github.com/huggingface/diffusers.git@80c7ed262aeffbeb43ef13ae04baeb9b84515a69 を用いたインストールが推奨されています。また、LoRAを使用する場合は peft ライブラリも必要です。

関連記事

出典