「LongLive-Plug-Wan2.2-TI2V-5B-cfg」動画生成モデル:必要VRAM 24GB〜

2026年9月30日

「LongLive-Plug-Wan2.2-TI2V-5B-cfg」動画生成モデル:必要VRAM 24GB〜

基本情報

項目 内容
リポジトリ Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-cfg
公開元のまとめ Efficient Large Model(NVIDIA・MIT) のモデルとライセンスのまとめ
公開日 2026-09-29
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(HuggingFace公式リポジトリから直接取得)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

テキストおよび画像から動画を生成するモデル「Wan2.2-TI2V-5B」に向けて、CFG(Classifier-Free Guidance)蒸留を施したLoRAアダプター「LongLive-Plug-Wan2.2-TI2V-5B-cfg」が公開されました。

本モデルは、ベースモデルの標準的なCFG=5による誘導フローを、生徒モデル側のCFG=1における1回の条件付きフォワードパスへと蒸留したアダプターです。デノイジングのステップごとに無条件(ネガティブ)分岐を計算する必要がなくなり、各ステップでDiT(Diffusion Transformer)のフォワード処理を1回のみに削減できます。なお、デノイジングスケジュールの蒸留は行われておらず、数ステップ生成を行うDMD(Distribution Matching Distillation)チェックポイントとは異なります。

スペック

モデルカードに記載されている仕様および推奨設定は以下の通りです。

  • パラメータ数: LoRAパラメータ数は161,218,560(FP32テンソル数: 600、ベースモデルは50億パラメータ規模の「Wan2.2-TI2V-5B」)
  • アーキテクチャ: トランスフォーマーの全30ブロックにまたがる300箇所のLinear層(各ブロックのself-attention q/k/v/o、cross-attention q/k/v/o、FFN 0/2)を対象としたPEFT LoRA(rank: 64、alpha: 64、dropout: 0.0)
  • 出力の仕様: 解像度1280×704(ベースモデル仕様として704×1280にも対応)、評価プロファイルでは121フレーム・24 FPS(元モデル仕様では5秒尺)
  • 推奨ステップ数・サンプラー: 50ステップ、FlowUniPCスケジューラ(timestep shift: 5.0)
  • 推奨ガイダンス・ウェイト設定: guidance_scaleは1.0(CFG=1)、LoRAウェイトスケールは1.0(学習時の整合スケール)
  • ライセンス条件: Apache-2.0ライセンスが適用されており、商用利用を含めて規定の許諾条件に従った利用が可能です

性能・品質

本アダプターの蒸留設計および推論設定に関して、公開元から以下の設定値が公開されています。

Setting Value
Teacher CFG scale used for distillation 5.0
Student CFG during training 1.0
Recommended inference CFG 1.0
Default LoRA weight scale 1.0
Teacher → student denoising steps 50 → 50
Scheduler / timestep shift FlowUniPC / 5.0
LoRA rank / alpha 64 / 64
Training checkpoint step 250

本手法では、固定された教師モデルの軌道状態に対して相対ガイダンス重み付けMSEを最小化する学習が行われており、ステップ数は元モデルと同じネイティブな50ステップを維持しています。学習時に生徒モデル自身によるロールアウト生成を行わない設計となっており、DMD criticなども含まれていません。無条件分岐の評価を省くことで計算負荷を抑えられる利点がある一方で、公開元はアーティファクトの完全性と実行された学習仕様を記録した研究用チェックポイントであるとしており、あらゆるプロンプトや下流モデルでの汎用的な品質を保証するものではないと言及しています。

なお、ベースとなっている「Wan2.2-TI2V-5B」自体の性能として、16×16×4(時間・縦・横方向で4×16×16)の圧縮率を持つWan2.2-VAEを採用しており、パッチ化層と合わせて4×32×32の総合圧縮を実現しています。元モデルの公表情報では、最適化を行わない状態でもコンシューマー向けGPU単体で5秒間の720P動画を9分未満で生成できる効率性を備えているとされています。

得意なこと・想定用途

本アダプターは、ベースモデルである「Wan2.2-TI2V-5B」の機能を維持しつつ、推論時の計算効率を向上させることを目的としています。具体的には、テキストからの動画生成(text-to-video)および画像からの動画生成(image-to-video)の両方のタスクにおいて、CFG(Classifier-Free Guidance)による誘導プロセスを効率化します。

従来のCFGを用いた推論では、各デノイジングステップにおいて「条件付き」と「無条件(ネガティブ)」の2回のフォワードパスが必要でしたが、本LoRAを適用して guidance_scale: 1.0 で実行することで、各ステップにつき1回の条件付きフォワードパスのみで動作させることが可能になります。これにより、生成品質の傾向を維持したまま、推論の計算コストを削減できることが期待されます。

動作環境

動作環境の目安(Local Model Watch 算出)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4090 / 3090 など 24GB そのままの精度 18.6GB 22.4GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 この配布は LoRA 等のアダプタで、表は元モデル Wan-AI/Wan2.2-TI2V-5B を動かす要件です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

配布ファイル

Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-cfg で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
adapter_model.safetensors 645MB
generator_lora.pt 645MB

入手方法

本モデルは、Hugging Faceのリポジトリから入手可能です。配布形式として、以下のファイルが提供されています。

  • adapter_model.safetensors: 安全でポータブルな形式のgenerator LoRA
  • generator_lora.pt: LongLiveのネイティブペイロード
  • adapter_config.json: PEFT設定および対象モジュール情報
  • training_config.yaml: 学習設定の詳細
  • inference_overrides.yaml: 推論用の設定(50ステップ、CFG=1)
  • release_metadata.json: メタデータ
  • provenance.json: 出所情報およびチェックサム
  • SHA256SUMS: アーティファクトのチェックサム

Hugging Faceの huggingface_hub ライブラリを使用して、以下のコマンドで generator_lora.pt をダウンロードできます。

from huggingface_hub import hf_hub_download

lora_path = hf_hub_download(
    repo_id="Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-cfg",
    filename="generator_lora.pt",
)
print(lora_path)

LongLiveの推論パスとして利用する際は、sampling_steps: 50、guidance_scale: 1.0、lora_weight_scale: 1.0 といった設定を用いることが推奨されています。

関連記事

次に読むなら

出典