「LongLive-Plug-Wan2.2-TI2V-5B-few-step」動画生成モデル:必要VRAM 24GB〜

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-few-step |
| 公開元のまとめ | Efficient Large Model(NVIDIA・MIT) のモデルとライセンスのまとめ |
| 公開日 | 2026-09-29 |
| ライセンス | apache-2.0 |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(HuggingFace公式リポジトリから直接取得) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
Efficient-Large-Model は、Wan-AI/Wan2.2-TI2V-5B をベースとした動画生成モデル向けに、極めて少ないステップ数での推論を可能にする Generator LoRA 「LongLive-Plug-Wan2.2-TI2V-5B-few-step」を公開しました。 この LoRA は、テキストまたは画像を入力として動画を出力する Text-to-Video および Image-to-Video のタスクに対応しており、わずか4ステップの非自己回帰(non-autoregressive)なフルシーケンス推論を実現します。
ベースモデルである Wan2.2-TI2V-5B は、720P解像度・24fpsの動画生成をサポートしており、現在利用可能な 720P@24fps モデルの中でも非常に高速な部類に入ります。 本リリースのチェックポイントは、16基のGPUを用いた dev/nonAR 実験における、イテレーション1500時点の学習済みモデルです。学習時には real_guidance_scale=3 が設定されています。なお、この蒸留された Generator は、推論時には CFG(Classifier-Free Guidance)を使用しない guidance_scale=1.0 の設定で検証されています。 公開されているファイルは、損失のない Generator のみの抽出です。元のチェックポイントには学習専用の Critic LoRA も含まれていますが、本リリースでは Generator LoRA のみが提供されています。
スペック
- ベースモデル:
Wan-AI/Wan2.2-TI2V-5B - アーキテクチャ: full-sequence non-AR
- 学習目的: DMD (Differentiable Diffusion Model) with backward simulation
- 学習時の Real Guidance Scale (RGS): 3
- チェックポイント識別子:
checkpoint_model_001500 - 学習時のワールドサイズ: 16
- LoRA Rank / Alpha: 128 / 128
- Generator LoRA パラメータ数: 322,437,120 (600個のFP32テンソル)
- 推論時のデノイジングステップ数: 4ステップ
- 推論時のCFGスケール: 1.0 (No CFG)
- ライセンス: Apache-2.0
得意なこと・想定用途
本モデルは、ベースモデルである Wan2.2-TI2V-5B の高度な動画生成能力を維持しながら、生成速度を劇的に向上させることに特化しています。主な用途は、テキストからの動画生成(Text-to-Video)および、静止画を元にした動画生成(Image-to-Video)の両方です。特に、本来は多くのステップを要する高品質な動画生成を、わずか4ステップの推論で完結させられる点が最大の利点です。
ベースモデルである Wan2.2 シリーズは、前バージョンの Wan2.1 と比較して学習データが大幅に拡充されています。具体的には画像データが 65.6% 増、動画データが 83.2% 増となっており、これにより複雑な動きの描写や、セマンティクス(意味的理解)、そして視覚的な美しさの面で汎用性が大きく向上しています。特に「シネマティックな美学」に注力して開発されており、ライティング、構図、コントラスト、色調といった詳細なラベルが付与されたデータセットで学習されています。そのため、ユーザーの好みに合わせた、より精密でコントロール可能な映画的なスタイルの動画生成を得意としています。
また、本モデルが採用している Wan2.2-VAE は、16×16×4 という高い圧縮率を実現しており、高品質な動画再構成を保ちながらも、効率的な生成を可能にしています。これにより、720P解像度(1280×704 または 704×1280)、24fpsの動画を生成することができます。本モデルは単一のフレームワーク内でテキストと画像の両方の入力をネイティブにサポートしているため、プロンプトによる指示と画像による構図指定を組み合わせた高度な制御が可能です。
この LoRA を適用することで、短時間で多数の試行錯誤を行いたいクリエイティブな用途や、リアルタイムに近いレスポンスが求められるアプリケーション、あるいは計算リソースを抑えつつ高品質な動画を得たい技術的な環境において、非常に強力なツールとなります。非自己回帰(non-AR)なフルシーケンス推論を採用しているため、生成プロセス全体の効率が最適化されています。
動作環境
動作環境の目安(Local Model Watch 算出)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4090 / 3090 など 24GB | そのままの精度 | 18.6GB | 22.4GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 この配布は LoRA 等のアダプタで、表は元モデル Wan-AI/Wan2.2-TI2V-5B を動かす要件です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
公開元の配布形式は safetensors です。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
配布ファイル
Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-few-step で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。
| ファイル | サイズ |
|---|---|
adapter_model.safetensors |
1.29GB |
generator_lora.pt |
1.29GB |
入手方法
本モデルの LoRA ウェイトおよび関連設定ファイルは、Hugging Face のリポジトリ Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-few-step から入手可能です。本リポジトリは、選別された学習チェックポイントのウェイト、設定ファイル、ランタイムソースコード、およびライセンス通知を保持しています。
配布されている主なファイルは以下の通りです。
– generator_lora.pt: LongLive ラッパーで使用するネイティブ形式のウェイト
– adapter_model.safetensors: 600個のテンソルを含む Safetensors 形式のウェイト
– adapter_config.json: PEFT の Rank/Alpha 設定を含む設定ファイル
– inference_config.yaml: 4ステップ推論および CFG なし(No-CFG)の設定を含む推論用設定ファイル
– training_config.yaml: 16基のGPUを用いた学習時の詳細な構成記録
– provenance.json: ソースファイルと公開ファイルのチェックサム記録
Python を使用してウェイトをダウンロードする場合は、以下のコードが利用できます。
from huggingface_hub import hf_hub_download
lora_path = hf_hub_download(
repo_id="Efficient-Large-Model/LongLive-Plug-Wan2.2-TI2V-5B-few-step",
filename="generator_lora.pt",
)
推論時には、以下の設定を厳守する必要があります。これらは本アダプター専用の設定であり、一般的な自己回帰モデル用のデフォルト設定は使用しないでください。
– サンプリングステップ数: 4
– 推論時の Guidance Scale: 1.0 (CFGなし)
– LoRA Rank / Alpha: 128 / 128
– generator_is_causal: false (非自己回帰設定)
本モデルは Apache-2.0 ライセンスの下で公開されており、商用・研究の両面で柔軟な利用が可能です。入手にあたって特別な同意プロセス(Gated)は必要ありません。
関連記事
- 「LongLive-Plug-Wan2.2-TI2V-5B-cfg」動画生成モデル:必要VRAM 24GB〜
- 「LongLive-Plug-Wan2.1-T2V-14B-cfg」動画生成モデル:必要VRAM 80GB〜
- 動画生成モデル「MiniMax-H3」向けLoRAアダプタ2種公開
- 「H3-to-LTX-Latent-Adapter」:必要VRAM 4GB〜・配布ファイル一覧
次に読むなら
- このモデルを入手できる形式を調べる → Safetensors形式の解説と対応モデル
- 公開元について調べる → Efficient Large Model(NVIDIA・MIT) のモデル・ライセンス・記事のまとめ
- 同じ用途の他のモデルを探す → 動画生成のモデル一覧

