「LongLive-Plug-Wan2.1-T2V-14B-few-step」動画生成モデル:必要VRAM 80GB〜

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | Efficient-Large-Model/LongLive-Plug-Wan2.1-T2V-14B-few-step |
| 公開元のまとめ | Efficient Large Model(NVIDIA・MIT) のモデルとライセンスのまとめ |
| 公開日 | 2026-09-30 |
| ライセンス | apache-2.0 |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(HuggingFace公式リポジトリが一次情報として直接確認可能) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
Efficient-Large-Modelは、Wan-AI/Wan2.1-T2V-14Bをベースモデルとして使用する、動画生成の高速化を目的としたLoRAアダプター「LongLive-Plug-Wan2.1-T2V-14B-few-step」を公開しました。このモデルは、テキストから動画を生成する(text-to-video)プロセスにおいて、より少ないステップ数での生成を可能にするために設計されています。本モデルはアダプターとして機能するため、動作させるには対応するベースモデルが必要となります。また、使用にあたっては、対応する「CFG LoRA」(LongLive-Plug-Wan2.1-T2V-14B-cfg)との併用が推奨されています。
スペック
本モデルは、以下の仕様を持つベースモデルを対象としています。
- ベースモデル:
Wan-AI/Wan2.1-T2V-14B - アーキテクチャ: Video Diffusion DiT (Flow Matchingフレームワーク)
- ベースモデル(14B)のアーキテクチャ詳細:
- Dimension: 5120 – Input Dimension: 16 – Output Dimension: 16 – Feedforward Dimension: 13824 – Frequency Dimension: 256 – Number of Heads: 40 – Number of Layers: 40
- 推奨設定:
few-stepとCFGの重みの比率を1 : 0.5に設定することが推奨されています。なお、これは推論時のCFGスケールではなく、アダプターの重みの比率を指します。
- ライセンス:
apache-2.0
性能・品質
本アダプターの基盤となるベースモデル「Wan2.1-T2V-14B」は、オープンソースおよび商用モデルの双方において、新たなSOTA(State-of-the-Art)性能のベンチマークを確立するモデルであると報告されています。
ベースモデルのアーキテクチャに関する詳細な構成は以下の通りです。
→ 横にスクロールできます
| Model | Dimension | Input Dimension | Output Dimension | Feedforward Dimension | Frequency Dimension | Number of Heads | Number of Layers |
|---|---|---|---|---|---|---|---|
| 14B | 5120 | 16 | 16 | 13824 | 256 | 40 | 40 |
公開元による評価では、1,035個の内部プロンプトを用いたテストにおいて、14の主要な次元および26のサブ次元にわたる多角的な検証が行われています。これらの結果は、人間の好みに基づいた重み付けを用いた計算によって算出されており、既存のモデルと比較して優れた性能を示すことが確認されています。
また、ベースモデルの品質を支える技術として、以下の特徴が挙げられています。
- 高品質なビジュアルと動きのダイナミクス: 高品質なビジュアルと、大幅な動きのダイナミクスを伴う動画の生成が可能です。
- 高度なテキスト生成: 中国語と英語の両方のテキストを動画内に生成できる、初のビデオモデルとされています。
- 高性能なビデオVAE: 独自の「
Wan-VAE」を採用しており、任意の長さの1080P動画を時間的な情報を保持したまま、効率的にエンコードおよびデコードすることが可能です。 - 解像度の柔軟性: 480Pおよび720Pの両方の解像度での動画生成をサポートしています。
本アダプター「LongLive-Plug-Wan2.1-T2V-14B-few-step」は、これらの強力なベースモデルに対して蒸留(distillation)技術を適用することで、生成ステップ数の削減による効率化を実現しています。
得意なこと・想定用途
本モデルは、テキストから動画を生成するタスク(text-to-video)において、ベースモデル「Wan-AI/Wan2.1-T2V-14B」の性能を維持しながら、より少ないステップ数で高速な動画生成を行うことを得意としています。PEFTやLoRA、蒸留(distillation)技術を活用したアダプターとして設計されており、対応する「CFG LoRA」と組み合わせて使用することを想定しています。なお、ベースモデル側が持つ中国語と英語の両方のテキスト生成能力や、高い動きのダイナミクスを持つビジュアル表現、および480Pや720Pの解像度を活かした動画生成の効率化に貢献します。
類似モデルとの違い
当サイトですでに紹介している「LongLive-Plug-Wan2.1-T2V-14B-cfg」がClassifier-Free Guidance (CFG) の条件付きのみのビデオ generation への蒸留を行い、無条件の推論ブランチの実行を低減することを目的としているのに対し、今回の「LongLive-Plug-Wan2.1-T2V-14B-few-step」は、より少ないステップ数での動画生成を実現するためのLoRAアダプターとして機能する点が異なります。両者は同じベースモデルであるWan-AI/Wan2.1-T2V-14Bを対象としており、few-step用とCFG用のアダプター重みを 1 : 0.5 の比率で併用することが推奨されています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 14.3B(元モデル Wan-AI/Wan2.1-T2V-14B の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| A100 / H100 80GB クラス | F32 | 53.2GB | 63.9GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 この配布は LoRA 等のアダプタで、表は元モデル Wan-AI/Wan2.1-T2V-14B を動かす要件です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
公開元の配布形式は safetensors です。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
配布ファイル
Efficient-Large-Model/LongLive-Plug-Wan2.1-T2V-14B-few-step で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。
| ファイル | サイズ |
|---|---|
generator_lora_lightx2v.safetensors |
1.23GB |
training_checkpoint/model.pt |
4.91GB |
入手方法
Hugging Faceの公式リポジトリから入手可能です。PEFTライブラリに対応するLoRAアダプターウェイトとして配布されており、対応するベースモデルやCFG LoRAと組み合わせて利用します。
- リポジトリ: Efficient-Large-Model/LongLive-Plug-Wan2.1-T2V-14B-few-step
- 配布形式:
safetensors
関連記事
- 「LongLive-Plug-Wan2.1-T2V-14B-cfg」動画生成モデル:必要VRAM 80GB〜
- 動画生成モデル「MiniMax-H3」向けLoRAアダプタ2種公開
- 「LongLive-Plug-Wan2.2-TI2V-5B-cfg」動画生成モデル:必要VRAM 24GB〜
- 「LongLive-Plug-Wan2.2-TI2V-5B-few-step」動画生成モデル:必要VRAM 24GB〜
次に読むなら
- このモデルを入手できる形式を調べる → Safetensors形式の解説と対応モデル
- 公開元について調べる → Efficient Large Model(NVIDIA・MIT) のモデル・ライセンス・記事のまとめ
- 同じ用途の他のモデルを探す → 動画生成のモデル一覧
