「LongLive-Plug-Wan2.1-T2V-14B-cfg」動画生成モデル:必要VRAM 80GB〜

「LongLive-Plug-Wan2.1-T2V-14B-cfg」動画生成モデル:必要VRAM 80GB〜

基本情報

項目 内容
リポジトリ Efficient-Large-Model/LongLive-Plug-Wan2.1-T2V-14B-cfg
公開元のまとめ Efficient Large Model(NVIDIA・MIT) のモデルとライセンスのまとめ
公開日 2026-09-29
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(HuggingFace公式リポジトリが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

Efficient-Large-Modelは、Wan2.1-T2V-14B向けのLoRAアダプターである「LongLive-Plug-Wan2.1-T2V-14B-cfg」を公開しました。このアダプターは、Classifier-Free Guidance (CFG) を条件付きのみのビデオ生成へと蒸留(distillation)することを目的としています。これにより、推論プロセスにおいて別途、無条件(unconditional)の推論ブランチを実行する必要性が低減されます。なお、このアダプターは単体で数ステップの高速化を提供するものではなく、あくまでアダプターとして機能するため、使用には対応するベースモデルが必要となります。

スペック

  • ベースモデル: Wan-AI/Wan2.1-T2V-14B
  • アーキテクチャ: Video Diffusion DiT (Flow Matchingフレームワーク)
  • ベースモデルの仕様 (14B):

→ 横にスクロールできます

Model Dimension Input Dimension Output Dimension Feedforward Dimension Frequency Dimension Number of Heads Number of Layers
14B 5120 16 16 13824 256 40 40
  • 出力解像度: 480Pおよび720Pをサポート
  • 配布形式: safetensors (PEFT/LoRA)
  • ライセンス: apache-2.0
  • 推奨設定: 対応する few-step LoRA と組み合わせて使用することが推奨されています。推奨される重みの比率は few-step : CFG = 1 : 0.5 です。ただし、これはアダプターの重みの比率であり、推論時のCFGスケールそのものではありません。

性能・品質

本アダプターが対象とするベースモデルである Wan2.1-T2V-14B は、オープンソースおよび商用の最先端(SOTA)モデルを複数のベンチマークで上回る性能を持つと報告されています。モデルカードによれば、1,035個の内部プロンプトを用い、14の主要な次元と26のサブ次元にわたる評価が行われており、その結果、既存のモデルと比較して優れた性能を示すことが確認されています。

また、プロンプト拡張(Prompt Extension)を適用した際の手動評価においても、既存のオープンソースおよびクローズドソースのモデルより優れた結果が得られることが示されています。ベースモデルは、高品質なビジュアルと顕著な動きのダイナミクスを生成する能力に長けており、中国語と英語の両方のテキストを生成できる唯一のビデオモデルであることも特徴として挙げられています。

得意なこと・想定用途

本アダプターは、ベースモデルである Wan2.1-T2V-14B のビデオ生成プロセスにおいて、Classifier-Free Guidance (CFG) を条件付きのみの生成へと蒸留することを得意としています。これにより、推論時に無条件ブランチを別途実行する手間を省くことが可能です。

ベースモデルの Wan2.1-T2V-14B は、テキストからビデオを生成する text-to-video タスクにおいて、高品質なビジュアルとダイナミックな動きを生成することに長けています。また、ビデオ内に中国語と英語の両方のテキストを生成できる能力も備えています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 14.3B(元モデル Wan-AI/Wan2.1-T2V-14B の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
A100 / H100 80GB クラス F32 53.2GB 63.9GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 この配布は LoRA 等のアダプタで、表は元モデル Wan-AI/Wan2.1-T2V-14B を動かす要件です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

配布ファイル

Efficient-Large-Model/LongLive-Plug-Wan2.1-T2V-14B-cfg で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
adapter_model.safetensors 2.45GB
generator_lora.pt 2.45GB

入手方法

本アダプターは、以下のリポジトリから入手可能です。

  • リポジトリ: Efficient-Large-Model/LongLive-Plug-Wan2.1-T2V-14B-cfg
  • 配布形式: safetensors
  • 対応ライブラリ: peft

なお、本アダプターの使用には、対応するベースモデルである Wan-AI/Wan2.1-T2V-14B が必要です。また、公開元からは、これと組み合わせて使用するための few-step LoRA も公開されており、それらと併用することが推奨されています。

関連記事

次に読むなら

出典