音声付き動画生成モデル「FastH3 V2」のFP8およびNVFP4版公開

音声付き動画生成モデル「FastH3 V2」のFP8およびNVFP4版公開

基本情報

項目 内容
リポジトリ FastVideo/FastVideo-FastH3-8-Step-V2-NVFP4-Consumer
まとめページ MiniMax-H3 のまとめ(記事6本)
公開元のまとめ MiniMax のモデルとライセンスのまとめ
公開日 2026-10-06
ライセンス other
配布形式 safetensors
出典の種類 公開元の一次情報(公式リポジトリURLが一次情報として提示されているため)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

FastVideoチームより、音声付き動画生成モデル「FastH3 V2」の量子化版2種が公開されました。いずれもテキストを入力すると、同期した音声付きの動画を出力するモデルです。ベースとなる「FastVideo/FastVideo-FastH3-8-Step-V2」を、NVFP4形式に量子化したFastVideo-FastH3-8-Step-V2-NVFP4-Consumerと、FP8形式に量子化したFastVideo-FastH3-8-Step-V2-FP8が同時にHugging Face上で公開されています。いずれも8ステップでの蒸留済み推論に対応しており、手元の単一GPUでの実行を狙った配布です。

スペック

  • ベースモデルの規模: ベースとなるFastVideo-FastH3-8-Step-V2は13.9Bパラメータとされています。
  • アーキテクチャ: 両モデルともTransformer本体はFastH3 V2(50ブロック構成)。
  • NVFP4版: MLP線形層はベースのNVFP4量子化版であるFastVideo-FastH3-8-Step-V2-NVFP4から較正済みの重みとアクティベーションスケールを引き継いでおり、Attention射影層やスパースアテンションのゲートもNVFP4で保持されています。 – FP8版: AttentionとMLPの線形層をFP8 E4M3形式とし、出力チャネルごとに1つのスケールを持たせ、アクティベーションは実行時にトークン単位で量子化されます。それ以外の部分はBF16のままです。
  • テキストエンコーダ: 両モデルともNVFP4量子化されたQwen3-VLを、H3が読み込む50層分に絞って使用しています。FP8版ではFP4非対応GPU上でレイヤーごとに逆量子化されるとされています。
  • VAE: 動画用にLynnReal軽量版VAE(Kijai氏によるINT8重み)、音声用にH3のaudio VAEを使用しています。
  • サンプリング: fastvideo_inference.jsonに8ステップのDMDスケジュールが収録されており、FastVideoが自動的に読み込みます。
  • 想定GPU: NVFP4版はRTX 5090・RTX PRO 6000などBlackwell世代の単一GPU、またはDGX Sparkを想定。FP8版はFP4のテンソルコアを持たないRTX 4090・RTX 3090、および16GB・12GBクラスのメモリ帯を想定しているとされています。
  • ライセンス: 両モデルのリポジトリ上の表記は"other"ですが、ベースモデルはMiniMax H3 Community Licenseを継承するとされています。

性能・品質

ベースモデルのカードでは、本モデル(FastH3 V2)がdata-free DMD2とVSA-H3(80%スパース)を用いて学習されたstep-1300のチェックポイントであると説明されています。また、本チェックポイントの対応範囲について「text-to-audio-video生成をサポートするが、FL2VAおよびRef2VAは蒸留対象に含まれていない」こと、さらに「難しいモーション・細部の再現・一部の音声は、ベースとなるMiniMax H3本体の品質を下回る場合がある」と公開元自身が述べています。定量的なベンチマーク数値は今回の資料には示されていません。

得意なこと・想定用途

本モデル群は、テキストプロンプトを入力として、映像と同期した音声を同時に出力するテキストからの音声・動画生成(text-to-audio-video)を得意としています。わずか8ステップの少ない推論プロセスで完結できる点が大きな特徴であり、ローカル環境において短時間で音声付き動画を生成したい用途に適しています。

今回登場した2つの量子化モデルは、ユーザーの所有するハードウェア環境やメモリ帯に応じて使い分けができるように設計されています。

  • FastVideo-FastH3-8-Step-V2-NVFP4-Consumer: RTX 5090やRTX PRO 6000といったBlackwell世代の単一GPUや、DGX Sparkなどの環境でテキストからの動画・音声生成を行う用途に向いています。単一GPUで効率的に動作させるため、トランスフォーマーの50ブロック構造を保ちつつNVFP4形式に量子化・パッケージングされています。
  • FastVideo-FastH3-8-Step-V2-FP8: RTX 4090やRTX 3090など、FP4用のテンソルコアを持たない既存のGPU環境や、16GBおよび12GBといったメモリ帯での利用を想定しています。FP8精度への量子化によってメモリ消費を抑えつつ、ローカル環境での音声付き動画生成を可能にします。

なお、ベースモデルの仕様として、FL2VA(フレームから動画・音声への変換)やRef2VA(参照画像からの生成)は蒸留対象に含まれておらず、サポートされている機能はテキストからの生成に限られます。また、複雑なモーションや細かいディテールの描画、一部の音声の品質については、ベースとなるMiniMax H3本体と比較して低下している場合がある点に留意してください。

類似モデルとの違い

当サイトで以前紹介した音声付き動画生成モデル「FastH3 Trim」8ステップ版が公開で扱った「FastH3 Trim」は、FastH3 8-Step V2のトランスフォーマーにおける50個のブロックから、影響が小さかった8ブロックを取り除いて42ブロックへとレイヤー自体を削減することで高速化と省サイズ化を図った実験的モデルでした。これに対し、今回公開されたモデルは50ブロックの構造を維持したままNVFP4やFP8への量子化を適用しています。構造そのものを削ることなく、単一GPUや特定のメモリ帯での動作を目指したモデルという点でアプローチが異なります。

また、動画生成モデル「MiniMax-H3」向けLoRAアダプタ2種公開で取り上げたモデルは、MiniMax-H3のベースモデルに対して後から適用してCFG蒸留や高速化を行うLoRAアダプタでした。今回のモデルは、蒸留済みのモデル「FastVideo-FastH3-8-Step-V2」を直接量子化した単体で動くチェックポイントであり、別途アダプタを適用する必要がない点が異なります。

配布ファイル

FastVideo/FastVideo-FastH3-8-Step-V2-NVFP4-Consumer で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
audio_vae/diffusion_pytorch_model.safetensors 605MB
text_encoder/model-*-of-00004.safetensors 16.46GB(4分割)
transformer/diffusion_pytorch_model-*-of-00006.safetensors 27.71GB(6分割)
transformer/nvfp4_weights.safetensors 11.92GB
vae/diffusion_pytorch_model.safetensors 4.23GB
vae/minimax_h3_video_vae_int8_convrot.safetensors 2.14GB

入手方法

両モデルはHugging Face上からsafetensors形式で入手可能です。ダウンロードに際して利用規約への同意が必要なGatedモデルではありません。

実行にあたってはFastVideoリポジトリを利用します。まず uv を用いて必要なパッケージとVSA-H3アテンションカーネルをインストールします。

git clone https://github.com/hao-ai-lab/FastVideo.git
cd FastVideo
uv venv --python 3.12 --seed
source.venv/bin/activate
UV_TORCH_BACKEND=cu130 uv pip install \
  --no-sources-package fastvideo-kernel \
  -e ".[fasth3]"

インストール完了後、付属の推論スクリプトを用いて以下のように実行します。

python examples/inference/basic/basic_fasth3_8step.py \
  --prompt "your prompt" \
  --no-warmup \
  --repeats 1

推論時、8ステップのDMDサンプリングスケジュール(fastvideo_inference.json)がFastVideoによって自動的に読み込まれます。なお、その他のマルチGPU環境で実行する場合は、公式のガイドに従い --no-replicated-dit --vsa-kernel triton --no-fa4 オプションの追加が推奨されています。その際、使用するGPU数はH3のアテンションヘッド数(56個)を割り切れる数にする必要があります。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

ライセンスの都合で行っていない実測

このモデルのライセンス(other)の商用利用の条件を、当サイトが満たしていることを確認できていません。広告を掲載している当サイトでは、ライセンスの都合上、モデルを動かす実測(CPU での実行・回答・量子化の比較・変換・生成)は行っていません。

関連記事

次に読むなら

出典