音声付き動画生成モデル「FastH3 Trim」8ステップ版が公開

音声付き動画生成モデル「FastH3 Trim」8ステップ版が公開

基本情報

項目 内容
リポジトリ FastVideo/FastVideo-FastH3-Trim-8-Step-NVFP4
まとめページ MiniMax-H3 のまとめ(記事6本)
公開元のまとめ MiniMax のモデルとライセンスのまとめ
公開日 2026-10-03
ライセンス other
配布形式 safetensors
出典の種類 公開元の一次情報(FastVideo公式のHuggingFaceリポジトリが一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

FastVideoチームより、テキストから音声付きの動画を生成できる8ステップの動画生成モデル「FastH3 Trim」が公開されました。本モデルはBF16版の「FastVideo/FastVideo-FastH3-Trim-8-Step」に加え、量子化版として「FastVideo/FastVideo-FastH3-Trim-8-Step-NVFP4」および「FastVideo/FastVideo-FastH3-Trim-8-Step-FP8」のバリアントが同時に提供されています。

FastH3 Trimは、ベースモデルである「FastVideo/FastVideo-FastH3-8-Step-V2」をベースに、トランスフォーマーのブロック削減や軽量化を施した実験的な小型化モデルです。テキストを入力することで、同期した音声と動画をわずか8ステップの推論プロセスで生成します。ブロック削除により高速化と省サイズ化を図っている一方、品質面でのトレードオフが存在することが明示されています。

スペック

公開されたモデルカードから確認できる仕様は以下の通りです。

  • アーキテクチャ・構造:
  • MiniMax H3の50層あるトランスフォーマーブロックのうち、動画および音声の予測結果への影響が最も小さかった8ブロックを削除し、計42ブロックで構成されています。 – 各ブロックのAdaLNタイムステップ射影は、共有されたrank-16基底へと置き換えられています。 – 8ステップのDMD2(チェックポイント300)を用いて学習されています。
  • サンプリングおよび推論仕様:
  • DMDステップ数: 8ステップ(タイムステップ: 999, 874, 749, 624, 500, 375, 250, 125) – スパースアテンション: タイルの20%を維持する設定(80%のスパース性)が適用されます。 – 推論スケジュールは fastvideo_inference.json に保持されており、推論フレームワーク「FastVideo」から自動的に読み込まれます。
  • 構成コンポーネント:
  • テキストエンコーダー: H3が参照する50層にトリミングされたNVFP4形式のQwen3-VLを採用しています。 – VAE: Kijai氏によるINT8重みを適用した軽量ビデオVAE「LynnReal」と、H3 audio VAEを使用します。 – Diffusersパイプライン: MiniMaxH3ModularPipeline に対応しています。
  • 各バリアントの仕様:
  • BF16版 (FastVideo-FastH3-Trim-8-Step): トランスフォーマーのサイズは34.9 GiB(AdaLN係数はFP16)です。量子化リリースのソースやApple Silicon上のローカルMLX変換向けとされています。 – NVFP4版 (FastVideo-FastH3-Trim-8-Step-NVFP4): トランスフォーマーのサイズは11.1 GiBです。Attention、MLP、およびスパースアテンションのゲート線形層がNVFP4で構成され、全8ステップにわたる1,000プロンプトでキャリブレーションされた静的アクティベーションスケールを持ちます。RTX 5090、RTX PRO 6000、DGX Spark向けと案内されています。 – FP8版 (FastVideo-FastH3-Trim-8-Step-FP8): トランスフォーマーのサイズは19.9 GiBです。AttentionおよびMLPの線形層は出力チャネルごとに1スケールを持つFP8 E4M3で構成され、実行時にトークン単位でアクティベーションが量子化されます。RTX 4090での動作に対応し、レイヤーごとのオフロード(layerwise offload)により16 GBや12 GBの環境でも動作すると案内されています。
  • ライセンス:
  • ライセンス区分は other と指定されています(元モデルの記述ではMiniMax H3 Community Licenseを継承すると説明されています)。

性能・品質

モデルカードにおいてベンチマークスコアの数値一覧表などは掲載されていませんが、公開元より品質および生成挙動に関する特性がいくつか説明されています。

まず本モデル自体の特性として、トランスフォーマーブロックを削除したことによりモデルの小型化と高速化が達成されている反面、一定の品質低下が伴うと報告されています。そのため、公開元は生成品質を最優先とするユースケースでは、元モデルである完全品質版の「FastVideo-FastH3-8-Step-V2」を使用することを推奨しています。

また、元モデルであるFastH3-8-Step-V2の性能特性として、テキストからの音声付き動画生成(Text-to-Audio-Video)に特化して蒸留されており、参照画像や動画からの生成(FL2VAおよびRef2VA)は蒸留されていない点が挙げられています。ベースとなるオリジナルのMiniMax H3と比較した場合、複雑な動きや細かいディテール、一部の音声表現において品質が下回る場合がある旨が公開元より案内されています。

得意なこと・想定用途

FastH3 Trimは、テキストプロンプトからの音声同期動画生成(Text-to-Video)を、限られたハードウェアリソースや高速性が求められるローカル環境で実行することに特化しています。

本モデルの最大の強みは、トランスフォーマーブロックの剪定(50ブロック中8ブロック削除)と8ステップDMD2蒸留、スパースアテンションを組み合わせたことで実現された高い推論効率です。従来の多ステップ推論を要する動画生成モデルと比較してステップ数が大幅に削減されているため、迅速なプレビュー生成やプロトタイピング、手元のPC環境での実験的な動画・音声生成に適しています。

また、ユーザーの実行環境に応じた3種類のバリアントが用意されている点も大きな特徴です。

  • BF16版: Apple Silicon環境におけるローカルでのMLX変換や、独自の量子化処理を行いたい開発者向けのソースモデルとして適しています。
  • NVFP4版: NVIDIAのBlackwellアーキテクチャ(RTX 5090、RTX PRO 6000、DGX Sparkなど)を備えた環境向けに最適化されており、最先端のハードウェア性能を引き出した高速推論を狙う用途に向いています。
  • FP8版: RTX 4090をはじめとする既存のコンシューマ向けGPUでの実行に適しており、レイヤーごとのオフロード機能を併用することで、VRAM 16 GBや12 GBクラスのGPU環境でもローカル生成を試みる用途に対応しています。

なお、公開元から示されている通り、ブロック削除に伴う品質の低下があるため、商業制作など映像や音声の絶対的なクオリティを最優先とする場面では、フル品質版である「FastH3 V2」の利用が推奨されています。また、元モデルの蒸留範囲がテキスト入力に限定されているため、既存動画や参照画像をもとにした生成(FL2VAやRef2VA)を必要とするユースケースには適していません。

類似モデルとの違い

当サイトで過去に取り上げたMiniMax-H3関連モデルとの具体的な違いは以下の通りです。

過去に紹介した動画生成モデル「MiniMax-H3」向けLoRAアダプタ2種公開では、ベースモデルであるMiniMax-H3に対してCFG(分類器なしガイダンス)の蒸留や少ステップ化を付与するLoRAアダプターが提供されていました。これに対し、今回のFastH3 Trimはアダプター形式ではなく、モデル本体のトランスフォーマーブロックを物理的に削減したうえで蒸留学習を行ったスタンドアロンの軽量化モデルです。追加のアダプターをベースモデルに適用することなく、単体でコンパクトなモデルサイズと高速な8ステップ推論を実現している点が異なります。

また、「MiniMax-H3-Character-Swap-LoRA」動画生成モデル:配布ファイル一覧で取り上げたモデルは、既存の動画入力を受け取ってキャラクターを差し替えるVideo-to-Video(Ref2VA)タスクに特化した専用アダプターでした。対するFastH3 Trimは、テキストから同期音声付き動画を一から生成するText-to-Videoに特化しており、Ref2VAなどの機能は蒸留の対象外とされています。特定タスクのアダプター適用ではなく、基本となるテキストからの生成処理自体の実行負荷軽減と推論速度向上を狙っている点において、目的とアプローチが明確に分かれています。

配布ファイル

FastVideo/FastVideo-FastH3-Trim-8-Step で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
audio_vae/diffusion_pytorch_model.safetensors 605MB
text_encoder/model-*-of-00004.safetensors 16.46GB(4分割)
transformer/diffusion_pytorch_model-*-of-00008.safetensors 37.52GB(8分割)
vae/diffusion_pytorch_model.safetensors 4.23GB
vae/minimax_h3_video_vae_int8_convrot.safetensors 2.14GB

入手方法

各モデルの重みはHugging Faceにてsafetensors形式で公開されています。Gatedモデルではないため、事前の利用申請や同意手続きなしで直接ダウンロードできます。

利用目的に応じて以下のリポジトリから入手可能です。

  • BF16ソース重み: FastVideo/FastVideo-FastH3-Trim-8-Step
  • NVFP4量子化版: FastVideo/FastVideo-FastH3-Trim-8-Step-NVFP4
  • FP8量子化版: FastVideo/FastVideo-FastH3-Trim-8-Step-FP8

フレームワークとしてはDiffusers(パイプライン: MiniMaxH3ModularPipeline)に対応しているほか、開発元であるFastVideoのリポジトリを利用して推論を行うことができます。推論スケジュールは各リポジトリ内の fastvideo_inference.json に保存されており、FastVideoから自動的に読み込まれます。

FastVideoリポジトリを用いたセットアップ手順は以下の通り案内されています。

git clone https://github.com/hao-ai-lab/FastVideo.git
cd FastVideo
uv venv --python 3.12 --seed
source.venv/bin/activate
UV_TORCH_BACKEND=cu130 uv pip install \
  --no-sources-package fastvideo-kernel \
  -e ".[fasth3]"

推論を実行する際は、同梱のスクリプトを利用します。

python examples/inference/basic/basic_fasth3_8step.py \
  --prompt "your prompt" \
  --no-warmup \
  --repeats 1

なお、FP8版を16 GBや12 GBの環境で動作させる際にはレイヤーごとのオフロード(layerwise offload)の設定が必要となります。また、マルチGPU環境で動かす場合は、GPU数がMiniMax H3のアテンションヘッド数である56を割り切れる構成にする必要があると案内されています。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

ライセンスの都合で行っていない実測

このモデルのライセンス(other)の商用利用の条件を、当サイトが満たしていることを確認できていません。広告を掲載している当サイトでは、ライセンスの都合上、モデルを動かす実測(CPU での実行・回答・量子化の比較・変換・生成)は行っていません。

関連記事

次に読むなら

出典