「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧

2026年9月27日

「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧

作例は配布元のモデルカードで公開されています。

基本情報

項目 内容
リポジトリ MiniMaxAI/MiniMax-H3
まとめページ MiniMax-H3 のまとめ(記事2本)
公開元のまとめ MiniMax のモデルとライセンスのまとめ
公開日 2026-07-28
ライセンス other
配布形式 safetensors
出典の種類 公開元の一次情報(公式HFリポジトリの一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

MiniMax が、テキスト・画像・動画・音声を入力として受け取り、音声付きの動画を生成する MiniMax H3 の重みを Hugging Face で公開している。モデルカードは H3 を「汎用のオムニモーダル生成システム」と説明しており、ネイティブのステレオ音声が付いた最長15秒・最大2Kの動画を作れる。テキストだけから動画を作るほか、最初と最後のフレームの画像を指定する、参照用の画像・動画・音声を渡す、といった使い方ができる。

ただし、公開されたのはシステム全体のうち中核の生成モデル H3-Base だけである。入力の指示を解釈して整える H3-Context-IR と、2K へ描き直す H3-Regenerate-2K は今回の公開に含まれず、MiniMax の API として提供されている。手元で動かせるのは H3-Base による 768p の生成までになる。

スペック

  • 生成モデル(H3-Omni-Transformer): 33B パラメータの Dense で、単一ストリームの Transformer。このうち約 13B は AdaLN 関連の分岐にある。モデルカードによれば、AdaLN の出力は前もって計算してキャッシュできるので、推論だけに使う場合はこの部分の重みを読み込まなくてよい(ファインチューニングなどのため、重みは全て公開している)
  • 構造: アテンション層・FFN 層にはモダリティ別の構造が無く、モダリティごとのパラメータは入出力の層と AdaLN の分岐にだけある。位置の表現は時間・縦・横の3次元の MM-RoPE
  • テキストの符号化(H3-Encoder): Qwen3-VL-32B の学習済みの重みを丸ごと使い、その50層目の隠れ状態を生成モデルに渡す。H3 用の特殊トークンを足しているため、H3 のリポジトリに入っているトークナイザと設定ファイルを使う必要がある
  • 映像の VAE(H3-VisualVAE): 時間方向に因果的な動画オートエンコーダで、空間 16 倍・時間 4 倍に圧縮し、潜在のチャネル数は 24(f16t4d24)。さらに 1 × 2 × 2 のパッチにまとめるので、Transformer に入る時点では空間 32 倍・時間 4 倍の縮小になる。デコーダは ViT ベースで、別に学習している
  • 音声の VAE(H3-AudioVAE): 左右のチャネルを同じエンコーダ・デコーダで別々に処理してステレオを扱う。32 kHz の音声を、チャネルごとに 40 Hz の潜在の列へ圧縮する
  • 出力の仕様: 長さは 4〜15 秒、フレームレートは 24 FPS、音声は 32 kHz のステレオ。アスペクト比は 21:9・16:9・4:3・1:1・3:4・9:16 などに対応し、解像度は短辺 768 ピクセルが既定(2K は H3-Regenerate-2K を使う)
  • 対話の言語: アラビア語・中国語・英語・フランス語・ドイツ語・イタリア語・日本語・韓国語・ポルトガル語・ロシア語・スペイン語の11言語に安定して対応し、ほかの言語もある程度は扱えるという
  • 公開された重み: 用途別の2つのチェックポイントで、どちらも BF16。CFG を蒸留した重みになっている
  • H3-Base-FL2VA: テキストから音声付き動画(t2va)と、最初と最後のフレームからの生成(fl2va)。入力する画像は0〜2枚で、0枚ならテキストのみ、1枚なら最初または最後のフレーム、2枚なら両端のフレームを指定する – H3-Base-Ref2VA: 参照からの生成(ref2va)。画像は9枚まで、動画は3本まで(各2〜15秒、合計15秒以内)、音声も3本まで(各2〜15秒、合計15秒以内)、全部で12ファイルまで渡せる
  • 疎なアテンション: 学習の最終段階で導入しているが、最初の公開では推論は全結合のアテンションだけに対応している。疎なアテンションの実装は後日公開するとしている
  • ライセンスの条件: 「MiniMax H3 Community License」で配布されている。モデルカードはこのライセンスに、適法な利用と利用の制限に関する義務があることに触れている。商用利用の可否など具体的な条件はモデルカードの本文には書かれていないので、使う前にライセンスの原文を確認してほしい

性能・品質

モデルカードには、他のモデルと比べたベンチマークや人手評価の表は載っていない。載っているのは、同じ依頼(T2VA・FL2VA・Ref2VA の3例)を手元の H3-Base と MiniMax の API の両方で生成し、結果を見比べられるようにした再現用の事例である。各事例には、H3-Context-IR が整えた後の指示文と、H3-Base の 768p の出力、H3-Regenerate-2K の 2K の出力、API で直接生成した 2K・768p の参考の出力が並んでいる。

品質についてのモデルカードの説明は、「課題を一般化することを重視した設計のおかげで、事前学習の段階から幅広いマルチモーダルの文脈を理解・生成でき、複雑なマルチモーダルの指示に従う性能が高い」というものである。数値の裏付けは示されていないので、公開元の主張として受け取る必要がある。

また、モデルカードは H3-Context-IR が最終的な出力の品質を大きく左右すると強調している。入力の画像・音声・参照動画の関係や時間の流れを解釈し、足りない描写を補ったうえで H3-Base が理解しやすい構造化された指示に変える工程で、事例の指示文もショットの割り振り・音響・劇伴まで細かく書き分けられている。手元の H3-Base に短い指示をそのまま渡しても、API と同じ品質にはならないと考えてよい。

得意なこと・想定用途

タグには text-to-video・image-to-video・video-to-video・text-to-audio-video・reference-to-audio-video・synchronized-audio-video などが並び、映像と音声を同時に作ることが最大の特徴である。効果音・環境音・劇伴・セリフを映像と合わせて生成でき、事例でも「宇宙船の艦橋で艦隊がワープする場面」に、機関の唸りや衝撃音、オーケストラの劇伴を指定している。11言語の対話に安定して対応するので、日本語のセリフを含む短い動画にも使える。

使い分けは2つのチェックポイントで決まる。

  • 絵コンテのように最初と最後のフレームを決めて間をつなぎたい、あるいはテキストだけから作りたい場合は FL2VA
  • 登場人物の画像や、声・音楽の参照、既存の動画の続きのように、複数の素材を手がかりに作りたい場合は Ref2VA

2K で仕上げたい場合は、手元の H3-Base の 768p の出力を MiniMax の API の H3-Regenerate-2K に渡して描き直す「Full 2K Workflow」が案内されている。この場合、指示の解釈(H3-Context-IR)と 2K への描き直しは MiniMax 側で行われ、自動の内容審査(違法・性的・権利侵害のおそれがある内容の遮断)がかかる。

類似モデルとの違い

当サイトでは以前、H3 を元にした 「Minimax-h3_Singularity」ComfyUIで動く動画生成モデル:必要VRAM 16GB〜 を取り上げた。あちらは個人の開発者が、テキスト・画像・参照・動画からの生成を ComfyUI 上の1つのモデルで扱えるようにまとめ、刈り込み(プルーニング)と重みの調整を加えたファインチューンである。今回の記事は、その元になった MiniMax 公式の重みで、用途別の2つのチェックポイントに分かれている。

動作環境

動作環境の目安(Local Model Watch 算出)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 5090 など 32GB Q3_K_XL 26.5GB 31.8GB
RTX 6000 Ada / A6000 など 48GB Q8_0 37.6GB 45.1GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 unsloth/MiniMax-H3-GGUF の配布ファイルの実測値です。 生成モデルなので、ファイルサイズは本体に、同じリポジトリにある最小のテキストエンコーダ(qwen3vl_32b_minimax_h3-Q2_K_M、12.2GB)と VAE(minimax_h3_audio_vae_fp32(0.6GB)・minimax_h3_video_vae_fp16(4.9GB))を足した合計です(全部品を同時に読み込む場合)。ComfyUI のように部品を順に読み込むツールでは、これより少なく済むことがあります。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

配布ファイル

MiniMaxAI/MiniMax-H3 で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
audio_vae/diffusion_pytorch_model.safetensors 605MB
FL2VA/audio_vae/model.safetensors 605MB
FL2VA/text_encoder/model-*-of-00014.safetensors 66.71GB(14分割)
FL2VA/transformer/model-*-of-00013.safetensors 66.28GB(13分割)
FL2VA/video_vae/source/model.safetensors 10.42GB
Ref2VA/audio_vae/model.safetensors 605MB
Ref2VA/text_encoder/model-*-of-00014.safetensors 66.71GB(14分割)
Ref2VA/transformer/model-*-of-00013.safetensors 66.28GB(13分割)
Ref2VA/video_vae/source/model.safetensors 10.42GB
text_encoder/model-*-of-00014.safetensors 66.71GB(14分割)
transformer/diffusion_pytorch_model-*-of-00014.safetensors 66.28GB(14分割)
transformer_ref/diffusion_pytorch_model-*-of-00014.safetensors 66.28GB(14分割)
vae/diffusion_pytorch_model-*-of-00003.safetensors 10.42GB(3分割)

入手方法

  • 配布形式: Hugging Face の MiniMaxAI/MiniMax-H3 に、元の形式のチェックポイント(FL2VA/・Ref2VA/)と diffusers 形式が並んで置かれている。各チェックポイントには、生成モデルに加えてプロセッサ・トークナイザ・テキストエンコーダ・映像の VAE・音声の VAE が入っている。ダウンロードに利用規約への同意は要らない
  • 入手コマンド(SGLang・vLLM 向けに元の形式を取る場合):
  • 両方: hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3 – 片方だけ: hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3
  • diffusers で使う場合は手動のダウンロードは不要で、ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") が必要な部品だけを取得する
  • 対応するツール: モデルカードが勧めているのは SGLang・vLLM・diffusers・ComfyUI。ComfyUI には、参照からの生成(R2V)とテキストからの生成(T2V)のワークフローのテンプレートが用意されている
  • SGLang の起動例: sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --ulysses-degree 4 --performance-mode speed --model-variant fl2va(Ref2VA は --model-variant ref2va)。モデルカードの例は GPU 4基での並列実行を前提にしている
  • 指示文の書き方: H3-Context-IR を使わずに自前で指示を整える人向けに、モデルカードは基本用と参照用の2つのプロンプトの書き方の手引きと、指示文を改善するためのスキル集を公開している

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-09-26 unsloth GGUF unsloth/MiniMax-H3-GGUF Q2_K 7.5GB(8GB VRAMで動作)

各リポジトリの量子化とファイルサイズ:

  • unsloth/MiniMax-H3-GGUF の量子化: Q2_K 6.2GB / Q2_K_XL 7.5GB / Q3_K 8.1GB / Q3_K_XL 8.9GB / Q4_K 10.6GB / Q2_K_M 12.2GB / Q5_0 12.9GB / Q6_K 15.4GB / Q4_K_M 17.0GB / Q8_0 19.9GB

このほか、上記以外の投稿者による変換版が 49 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。

関連記事

次に読むなら

出典

更新履歴

  • 2026-09-26: 変換版を「派生版・量子化版」に追記しました: unsloth/MiniMax-H3-GGUF
  • 2026-09-26: 動作環境の表を unsloth/MiniMax-H3-GGUF の実ファイルサイズで更新しました。
  • 2026-09-26: タイトルを、記事で分かる内容(必要VRAM・配布ファイル等)を示す形に変更しました。