MiniMax-H3 まとめ:必要VRAM・GGUF版・配布ファイル
このモデルについて
MiniMax H3 は、MiniMax が公開した音声付きの動画を生成するモデルです。テキスト・画像・動画・音声を組み合わせた指示から、ネイティブのステレオ音声が付いた最長 15 秒の動画を作ります。効果音・環境音・劇伴・セリフを映像と一緒に生成できるのが最大の特徴で、セリフはアラビア語・中国語・英語・日本語など 11 言語に安定して対応するとしています。
システム全体は3つの部品でできています。指示を解釈して整える H3-Context-IR、音声付き動画を 768p で生成する H3-Base、その結果を 2K に描き直す H3-Regenerate-2K です。このうち重みが公開されたのは H3-Base だけです。
H3-Base の中核は 33B パラメータの Dense な Transformer(H3-Omni-Transformer)で、テキストの符号化には Qwen3-VL-32B の学習済みの重みを丸ごと使います。公開された重みは用途別の2つのチェックポイントです。
- FL2VA: テキストのみ、または最初と最後のフレームの画像(0〜2枚)から生成します。
- Ref2VA: 画像(9枚まで)・動画(3本まで)・音声(3本まで)を参照にして生成します。
何がすごいのか
- 映像と音声を1つのモデルで同時に作ります。 映像と音声の潜在をまとめて予測する単一ストリームの Transformer で、音声は 32 kHz のステレオです。映像を作ってから別のモデルで音を付ける必要がありません。
- 参照の渡し方が柔軟です。 Ref2VA は画像・動画・音声を合わせて最大 12 ファイルまで受け取れます。登場人物の見た目、声、既存の映像の続きなどを手がかりにできます。
- 出力の仕様が実用的です。 長さは 4〜15 秒、フレームレートは 24 FPS です。アスペクト比は 21:9 から 9:16 まで幅広く対応します。
- ファインチューニングにも使えます。 推論だけなら読み込まなくてよい AdaLN の部分(約 13B)も含め、重みを全て公開しています。
注意したい点・弱み
- 性能を示す数値がありません。 モデルカードには、他のモデルと比べたベンチマークや人手評価の表が無く、「複雑なマルチモーダルの指示に従う性能が高い」という説明は公開元の主張にとどまります。
- 手元で出せる品質は API と同じではありません。 モデルカードは、指示を整える H3-Context-IR が最終的な品質を大きく左右すると強調しています。しかしこの部品は公開されておらず、API で使うか、公開された書き方の手引きに沿って自前で指示を整える必要があります。2K への描き直しも API だけで、手元の出力は 768p までです。
- 疎なアテンションはまだ使えません。 学習では使っていますが、最初の公開では推論は全結合のアテンションだけに対応しており、長い動画ほど計算が重くなります。
手元で動かすときのポイント
- 大きな GPU、または部品を順に読み込むツールが前提です。 本体に加えて、テキストエンコーダ(Qwen3-VL-32B)と映像・音声の VAE が要ります。当サイトの必要メモリの表(このページの下)は、変換版の GGUF で本体・最小のテキストエンコーダ・VAE を全て同時に読み込む場合の合計です。ComfyUI のように部品を順に読み込むツールでは、これより少なく済むことがあります。
- 公開元が勧めるツールは SGLang・vLLM・diffusers・ComfyUI です。ComfyUI には、テキストからの生成(T2V)と参照からの生成(R2V)のワークフローのテンプレートがあります。SGLang の起動例は GPU 4基での並列実行です。
- 指示文は短く書くより、ショットの割り振り・音響・劇伴まで細かく書き分けた方が、公開元の事例に近い結果になります。
- ライセンスは「MiniMax H3 Community License」です。 適法な利用と利用の制限に関する義務があるとモデルカードは触れていますが、商用利用の可否などの具体的な条件は本文に書かれていません。使う前に原文を確認してください。
- このシリーズの記事には、個人の開発者が ComfyUI 向けにまとめたファインチューン(Minimax-h3_Singularity)も含まれます。重みが公式のモデルとは異なる別物です。
出典: MiniMaxAI/MiniMax-H3 のモデルカード(2026-09-26 時点)。
当サイトの記録とデータ
当サイトが MiniMax-H3 系統について公開した記事(2本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。
基本情報
| 項目 | 内容 |
|---|---|
| 元のモデル | MiniMaxAI/MiniMax-H3 |
| 公開元 | MiniMax |
| ライセンス(モデルカード) | apache-2.0、other |
| 最小のVRAM階層 | 32GB |
| 記事数 | 2本 |
動作環境
動作環境の目安(Local Model Watch 算出)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 5090 など 32GB | Q3_K_XL | 26.5GB | 31.8GB |
| RTX 6000 Ada / A6000 など 48GB | Q8_0 | 37.6GB | 45.1GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 unsloth/MiniMax-H3-GGUF の配布ファイルの実測値です。 生成モデルなので、ファイルサイズは本体に、同じリポジトリにある最小のテキストエンコーダ(qwen3vl_32b_minimax_h3-Q2_K_M、12.2GB)と VAE(minimax_h3_audio_vae_fp32(0.6GB)・minimax_h3_video_vae_fp16(4.9GB))を足した合計です(全部品を同時に読み込む場合)。ComfyUI のように部品を順に読み込むツールでは、これより少なく済むことがあります。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
公開元の配布形式は safetensors です。
ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。
配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
配布ファイル
MiniMaxAI/MiniMax-H3 で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。
| ファイル | サイズ |
|---|---|
audio_vae/diffusion_pytorch_model.safetensors |
605MB |
FL2VA/audio_vae/model.safetensors |
605MB |
FL2VA/text_encoder/model-*-of-00014.safetensors |
66.71GB(14分割) |
FL2VA/transformer/model-*-of-00013.safetensors |
66.28GB(13分割) |
FL2VA/video_vae/source/model.safetensors |
10.42GB |
Ref2VA/audio_vae/model.safetensors |
605MB |
Ref2VA/text_encoder/model-*-of-00014.safetensors |
66.71GB(14分割) |
Ref2VA/transformer/model-*-of-00013.safetensors |
66.28GB(13分割) |
Ref2VA/video_vae/source/model.safetensors |
10.42GB |
text_encoder/model-*-of-00014.safetensors |
66.71GB(14分割) |
transformer/diffusion_pytorch_model-*-of-00014.safetensors |
66.28GB(14分割) |
transformer_ref/diffusion_pytorch_model-*-of-00014.safetensors |
66.28GB(14分割) |
vae/diffusion_pytorch_model-*-of-00003.safetensors |
10.42GB(3分割) |
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-26 | unsloth | GGUF | unsloth/MiniMax-H3-GGUF | Q2_K 7.5GB(8GB VRAMで動作) |
各リポジトリの量子化とファイルサイズ:
- unsloth/MiniMax-H3-GGUF の量子化: Q2_K 6.2GB / Q2_K_XL 7.5GB / Q3_K 8.1GB / Q3_K_XL 8.9GB / Q4_K 10.6GB / Q2_K_M 12.2GB / Q5_0 12.9GB / Q6_K 15.4GB / Q4_K_M 17.0GB / Q8_0 19.9GB
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。
記事(シリーズ自身のモデルを先に、新しい順)
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-26 | MiniMaxAI/MiniMax-H3 | 画像・動画・音声 | 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧 |
| 2026-09-07 | WarmBloodAban/Minimax-h3_Singularity | 新モデル | 「Minimax-h3_Singularity」ComfyUIで動く動画生成モデル:必要VRAM 16GB〜 |
リポジトリ
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。