動画生成モデル「MiniMax-H3」向けLoRAアダプタ2種公開

動画生成モデル「MiniMax-H3」向けLoRAアダプタ2種公開

基本情報

項目 内容
リポジトリ Efficient-Large-Model/LongLive-Plug-MiniMax-H3-cfg
まとめページ MiniMax-H3 のまとめ(記事4本)
公開元のまとめ Efficient Large Model(NVIDIA・MIT) のモデルとライセンスのまとめ
公開日 2026-09-29
ライセンス minimax-h3-community-license-agreement
配布形式 safetensors
出典の種類 公開元の一次情報(HuggingFace公式リポジトリが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

Efficient-Large-Modelチームにより、音声付き動画生成モデル「MiniMax-H3」向けのLoRAアダプタ2種がHugging Face上で公開されています。今回公開されたのは、分類器なしガイダンス(Classifier-Free Guidance: CFG)の蒸留を行い条件付き音声・動画生成を行う「Efficient-Large-Model/LongLive-Plug-MiniMax-H3-cfg」と、同期された音声付き動画をより高速かつ少ないステップで生成するための「Efficient-Large-Model/LongLive-Plug-MiniMax-H3-few-step」です。

いずれもアダプタモデルであり、動作には対応するベースモデルであるMiniMax-H3が必要となります。公開元によると、現時点ではこれら2つのLoRAアダプタを組み合わせて使用することは推奨されておらず、それぞれ個別に適用することが案内されています。

スペック

  • ライセンス: minimax-h3-community-license-agreement(license:otherとして登録)
  • 配布形式: safetensors(PEFTライブラリ対応)
  • 対象タスク: テキストから動画への生成(text-to-video)
  • ベースモデル: MiniMaxAI/MiniMax-H3

なお、元モデルであるMiniMax-H3の仕様および性能によれば、元モデルはテキスト、画像、動画、音声のマルチモーダルコンテキスト入力を受け付け、ネイティブのステレオ音声が付いた最長15秒・最大2K解像度の動画生成をサポートしています。出力フレーム率は24 FPSで、出力音声は32 kHzステレオとなっています。対応言語として、アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語の11言語が安定してサポートされています。

性能・品質

公開元によるモデルカード等の記載では、今回公開されたLoRAアダプタ自体のベンチマークスコアや定量的評価は示されていません。元モデルであるMiniMax-H3においては、H3-Baseによる768p解像度での生成結果や、H3-Regenerate-2Kを用いた2K解像度での高品質な出力が示されていますが、アダプタ適用時の詳細な性能比較については記載されていません。そのため、導入にあたっては実際の生成品質をご自身で検証していただく必要があります。

得意なこと・想定用途

今回公開された2種類のLoRAアダプタは、MiniMax-H3を用いた動画生成ワークフローを特定のニーズに合わせて最適化することに長けています。具体的には、生成速度の向上と推論プロセスの効率化という2つの側面で威力を発揮します。

「LongLive-Plug-MiniMax-H3-few-step」は、より少ないステップ数での動画生成を可能にします。元モデルであるMiniMax-H3は高品質な音声付き動画を生成できますが、計算コストが課題となる場合があります。このアダプタを使用することで、同期されたステレオ音声を保持したまま、生成時間を短縮できるため、プロトタイピングや大量の素材生成を行う用途に非常に向いています。

「LongLive-Plug-MiniMax-H3-cfg」は、分類器なしガイダンス(CFG)を条件付き推論のみに蒸留したモデルです。これにより、推論時に無条件推論のブランチを個別に計算する必要性を減らし、計算リソースの効率的な活用を支援します。特定の制約がある推論環境において、処理の簡略化を図りたい場合に適しています。

いずれのアダプタも、ベースモデルであるMiniMax-H3が持つ以下の強力な機能を前提とした用途に活用できます。
– 音声同期動画の生成: 映像とネイティブなステレオ音声が完全に同期した、最長15秒の動画制作。
– 多言語対応のコンテンツ制作: 日本語を含む11言語の対話シーンなど、音声と言語理解を組み合わせた生成。
– 多様な入力形式への対応: 最大9枚の画像、あるいは最大3つの動画・音声クリップを参照(Ref2VAモード)として取り込んだ、高度なコンテキスト制御。

類似モデルとの違い

当サイトで以前紹介した 「MiniMax-H3-Character-Swap-LoRA」動画生成モデル:配布ファイル一覧 は、動画内のキャラクターを特定の外見に差し替えるという「視覚的な編集」を目的としたサードパーティ製の実験的なモデルでした。これに対し、今回の2つのアダプタは生成プロセスそのもののアルゴリズム的効率化(ステップ数削減やCFG蒸留)を狙ったものであり、用途が根本的に異なります。

また、ベースモデルそのものを解説した 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧 では、汎用的なオムニモーダル生成の可能性について触れています。今回の「LongLive-Plug」シリーズは、そのベースモデルの機能を損なうことなく、特定の実行要件(速度や効率)に合わせて挙動を調整するための「機能特化型プラグイン」として位置づけられます。ベースモデル単体では重厚な処理が必要だった部分を、用途に応じて軽量化・最適化できる点が大きな違いです。

配布ファイル

Efficient-Large-Model/LongLive-Plug-MiniMax-H3-cfg で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
adapter_model.safetensors 2.77GB
sglang/adapter_model.safetensors 2.91GB

入手方法

各LoRAアダプタは、Hugging Faceの以下のリポジトリから safetensors 形式で入手可能です。

これらのモデルは peft ライブラリに対応しており、以下のツールやフレームワークでの利用が想定されています。なお、動作にはベースモデルである MiniMaxAI/MiniMax-H3 の重みが別途必要です。

対応ツールと導入方法

  • ComfyUI: 公式のワークフローテンプレート(T2V/R2V用)が提供されています。これらを利用することで、複雑なノード設定を簡略化して導入できます。
  • Diffusers: ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") を使用してベースモデルをロードした後、各LoRAを適用する形で利用できます。
  • SGLang / vLLM: 大規模な推論サービング環境での利用も案内されています。SGLangを使用する場合、以下のようなコマンドでモデルをサーブすることが例示されています。
sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --model-variant fl2va

利用上の注意点

公開元のドキュメントによると、現時点では cfg 版と few-step 版の2つのLoRAを同時に組み合わせて使用することは推奨されていません。それぞれの目的に応じて、個別に適用して使用してください。また、ライセンスは minimax-h3-community-license-agreement に準拠します。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス minimax-h3-community-license-agreement(商用利用不可): MiniMax の MiniMax H3 Community License です。ウェイトの利用を認める地域が EU・英国・韓国・米国に限られ、日本は対象外です(第II条・第V条4)。対象外の地域では個別の許諾が必要です。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

ライセンスの都合で行っていない実測

このモデルのライセンス(minimax-h3-community-license-agreement)は商用利用を認めていません。広告を掲載している当サイトでは、ライセンスの都合上、モデルを動かす実測(CPU での実行・回答・量子化の比較・変換・生成)は行っていません。

関連記事

次に読むなら

出典