「MiniMax-H3-Character-Swap-LoRA」動画生成モデル:配布ファイル一覧

「MiniMax-H3-Character-Swap-LoRA」動画生成モデル:配布ファイル一覧

基本情報

項目 内容
リポジトリ akatz-ai/MiniMax-H3-Character-Swap-LoRA
まとめページ MiniMax-H3 のまとめ(記事3本)
公開元のまとめ MiniMax のモデルとライセンスのまとめ
公開日 2026-09-25
ライセンス other
配布形式 safetensors
出典の種類 未確認(一次情報で裏付けできていない)(非公式のサードパーティ製LoRAであり、一次情報の裏付けなし)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Akatz Labsが開発した、動画生成モデル「MiniMax H3」向けのキャラクター差し替えLoRAアダプター「akatz-ai/MiniMax-H3-Character-Swap-LoRA」がHugging Face上で公開されたと報告されている。なお、本情報は公式に確認が取れていない未確認の情報である点に注意されたい。

本モデルは、元の動画(Video-to-Video / Ref2VA)を入力とし、参照画像をもとに元シーンの背景や照明、カメラワークを保持しながら特定のキャラクターのみを差し替える実験的なLoRAとされる。最終段階である1,000ステップ(1,000 updates)のチェックポイントファイルのみが提供されており、単体で動作するモデルではなく、ベースモデルに対して強度1.0で適用するモデル専用のLoRAアダプターとして配布されている。

スペック

モデルカードから確認できる仕様および学習構成は以下の通りである。

  • ベースモデル:Comfy-Org/MiniMax-H3(minimax_h3_ref2va_pruned_int8_convrot.safetensors)および ostris/minimax_h3_training_adapter(アシスタントおよびベースの重みは本アダプターに含まれない)
  • アダプター形式:LoRA(単体モデルやTurbo蒸留LoRAではない)
  • 学習ステップ数:1,000 updates(250 updatesごとにチェックポイント保存)
  • LoRA rank / alpha:16 / 16(adaln_proj を除く)
  • オプティマイザ / 学習率:AdamW8bit / 5e-5
  • 精度の記録:BF16、convrot8 transformer、NVFP4 text encoder
  • バッチサイズ / 累積:1 / 1
  • 解像度・エリア予算:編集ターゲットのエリア予算 1024(1344×768バケット)、動画正則化のエリア予算 384
  • 正則化動画の仕様:73フレーム、24 fps(約3.04秒)
  • 学習ハードウェア:RunPod RTX PRO 4500 Blackwell, 32 GB
  • 推奨設定:LoRA強度 1.0、トリガーワードは不要(プロンプト内で対象人物と差し替え指示を記述)
  • ライセンス:other

性能・品質

本モデルの学習設定および記録について、公開元のモデルカードには以下の表が掲載されている。

Setting Recorded value
Updates / saves 1,000 / every 250 updates
Hardware RunPod RTX PRO 4500 Blackwell, 32 GB
LoRA rank / alpha 16 / 16, excluding adaln_proj
Optimizer / learning rate AdamW8bit / 5e-5
Batch / accumulation 1 / 1
Precision BF16, convrot8 transformer, NVFP4 text encoder
Edit target resolution Area budget 1024; 1344×768 buckets
Video regularization resolution Reduced area budget 384
Regularization duration 73 frames at 24 fps, approximately 3.04 seconds
Memory measures Gradient checkpointing, layer offload, cached latents/text, chunked MLP
Sampling during training Disabled

公開元が実施したローカルのサイドバイサイド評価によれば、ベースモデル単体での生成と比較して、元動画のシーンや背景構造をより忠実に保持できる点が優れているとされる。特に約4〜5秒程度の短尺で連続したショットにおいて有望な結果を示したと報告されている。

一方で、生成時間が長くなると構図や配置、元動画のタイミングからのズレ(ドリフト)が発生しやすく、明確なカット転換(ハードカット)が徐々に移動するズームや位置変化に化けてしまう問題点が挙げられている。さらに、顔のアップ時における表情が元の演技と一致しない場合があり、複数キャラクターの同時差し替えについても学習データで監督されていないため精度が保証されないと公表されている。音声生成に関しても、継続テストにおいて音声のスキップや位置ズレが発生することが確認されている。

得意なこと・想定用途

本モデルは、入力された動画内の特定人物を参照画像やキャラクターシートのキャラクターへと置き換える、Video-to-Video(Ref2VA)におけるキャラクター差し替えタスクに特化して開発されている。元動画の背景や照明、カメラワーク、他の登場人物、小物などの環境を可能な限り維持しながら、指定したターゲット人物の動きやポーズ、位置関係に合わせて、参照画像内のキャラクターの見た目や衣装、画風を適用する用途に適している。

実写風やアニメ調などスタイルを跨いだ置換(クロススタイル)や、さまざまな形式のキャラクターシートからの差し替えに対応する。特に約4〜5秒程度の短尺かつカメラ切り替えのない連続したショットで良好な変換結果を得やすいとされる。

一方で、1回の生成で複数人のキャラクターを同時に差し替える処理は学習ターゲットとして監督されていないため推奨されない。また、激しいカット切り替えを含む動画や、口元の繊細な演技・表情の完全な再現を求める用途には限界がある点に留意して利用する必要がある。

類似モデルとの違い

当サイトで以前に取り上げた 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧 は、テキストや画像、音声入力から高精細な動画と音声を同時生成する汎用のオムニモーダル基盤モデルであり、単体でシステムとして完結している。また、「Minimax-h3_Singularity」ComfyUIで動く動画生成モデル:必要VRAM 16GB〜 は、MiniMax-H3の各種ワークフロー(T2V, I2V, Ref2V, V2V)をComfyUI向けに統合・最適化したファインチューニング済みモデルである。

これらに対して、今回報告された「akatz-ai/MiniMax-H3-Character-Swap-LoRA」は、単体で動作する生成モデルではなく、ベースモデルである Comfy-Org/MiniMax-H3 上に適用して特定の人物差し替え機能を加える追加アダプター(LoRA)である点が決定的に異なる。ベースモデル単体のRef2VA機能と比較して背景やシーンの保持性能が高められている反面、キャラクター置換に特化した1,000ステップの実験的なツールという位置づけになっている。

配布ファイル

akatz-ai/MiniMax-H3-Character-Swap-LoRA で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
h3_character_swap_pro4500_1000.safetensors 155MB

入手方法

本LoRAモデルは safetensors 形式(h3_character_swap_pro4500_1000.safetensors)で配布されており、Hugging Faceのリポジトリ akatz-ai/MiniMax-H3-Character-Swap-LoRA から直接ダウンロードできる。ダウンロード時の規約同意(Gatedアクセス)は設定されていない。

利用には、MiniMax H3のRef2VAに対応したComfyUIなどの実行環境が必要である。取得した .safetensors ファイルを ComfyUI/models/loras/ に配置し、互換性のあるモデル専用LoRAローダーを用いてベースモデルに適用する。使用時の標準設定としてLoRA強度(strength)は1.0が推奨されている。ベースモデル本体(minimax_h3_ref2va_pruned_int8_convrot.safetensors など)やVAE、および学習アシスタントの重みは本アダプターには含まれていないため、別途各自で用意して組み合わせて配置する必要がある。

実際のワークフローでは、入力用の元動画と差し替え用の参照画像(またはキャラクターシート)を読み込ませ、プロンプト内で置換対象の人物と保持したい背景・照明・カメラ動作などを文章で指示して生成を行う。モデル特有のトリガーワードは学習されていないため指定不要とされる。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス other: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

関連記事

次に読むなら

出典

この記事は未確認情報を含みます。 公式の一次情報で裏が取れ次第、更新履歴を追記して反映します。