Xiaomi MiMo-V2.6-MOPDモデル公開:マルチモーダル対応MoE

Xiaomi MiMo-V2.6-MOPDモデル公開:マルチモーダル対応MoE

基本情報

項目 内容
リポジトリ XiaomiMiMo/MiMo-V2.6-Flash-MOPD
公開元のまとめ Xiaomi(MiMo) のモデルとライセンスのまとめ
公開日 2026-09-27
ライセンス mit
配布形式 safetensors
出典の種類 公開元の一次情報(Xiaomi公式HFアカウントからの公開)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Xiaomiより、新しいスパースMoE(Mixture of Experts)マルチモーダルモデル「MiMo-V2.6-Flash-MOPD」および「MiMo-V2.6-Pro-MOPD」が公開されました。これらのモデルは、先行して公開されていた「MiMo-V2.6-Flash-RL」および「MiMo-V2.6-Pro-RL」のチェックポイントに対し、MOPD2(Multi-teacher On-policy Distillation 2)と呼ばれるアップグレードを適用したモデルです。

MOPD2は、検証可能なタスクで学習された「mixRL教師」と、信頼性の高い報酬設計が困難なオープンドメインタスク向けに合成デモンストレーションで学習された「SFT教師」という、複数のドメイン特化型教師モデルをオンポリシーで生徒モデルに蒸留する手法です。これにより、長期的なゲーム開発、科学研究、具現化された知能(embodied intelligence)など、訓練時の検証が困難なドメインへの適応能力を拡張しています。さらに、エージェント環境においてモデルが同じツール呼び出しを繰り返して進行が滞る「ツール呼び出しの繰り返し(tool-call repetition)」という、見落とされがちな失敗モードを効果的に診断・軽減することを目指して開発されました。

スペック

公開された2つのモデルの主なスペックは以下の通りです。

MiMo-V2.6-Flash-MOPD

  • アーキテクチャ: Sparse MoE (Mixture of Experts)
  • 総パラメータ数: 309B
  • 活性パラメータ数: 15B
  • コンテキスト長: 1M tokens
  • 対応モダリティ: テキスト、画像、動画、音声
  • ビジョンエンコーダ: 681Mパラメータ MiMo ViT (28レイヤー: 24 SWA + 4 Full)
  • オーディオエンコーダ: 308M AudioTokenizer + 127M オーディオパッチエンコーダ
  • マルチトークン予測 (MTP): 5レイヤー投機的デコーダー (DFlashスタイル、1フォワードパスあたり7トークンを予測)

「MiMo-V2.6-Flash-MOPD」のLLMバックボーンおよびビジョンエンコーダの構成詳細は以下の通りです。

Component MiMo-V2.6-Flash-MOPD
Layers (Total / SWA / GA) 48 / 39 / 9
Hidden Size 4096
SWA Heads (Q/KV) 64 / 8
GA Heads (Q/KV) 64 / 4
Head Dimensions (QK / V) 192 / 128
Sliding Window Size 128
Routed Experts (Total / Activated) 256 / 8
Max Context Length 1M
MTP / Speculative Decoder 5 SWA layers, window 1024
Configuration Value
Layers (Total / SWA / GA) 28 / 24 / 4
Hidden Size 1280
Attention Heads (Q / KV) 32 / 8
Head Dimension 64
Patch Size (T × H × W) 2 × 16 × 16
Sliding Window (Left / Right) 64 / 64
Spatial Merge Size 2 × 2
Parameters 681M

MiMo-V2.6-Pro-MOPD

  • アーキテクチャ: Sparse MoE (Mixture of Experts)
  • 総パラメータ数: 1.02T
  • 活性パラメータ数: 42B
  • コンテキスト長: 1M tokens
  • 対応モダリティ: テキスト、画像、動画、音声
  • ビジョンエンコーダ: 681Mパラメータ MiMo ViT (28レイヤー: 24 SWA + 4 Full)
  • オーディオエンコーダ: 308M AudioTokenizer + 127M オーディオパッチエンコーダ
  • マルチトークン予測 (MTP): 5レイヤー投機的デコーダー

性能

本モデル群には、一般的なベンチマークスイートの具体的な数値スコアを表したテーブルや、Hugging Faceによる実測ベンチマークデータ(benchmarks)は提供されていません。しかし、公開元であるXiaomi MiMoの開発チームによる報告に基づき、エージェントタスクにおける特定の性能改善が定性的に示されています。

開発チームの分析によると、従来の「MiMo-V2.6」リリース後に最も顕著な課題として浮上したのが、エージェント環境における「ツール呼び出しの繰り返し(tool-call repetition)」問題でした。これは、モデルが同じ、あるいは極めて類似したツール呼び出しを何度も繰り返し発行してしまい、時間とコンテキストを浪費する一方で、タスク自体は全く進捗しないという失敗モードです。この現象はエラーとして明示的に失敗しないため、見落とされやすい性質を持っています。

今回のMOPD(Multi-teacher On-policy Distillation)ステージの適用により、この課題が効率的に解決されたと報告されています。具体的には、短時間の特化型教師によるトレーニングを実行し、それを通常のMOPDパスに統合するという軽量な修正アプローチを採用しました。この結果、RL(強化学習)ステージのモデルと比較して、様々なコンテキスト長やエージェント評価用フレームワーク(agent harnesses)にわたり、レスポンスレベルでのツール呼び出し繰り返し率が大幅に低下し、エージェントとしての実用的な動作安定性が向上したとされています。

得意なこと・想定用途

MiMo-V2.6-Flash-MOPDおよびMiMo-V2.6-Pro-MOPDは、テキスト、画像、動画、音声を包括的に扱うオムニモーダル処理能力と、高度な自律的エージェントタスクに特化した強みを持っています。

具体的には、以下の分野や用途に適しています。

エージェントシステムと自律的ツール実行

今回のMOPD2蒸留により、エージェント環境で多発していた「進捗のないまま類似のツール呼び出しを延々と繰り返す」という問題が集中的に抑制されています。これにより、外部ツールやAPIを連続して呼び出しながら自律的に目標を達成する長時間タスク(ゲーム開発、科学研究のワークフロー自動化、具現化された知能〈embodied intelligence〉など)において、スタックせずに安定した実行を継続することが期待されます。また、モデルカードには推論(reasoning)およびツール呼び出しの専用パーサー(--reasoning-parser mimo、--tool-call-parser mimo)の利用が指定されており、構造化されたエージェント制御に最適化されています。

超長文脈(1Mトークン)を活かしたマルチモーダル理解

最大1Mトークンという大規模なコンテキストウィンドウを備えており、長大なドキュメントの解析はもちろん、長時間の動画理解や音声の連続処理が可能です。ビジョンエンコーダ(MiMo ViT)による動画・画像認識と、AudioTokenizerおよびオーディオパッチエンコーダによる音声認識が同一モデル内に統合されているため、映像と音声が混在するメディアの複合的な解析や対話タスクに対応します。

多言語環境での対話

対応言語タグとして英語(en)および中国語(zh)が付与されており、これら2言語をベースとする高度な対話システムや多言語エージェントとしての運用が想定されています。

入手方法

両モデルはMITライセンスのもとで公開されており、利用規約への同意を要するゲート付き(gated)モデルではないため、誰でも自由にダウンロードして利用可能です。配布形式はFP8(8-bit)のsafetensors形式となっています。

リポジトリはHugging FaceおよびModelScopeにて公開されています。

また、クラウドサービスやGUI環境として、AI Studio、MiMo Code、Xiaomi MiMo Desktop、Xiaomi MiMo Open Platform API、OpenRouter経由でも利用可能と案内されています。

推論エンジンとしては、SGLangおよびvLLMを用いたサービング手順が公開されています。なお、推奨サンプリングパラメータは temperature=1.0、top_p=0.95 とされています。

SGLangでのデプロイ

公式Dockerイメージ lmsysorg/sglang:latest の利用が推奨されています。投機的デコードアルゴリズムとしてEAGLEを設定可能です。

MiMo-V2.6-Flash-MOPDの起動例:

sglang serve \
  --trust-remote-code \
  --model-path XiaomiMiMo/MiMo-V2.6-Flash-MOPD \
  --tp 8 \
  --dp 2 \
  --enable-dp-attention \
  --enable-dp-lm-head \
  --mm-enable-dp-encoder \
  --mem-fraction-static 0.65 \
  --chunked-prefill-size 16384 \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --enable-multi-layer-eagle \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --host 0.0.0.0 \
  --port 30000

MiMo-V2.6-Pro-MOPDの起動例(2ノード構成):

sglang serve \
  --trust-remote-code \
  --model-path XiaomiMiMo/MiMo-V2.6-Pro-MOPD \
  --tp 16 \
  --dp 2 \
  --enable-dp-attention \
  --mm-enable-dp-encoder \
  --ep 16 \
  --moe-a2a-backend deepep \
  --moe-dense-tp-size 1 \
  --mem-fraction-static 0.7 \
  --max-running-requests 128 \
  --chunked-prefill-size 32768 \
  --page-size 64 \
  --swa-full-tokens-ratio 0.3 \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --enable-multi-layer-eagle \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --host 0.0.0.0 \
  --port 30000 \
  --nnodes 2 \
  --node-rank <node-rank> \
  --dist-init-addr <node0-ip>:20000

vLLMでのデプロイ

安定版vLLMでは対応が遅れる可能性があるため、事前構築済みのDockerイメージ vllm/vllm-openai:mimov25-cu129 の利用が案内されています。

MiMo-V2.6-Flash-MOPDの起動例:

vllm serve XiaomiMiMo/MiMo-V2.6-Flash-MOPD \
  --tensor-parallel-size 4 \
  --trust-remote-code \
  --gpu-memory-utilization 0.95 \
  --max-model-len auto \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --enable-auto-tool-choice \
  --generation-config vllm

MiMo-V2.6-Pro-MOPDの起動例:

vllm serve XiaomiMiMo/MiMo-V2.6-Pro-MOPD \
  --tensor-parallel-size 8 \
  --trust-remote-code \
  --gpu-memory-utilization 0.95 \
  --max-model-len auto \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --enable-auto-tool-choice \
  --generation-config vllm

手元で動かせるか

現時点では Ollama・LM Studio・llama.cpp で動かせません(GGUF版を確認できていない)。

公開元の配布は safetensors のみです。ただし llama.cpp の登録表にはこのモデルのアーキテクチャ名があるため、GGUFへの変換自体は可能な状態で、変換版が公開されれば動くようになります。現時点で動かすなら transformers(PyTorch)・vLLM で読み込む形になり、必要メモリは上の表のとおりです。

ライセンス mit(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時に著作権表示とライセンス文を残すことが条件です。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

関連記事

次に読むなら

出典