XiaomiMiMo-V2.6-Pro-RL公開:1.02TのMoEマルチモーダルモデル

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | XiaomiMiMo/MiMo-V2.6-Pro-RL |
| まとめページ | MiMo-V2.6 のまとめ(記事2本) |
| 公開元のまとめ | Xiaomi(MiMo) のモデルとライセンスのまとめ |
| 公開日 | 2026-09-22 |
| ライセンス | mit |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(HuggingFace公式リポジトリの一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Xiaomi の MiMo チームが、新世代 MiMo-V2.6 シリーズの最上位モデル MiMo-V2.6-Pro-RL を Hugging Face で公開した。総パラメータ 1.02T(1兆超)・推論時に働くのは 42B の MoE(Mixture of Experts)で、テキスト・画像・動画・音声を1つのモデルで扱い、100万トークンの文脈を読める。ライセンスは MIT で、商用利用を含めて重みを自由に使える。
シリーズの主題は「強化学習(RL)を大きくすることで、モデルが自分で伸び続ける仕組みを作る」ことである。コーディング・汎用エージェント・画像を見ながらの作業・サイバーセキュリティを別々に鍛えるのではなく、1回の混合 RL でまとめて鍛える(モデルカードは「You Only RL Once」と呼ぶ)。同じシリーズの中型モデル MiMo-V2.6-Flash-RL(総 309B / 活性 15B)も同時に公開されており、当サイトでは既にその GGUF 版を 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB で取り上げた。今回の記事は、その上位にあたる公式の Pro の重みである。
スペック
モデルカードの「Model Summary」と構成表から。
- パラメータ数: 総 1.02T / 活性 42B(Sparse MoE)
- 層構成: 70 層。うち 60 層がスライディングウィンドウ・アテンション(SWA、窓は 128 トークン)、10 層が全体を見るグローバル・アテンション(GA)。最初の1層だけは GA と密な FFN で、残りは SWA と GA を交互に重ね、どちらも共有エキスパートを持たない MoE の FFN を使う
- エキスパート: 384 個のうち 8 個を使う
- 隠れ層の次元: 6,144。アテンションのヘッドは SWA・GA とも Q 128 / KV 8、ヘッドの次元は QK 192 / V 128
- コンテキスト長: 最大 1M トークン
- 入力: テキスト・画像・動画・音声
- 視覚エンコーダ: 681M パラメータの MiMo ViT(28 層、うち 24 層が SWA・4 層が GA)
- 音声エンコーダ: 308M の AudioTokenizer(20 段の RVQ コードブック)と、127M の音声パッチエンコーダ(4 フレームを1パッチにまとめ、25Hz を 6.25Hz に落とす)
- 投機的デコード: 5 層の SWA で組んだ MTP(Multi-Token Prediction)のドラフターを内蔵し、1回の順伝播で後続の 7 トークンを予測して並列に検証する
中型の Flash と比べると、Pro は層が 48 → 70、隠れ層の次元が 4,096 → 6,144、エキスパートが 256 → 384 と、あらゆる軸で大きい。一方で Flash の方が事前学習のトークン数は多い。テクニカルレポートによれば、Flash は 48T トークン(テキスト 26T・マルチモーダル 22T)、Pro は 30T トークン(テキスト 27T・マルチモーダル 3T)で学習している。
性能
モデルカードの評価表をそのまま転記する。比較対象は同じシリーズの Flash、前世代の MiMo-V2.5 Pro と、クローズドな商用モデル3つ(Claude Opus 5・GPT-5.6 Sol・Claude Fable 5)で、いずれも公開元自身が公表した数値である(「-」は結果が無い)。
→ 横にスクロールできます
| Benchmark | MiMo-V2.6 Pro | MiMo-V2.6 Flash | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|---|---|
| Code Agent | ||||||
| DeepSWE v1.1 | 71.9 | 67.9 | 19.0 | 74.0 | 73.0 | 70.0 |
| ProgramBench | 26.5 | 26.0 | 12.5 | 37.0 | 25.0 | 33.0 |
| MiMo Code Bench | 63.2 | 61.2 | 40.4 | 68.6 | 59.3 | – |
| General Agent | ||||||
| AutomationBench v1.0.6 | 53.1 | 52.3 | 16.0 | 50.3 | 45.8 | 46.2 |
| Toolathlon-Verified | 76.9 | 73.6 | 49.1 | 80.6 | 74.9 | 77.9 |
| GDPval-AA 2.1 | 1673 | – | 1107 | 1708 | 1588 | 1595 |
| Agents’ Last Exam | 31.6 | 27.6 | 13.2 | 31.6 | 30.8 | 25.7 |
| Terminal Bench 4.0 | 34.9 | 28.8 | 1.5 | 49.0 | 39.9 | 42.4 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 65.2 | 89.1 | 88.8 | 84.3 |
| OSWorld-Verified | 82.0 | 80.8 | – | 83.4 | 83.0 | 86.0 |
| JobBench | 62.0 | 61.2 | 25.0 | 65.7 | 45.4 | 57.4 |
| Cybersecurity | ||||||
| CyberGym | 94.0 | 95.1 | 40.0 | – | – | – |
| MiMo Cyber Bench | 80.2 | 77.2 | 0.0 | – | – | – |
| ExploitGym | 17.8 | 6.0 | 0.2 | 22.1 | 30.3 | 28.4 |
| ExploitBench | 47.9 | 25.3 | 16.6 | 70.0 | 78.5 | 78.0 |
| SEC Bench Pro | 66.3 | 47.5 | 17.7 | – | 79.1 | – |
| Visual Agent | ||||||
| MiMo VisualCoding | 72.3 | 71.5 | – | 70.0 | 73.4 | 69.1 |
前世代からの伸びが桁違いに大きい。 長い開発タスクをやり切れるかを見る DeepSWE v1.1 は 19.0 から 71.9 へ、REST API を渡り歩いて業務の流れを組む AutomationBench は 16.0 から 53.1 へ、新しい版のターミナル作業のベンチマーク Terminal Bench 4.0 は 1.5 から 34.9 へ上がった。どれも「複数の手順を踏んで最後まで仕上げる」種類のタスクで、エージェント向けの RL を大規模に回したことの効果がそのまま表れている。
商用の最上位モデルとの比較では、「並ぶ項目」と「届かない項目」がはっきり分かれる。 ターミナル操作の Terminal Bench 2.1(89.9)と AutomationBench(53.1)は表の中で最も高く、難問を集めた Agents’ Last Exam(31.6)は Claude Opus 5 と同点である。DeepSWE(71.9)も Opus 5 との差は 2.1 ポイントにとどまる。一方、コンパイル済みのバイナリと文書からプログラムを作り直す ProgramBench は 26.5 で Opus 5 の 37.0 に 10 ポイント以上及ばず、Terminal Bench 4.0 も 34.9 対 49.0 と大きく離されている。脆弱性を実際に悪用するところまで進める ExploitBench(47.9)と ExploitGym(17.8)は、比較対象の商用3モデル(70.0〜78.5、22.1〜30.3)を下回る。画面を操作する OSWorld-Verified(82.0)も商用3モデル(83.0〜86.0)をいずれも下回り、Claude Fable 5 とは 4 ポイントの差がある。「手順の決まった作業を粘り強くこなす」力は最上位に並んだが、「未知の対象を解析して新しく作る・突破する」力ではまだ差がある、というのが表から読める傾向である。
Pro と Flash の差は、ほとんどの項目で小さい。 DeepSWE は 71.9 対 67.9、Terminal Bench 2.1 は 89.9 対 87.6、OSWorld-Verified は 82.0 対 80.8、JobBench は 62.0 対 61.2 で、差は 4 ポイント以内である。CyberGym では Flash の方が高い(95.1 対 94.0)。大きく差が開くのはセキュリティの攻撃側の項目で、ExploitBench は 47.9 対 25.3、ExploitGym は 17.8 対 6.0、SEC Bench Pro は 66.3 対 47.5 で、ExploitGym では約3倍、ExploitBench では約1.9倍の差になる。総パラメータで 3 倍以上の差がある割に、一般的なコーディング・業務エージェントの用途では Flash で大半の性能が得られる。
比較の条件には注意が要る。MiMo Code Bench・MiMo Cyber Bench・MiMo VisualCoding は Xiaomi の社内ベンチマークで、第三者が同じ条件で再現できる評価ではない。テクニカルレポートの注記によれば、CyberGym は評価環境の不備を公開元が修正したうえで測った値である。
得意なこと・想定用途
モデルカードとテクニカルレポートが示す狙いは、長い手順を踏むエージェント作業の中核として使うことである。100万トークンの文脈は、大きなリポジトリ全体・長いツールの実行記録・複数回にまたがるエージェントの作業履歴を丸ごと読ませるためだとモデルカードは説明している。
学習方法にも、この用途に向けた工夫がある。
- 1回の混合 RL: コーディング・汎用エージェント・画像・サイバーセキュリティの課題と、複数のエージェントの枠組み(ハーネス)を同じバッチに混ぜて学習する。モデルカードは、これによって能力が互いに補強され、学習で見ていないハーネスにも戦略が移るとしている
- 大規模な RL: 完全非同期の GRPO で、1ステップあたり 1,568 問 × 16 回の試行を回す。テクニカルレポートによれば 1ステップで 27億〜37億トークンを消費する
- グループ内の相対評価(GRS・GAR): 合格か不合格かだけでは合格した解答同士の優劣が付かないため、同じ問題への複数の解答を比べて採点基準を作り、よりよい解答に報酬を寄せる。モデルカードは、これによって短い手順・少ないトークンで解く方向にモデルが向かうとしている
- 報酬の抜け穴対策: 自分の誤った発話を振り返って書き直すデータから始め、RL の途中も環境の強化・敵対的な選別・検証器の相互チェックで、報酬だけを稼ぐ振る舞い(reward hacking)を抑える
- MOPD2: 混合 RL の後に、複数の教師モデルからの蒸留で、正解を機械的に判定しにくいタスクへ能力を広げる
テクニカルレポートは、RL の途中で MoE のルーター(どのエキスパートに振り分けるかを決める部分)を学習させると、特定のエキスパートに負荷が偏って崩れることを報告している。このため MiMo-V2.6 の RL ではルーターを固定している。こうした失敗の記録まで公開しているのは、再現を試みる研究者にとって有益である。
類似モデルとの違い
同じ MiMo-V2.6 シリーズには、用途の違う3つのモデルがある。
- MiMo-V2.6-Pro-RL(本記事): 総 1.02T / 活性 42B。シリーズの最上位で、特にセキュリティの攻撃側のタスクで Flash を大きく上回る
- MiMo-V2.6-Flash-RL: 総 309B / 活性 15B。モデルカードは「効率とのバランスを取ったチェックポイント」と位置づけており、上の表のとおり多くの項目で Pro との差は数ポイントにとどまる。当サイトの GGUF 版の記事: 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB
- MiMo-V2.6-Distill-Qwen-9B: Qwen3.5-9B に MiMo が生成したデータ(合計 774億トークン)で追加学習した小型モデル。テクニカルレポートは、これを「コミュニティがさらに RL を試すための共通の出発点」として公開したと説明している。SWE-bench Pro は元の Qwen3.5-9B の 32.0 から 44.6 に上がり、公開された RL 環境でさらに学習すると 47.6 になる。当サイトの GGUF 版の記事: 「MiMo-V2.6-Distill-Qwen-9B-GGUF」VLMモデル:必要VRAM 12GB〜
Xiaomi は重みだけでなく、学習に使った RL 環境(コーディング約3,000問・サイバー約1,000問・知識労働約1,000問・Web 開発約2,000問、ほかに作曲約1,000問)とデータセット(XiaomiMiMo/MiMo-V2.6-RL-oss)、学習のフレームワーク(verl の fork)も公開している。重みだけを出すオープンモデルが多いなかで、「どう鍛えたか」を追試できる材料まで揃えている点が、このシリーズの最大の特徴である。
入手方法
- 配布形式: Hugging Face の
XiaomiMiMo/MiMo-V2.6-Pro-RLに Transformers 形式(safetensors)の重みが置かれている。ダウンロードに利用規約への同意は要らない。ModelScope でも配布されている - 入手コマンドの例:
huggingface-cli download XiaomiMiMo/MiMo-V2.6-Pro-RL - 対応エンジン: モデルカードは SGLang と vLLM を挙げている。SGLang の例は、テンソル並列 16・2 ノード構成(
--tp 16 --nnodes 2)で、MTP を使った投機的デコード(EAGLE)を有効にしている。vLLM の例はテンソル並列 8(--tensor-parallel-size 8)で、MiMo-V2.5 向けに用意された Docker イメージ(vllm/vllm-openai:mimov25-cu129)を使う - 推奨のサンプリング設定:
temperature=1.0・top_p=0.95 - 手元の機材で動かす場合: 起動例が複数 GPU・複数ノードを前提にしていることからも分かるとおり、個人の機材で動かす規模ではない。個人の環境で試すなら、Flash-RL の GGUF 版か、9B の Distill-Qwen-9B が現実的な選択肢になる。llama.cpp・Ollama・LM Studio について、Pro のモデルカードは触れていない
- API として使う場合: モデルカードによれば、Xiaomi MiMo Open Platform の API と OpenRouter でも提供されている
手元で動かせるか
現時点では Ollama・LM Studio・llama.cpp で動かせません(GGUF版を確認できていない)。
公開元の配布は safetensors のみです。ただし llama.cpp の登録表にはこのモデルのアーキテクチャ名があるため、GGUFへの変換自体は可能な状態で、変換版が公開されれば動くようになります。公開元と実績のある量子化担当以外による変換版は 5 件あります。現時点で動かすなら transformers(PyTorch)・vLLM で読み込む形になり、必要メモリは上の表のとおりです。
ライセンス mit(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時に著作権表示とライセンス文を残すことが条件です。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-27 | mlx-community | MXFP4 | mlx-community/MiMo-V2.6-Pro-RL-mxfp4-q8 | MLX 4bit 619.0GB(単体のGPUには収まらない) |
各リポジトリの量子化とファイルサイズ:
- mlx-community/MiMo-V2.6-Pro-RL-mxfp4-q8 の量子化: MLX 4bit 515.8GB
このほか、上記以外の投稿者による変換版が 5 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。
関連記事
次に読むなら
- 同じモデル系統を調べる → MiMo-V2.6 系統のまとめ(記事2本・変換版1件)
- このモデルを動かすエンジンを調べる → vLLM
- このモデルを入手できる形式を調べる → NVFP4・MXFP4形式の解説と対応モデル
- 公開元について調べる → Xiaomi(MiMo) のモデル・ライセンス・記事のまとめ
- 同じ用途の他のモデルを探す → テキスト生成のモデル一覧
出典
更新履歴
- 2026-09-27: 変換版を「派生版・量子化版」に追記しました: mlx-community/MiMo-V2.6-Pro-RL-mxfp4-q8

