マルチモーダルモデル「MiMo-V2.6-Flash-RL-GGUF」公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | ggml-org/MiMo-V2.6-Flash-RL-GGUF |
| 公開日 | 2026-09-22 |
| ライセンス | mit |
| 配布形式 | GGUF |
| 出典の種類 | 公開元の一次情報(ggml-org公式リポジトリで裏付け確認済み) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
ggml-orgより、XiaomiMiMoが開発したマルチモーダルモデル「MiMo-V2.6-Flash-RL」のGGUF量子化版となる「ggml-org/MiMo-V2.6-Flash-RL-GGUF」が公開されました。自動変換ツールによって作成された本モデルには、MXFP4やQ2_Kなどの量子化形式が含まれており、投機的デコーディング機能(--mtp)を利用するためのMTPサイドカー(MXFP4およびQ8_0)や、画像・音声エンコーダ向けのQ8_0 mmprojも同梱されています。
元モデルの「XiaomiMiMo/MiMo-V2.6-Flash-RL」は、自己改善に向けた強化学習(RL)のスケールを目的に作られたモデルです。テキスト・画像・動画・音声を1つのモデルで扱うネイティブオムニモーダル構成を採用しており、単一のRL実行でコーディング、汎用エージェント、視覚タスク、サイバーセキュリティを複合的に強化しています。
スペック
- パラメータ数:総パラメータ 309B / 活性パラメータ 15B
- アーキテクチャ:Sparse MoE (Mixture of Experts)
- コンテキスト長:1M tokens
性能
以下は元モデル「XiaomiMiMo/MiMo-V2.6-Flash-RL」のモデルカードに掲載されている評価結果です。本モデルはGGUF量子化版のため、量子化に伴う若干の精度変化が生じる可能性があります。なお、表の列数が多いため、元モデルおよび主要な比較対象モデルを中心に列を絞って掲載しています(数値は原文のまま保持しています)。
→ 横にスクロールできます
| Benchmark | MiMo-V2.6 Flash | MiMo-V2.6 Pro | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Code Agent | |||||
| DeepSWE v1.1 | 67.9 | 71.9 | 19.0 | 74.0 | 73.0 |
| ProgramBench | 26.0 | 26.5 | 12.5 | 37.0 | 25.0 |
| MiMo Code Bench | 61.2 | 63.2 | 40.4 | 68.6 | 59.3 |
| General Agent | |||||
| AutomationBench v1.0.6 | 52.3 | 53.1 | 16.0 | 50.3 | 45.8 |
| Toolathlon-Verified | 73.6 | 76.9 | 49.1 | 80.6 | 74.9 |
| Agents’ Last Exam | 27.6 | 31.6 | 13.2 | 31.6 | 30.8 |
| Terminal Bench 4.0 | 28.8 | 34.9 | 1.5 | 49.0 | 39.9 |
| Terminal Bench 2.1 | 87.6 | 89.9 | 65.2 | 89.1 | 88.8 |
| OSWorld-Verified | 80.8 | 82.0 | – | 83.4 | 83.0 |
| JobBench | 61.2 | 62.0 | 25.0 | 65.7 | 45.4 |
| Cybersecurity | |||||
| CyberGym | 95.1 | 94.0 | 40.0 | – | – |
| MiMo Cyber Bench | 77.2 | 80.2 | 0.0 | – | – |
| ExploitGym | 6.0 | 17.8 | 0.2 | 22.1 | 30.3 |
| ExploitBench | 25.3 | 47.9 | 16.6 | 70.0 | 78.5 |
| SEC Bench Pro | 47.5 | 66.3 | 17.7 | – | 79.1 |
| Visual Agent | |||||
| MiMo VisualCoding | 71.5 | 72.3 | – | 70.0 | 73.4 |
公開元の測定によると、MiMo-V2.6-Flash-RLはCyberGymで95.1、AutomationBench v1.0.6で52.3を記録しており、一部の分野で他モデルを上回る結果を示しています。また、ターミナル上で実際にコマンドを実行して作業を最後までやり切れるかを測るTerminal Bench 2.1では87.6、実際のOS画面を操作してタスクを完了できるかを測るOSWorld-Verifiedでは80.8と高い水準のスコアを達成しています。一方で、ExploitBench(25.3)やExploitGym(6.0)などのサイバーセキュリティ分野や、Terminal Bench 4.0(28.8)においては他の大型フロンティアモデルに対して及ばない数値となっており、得意分野と苦手な領域が明確に分かれています。
得意なこと・想定用途
本モデルが得意とする領域や想定用途は、元モデルである「XiaomiMiMo/MiMo-V2.6-Flash-RL」の能力や学習設計に基づいています。
-
多モーダルを統合した長文コンテキスト処理
テキスト、画像、動画、音声をひとつのモデルで扱うネイティブオムニモーダルに対応しています。さらに最大1Mトークンのコンテキスト長を活かし、広大なソフトウェアリポジトリ全体の解析、長大なツール実行履歴(ツールトレース)の把握、あるいは複数セッションにわたる対話やエージェント操作ログを脱落なく処理することを得意としています。 -
自律的なエージェント操作と環境対応
「You Only RL Once」と呼ばれる一括の強化学習手法により、コーディング、汎用エージェント、視覚タスク、サイバーセキュリティの学習が単一のバッチ内で複合的に行われています。これにより、ターミナル上でのコマンド実行による作業完遂や、OSのGUI画面を視覚的に認識・操作するタスクなど、未経験の環境やツールに対しても柔軟に適応して作業を遂行できます。 -
投機的デコーディングによる高速推論
本モデルはマルチトークン予測(MTP)用のドラフター(5層のSWA MTP構造)を備えており、1回のフォワードパスで複数のトークンを予測する投機的デコーディングに対応しています。応答生成の速度や効率が求められる対話型アシスタントやエージェント実行に適しています。
主な対応言語は英語(en)および中国語(zh)であり、対話(conversational)や高度なツールの呼び出し、複合的なマルチモーダル解析が想定用途となります。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 159.4B(元モデル XiaomiMiMo/MiMo-V2.6-Flash-RL の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 4GB(ノートPCの内蔵GPU・スマートフォンなど) | Q8_0 | 2.2GB | 2.7GB |
| RTX 4060 / 3060 Ti など 8GB | BF16 | 4.2GB | 5.0GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 40B超 のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| bartowski/Intern-S2-397B-GGUF | 403.4B | — | apache-2.0 | マルチモーダル基盤モデル「Intern-S2-397B」のGGUF量子化版公開(2026-09-15) |
| dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 | 763.2B | — | mit | DeepSeek-V4.1-Flashの検閲解除版FP8モデルがHugging Faceに公開(2026-09-13) |
| deepseek-ai/DeepSeek-V4.1-Flash | 763.2B | — | mit | DeepSeek-V4.1-Flash公開、552BのMoEマルチモーダルモデル(2026-09-10) |
入手方法
ggml-org/MiMo-V2.6-Flash-RL-GGUFは、Hugging FaceにてGGUF形式で公開されています。ライセンスにはMITライセンスが設定されています。
本リポジトリでは、用途や環境に応じた各種量子化ファイルおよび追加モジュールが提供されています。
- MXFP4: ルーティングされるエキスパート部をネイティブのMXFP4精度のまま維持した構成です。
- Q2_K: エキスパートのDownプロジェクションをMXFP4に保持し、GateおよびUpプロジェクションをQ2_Kに量子化した構成です(※現時点ではimatrixによるキャリブレーションは適用されていません)。
- MTPサイドカー(MXFP4 / Q8_0): 投機的デコーディング機能(
--mtp)を利用するためのサイドカー構成です。 - Q8_0 mmproj: 画像エンコーダ(MiMo ViT)および音声エンコーダ用のコンポーネントです。
llama.appを使用したセットアップおよびサーバーの起動は、以下のコマンドを実行することで行えます。
llama serve -hf ggml-org/MiMo-V2.6-Flash-RL-GGUF
