エージェント指向モデル「MiMo-V2.6-Distill-Qwen-9B」のGGUF版公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF |
| 公開日 | 2026-09-22 |
| ライセンス | mit |
| 配布形式 | GGUF |
| 出典の種類 | 公開元の一次情報(ggml-org公式リポジトリによるGGUF公開) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
2026年9月21日、Xiaomi MiMoが開発したエージェント指向モデル「MiMo-V2.6-Distill-Qwen-9B」のGGUF版が、ggml-orgより公開されました。本モデルは Qwen3.5-9B をベースモデルとし、MiMoが生成したデータセットを用いて蒸留(Distill)および教師あり微調整(SFT)を施した9.4Bパラメータのモデルです。コーディング、汎用エージェントタスク、視覚的コーディング、およびサイバーセキュリティの4つの主要ドメインをターゲットとして設計されています。
モデルカードによれば、本モデルはエージェント型強化学習におけるオープンな研究の出発点として公開されました。GGUF版の配布にあたっては、ビジョンエンコーダー用の Q8_0 mmproj ファイルも同梱されており、マルチモーダルなタスクへの対応が図られています。読者は llama.cpp や Ollama などの GGUF 対応環境で、このエージェント特化型モデルを試用することが可能です。
スペック
- パラメータ数: 9.4B
- アーキテクチャ: Qwen3_5ForConditionalGeneration (Qwen 3.5)
性能
以下に示す性能評価は、Xiaomi MiMoが公開した元モデル(XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B)のテクニカルレポートに基づく数値です。ベースとなった Qwen3.5-9B との比較が示されています。量子化版であるGGUF形式では、量子化のプロセスによりこれらの数値からわずかに変化する可能性がある点に留意してください。
→ 横にスクロールできます
| Domain | Benchmark | Metric | Qwen3.5-9B | MiMo-V2.6-Distill-Qwen-9B (SFT) |
|---|---|---|---|---|
| Code | SWE Verified | avg@3 | 60.0 | 61.1 |
| Code | SWE Pro | avg@3 | 32.0 | 44.6 |
| Code | MiMo Code (mini)† | avg@3 | 19.5 | 51.6 |
| Cyber | MiMo Cyber (mini)† | avg@3 | 5.7 | 31.3 |
| General | AutomationBench v1.0.6 | avg@1 | 5.0 | 30.3 |
| General | Terminal Bench 2.1 | avg@1 | 27.0 | 37.1 |
| General | Toolathlon-Verified | avg@1 | 25.9 | 35.2 |
| General | OfficeQA | avg@1 | 9.0 | 19.5 |
| General | JobBench | avg@1 | 2.6 | 18.3 |
| General | MiMo General (mini)† | avg@1 | 28.5 | 62.2 |
| Visual | MiMo Visual Coding (mini)† | avg@1 | 61.7 | 64.0 |
† 内部評価セットによる数値
公開元の測定結果から、本モデルはベースモデルである Qwen3.5-9B と比較して、ほぼ全ての評価項目でスコアを向上させていることが分かります。特に「Terminal Bench 2.1」において、ベースモデルの 27.0 から 37.1 へとスコアを伸ばしている点は注目に値します。Terminal-Bench は、ターミナル上で実際にコマンドを実行し、与えられた作業を最後までやり切れるかというエージェントとしての実用能力を測る指標であり、本モデルが端末操作を伴うタスクに強いことを示唆しています。
また、コーディング分野の難関ベンチマークである SWE Pro では 32.0 から 44.6 へ、サイバーセキュリティ分野の内部評価(MiMo Cyber mini)では 5.7 から 31.3 へと、特定の専門領域で飛躍的な向上が見られます。一方で、SWE Verified のように 60.0 から 61.1 という僅差の向上に留まっている項目もあり、全てのコーディングタスクで一様に圧倒的な差が出るわけではないことも読み取れます。総じて、自動化(AutomationBench)やツール利用(Toolathlon-Verified)といった、エージェント的な振る舞いが求められる領域で特に強みを発揮するモデルと言えます。
参考として、本モデルのトレーニングに使用されたデータの構成は以下の通り報告されています。合計 77.4B トークンのうち、学習に寄与する Loss-bearing トークンは 27.2B トークンとなっています。
| Domain | Total tokens (B) | Token share (%) | Loss-bearing tokens (B) |
|---|---|---|---|
| Code | 23.2 | 29.9 | 7.3 |
| Cyber | 11.0 | 14.2 | 4.8 |
| General | 22.0 | 28.5 | 5.7 |
| Visual | 21.2 | 27.4 | 9.4 |
| Total | 77.4 | 100.0 | 27.2 |
得意なこと・想定用途
本モデルの最大のアイデンティティは、単なるテキスト生成に留まらない「エージェント(Agentic)」としての高度な自律性にあります。開発元のXiaomi MiMoが、エージェント型強化学習の研究基盤として本モデルを位置づけている通り、複雑な指示を解釈し、それを具体的なステップに分解して実行する能力に長けています。ベースモデルである Qwen3.5-9B に対して、MiMoが生成した高品質なデータセットを用いて教師あり微調整(SFT)を施したことで、特定の専門領域において劇的な進化を遂げています。
特に注目すべきは、ターミナル操作を伴うタスクへの適応力です。性能セクションで言及した「Terminal-Bench 2.1」における高いスコアは、このモデルがローカル環境やサーバー上でのコマンドライン操作を正確にシミュレート、あるいは指示できることを示しています。システム管理の自動化スクリプトの作成や、複雑なデプロイ手順の構築、さらには対話形式でのシステムトラブルシューティングなど、エンジニアの日常的なワークフローを直接的に支援するポテンシャルを秘めています。ツール利用(Tool-use)に関しても、Toolathlon-Verified でのスコア向上が示す通り、外部ツールを適切に呼び出してタスクを完遂する能力が強化されています。
また、本モデルは「思考(Thinking)」プロセスを明示的に出力できる設計となっています。これは、モデルが最終的な回答を出す前に内部的な推論ステップを踏むことを意味しており、特に数学的な計算や複雑なアルゴリズムの構築において、論理的な破綻を防ぐ効果があります。ユーザーは API 経由で思考機能を有効化することで、モデルがどのような論理展開を経て結論に至ったのかを reasoning_content として確認できます。この透明性は、デバッグ作業や、モデルの判断根拠を人間が検証する必要があるクリティカルなシーンで極めて有用です。
対応ドメインの広さと専門性も特筆すべき点です。トレーニングデータにおいて、以下の4つの分野が戦略的に配合されています。
- コーディングと視覚の融合: 「Visual Coding」ドメインの強化により、例えばウェブサイトのスクリーンショットやUI設計図を読み取り、それを実現するためのHTML/CSSやReactコードを生成するといった、視覚情報を起点とした開発タスクに対応します。トレーニングデータの27.4%が視覚関連(Visual)に割り当てられており、画像認識とコード生成の高度な連携が期待できます。
- サイバーセキュリティ: 110億トークン(11.0B tokens)に及ぶサイバーセキュリティ関連のデータが投入されています。これにより、脆弱性診断の補助やセキュリティログの解析、ペネトレーションテストのシナリオ作成など、一般的なLLMでは対応が難しい専門性の高いセキュリティ業務への応用が想定されています。
- 汎用エージェントタスク: OfficeQAやJobBenchといったベンチマークでのスコア向上が示す通り、オフィス業務の自動化やジョブプロセスの管理など、実務に即したエージェント機能が強化されています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 9.4B(元モデル XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4070 / 3060 12GB など 12GB | Q8_0 | 8.9GB | 10.6GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
入手方法
本モデルは GGUF 形式で公開されており、ggml-org のリポジトリからダウンロード可能です。GGUF 形式の採用により、CPU 推論や GPU オフロードを柔軟に組み合わせた運用が可能となっており、メモリリソースが限られたローカル環境でも、9.4B パラメータのモデルを効率的に動作させることができます。
入手および実行には、llama.cpp エコシステムのツールが推奨されます。例えば、llama.app を使用する場合、以下のコマンドで Hugging Face から直接モデルをロードし、API サーバーを立ち上げることができます。
llama serve -hf ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF
本モデルはマルチモーダル対応であるため、テキスト用のメインモデルファイルに加えて、ビジョンエンコーダー用の mmproj ファイルが必要となります。リポジトリには Q8_0 量子化済みの mmproj ファイルが同梱されており、画像入力を利用する際にはこのファイルを指定してロードしてください。量子化版であっても、ビジョンエンコーダーに Q8_0 という高精度なビット数を割り当てることで、視覚情報の認識精度を維持する工夫がなされています。
また、元モデルの仕様に基づき、推論時には MiMo v2.6 専用のチャットテンプレートを使用することが推奨されます。SGLang などのエンジンを使用する場合は、--reasoning-parser mimo フラグを立てることで、前述の思考プロセス(Thinking)を適切にパースし、利用することが可能になります。ローカル環境で「思考するエージェント」を構築したい技術者にとって、非常に扱いやすいパッケージとなっています。

