XiaomiMiMoがLLMエージェント向け強化学習環境「MiMo-V2.6-RL-oss」公開

2026年9月28日

XiaomiMiMoがLLMエージェント向け強化学習環境「MiMo-V2.6-RL-oss」公開

基本情報

項目 内容
リポジトリ XiaomiMiMo/MiMo-V2.6-RL-oss
公開日 2026-09-25
出典の種類 公開元の一次情報(公式のHugging Face組織アカウントが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

XiaomiMiMoは、LLMエージェント向けの強化学習(Agentic RL)トレーニング環境を構築するためのデータセット「XiaomiMiMo/MiMo-V2.6-RL-oss」および強化学習フレームワークverlのフォークリポジトリ「XiaomiMiMo/verl」を公開しました。対象モデルとして「MiMo-V2.6-Distill-Qwen-9B」が指定されており、verl(0.9.0.dev)をベースに5つのドメイン(Code、Cyber、General、Visual、Music)における強化学習環境の再現コードが提示されています。

本資料では、自己改善に向けた強化学習のスケーリング手法に関して、技術レポート「MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement」のセクション7で述べられている詳細なトレーニングレシピを再現するための具体的な環境構成と検証器(Verifier)の実装設計が示されています。

主張と根拠

発表者の提示によると、エージェント型強化学習の再現基盤は、ドメインごとに異なる検証機構(Verifier)とタスクファミリーを組み合わせた5種類のRL環境として構成されています。verl(0.9.0.dev)のフォークリポジトリ内で提供されている各環境の対応関係は以下の通りです。

→ 横にスクロールできます

Domain Task Family Verifier Launch script Settings
Code Software engineering Executable tests scripts/code/train.sh scripts/code/env.example
Cyber Vulnerability reproduction Rule checks scripts/arvo/arvo.sh scripts/arvo/arvo.env.example
General Knowledge work Rubric-based judging scripts/general/general.sh scripts/general/general.env.example
Visual Web development Visual grading scripts/design/webdev.sh scripts/design/webdev.env.example
Music Symbolic music composition Rule checks scripts/design/music.sh scripts/design/music.env.example

各ドメインにおけるタスクファミリーと検証機構の特徴は次のように整理されています。

  • Code(ソフトウェアエンジニアリング): 実行可能なテストコード(Executable tests)によって生成結果を判定します。起動スクリプトは scripts/code/train.sh、設定ファイルは scripts/code/env.example が対応します。
  • Cyber(脆弱性再現): ルールベースのチェック(Rule checks)による判定を行います。起動スクリプトは scripts/arvo/arvo.sh、設定ファイルは scripts/arvo/arvo.env.example が割り当てられています。
  • General(ナレッジワーク): ルーブリックに基づく判定(Rubric-based judging)を用いて評価を実施します。起動スクリプトは scripts/general/general.sh、設定ファイルは scripts/general/general.env.example を使用します。
  • Visual(Web開発): 視覚的なグレーディング(Visual grading)によって検証を行います。起動スクリプトは scripts/design/webdev.sh、設定ファイルは scripts/design/webdev.env.example です。
  • Music(シンボリック音楽作曲): ルールベースのチェック(Rule checks)により評価を行います。起動スクリプトは scripts/design/music.sh、設定ファイルは scripts/design/music.env.example です。

また、これらの環境を実行するためのエージェント実行基盤および軌跡(Trajectory)収集機構として、リポジトリ内の third_party/ 配下に配置された2つのサブモジュールが用いられています。

  1. mimoagent(third_party/mimoagent-osr): mini-swe-agentのフォークであり、エージェントハーネス、ツール群、実行環境、およびグレーダー(評価器)を提供します。Code、Cyber、General、Visualの4ドメインで使用されます。このうちCyber、General、Visualの3ドメインでは、verlのAgentLoop(recipes/{arvo,general,design}/agent_loop.py)から直接mimoagentを呼び出して駆動します。
  2. uni-agent(third_party/uni_agent): verl-project/uni-agentのフォークであり、モデルゲートウェイ機能とTransferQueueによる軌跡キャプチャを担います。このサブモジュールはCodeドメインでのみ使用され、verl標準のagent-loopマネージャーを置き換えてuni-agentセッション内でmimoagentハーネスを実行します(recipes/code/mimoagent_runner.py)。

発表者の資料によると、これら2つのサブモジュールは相互に直接インポートする関係にはなく、統合処理(グルーコード)は recipes/ ディレクトリ内に配置されています。なお、Musicドメインについてはmimoagentおよびuni-agentのどちらも使用しない独立した構成であることが示されています。

前提条件

本資料が提示する強化学習パイプラインを再現するための条件は、資料中に明記されている範囲で以下の通りです。

  • 対象モデル:
  • XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B(Hugging Faceで公開)
  • 強化学習フレームワーク・ベースソフトウェア:
  • verl(バージョン 0.9.0.dev)
  • サブモジュールおよび外部コンポーネント:
  • third_party/mimoagent-osr(https://github.com/XiaomiMiMo/mimoagent、SWE-agent/mini-swe-agent のフォーク) – third_party/uni_agent(https://github.com/XiaomiMiMo/uni-agent、verl-project/uni-agent のフォーク)
  • トレーニングデータセット:
  • XiaomiMiMo/MiMo-V2.6-RL-oss(Hugging FaceにてApache-2.0ライセンスで公開) – データ形式: Parquet形式 – モダリティ: テキスト、ドキュメント、画像 – 規模カテゴリ: 1K〜10K件 – コンフィグ構成: code、cyber、general、webdev、music の5種類 – 対応ライブラリ: datasets、pandas、polars、mlcroissant
  • 実行コンテナ環境:
  • Docker Hubで提供されているDockerイメージ xiaomimimo/mimo-v2.6-rl-oss
  • 設定ファイル:
  • 各ドメインに対応する環境変数テンプレートファイル(scripts/code/env.example、scripts/arvo/arvo.env.example、scripts/general/general.env.example、scripts/design/webdev.env.example、scripts/design/music.env.example)

手元で再現できる範囲

公開リポジトリおよびデータセットを用いて手元の環境で実行・再現できる手順とリソースは、以下の通り公開されています。

サブモジュールの初期化

トレーニングコードのリポジトリを取得後、エージェント環境およびモデルゲートウェイを機能させるため、以下のコマンドで third_party/ 配下のサブモジュールを初期化します。

git submodule update --init third_party/mimoagent-osr third_party/uni_agent

コンテナ環境の取得

実行環境として、ビルド済みのDockerイメージが Docker Hub 上で公開されています。

docker pull xiaomimimo/mimo-v2.6-rl-oss

各ドメインのトレーニング起動

各ドメインの起動スクリプトを実行する前に、それぞれのスクリプトと同じディレクトリにある *.env.example を参照し、指定されている環境変数を設定する必要があります。設定完了後、対象タスクに対応するシェルスクリプトを実行します。

  • Code(ソフトウェアエンジニアリング):
    scripts/code/env.example 内の変数を設定後、scripts/code/train.sh を実行します。内部では recipes/code/mimoagent_runner.py を介してuni-agentセッション内でmimoagentが実行され、TransferQueueによる軌跡取得が行われます。
  • Cyber(脆弱性再現):
    scripts/arvo/arvo.env.example 内の変数を設定後、scripts/arvo/arvo.sh を実行します。verlの recipes/arvo/agent_loop.py から直接mimoagentが駆動されます。
  • General(ナレッジワーク):
    scripts/general/general.env.example 内の変数を設定後、scripts/general/general.sh を実行します。recipes/general/agent_loop.py から直接mimoagentが呼び出されます。
  • Visual(Web開発):
    scripts/design/webdev.env.example 内の変数を設定後、scripts/design/webdev.sh を実行します。recipes/design/agent_loop.py から直接mimoagentが呼び出されます。
  • Music(シンボリック音楽作曲):
    scripts/design/music.env.example 内の変数を設定後、scripts/design/music.sh を実行します。mimoagentおよびuni-agentのサブモジュールは使用せず、ルールチェックによる検証が行われます。

詳細なトレーニングレシピについては、技術レポート「MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement」のセクション7に記載されていると案内されています。

資料が触れていないこと

本資料およびREADMEには、以下の情報が含まれていません。

  • ハードウェア要件: トレーニングに必要なGPUの型番、推奨されるGPU枚数、VRAM容量、システムメモリ容量などの具体的な計算機スペックは明記されていません。
  • ハイパーパラメータの推奨値: 学習率、バッチサイズ、PPO等の強化学習アルゴリズム固有のパラメータ、コンテキスト長、エポック数などの具体的な設定値は資料内には直接記述されておらず、環境変数設定ファイル(*.env.example)や外部技術レポートを参照する必要があります。
  • トレーニングの所要時間と計算コスト: 各ドメインの強化学習を完了するために必要な計算時間やノード構成ごとの所要時間は記載されていません。
  • ベンチマークスコアや検証結果の数値: 本資料内には、ベースラインモデルとの比較数値や、強化学習実施前後の定量的性能スコアの表・測定データは直接掲載されていません。

関連記事

出典