NVIDIA、推論エンジニアリング用ベンチマーク「SWE-Serve」発表

NVIDIA、推論エンジニアリング用ベンチマーク「SWE-Serve」発表

基本情報

項目 内容
公開元 NVIDIA Developer
公開日 2026-09-24
出典の種類 公開元の一次情報(NVIDIA Developer公式ブログが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

NVIDIAは、AIコーディングエージェントを対象とした新しいベンチマーク「SWE-Serve」を発表しました。このベンチマークは、オープンソースのLLM推論サービングシステムであるSGLangのプルリクエストから派生した53のタスクを用い、推論エンジニアリングにおけるコードの修正が、実際のサービングパス(モデルのロードやリクエスト処理を含む一連の流れ)を通じて正しく動作するかを評価します。

主張と根拠

発表者の測定によれば、AIエージェントが作成したパッチは、ローカルなテストを通過しても、実際のライブサービング環境では失敗する場合があるという「配信ギャップ」が示されています。

ライブサービングによる検証の重要性

SWE-Serveに含まれる19のタスクでは、実際のサーバーを起動してライブサービングのチェックを行っています。発表者の測定結果では、これらのタスクにおいて、ライブサービングのチェックを除外した場合には69.4%のパッチが合格しましたが、完全な検証器(complete verifier)を用いた場合には45.9%に留まりました。これは、他のテストを通過したパッチの約3分の1が、ライブサービングの検証では失敗することを示しています。例えば、Gemma 4 MoEに関するタスクでは、他のすべてのチェックを通過しながらも、モデルのロード、エキスパートのルーティング、テキストや画像のサービング、あるいは正しい順序でのバッチ生成といったライブサービングテストの少なくとも1つで失敗したパッチが33個中16個存在しました。

実行ドメインの広さと合格率の関係

タスクがカバーする実行ドメインの範囲によって、合格率に顕著な差が見られました。リクエスト処理からI/O、スケジューリング、モデル実行、KVキャッシュ管理といった複数の実行ドメインにまたがる27のタスクでは、単一のドメインに限定された26のタスク(合格率69.0%)と比較して、合格率が47.7%と21.3ポイント低くなっています。この傾向は、テストされたすべてのモデルにおいて同様に確認されています。

モデル別の性能比較

mini-swe-agentを用いた評価では、11のモデルにおける平均pass@1スコアが34.6%から75.5%の範囲に分布しました。各モデルの最高スコアを記録した設定の詳細は以下の通りです。

→ 横にスクロールできます

Model Reasoning setting pass@1 (mean ± SD, 3 runs) Mean cost/task Mean wall time
Claude Opus 5 max 75% ± 3% $17.40 57.5 min
GPT-5.6 Sol max 75% ± 6% $12.26 29.5 min
Claude Sonnet 5 xhigh 64% ± 3% $6.61 40.6 min
Kimi K3 max 64% ± 5% $7.24 99.9 min
GPT-5.6 Luna max 64% ± 4% $0.95 28.9 min
GPT-5.6 Terra max 64% ± 4% $5.06 25.5 min
DeepSeek V4 Flash (0731) max 55% ± 4% $0.69 36.4 min
GLM-5.2 max 48% ± 2% $2.10 34.0 min
Gemini 3.6 Flash high 48% ± 6% $4.84 37.3 min
Laguna S 2.1 max 46% ± 5% $0.33 56.9 min
Inkling S xhigh 35% ± 3% $0.44 17.6 min

なお、性能が同等のモデル間でも、タスクあたりの平均コストや実行時間は大きく異なることが示されています。

前提条件

本ベンチマークの評価結果は、以下の条件に基づいています。

  • 対象モデル: Claude Opus 5, GPT-5.6 Sol, Claude Sonnet 5, Kimi K3, GPT-5.6 Luna, GPT-5.6 Terra, DeepSeek V4 Flash (0731), GLM-5.2, Gemini 3.6 Flash, Laguna S 2.1, Inkling S
  • 使用エージェント: mini-swe-agent (Bashのみを使用する最小限のソフトウェアエンジニアリングエージェント)
  • 評価条件: closed-book条件 (評価中にパブリックなウェブやアップストリームのリポジトリへのアクセスはブロックされ、Hugging Faceへのモデルウェイトのアクセスのみ許可されている)
  • タスク構成: SGLangの83のマージ済みプルリクエストから派生した53の実行可能なタスク
  • ハードウェア: 12個のタスクはCPUで実行、41個のタスクは単一のNVIDIA H100を使用
  • エージェントの制限: 各セッションは210分および350ステップに制限

手元で再現できる範囲

読者は以下のリソースを通じて、自身のコーディングエージェントをSGLangの推論エンジニアリングタスクで評価することが可能です。

  • SWE-Serveの実行: GitHub上でSWE-Serveが公開されており、タスク環境、検証器、ベースライン構成を利用して評価を実行できます。
  • リーダーボード: SWE-Serveのリーダーボードを通じて、推論エンジニアリングタスクにおけるモデルの性能比較を確認できます。
  • 詳細な検証プロセス: 評価の整合性プロセスや詳細な資格確認については、SWE-Serveの論文で公開されています。

関連記事

出典