LLMベンチマーク用語集:スコアの読み方
当サイトの記事に出てくるベンチマークについて、その数値が何を測っているか、どう読むか、高いほど良いのか低いほど良いのかをまとめた用語集です。記事を書くパイプラインが記者に渡しているのと同じ定義で、ここに無いベンチマークは記事の中で説明せず、スコアの比較だけを書く方針にしています。定義はAIモデルが生成したものではなく、サイトのソースコード内で人間が管理しています。
読むときの注意が2つあります。誤り率(WER・CER)とPerplexityは低いほど良い指標で、正解率と同じ読み方をすると評価が逆になります。また、別々のモデルカードのスコアは、プロンプトの形式・試行回数・採点方法が違うため、そのまま横に並べて比べられるとは限りません。
コーディング
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| HumanEval | HumanEval+, EvalPlus | 短いPython関数を仕様(docstring)どおりに実装できるか。単体テストで自動採点する | Pass@1 = 生成1回でテストに通った割合(%) | 高いほど良い |
| MBPP | MBPP+ | 入門〜中級のPython課題を解けるか | Pass@1(%) | 高いほど良い |
| BigCodeBench | — | 実務に近い、複数ライブラリの呼び出しを含むPythonタスクを解けるか | Pass@1(%) | 高いほど良い |
| LiveCodeBench | — | 出題時期を区切って集めた競技プログラミングの新作問題。学習データへの混入を避ける設計 | Pass@1(%) | 高いほど良い |
コーディング(実リポジトリ)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| SWE-bench | SWE-bench Verified, SWE-bench Pro, SWE-bench Multimodal | 実在のGitHub issueを、リポジトリを編集して修正できるか。隠しテストが通れば正解 | Resolved = 解決できた課題の割合(%) | 高いほど良い |
| Aider Polyglot | Aider | 複数言語のコードを、既存ファイルを編集する形で直せるか | 正解率(%) | 高いほど良い |
コーディング(競技)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| Codeforces | CodeForces | 競技プログラミングでの実力 | Rating(Elo) = 人間の参加者と同じレーティング尺度。百分率ではない | 高いほど良い |
エージェント(端末操作)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| Terminal-Bench | TerminalBench, Terminal Bench | ターミナル上で実際にコマンドを実行し、与えられた作業を最後までやり切れるか | Pass@1(%) | 高いほど良い |
エージェント(ツール利用)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| τ-bench | tau-bench, TAU-bench, tau2-bench | 業務手順(ポリシー)を守りながら、利用者との対話とツール呼び出しを両立できるか | 成功率(%) | 高いほど良い |
| BFCL | Berkeley Function Calling Leaderboard, Berkeley Function-Calling Leaderboard | 関数(ツール)の選択と引数の組み立てが正確か | 正解率(%) | 高いほど良い |
エージェント(調査)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| GAIA | — | 検索やファイル操作など道具を使って、実世界の調べ物課題を解けるか | 正解率(%) | 高いほど良い |
エージェント(GUI操作)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| OSWorld | — | 実際のOSの画面を操作してタスクを完了できるか | 成功率(%) | 高いほど良い |
数学
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| GSM8K | — | 小学校レベルの算数の文章題を、手順を追って解けるか。上位モデルでは飽和気味で差が出にくい | EM = 最終解答の完全一致(%) | 高いほど良い |
| MATH | MATH-500, MATH500 | 高校〜競技レベルの数学の問題を解けるか | EM(%) | 高いほど良い |
数学(競技)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| AIME | AIME 2024, AIME 2025 | 米国の数学オリンピック予選(AIME)の問題を解けるか | Pass@1(%)。1回の試験が15問しかないため、1問の正誤でスコアが大きく動く | 高いほど良い |
多言語
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| MGSM | — | GSM8Kの算数問題を多言語に翻訳したもの。英語以外でも同じように解けるかを見る | EM(%) | 高いほど良い |
一般知識
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| MMLU | — | 57分野の4択問題で、広く浅い知識を測る古典的な指標。上位モデルでは差が付きにくい | 正解率(%) | 高いほど良い |
一般知識・推論
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| MMLU-Pro | MMLU Pro | MMLUの難化版。選択肢を10個に増やし、推論を要する問題に差し替えたもの | EM(%) | 高いほど良い |
| AGIEval | — | 大学入試や資格試験など、人間向けに作られた試験問題をそのまま解かせる | EM(%) | 高いほど良い |
科学の難問
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| GPQA Diamond | GPQA-Diamond, GPQA | 物理・化学・生物の博士課程レベルの問題。検索しても簡単には解けないよう作られている(Diamondは最難サブセット) | Pass@1(%) | 高いほど良い |
超難問
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| HLE | Humanity’s Last Exam, Humanitys Last Exam | 各分野の専門家が作った超難問集。どのモデルもまだ正答率が低く、数十%でも高い部類に入る | Pass@1(%) | 高いほど良い |
推論
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| BBH | BIG-Bench Hard | BIG-Benchのうち、当時のモデルが人間に及ばなかった難しいタスクを集めたもの | EM(%) | 高いほど良い |
| BBEH | BIG-Bench Extra Hard | BBHが飽和したことを受けて作られた、さらに難しい後継版 | EM(%) | 高いほど良い |
専門知識
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| SuperGPQA | — | 分野を大きく広げた大学院レベルの専門問題 | EM(%) | 高いほど良い |
多言語(中国語)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| C-Eval | CEval, CMMLU | 中国語で学術・専門知識を問う4択問題 | EM(%) | 高いほど良い |
読解
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| DROP | — | 文章から数値を拾って足し引き・比較する読解問題 | F1(%) | 高いほど良い |
常識推論
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| HellaSwag | — | 文の自然な続きを選ぶ常識推論。古くから使われており、上位モデルでは飽和している | 正解率(%) | 高いほど良い |
| Winogrande | WinoGrande | 代名詞が何を指すかを文脈から当てる | 正解率(%) | 高いほど良い |
| ARC-Challenge | ARC-c, AI2 Reasoning Challenge | 小中学校の理科の4択問題のうち、検索では解きにくい難問 | 正解率(%) | 高いほど良い |
事実性
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| SimpleQA | SimpleQA-Verified | 答えが1つに定まる短い事実質問。知らないことを作り話で埋めないかを見る | 正答率(%) | 高いほど良い |
| TruthfulQA | — | 世間によくある誤解につられずに答えられるか | 正答率(%) | 高いほど良い |
指示追従
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| IFEval | — | 「300語以内で」「JSONで」といった形式の指示を、内容とは別に守れるか | 遵守率(%) | 高いほど良い |
対話品質
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| Arena-Hard | ArenaHard, MT-Bench, MTBench | 難しめの対話プロンプトへの応答を、別のLLMが相対評価する | 勝率・スコア。審査もLLMなので、絶対値の比較には向かない | 高いほど良い |
長文脈
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| LongBench | LongBench-v2, LongBench-V2 | 長い文書を読ませ、要約・質問応答・コード理解ができるかを測る | EM/F1(%) | 高いほど良い |
| RULER | — | 公称の対応文脈長のうち、実際に使える長さがどこまでかを測る | 正解率(%) | 高いほど良い |
| Needle in a Haystack | NIAH, Needle-in-a-Haystack | 長い文脈のどこかに埋め込んだ1文を取り出せるか | 検出率(%) | 高いほど良い |
画像理解
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| MMMU | MMMU-Pro | 図表や写真を含む大学レベルの問題を、画像を見て解けるか | EM(%) | 高いほど良い |
画像理解(文書)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| DocVQA | — | 請求書・帳票などの文書画像を読んで質問に答えられるか | ANLS/正解率(%) | 高いほど良い |
画像理解(図表)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| ChartQA | — | グラフの画像から数値や傾向を読み取れるか | 正解率(%) | 高いほど良い |
画像理解(数学)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| MathVista | — | 図形やグラフを含む数学の問題を、画像を見て解けるか | 正解率(%) | 高いほど良い |
画像理解(位置特定)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| RefCOCO | RefCOCO+, RefCOCOg | 「左から2番目の赤い車」のような指示で、画像中の物体の位置を特定できるか | Acc@0.5 = 正解領域との重なり(IoU)が0.5以上なら正解(%) | 高いほど良い |
画像理解(文字)
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| OCRBench | — | 画像中の文字を正しく読み取れるか | スコア | 高いほど良い |
音声認識
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| WER | Word Error Rate | 書き起こしの単語単位の誤り率 | 低いほど良い(%) | 低いほど良い |
| CER | Character Error Rate | 書き起こしの文字単位の誤り率 | 低いほど良い(%) | 低いほど良い |
言語モデルの素の精度
→ 横にスクロールできます
| ベンチマーク | 表記ゆれ | 何を測るか | 数値の読み方 | 良い方向 |
|---|---|---|---|---|
| Perplexity | PPL | 次の語をどれだけ言い当てられるか。量子化による劣化の比較によく使われる | 低いほど良い | 低いほど良い |
45項目。最終更新 2026-09-18(JST)。量子化・モデル形式の用語集もあわせてどうぞ。