LLMベンチマーク用語集:スコアの読み方

2026年9月18日

当サイトの記事に出てくるベンチマークについて、その数値が何を測っているか、どう読むか、高いほど良いのか低いほど良いのかをまとめた用語集です。記事を書くパイプラインが記者に渡しているのと同じ定義で、ここに無いベンチマークは記事の中で説明せず、スコアの比較だけを書く方針にしています。定義はAIモデルが生成したものではなく、サイトのソースコード内で人間が管理しています。

読むときの注意が2つあります。誤り率(WER・CER)とPerplexityは低いほど良い指標で、正解率と同じ読み方をすると評価が逆になります。また、別々のモデルカードのスコアは、プロンプトの形式・試行回数・採点方法が違うため、そのまま横に並べて比べられるとは限りません。

コーディング

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
HumanEval HumanEval+, EvalPlus 短いPython関数を仕様(docstring)どおりに実装できるか。単体テストで自動採点する Pass@1 = 生成1回でテストに通った割合(%) 高いほど良い
MBPP MBPP+ 入門〜中級のPython課題を解けるか Pass@1(%) 高いほど良い
BigCodeBench 実務に近い、複数ライブラリの呼び出しを含むPythonタスクを解けるか Pass@1(%) 高いほど良い
LiveCodeBench 出題時期を区切って集めた競技プログラミングの新作問題。学習データへの混入を避ける設計 Pass@1(%) 高いほど良い

コーディング(実リポジトリ)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
SWE-bench SWE-bench Verified, SWE-bench Pro, SWE-bench Multimodal 実在のGitHub issueを、リポジトリを編集して修正できるか。隠しテストが通れば正解 Resolved = 解決できた課題の割合(%) 高いほど良い
Aider Polyglot Aider 複数言語のコードを、既存ファイルを編集する形で直せるか 正解率(%) 高いほど良い

コーディング(競技)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
Codeforces CodeForces 競技プログラミングでの実力 Rating(Elo) = 人間の参加者と同じレーティング尺度。百分率ではない 高いほど良い

エージェント(端末操作)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
Terminal-Bench TerminalBench, Terminal Bench ターミナル上で実際にコマンドを実行し、与えられた作業を最後までやり切れるか Pass@1(%) 高いほど良い

エージェント(ツール利用)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
τ-bench tau-bench, TAU-bench, tau2-bench 業務手順(ポリシー)を守りながら、利用者との対話とツール呼び出しを両立できるか 成功率(%) 高いほど良い
BFCL Berkeley Function Calling Leaderboard, Berkeley Function-Calling Leaderboard 関数(ツール)の選択と引数の組み立てが正確か 正解率(%) 高いほど良い

エージェント(調査)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
GAIA 検索やファイル操作など道具を使って、実世界の調べ物課題を解けるか 正解率(%) 高いほど良い

エージェント(GUI操作)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
OSWorld 実際のOSの画面を操作してタスクを完了できるか 成功率(%) 高いほど良い

数学

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
GSM8K 小学校レベルの算数の文章題を、手順を追って解けるか。上位モデルでは飽和気味で差が出にくい EM = 最終解答の完全一致(%) 高いほど良い
MATH MATH-500, MATH500 高校〜競技レベルの数学の問題を解けるか EM(%) 高いほど良い

数学(競技)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
AIME AIME 2024, AIME 2025 米国の数学オリンピック予選(AIME)の問題を解けるか Pass@1(%)。1回の試験が15問しかないため、1問の正誤でスコアが大きく動く 高いほど良い

多言語

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
MGSM GSM8Kの算数問題を多言語に翻訳したもの。英語以外でも同じように解けるかを見る EM(%) 高いほど良い

一般知識

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
MMLU 57分野の4択問題で、広く浅い知識を測る古典的な指標。上位モデルでは差が付きにくい 正解率(%) 高いほど良い

一般知識・推論

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
MMLU-Pro MMLU Pro MMLUの難化版。選択肢を10個に増やし、推論を要する問題に差し替えたもの EM(%) 高いほど良い
AGIEval 大学入試や資格試験など、人間向けに作られた試験問題をそのまま解かせる EM(%) 高いほど良い

科学の難問

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
GPQA Diamond GPQA-Diamond, GPQA 物理・化学・生物の博士課程レベルの問題。検索しても簡単には解けないよう作られている(Diamondは最難サブセット) Pass@1(%) 高いほど良い

超難問

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
HLE Humanity’s Last Exam, Humanitys Last Exam 各分野の専門家が作った超難問集。どのモデルもまだ正答率が低く、数十%でも高い部類に入る Pass@1(%) 高いほど良い

推論

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
BBH BIG-Bench Hard BIG-Benchのうち、当時のモデルが人間に及ばなかった難しいタスクを集めたもの EM(%) 高いほど良い
BBEH BIG-Bench Extra Hard BBHが飽和したことを受けて作られた、さらに難しい後継版 EM(%) 高いほど良い

専門知識

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
SuperGPQA 分野を大きく広げた大学院レベルの専門問題 EM(%) 高いほど良い

多言語(中国語)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
C-Eval CEval, CMMLU 中国語で学術・専門知識を問う4択問題 EM(%) 高いほど良い

読解

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
DROP 文章から数値を拾って足し引き・比較する読解問題 F1(%) 高いほど良い

常識推論

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
HellaSwag 文の自然な続きを選ぶ常識推論。古くから使われており、上位モデルでは飽和している 正解率(%) 高いほど良い
Winogrande WinoGrande 代名詞が何を指すかを文脈から当てる 正解率(%) 高いほど良い
ARC-Challenge ARC-c, AI2 Reasoning Challenge 小中学校の理科の4択問題のうち、検索では解きにくい難問 正解率(%) 高いほど良い

事実性

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
SimpleQA SimpleQA-Verified 答えが1つに定まる短い事実質問。知らないことを作り話で埋めないかを見る 正答率(%) 高いほど良い
TruthfulQA 世間によくある誤解につられずに答えられるか 正答率(%) 高いほど良い

指示追従

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
IFEval 「300語以内で」「JSONで」といった形式の指示を、内容とは別に守れるか 遵守率(%) 高いほど良い

対話品質

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
Arena-Hard ArenaHard, MT-Bench, MTBench 難しめの対話プロンプトへの応答を、別のLLMが相対評価する 勝率・スコア。審査もLLMなので、絶対値の比較には向かない 高いほど良い

長文脈

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
LongBench LongBench-v2, LongBench-V2 長い文書を読ませ、要約・質問応答・コード理解ができるかを測る EM/F1(%) 高いほど良い
RULER 公称の対応文脈長のうち、実際に使える長さがどこまでかを測る 正解率(%) 高いほど良い
Needle in a Haystack NIAH, Needle-in-a-Haystack 長い文脈のどこかに埋め込んだ1文を取り出せるか 検出率(%) 高いほど良い

画像理解

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
MMMU MMMU-Pro 図表や写真を含む大学レベルの問題を、画像を見て解けるか EM(%) 高いほど良い

画像理解(文書)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
DocVQA 請求書・帳票などの文書画像を読んで質問に答えられるか ANLS/正解率(%) 高いほど良い

画像理解(図表)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
ChartQA グラフの画像から数値や傾向を読み取れるか 正解率(%) 高いほど良い

画像理解(数学)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
MathVista 図形やグラフを含む数学の問題を、画像を見て解けるか 正解率(%) 高いほど良い

画像理解(位置特定)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
RefCOCO RefCOCO+, RefCOCOg 「左から2番目の赤い車」のような指示で、画像中の物体の位置を特定できるか Acc@0.5 = 正解領域との重なり(IoU)が0.5以上なら正解(%) 高いほど良い

画像理解(文字)

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
OCRBench 画像中の文字を正しく読み取れるか スコア 高いほど良い

音声認識

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
WER Word Error Rate 書き起こしの単語単位の誤り率 低いほど良い(%) 低いほど良い
CER Character Error Rate 書き起こしの文字単位の誤り率 低いほど良い(%) 低いほど良い

言語モデルの素の精度

→ 横にスクロールできます

ベンチマーク 表記ゆれ 何を測るか 数値の読み方 良い方向
Perplexity PPL 次の語をどれだけ言い当てられるか。量子化による劣化の比較によく使われる 低いほど良い 低いほど良い

45項目。最終更新 2026-09-18(JST)。量子化・モデル形式の用語集もあわせてどうぞ。