BenchIndex

Benchmark Reference

AI 評測基準索引

前沿模型每次發表都附著一整面的分數牆。這裡把常被引用的基準按能力面向分類,說明每個基準實際測什麼、怎麼算分,以及它現在還有沒有鑑別力。

為什麼需要分類看

單一總分沒有意義。一個在 MMLU 拿 90 分的模型,可能在 SWE-bench 上只有 30 分 —— 兩者測的是完全不同的東西。更麻煩的是,基準會飽和:當多數模型都擠在 95 分以上,這個基準就失去了區分能力,繼續引用它只是在製造噪音。

下面六個類別各自對應一組能力面向。每頁列出該領域的主要基準、發布年份、題目規模與目前狀態。

評測類別

推理與知識

MMLU、MMLU-Pro、GPQA、ARC-AGI、Humanity's Last Exam。測廣度知識與多步推理。

查看 →

程式能力

HumanEval、SWE-bench、LiveCodeBench、Aider Polyglot。從單函式補全到真實 repo 的問題修復。

查看 →

數學

GSM8K、MATH、AIME、FrontierMath。從小學應用題到研究等級難題。

查看 →

多模態

MMMU、MathVista、ChartQA、Video-MME。圖表、文件、影片的理解與推理。

查看 →

代理與工具使用

GAIA、OSWorld、WebArena、τ-bench。多步驟任務、工具呼叫與環境互動。

查看 →

安全與長文本

TruthfulQA、HarmBench、RULER、IFEval。誠實性、拒答行為與長脈絡檢索。

查看 →

最常被引用的幾個

基準領域題數狀態
MMLU廣度知識15,908已飽和
GPQA Diamond研究所級科學198仍有鑑別力
HumanEval程式補全164已飽和
SWE-bench Verified真實軟體工程500仍有鑑別力
AIME競賽數學15 / 年仍有鑑別力
FrontierMath研究級數學~300極難
Humanity's Last Exam跨領域極難題~2,500極難
MMMU多模態11,500仍有鑑別力
關於題數:題數少不代表容易評測。GPQA Diamond 只有 198 題,但單題的統計雜訊相對大 —— 差 2 題就是 1 個百分點。看到相近的分數差距時,先確認是否有信賴區間。

怎麼讀這些數字

三個最常見的誤讀:把不同 pass@k 設定的分數並排比較、忽略推理預算(同一個模型給更多 token 分數會變)、以及沒有考慮訓練資料污染。方法論那頁有比較完整的說明。