為什麼需要分類看
單一總分沒有意義。一個在 MMLU 拿 90 分的模型,可能在 SWE-bench 上只有 30 分 —— 兩者測的是完全不同的東西。更麻煩的是,基準會飽和:當多數模型都擠在 95 分以上,這個基準就失去了區分能力,繼續引用它只是在製造噪音。
下面六個類別各自對應一組能力面向。每頁列出該領域的主要基準、發布年份、題目規模與目前狀態。
評測類別
最常被引用的幾個
| 基準 | 領域 | 題數 | 狀態 |
|---|---|---|---|
| MMLU | 廣度知識 | 15,908 | 已飽和 |
| GPQA Diamond | 研究所級科學 | 198 | 仍有鑑別力 |
| HumanEval | 程式補全 | 164 | 已飽和 |
| SWE-bench Verified | 真實軟體工程 | 500 | 仍有鑑別力 |
| AIME | 競賽數學 | 15 / 年 | 仍有鑑別力 |
| FrontierMath | 研究級數學 | ~300 | 極難 |
| Humanity's Last Exam | 跨領域極難題 | ~2,500 | 極難 |
| MMMU | 多模態 | 11,500 | 仍有鑑別力 |
關於題數:題數少不代表容易評測。GPQA Diamond 只有 198 題,但單題的統計雜訊相對大 —— 差 2 題就是 1 個百分點。看到相近的分數差距時,先確認是否有信賴區間。
怎麼讀這些數字
三個最常見的誤讀:把不同 pass@k 設定的分數並排比較、忽略推理預算(同一個模型給更多 token 分數會變)、以及沒有考慮訓練資料污染。方法論那頁有比較完整的說明。