MMLU
2020已飽和Massive Multitask Language Understanding。橫跨 57 個科目的四選一選擇題,從高中數學到專業法律、臨床醫學都有。長年被當成「通用知識」的預設指標。
- 題數
- 15,908
- 形式
- 4 選 1 選擇題
- 指標
- 準確率(常用 5-shot)
- 現況
- 前沿模型普遍在 88% 以上,題目本身也被查出有標註錯誤,差距已不具意義
MMLU-Pro
2024仍有鑑別力針對 MMLU 飽和問題的重製版。選項從 4 個增加到 10 個,大幅降低瞎猜的期望分數,並移除了原版中有問題的題目、加入更多需要推理而非記憶的題型。
- 題數
- 約 12,000
- 形式
- 10 選 1 選擇題
- 差異
- 隨機猜測基線從 25% 降到 10%
GPQA
2023仍有鑑別力Graduate-Level Google-Proof Q&A。由生物、物理、化學領域的博士級專家撰寫,設計目標是「即使能自由上網搜尋也很難答對」—— 驗證時非該領域的專家在有網路的情況下正確率仍偏低。
- 題數
- 448(Diamond 子集 198 題)
- 常用子集
- GPQA Diamond,即專家一致答對、非專家答錯的題目
- 注意
- Diamond 僅 198 題,單題約值 0.5 個百分點,小幅差距須看信賴區間
ARC-AGI
2019 / 2025極難François Chollet 提出的抽象推理測驗。題目是彩色網格的輸入輸出配對,要從少數範例中歸納出轉換規則再套用到新的網格上。刻意設計成無法靠記憶語料解決,強調的是對新規則的即時歸納。
- 形式
- 網格轉換,需輸出完整答案網格
- 版本
- ARC-AGI-1 與更困難的 ARC-AGI-2
- 特點
- 人類容易、模型困難,是少數保有大幅人機落差的基準
Humanity's Last Exam (HLE)
2025極難由全球各領域專家徵集的極難題目集,涵蓋數學、人文、自然科學等上百個子領域,明確以「現有基準都被刷爆了,需要一個還沒被解決的」為出發點設計。
- 題數
- 約 2,500
- 形式
- 選擇題與簡答混合
- 特點
- 包含大量需要專業訓練才能作答的題目;亦常用於觀察模型的過度自信程度
BIG-Bench Hard (BBH)
2022大致飽和從 BIG-Bench 的 200 多個任務中,挑出當時語言模型還贏不過人類平均的 23 個子任務。是早期驗證 chain-of-thought 提示有效性的重要證據來源。
- 任務數
- 23
- 歷史意義
- 顯示加入思考步驟可大幅改變表現
HellaSwag / WinoGrande / ARC
2018–2019已飽和常識推理與指代消解的經典基準。在當年具有很強的鑑別力,現在前沿模型多半在 95% 以上,主要用途已轉為小模型的迴歸測試而非能力排名。
飽和不等於沒用。已飽和的基準仍適合當作迴歸測試 —— 分數突然掉下來通常代表訓練流程出了問題。它只是不再適合用來比較兩個前沿模型的高下。