BenchIndex

Category

推理與知識

這一類基準測的是廣度知識的召回,以及需要多步串接的推理。它同時也是飽和最嚴重的一類 —— 2020 年代初期的幾個代表性基準現在幾乎失去鑑別力。

MMLU

2020已飽和

Massive Multitask Language Understanding。橫跨 57 個科目的四選一選擇題,從高中數學到專業法律、臨床醫學都有。長年被當成「通用知識」的預設指標。

題數
15,908
形式
4 選 1 選擇題
指標
準確率(常用 5-shot)
現況
前沿模型普遍在 88% 以上,題目本身也被查出有標註錯誤,差距已不具意義

MMLU-Pro

2024仍有鑑別力

針對 MMLU 飽和問題的重製版。選項從 4 個增加到 10 個,大幅降低瞎猜的期望分數,並移除了原版中有問題的題目、加入更多需要推理而非記憶的題型。

題數
約 12,000
形式
10 選 1 選擇題
差異
隨機猜測基線從 25% 降到 10%

GPQA

2023仍有鑑別力

Graduate-Level Google-Proof Q&A。由生物、物理、化學領域的博士級專家撰寫,設計目標是「即使能自由上網搜尋也很難答對」—— 驗證時非該領域的專家在有網路的情況下正確率仍偏低。

題數
448(Diamond 子集 198 題)
常用子集
GPQA Diamond,即專家一致答對、非專家答錯的題目
注意
Diamond 僅 198 題,單題約值 0.5 個百分點,小幅差距須看信賴區間

ARC-AGI

2019 / 2025極難

François Chollet 提出的抽象推理測驗。題目是彩色網格的輸入輸出配對,要從少數範例中歸納出轉換規則再套用到新的網格上。刻意設計成無法靠記憶語料解決,強調的是對新規則的即時歸納。

形式
網格轉換,需輸出完整答案網格
版本
ARC-AGI-1 與更困難的 ARC-AGI-2
特點
人類容易、模型困難,是少數保有大幅人機落差的基準

Humanity's Last Exam (HLE)

2025極難

由全球各領域專家徵集的極難題目集,涵蓋數學、人文、自然科學等上百個子領域,明確以「現有基準都被刷爆了,需要一個還沒被解決的」為出發點設計。

題數
約 2,500
形式
選擇題與簡答混合
特點
包含大量需要專業訓練才能作答的題目;亦常用於觀察模型的過度自信程度

BIG-Bench Hard (BBH)

2022大致飽和

從 BIG-Bench 的 200 多個任務中,挑出當時語言模型還贏不過人類平均的 23 個子任務。是早期驗證 chain-of-thought 提示有效性的重要證據來源。

任務數
23
歷史意義
顯示加入思考步驟可大幅改變表現

HellaSwag / WinoGrande / ARC

2018–2019已飽和

常識推理與指代消解的經典基準。在當年具有很強的鑑別力,現在前沿模型多半在 95% 以上,主要用途已轉為小模型的迴歸測試而非能力排名。

飽和不等於沒用。已飽和的基準仍適合當作迴歸測試 —— 分數突然掉下來通常代表訓練流程出了問題。它只是不再適合用來比較兩個前沿模型的高下。