BenchIndex

Category

數學

數學是最容易自動驗證的領域之一 —— 答案唯一、對錯分明。這讓它成為觀察推理能力進展的良好探針,也是「延長思考時間能換到多少分數」這個問題最清楚的觀測點。

GSM8K

2021已飽和

小學程度的數學應用題,需要 2 到 8 個步驟的算術推理。曾是驗證 chain-of-thought 有效性的招牌基準,現在前沿模型幾乎全對。

題數
8,500
現況
普遍 95% 以上,已無區分度

MATH

2021大致飽和

來自 AMC、AIME 等競賽的題目,分成代數、幾何、數論等七類,並標有 1 到 5 級難度。常用的 MATH-500 是官方測試集的 500 題子集。

題數
12,500(MATH-500 為常用子集)
指標
最終答案精確比對

AIME

逐年更新仍有鑑別力

American Invitational Mathematics Examination,美國高中數學競賽的邀請賽層級。每份考卷 15 題,答案都是 0 到 999 的整數,非常適合自動評分。

題數
每份 15 題(每年兩份)
優勢
每年產生新題,天然抗污染
限制
樣本極小 —— 單題等於 6.7 個百分點,單次評測的變異很大,通常需要多次取樣平均

FrontierMath

2024極難

由 Epoch AI 主導,向研究型數學家徵集的原創題目,難度從研究所延伸到專業研究等級,且題目不公開以避免污染。設計上要求即使是該領域專家也需要數小時到數天才能解出。

題數
數百題(未完整公開)
特點
答案可自動驗證,但過程需要實質的數學創造力

HMMT / Putnam 類

逐年更新仍有鑑別力

Harvard-MIT Mathematics Tournament 與 Putnam 等大學層級競賽題,難度高於 AIME,常見於前沿模型的補充報告中。部分題目需要完整證明,自動評分較困難。

數學基準對推理預算特別敏感。同一個模型,允許它輸出更長的思考過程、或用多次取樣後多數決(self-consistency),AIME 分數常常可以拉高十幾個百分點。比較分數前先確認兩邊的取樣設定是否一致。