GSM8K
2021已飽和小學程度的數學應用題,需要 2 到 8 個步驟的算術推理。曾是驗證 chain-of-thought 有效性的招牌基準,現在前沿模型幾乎全對。
- 題數
- 8,500
- 現況
- 普遍 95% 以上,已無區分度
MATH
2021大致飽和來自 AMC、AIME 等競賽的題目,分成代數、幾何、數論等七類,並標有 1 到 5 級難度。常用的 MATH-500 是官方測試集的 500 題子集。
- 題數
- 12,500(MATH-500 為常用子集)
- 指標
- 最終答案精確比對
AIME
逐年更新仍有鑑別力American Invitational Mathematics Examination,美國高中數學競賽的邀請賽層級。每份考卷 15 題,答案都是 0 到 999 的整數,非常適合自動評分。
- 題數
- 每份 15 題(每年兩份)
- 優勢
- 每年產生新題,天然抗污染
- 限制
- 樣本極小 —— 單題等於 6.7 個百分點,單次評測的變異很大,通常需要多次取樣平均
FrontierMath
2024極難由 Epoch AI 主導,向研究型數學家徵集的原創題目,難度從研究所延伸到專業研究等級,且題目不公開以避免污染。設計上要求即使是該領域專家也需要數小時到數天才能解出。
- 題數
- 數百題(未完整公開)
- 特點
- 答案可自動驗證,但過程需要實質的數學創造力
HMMT / Putnam 類
逐年更新仍有鑑別力Harvard-MIT Mathematics Tournament 與 Putnam 等大學層級競賽題,難度高於 AIME,常見於前沿模型的補充報告中。部分題目需要完整證明,自動評分較困難。
數學基準對推理預算特別敏感。同一個模型,允許它輸出更長的思考過程、或用多次取樣後多數決(self-consistency),AIME 分數常常可以拉高十幾個百分點。比較分數前先確認兩邊的取樣設定是否一致。