單函式層級
HumanEval
2021已飽和OpenAI 隨 Codex 一起發表。每題給一個函式簽名與 docstring,模型補完函式本體,再用隱藏的單元測試驗證。pass@k 這個指標就是在這篇論文中普及的。
- 題數
- 164(Python)
- 指標
- pass@1 / pass@10
- 現況
- 前沿模型普遍 95% 以上;題目量少且已被大量複製到網路上,污染風險高
MBPP
2021已飽和Mostly Basic Python Problems。入門到中階的 Python 題目,每題附三個測試案例。常與 HumanEval 並列引用,難度定位相近。
- 題數
- 約 1,000(含人工驗證的 MBPP+ 變體)
真實工程層級
SWE-bench
2023仍有鑑別力目前最具代表性的軟體工程基準。題目取自 12 個熱門 Python 開源專案的真實 GitHub issue 與對應的修復 PR。模型拿到 issue 描述與整個 repo,必須產出一個能讓該 PR 附帶測試通過的 patch。
- 題數
- 2,294(完整集)
- 常用子集
- SWE-bench Verified,500 題,由人工確認題目敘述充分且測試合理
- 指標
- 解決率(測試全數通過的比例)
- 注意
- 成績高度依賴外層的 agent 框架與可用工具,不是純粹的模型能力比較
LiveCodeBench
2024仍有鑑別力題目持續從 LeetCode、AtCoder、Codeforces 抓取新賽題,並記錄每題的發布時間。評測時可以只取模型訓練截止日之後的題目,藉此排除訓練資料污染 —— 這是它最重要的設計。
- 形式
- 競賽程式題,附時間戳
- 價值
- 抗污染;可觀察同一模型在「見過」與「沒見過」時段的分數落差
Aider Polyglot
2024仍有鑑別力由 Aider 專案維護,測的是編輯既有程式碼而非從零撰寫,涵蓋 C++、Go、Java、JavaScript、Python、Rust 等多種語言。同時檢驗模型是否能穩定產出格式正確的 diff。
- 特點
- 會分開統計「答案正確」與「編輯格式正確」,對實務工具整合很有參考價值
Terminal-Bench
2025仍有鑑別力在真實終端環境中完成任務:編譯專案、除錯環境設定、處理檔案系統操作等。與 SWE-bench 互補 —— 後者聚焦程式碼修改,前者聚焦命令列環境的操作能力。
BigCodeBench
2024仍有鑑別力要求在單一任務中正確組合多個函式庫的 API 呼叫,比 HumanEval 更接近實際開發情境。強調工具鏈的複合使用而非演算法巧思。
看 SWE-bench 分數時務必確認評測配置。同一個模型搭配不同的 agent scaffold、不同的重試次數、是否允許執行測試,分數可以差出十幾個百分點。官方排行榜會標註每個提交所用的框架。