BenchIndex

External

資源

本站是整理與註記,不是資料來源。實際分數請以各基準的官方排行榜為準 —— 它們會隨新模型提交持續更新,而任何二手整理都會過時。

官方排行榜

SWE-bench

官方排行榜會標註每筆提交所用的 agent scaffold 與是否開源。

swebench.com →

LMArena

人類盲測偏好 Elo,附各類別分項與投票數統計。

lmarena.ai →

ARC Prize

ARC-AGI 的官方競賽與排行榜,含逐年任務集說明。

arcprize.org →

Epoch AI

FrontierMath 與各項能力趨勢的長期追蹤資料。

epoch.ai →

Stanford HELM

多面向的整體性評測框架,強調同一套流程下的可比性。

crfm.stanford.edu →

Papers with Code

各基準的歷史 SOTA 曲線與對應論文連結。

paperswithcode.com →

開源評測框架

專案用途
lm-evaluation-harnessEleutherAI 維護,涵蓋數百個任務的標準化執行框架,是多數論文報告的基礎
HELMStanford CRFM,強調同一套設定下的橫向比較與完整記錄
OpenAI Evals可自訂評測任務的框架,適合建立內部的專屬評測集
inspect_aiUK AI Safety Institute 維護,偏重代理與安全性評測
SWE-bench harness官方容器化執行環境,確保 patch 驗證結果可重現