官方排行榜
開源評測框架
| 專案 | 用途 |
|---|---|
| lm-evaluation-harness | EleutherAI 維護,涵蓋數百個任務的標準化執行框架,是多數論文報告的基礎 |
| HELM | Stanford CRFM,強調同一套設定下的橫向比較與完整記錄 |
| OpenAI Evals | 可自訂評測任務的框架,適合建立內部的專屬評測集 |
| inspect_ai | UK AI Safety Institute 維護,偏重代理與安全性評測 |
| SWE-bench harness | 官方容器化執行環境,確保 patch 驗證結果可重現 |
External
本站是整理與註記,不是資料來源。實際分數請以各基準的官方排行榜為準 —— 它們會隨新模型提交持續更新,而任何二手整理都會過時。
| 專案 | 用途 |
|---|---|
| lm-evaluation-harness | EleutherAI 維護,涵蓋數百個任務的標準化執行框架,是多數論文報告的基礎 |
| HELM | Stanford CRFM,強調同一套設定下的橫向比較與完整記錄 |
| OpenAI Evals | 可自訂評測任務的框架,適合建立內部的專屬評測集 |
| inspect_ai | UK AI Safety Institute 維護,偏重代理與安全性評測 |
| SWE-bench harness | 官方容器化執行環境,確保 patch 驗證結果可重現 |