BenchIndex

Category

安全與長文本

這頁收的是三組性質不同、但都不適合用「越高越好」單一視角解讀的基準:誠實性與拒答行為、指令遵循,以及長脈絡下的資訊檢索。

誠實性與安全性

TruthfulQA

2021仍有參考價值

題目刻意針對人類常見的錯誤信念與都市傳說設計,測試模型會不會為了迎合提問而複述流傳廣泛的謬誤。名稱雖是「真實性」,實際測的是對誤導性前提的抵抗力。

題數
817
涵蓋
健康、法律、金融、迷信等 38 個類別

HarmBench / AgentHarm

2024仍有鑑別力

標準化的紅隊評測框架,涵蓋多種越獄攻擊手法與有害行為分類。AgentHarm 進一步延伸到代理情境 —— 檢驗模型在具備工具能力時,是否會執行有害的多步驟任務。

用途
攻擊成功率(ASR)比較,數值越低越好

XSTest / OR-Bench

2024仍有鑑別力

測的是過度拒答:表面上帶有敏感字眼、實際上完全無害的請求,模型會不會誤判而拒絕。與 HarmBench 形成一組對照 —— 只看其中一邊會得到誤導性的結論。

安全性分數必須成對讀。一個把所有請求都拒絕的模型,在 HarmBench 上會拿到完美分數,但在 XSTest 上會很難看。單獨引用任何一邊都不能說明模型的實際可用性。

指令遵循

IFEval

2023仍有鑑別力

Instruction-Following Eval。所有指令都是可程式化驗證的,例如「回答必須少於 300 字」、「不可使用逗號」、「以 JSON 格式輸出」。因為不需要模型或人類評分,結果完全客觀且可重現。

特點
零主觀性,是少數不需要 judge 的評測

LMArena / Arena-Hard

2023仍有鑑別力

以人類盲測兩兩比較計算 Elo 分數。反映的是整體偏好而非單一能力,容易受回答長度與排版風格影響 —— 這是它長期被討論的偏差來源。Arena-Hard 則是從中萃取困難提示的自動化版本。

性質
偏好排名,與能力基準互補而非取代

長脈絡

Needle in a Haystack

2023大致飽和

在一大段無關文字中埋入一句關鍵資訊,測試模型能否找回。概念直觀,但太容易 —— 現在多數長脈絡模型都能接近全對,已不足以區分能力。

RULER

2024仍有鑑別力

針對上述問題設計的加強版:多根針、需要聚合多處資訊、變數追蹤等更複雜的任務。常見結論是模型的有效脈絡長度明顯短於它宣稱支援的長度。

價值
可畫出隨長度衰減的曲線,而非單一數字

LongBench / MRCR

2023–2024仍有鑑別力

LongBench 涵蓋長文件問答、摘要與程式碼理解等多種長脈絡任務;MRCR 則測多輪對話中的指代消解 —— 需要在很長的對話歷史中正確定位「第幾次提到的那個」。