誠實性與安全性
TruthfulQA
2021仍有參考價值題目刻意針對人類常見的錯誤信念與都市傳說設計,測試模型會不會為了迎合提問而複述流傳廣泛的謬誤。名稱雖是「真實性」,實際測的是對誤導性前提的抵抗力。
- 題數
- 817
- 涵蓋
- 健康、法律、金融、迷信等 38 個類別
HarmBench / AgentHarm
2024仍有鑑別力標準化的紅隊評測框架,涵蓋多種越獄攻擊手法與有害行為分類。AgentHarm 進一步延伸到代理情境 —— 檢驗模型在具備工具能力時,是否會執行有害的多步驟任務。
- 用途
- 攻擊成功率(ASR)比較,數值越低越好
XSTest / OR-Bench
2024仍有鑑別力測的是過度拒答:表面上帶有敏感字眼、實際上完全無害的請求,模型會不會誤判而拒絕。與 HarmBench 形成一組對照 —— 只看其中一邊會得到誤導性的結論。
安全性分數必須成對讀。一個把所有請求都拒絕的模型,在 HarmBench 上會拿到完美分數,但在 XSTest 上會很難看。單獨引用任何一邊都不能說明模型的實際可用性。
指令遵循
IFEval
2023仍有鑑別力Instruction-Following Eval。所有指令都是可程式化驗證的,例如「回答必須少於 300 字」、「不可使用逗號」、「以 JSON 格式輸出」。因為不需要模型或人類評分,結果完全客觀且可重現。
- 特點
- 零主觀性,是少數不需要 judge 的評測
LMArena / Arena-Hard
2023仍有鑑別力以人類盲測兩兩比較計算 Elo 分數。反映的是整體偏好而非單一能力,容易受回答長度與排版風格影響 —— 這是它長期被討論的偏差來源。Arena-Hard 則是從中萃取困難提示的自動化版本。
- 性質
- 偏好排名,與能力基準互補而非取代
長脈絡
Needle in a Haystack
2023大致飽和在一大段無關文字中埋入一句關鍵資訊,測試模型能否找回。概念直觀,但太容易 —— 現在多數長脈絡模型都能接近全對,已不足以區分能力。
RULER
2024仍有鑑別力針對上述問題設計的加強版:多根針、需要聚合多處資訊、變數追蹤等更複雜的任務。常見結論是模型的有效脈絡長度明顯短於它宣稱支援的長度。
- 價值
- 可畫出隨長度衰減的曲線,而非單一數字
LongBench / MRCR
2023–2024仍有鑑別力LongBench 涵蓋長文件問答、摘要與程式碼理解等多種長脈絡任務;MRCR 則測多輪對話中的指代消解 —— 需要在很長的對話歷史中正確定位「第幾次提到的那個」。