GAIA
2023仍有鑑別力General AI Assistants。題目對人類而言概念上並不難,但需要真的去查資料、讀檔案、做計算才能得到答案。分成三個難度等級,等級越高需要越多步驟與越多種工具。
- 題數
- 466
- 設計理念
- 人類正確率高、模型正確率低 —— 刻意製造人機落差
- 指標
- 最終答案精確比對
OSWorld
2024極難在真實作業系統環境中執行任務,跨越檔案總管、瀏覽器、試算表、影像編輯等多個應用程式。以最終系統狀態是否符合預期來評分,而非比對文字輸出。
- 任務數
- 369
- 環境
- Ubuntu / Windows 虛擬機
- 現況
- 人類完成率遠高於模型,是目前落差最大的基準之一
WebArena / VisualWebArena
2023–2024仍有鑑別力自建的可重現網站環境(電商、論壇、程式碼託管、地圖),任務需要跨站操作並實際改變網站狀態。因為環境自架,評測結果不受外部網站改版影響 —— 這是它相對於真實網頁測試的關鍵優勢。
- 評分
- 依最終狀態或執行結果判定,非比對文字
τ-bench (tau-bench)
2024仍有鑑別力模擬客服情境下的工具使用:模型必須與一個扮演使用者的模型多輪對話,同時遵守領域規則(例如退款政策),並正確呼叫後端 API。特別檢驗一致性 —— 同一題重複多次是否都能成功。
- 領域
- 零售、航空
- 特色指標
pass^k:連續 k 次都成功的比率,比 pass@k 嚴格得多
BrowseComp
2025極難專測網頁瀏覽下的資訊尋找能力。答案短且可驗證,但需要在網路上進行相當深入的多跳查找才能定位,難以靠單次搜尋解決。
MLE-bench
2024極難取自 Kaggle 競賽的機器學習工程任務:資料前處理、模型訓練、提交結果,以競賽排行榜的獎牌門檻作為評分標準。任務長度可達數小時,考驗長時程的自主執行能力。
代理基準的分數波動特別大。環境版本、逾時設定、允許的最大步數、是否可以重試 —— 任何一項改變都會顯著影響結果。同一模型在同一基準上跑兩次也可能差好幾個百分點,看單次結果要保守。