BenchIndex

Category

代理與工具使用

代理類基準測的不是單次回答,而是一整條行動軌跡:規劃、呼叫工具、看到結果、修正、再繼續。錯誤會累積,所以單步正確率很高的模型在這裡仍可能大幅失分。

GAIA

2023仍有鑑別力

General AI Assistants。題目對人類而言概念上並不難,但需要真的去查資料、讀檔案、做計算才能得到答案。分成三個難度等級,等級越高需要越多步驟與越多種工具。

題數
466
設計理念
人類正確率高、模型正確率低 —— 刻意製造人機落差
指標
最終答案精確比對

OSWorld

2024極難

在真實作業系統環境中執行任務,跨越檔案總管、瀏覽器、試算表、影像編輯等多個應用程式。以最終系統狀態是否符合預期來評分,而非比對文字輸出。

任務數
369
環境
Ubuntu / Windows 虛擬機
現況
人類完成率遠高於模型,是目前落差最大的基準之一

WebArena / VisualWebArena

2023–2024仍有鑑別力

自建的可重現網站環境(電商、論壇、程式碼託管、地圖),任務需要跨站操作並實際改變網站狀態。因為環境自架,評測結果不受外部網站改版影響 —— 這是它相對於真實網頁測試的關鍵優勢。

評分
依最終狀態或執行結果判定,非比對文字

τ-bench (tau-bench)

2024仍有鑑別力

模擬客服情境下的工具使用:模型必須與一個扮演使用者的模型多輪對話,同時遵守領域規則(例如退款政策),並正確呼叫後端 API。特別檢驗一致性 —— 同一題重複多次是否都能成功。

領域
零售、航空
特色指標
pass^k:連續 k 次都成功的比率,比 pass@k 嚴格得多

BrowseComp

2025極難

專測網頁瀏覽下的資訊尋找能力。答案短且可驗證,但需要在網路上進行相當深入的多跳查找才能定位,難以靠單次搜尋解決。

MLE-bench

2024極難

取自 Kaggle 競賽的機器學習工程任務:資料前處理、模型訓練、提交結果,以競賽排行榜的獎牌門檻作為評分標準。任務長度可達數小時,考驗長時程的自主執行能力。

代理基準的分數波動特別大。環境版本、逾時設定、允許的最大步數、是否可以重試 —— 任何一項改變都會顯著影響結果。同一模型在同一基準上跑兩次也可能差好幾個百分點,看單次結果要保守。