MMMU
2023仍有鑑別力Massive Multi-discipline Multimodal Understanding。取材自大學教科書、考卷與講義,橫跨藝術、商業、醫學、工程等六大領域三十個學科。圖片形式非常雜 —— 化學結構式、電路圖、樂譜、醫學影像都有。
- 題數
- 11,500
- 特點
- 需要同時具備該學科知識與圖像解讀能力,兩者缺一不可
- 變體
- MMMU-Pro 加入純截圖題型,答案選項也嵌在圖中,防止模型繞過視覺直接讀文字
MathVista
2023仍有鑑別力視覺情境下的數學推理:從函數圖形讀取資訊、幾何圖形計算、統計圖表推論。是少數能明確暴露「讀得出數字但推不出結論」這種失敗模式的基準。
- 題數
- 約 6,100
ChartQA / DocVQA / AI2D
2021–2022大致飽和分別聚焦圖表問答、文件影像問答與科學示意圖理解。前沿模型表現已相當高,但仍是評估文件處理類應用的實用指標,尤其在需要精確數值讀取的場景。
- 用途
- OCR 與版面理解能力的迴歸測試
Video-MME
2024仍有鑑別力影片理解的綜合評測,影片長度從數十秒到一小時以上,涵蓋短、中、長三個區間。長影片子集特別能檢驗模型的時序記憶與跨片段資訊整合能力。
- 特點
- 可分別觀察不同影片長度下的衰減曲線
MVBench / TempCompass
2023–2024仍有鑑別力專門測試時序理解:動作先後順序、狀態變化、因果關係。設計上刻意讓「只看單一幀」無法作答,藉此排除把影片當成靜態圖片處理的取巧解法。
多模態分數要留意題目洩漏路徑。若題目文字本身就足以推出答案,模型可以完全不看圖也答對。MMMU-Pro 把選項嵌進圖片正是為了堵這條路 —— 引用時註明是原版還是 Pro 版很重要。