大模型与 AI Agent Benchmark 全景指南:它们究竟在评估什么
看模型发布报告时,我们经常会遇到一长串名字:ARC-E、ARC-C、MMLU、GPQA、GSM8K、HumanEval、SWE-bench、GAIA、WebArena、OSWorld……它们的分数不能直接横向比较,因为每个 benchmark 测量的能力、输入形式、可用工具和评分方式都不同。
本文整理一张从“大模型答题”到“Agent 完成真实任务”的评测地图,并解释每个常见 benchmark 究竟是什么、适合测什么,以及不能从分数中推出什么结论。