智能体评测(Agent Evaluation)指针对 AI 智能体(Agent)的专项评测体系。与传统的问答类大模型评测不同,智能体评测关注的是“能不能完成真实任务”——包括多步规划、工具调用、环境交互、错误恢复等,而不是单纯看单轮回答好不好。
与传统评测的区别
- 传统评测:单轮问答,看答案准确率
- 智能体评测:多轮交互,看最终任务是否完成、完成质量如何
- 任务完成率:目标是否达成(如修好一个 Bug、订到一张票)
- 效率:用了多少步、多少轮交互、多少 token
- 鲁棒性:遇到意外情况(网页变化、报错)能否恢复
- 安全性:是否越权操作、是否泄露敏感信息
- SWE-bench:让智能体在真实代码仓库中修 Bug,评估编程能力
- GAIA:面向真实世界任务的通用智能体基准
- WebArena:在模拟网站环境中评估网页操作类智能体