🤖 Agent 评测
超越单轮对话——评测 Agent 的多步推理、工具使用、环境交互和长期任务执行能力。
为什么 Agent 评测需要独立的体系?
普通 LLM 评测
- 单轮 / 短对话
- 关注输出质量
- 静态输入 → 输出
- 评估"会不会回答"
Agent 评测
- 多步循环(ReAct 循环)
- 工具调用决策
- 环境状态变化
- 评估"能不能完成任务"
核心差异
- 需要可执行环境(沙箱)
- 需要衡量中间步骤
- 需要安全维度(越狱注入)
- 需要长程记忆能力
Agent 评测维度体系
系统评测框架
1. 提示词注入防御
• 系统提示泄露测试
• 间接注入(网页/PDF)
• 多轮渐进式越狱
• 跨工具污染(邮件→知识库)
• 间接注入(网页/PDF)
• 多轮渐进式越狱
• 跨工具污染(邮件→知识库)
2. 工具沙箱安全
• 命令注入防护
• 文件系统隔离
• 网络访问控制
• 权限最小化验证
• 文件系统隔离
• 网络访问控制
• 权限最小化验证
3. 记忆腐化安全
• 恶意记忆注入
• 长期记忆一致性
• 记忆污染后恢复
• 记忆衰减合理性
• 长期记忆一致性
• 记忆污染后恢复
• 记忆衰减合理性
4. 长程任务效果
• 多步骤计划执行率
• 中间状态跟踪精度
• 错误恢复能力
• 上下文窗口利用
• 中间状态跟踪精度
• 错误恢复能力
• 上下文窗口利用
5. 大模型一致性
• 工具调用确定性
• 温度参数鲁棒性
• 跨次运行结果方差
• 输出格式稳定性
• 温度参数鲁棒性
• 跨次运行结果方差
• 输出格式稳定性
6. 工具选择精准度
• 工具选择准确率
• 参数构造合理性
• 错误工具后的重试
• 工具组合编排能力
• 参数构造合理性
• 错误工具后的重试
• 工具组合编排能力
7. 环境交互能力
• 浏览器操作准确率
• API 调用可靠性
• 代码执行正确性
• 文件 I/O 正确性
• API 调用可靠性
• 代码执行正确性
• 文件 I/O 正确性
8. 终止判断能力
• 任务完成判断
• 无限循环检测
• 不确定时的追问
• 安全停机能力
• 无限循环检测
• 不确定时的追问
• 安全停机能力
Agent 评测工具
1. AgentBench — 清华 Agent 综合评测
AgentBench
清华大学开源 · 20+ 子任务
面向 LLM Agent 的综合评测基准,包含 Web 浏览、代码生成、工具调用、人类交互等 8 大领域。
评测领域
- Knowledge Graph — 基于知识图谱的推理
- PaperQA — 论文问答与信息抽取
- Web Browsing — 真实浏览器任务完成
- Data Analysis — 数据分析与可视化
- Code Generation — 代码编写与调试
- Tool Usage — 多工具编排调用
- Human Interaction — 人机协作任务
- ML Applications — 机器学习应用
使用方法
# 克隆 AgentBench
git clone https://github.com/THUDM/AgentBench
cd AgentBench
# 安装依赖
pip install -r requirements.txt
# 配置模型 API
export OPENAI_API_KEY="sk-xxx"
# 运行评测(以 Web Browsing 为例)
python -m agents.web.mind2web --model gpt-4 --task_config config/web_tasks.yaml
• • •
• • •
3. Agent-Internet-Bench — 真实网络环境
Agent-Internet-Bench
真实网站环境下的 Agent 评测
使用 Playwright 在真实网站上测试 Agent 的浏览器操作能力,包括搜索、表单填写、信息抽取等任务。
核心特点
- 真实网站(Amazon、Reddit、Map 等)而非模拟环境
- 可复现的录制回放机制
- 细粒度评分(点击坐标、填写内容、最终结果)
- 支持多语言网站
任务示例
| 任务 | 描述 | 评测方式 |
|---|---|---|
| 商品搜索 | 在电商网站搜索特定产品并提取价格 | 信息抽取准确率 |
| 路线规划 | 在地图网站规划 A 到 B 的路线 | 路线正确性 |
| 信息汇总 | 从多个网页汇总特定信息 | F1 Score |
| 表单填写 | 在注册页面填写表单 | 字段准确率 |
Agent 评测数据集与方法
评测数据集 / 基准汇总
| 数据集 / 基准 | Agent 类型 | 获取路径 | 优点 | 缺点 |
|---|---|---|---|---|
| AgentBench | 通用 Agent | GitHub: THUDM/AgentBench | 覆盖全面,学术界认可 | 部分任务需要付费 API |
| AgentBoard | Agent 原语 | GitHub: OSU-NLP-Group/AgentBoard | 细粒度能力诊断 | 非端到端场景 |
| WebArena | Web Agent | GitHub: web-arena-bench | 真实网站模拟环境 | 仅英文网站 |
| SWE-bench | 代码 Agent | HuggingFace: princeton-nlp/SWE-bench | 真实 GitHub Issue | 需要代码执行环境 |
| ToolBench | 工具调用 Agent | GitHub: OpenBMB/ToolBench | 12000+ API 集合 | API 覆盖可能不完整 |
| AgentHarm | 安全 Agent | GitHub: AgentHarm | 专注安全测试 | 场景相对单一 |
| GAIA | 通用 Agent | GitHub: gaia-benchmark | 真实世界任务 | 部分任务需要人工打分 |
| Agent-Internet-Bench | 浏览器 Agent | GitHub: agent-internet-bench | 真实网站环境 | 受网络波动影响 |
评测方法论
Agent 评测的三种方法
1. 结果评测(Outcome-based)
只看最终输出是否正确:
- ✅ 优点:简单客观,易于自动化
- ❌ 缺点:不了解过程,无法诊断问题
- 适用:有明确正确答案的任务
2. 过程评测(Process-based)
检查中间步骤是否合理:
- ✅ 优点:可诊断、可定位问题
- ❌ 缺点:实现复杂,需要标注中间状态
- 适用:多步骤推理和工具调用任务
3. LLM-as-Judge
用另一个 LLM 做裁判:
- ✅ 优点:灵活,可评估开放式答案
- ❌ 缺点:评分不稳定,有偏差
- 适用:主观质量评估、安全评分
• • •
典型 Agent 评测报告结构
┌─────────────────────────────────────────────────┐
│ Agent 评测报告 · 企业知识库问答 Agent │
├─────────────────────────────────────────────────┤
│ 1. 评测概述 │
│ - Agent 架构:RAG + Tool-Use + 记忆 │
│ - 评测场景:企业知识问答(5 大部门 200+ 问题) │
│ - 模型:GPT-4o / Claude-3.5-Sonnet │
├─────────────────────────────────────────────────┤
│ 2. 基础能力 │
│ ┌───────────────┬─────────┬─────────┐ │
│ │ 维度 │ 得分 │ 评级 │ │
│ ├───────────────┼─────────┼─────────┤ │
│ │ 答案正确性 │ 92.3% │ A │ │
│ │ 检索忠实度 │ 88.7% │ A │ │
│ │ 响应相关性 │ 94.1% │ A │ │
│ └───────────────┴─────────┴─────────┘ │
├─────────────────────────────────────────────────┤
│ 3. Agent 特有能力 │
│ - 平均步数:2.3 步 / 任务 │
│ - 工具选择准确率:91.5% │
│ - 多步完成率:87.2% │
│ - 错误恢复率:76.0% │
│ - 平均 Token 消耗:3,240 tokens │
├─────────────────────────────────────────────────┤
│ 4. 安全评估 │
│ - 提示词注入成功率:0% │
│ - 越狱尝试抵抗:良好 │
│ - 敏感信息泄露:未检测到 │
├─────────────────────────────────────────────────┤
│ 5. 长期任务评估(模拟 30 分钟会话) │
│ - 任务完成率:81% │
│ - 记忆一致性:89% │
│ - 状态追踪精度:92% │
├─────────────────────────────────────────────────┤
│ 6. 改进建议 │
│ - ⚠️ 在第 4 步后出现记忆衰减,建议增加记忆刷新 │
│ - ⚠️ 工具选择在模糊意图下准确率下降,建议增加澄清 │
│ - ✅ 安全表现良好,可考虑更激进的越狱测试用例 │
└─────────────────────────────────────────────────┘