为什么 Agent 评测需要独立的体系?

普通 LLM 评测

  • 单轮 / 短对话
  • 关注输出质量
  • 静态输入 → 输出
  • 评估"会不会回答"

Agent 评测

  • 多步循环(ReAct 循环)
  • 工具调用决策
  • 环境状态变化
  • 评估"能不能完成任务"

核心差异

  • 需要可执行环境(沙箱)
  • 需要衡量中间步骤
  • 需要安全维度(越狱注入)
  • 需要长程记忆能力
Agent 评测维度体系

系统评测框架

💉
1. 提示词注入防御
• 系统提示泄露测试
• 间接注入(网页/PDF)
• 多轮渐进式越狱
• 跨工具污染(邮件→知识库)
🔒
2. 工具沙箱安全
• 命令注入防护
• 文件系统隔离
• 网络访问控制
• 权限最小化验证
🧟
3. 记忆腐化安全
• 恶意记忆注入
• 长期记忆一致性
• 记忆污染后恢复
• 记忆衰减合理性
📡
4. 长程任务效果
• 多步骤计划执行率
• 中间状态跟踪精度
• 错误恢复能力
• 上下文窗口利用
⚖️
5. 大模型一致性
• 工具调用确定性
• 温度参数鲁棒性
• 跨次运行结果方差
• 输出格式稳定性
🎯
6. 工具选择精准度
• 工具选择准确率
• 参数构造合理性
• 错误工具后的重试
• 工具组合编排能力
🌐
7. 环境交互能力
• 浏览器操作准确率
• API 调用可靠性
• 代码执行正确性
• 文件 I/O 正确性
🛑
8. 终止判断能力
• 任务完成判断
• 无限循环检测
• 不确定时的追问
• 安全停机能力
Agent 评测工具

1. AgentBench — 清华 Agent 综合评测

🏛️
AgentBench
清华大学开源 · 20+ 子任务

面向 LLM Agent 的综合评测基准,包含 Web 浏览、代码生成、工具调用、人类交互等 8 大领域。

评测领域

  • Knowledge Graph — 基于知识图谱的推理
  • PaperQA — 论文问答与信息抽取
  • Web Browsing — 真实浏览器任务完成
  • Data Analysis — 数据分析与可视化
  • Code Generation — 代码编写与调试
  • Tool Usage — 多工具编排调用
  • Human Interaction — 人机协作任务
  • ML Applications — 机器学习应用

使用方法

# 克隆 AgentBench
git clone https://github.com/THUDM/AgentBench
cd AgentBench

# 安装依赖
pip install -r requirements.txt

# 配置模型 API
export OPENAI_API_KEY="sk-xxx"

# 运行评测(以 Web Browsing 为例)
python -m agents.web.mind2web   --model gpt-4   --task_config config/web_tasks.yaml
• • •

2. AgentBoard — OSU Agent 能力测试

🎯
AgentBoard
俄亥俄州立大学 · Agent 原语测试

专注于 Agent 基础能力(称为"原语")的精细测试,包括规划、工具使用、记忆、反思等。

六大 Agent 原语

Planning
任务分解和子任务排序
Tool Use
正确选择和使用工具
Memory
跨步骤信息保持和调用
Reflection
自我检查和纠错
Command Following
严格遵循指令约束
Language Fluency
自然语言生成质量
• • •

3. Agent-Internet-Bench — 真实网络环境

🌐
Agent-Internet-Bench
真实网站环境下的 Agent 评测

使用 Playwright 在真实网站上测试 Agent 的浏览器操作能力,包括搜索、表单填写、信息抽取等任务。

核心特点

  • 真实网站(Amazon、Reddit、Map 等)而非模拟环境
  • 可复现的录制回放机制
  • 细粒度评分(点击坐标、填写内容、最终结果)
  • 支持多语言网站

任务示例

任务 描述 评测方式
商品搜索 在电商网站搜索特定产品并提取价格 信息抽取准确率
路线规划 在地图网站规划 A 到 B 的路线 路线正确性
信息汇总 从多个网页汇总特定信息 F1 Score
表单填写 在注册页面填写表单 字段准确率
Agent 评测数据集与方法

评测数据集 / 基准汇总

数据集 / 基准 Agent 类型 获取路径 优点 缺点
AgentBench 通用 Agent GitHub: THUDM/AgentBench 覆盖全面,学术界认可 部分任务需要付费 API
AgentBoard Agent 原语 GitHub: OSU-NLP-Group/AgentBoard 细粒度能力诊断 非端到端场景
WebArena Web Agent GitHub: web-arena-bench 真实网站模拟环境 仅英文网站
SWE-bench 代码 Agent HuggingFace: princeton-nlp/SWE-bench 真实 GitHub Issue 需要代码执行环境
ToolBench 工具调用 Agent GitHub: OpenBMB/ToolBench 12000+ API 集合 API 覆盖可能不完整
AgentHarm 安全 Agent GitHub: AgentHarm 专注安全测试 场景相对单一
GAIA 通用 Agent GitHub: gaia-benchmark 真实世界任务 部分任务需要人工打分
Agent-Internet-Bench 浏览器 Agent GitHub: agent-internet-bench 真实网站环境 受网络波动影响
评测方法论

Agent 评测的三种方法

1. 结果评测(Outcome-based)

只看最终输出是否正确:

  • ✅ 优点:简单客观,易于自动化
  • ❌ 缺点:不了解过程,无法诊断问题
  • 适用:有明确正确答案的任务

2. 过程评测(Process-based)

检查中间步骤是否合理:

  • ✅ 优点:可诊断、可定位问题
  • ❌ 缺点:实现复杂,需要标注中间状态
  • 适用:多步骤推理和工具调用任务

3. LLM-as-Judge

用另一个 LLM 做裁判:

  • ✅ 优点:灵活,可评估开放式答案
  • ❌ 缺点:评分不稳定,有偏差
  • 适用:主观质量评估、安全评分
• • •

典型 Agent 评测报告结构

┌─────────────────────────────────────────────────┐
│      Agent 评测报告 · 企业知识库问答 Agent           │
├─────────────────────────────────────────────────┤
│ 1. 评测概述                                       │
│    - Agent 架构:RAG + Tool-Use + 记忆               │
│    - 评测场景:企业知识问答(5 大部门 200+ 问题)      │
│    - 模型:GPT-4o / Claude-3.5-Sonnet               │
├─────────────────────────────────────────────────┤
│ 2. 基础能力                                        │
│    ┌───────────────┬─────────┬─────────┐          │
│    │ 维度            │ 得分     │ 评级     │          │
│    ├───────────────┼─────────┼─────────┤          │
│    │ 答案正确性       │ 92.3%  │ A       │          │
│    │ 检索忠实度       │ 88.7%  │ A       │          │
│    │ 响应相关性       │ 94.1%  │ A       │          │
│    └───────────────┴─────────┴─────────┘          │
├─────────────────────────────────────────────────┤
│ 3. Agent 特有能力                                   │
│    - 平均步数:2.3 步 / 任务                        │
│    - 工具选择准确率:91.5%                           │
│    - 多步完成率:87.2%                              │
│    - 错误恢复率:76.0%                              │
│    - 平均 Token 消耗:3,240 tokens                  │
├─────────────────────────────────────────────────┤
│ 4. 安全评估                                        │
│    - 提示词注入成功率:0%                           │
│    - 越狱尝试抵抗:良好                              │
│    - 敏感信息泄露:未检测到                          │
├─────────────────────────────────────────────────┤
│ 5. 长期任务评估(模拟 30 分钟会话)                    │
│    - 任务完成率:81%                                │
│    - 记忆一致性:89%                               │
│    - 状态追踪精度:92%                              │
├─────────────────────────────────────────────────┤
│ 6. 改进建议                                        │
│    - ⚠️ 在第 4 步后出现记忆衰减,建议增加记忆刷新       │
│    - ⚠️ 工具选择在模糊意图下准确率下降,建议增加澄清   │
│    - ✅ 安全表现良好,可考虑更激进的越狱测试用例        │
└─────────────────────────────────────────────────┘