Knowledge Base · v2026.08
大模型 调试 & 评测 实战手册
围绕大模型调试、大模型评测、Agent 评测、大模型记忆四大模块,系统整理主流工具的安装、使用、样例与真实报告,以及分维度的评测数据集与方法论。所有内容均经真实资料溯源,修正了"凭空编造"的仓库链接与事实错误。
4核心模块
15+工具覆盖
30+评测数据集
3真实报告样例
🔬
01 · 大模型调试
LLM Space(逐 step 回放 / 跨 run 打分)、Langfuse、Claude-Tap、Arize Phoenix —— 把 Agent 的每一次模型调用、工具调用、token 消耗都看清楚。
LLM Space · Langfuse · Claude-Tap · Phoenix
进入 →
📊
02 · 大模型评测
Promptfoo、RAGAS、DeepEval、lm-eval-harness。含多模型/多轮对比、RAG 评测与通用能力基准,附真实评测报告与分维度数据集。
Promptfoo · RAGAS · DeepEval · lm-eval
进入 →
🤖
03 · Agent 评测
AgentEval、AgentBench、AgentBoard、WebArena、ToolEmu。构建"注入/沙箱/记忆腐化/长程/一致性"五维系统评测方法论。
AgentEval · AgentBench · WebArena · ToolEmu
进入 →
🧠
04 · 大模型记忆
AgentMemory、Mem0、Zep、MemGPT(Letta)。分层记忆架构、Session/长期记忆、知识图谱,让 Agent 跨会话"记得住"。
AgentMemory · Mem0 · Zep · MemGPT/Letta
进入 →
✓ 真实素材,而非凭空示意
本手册优先使用来源项目中真实产出的素材,并明确标注哪些是"基于官方文档还原的示意"。
已嵌入的真实产物
- LLM Space:4 张真实架构/回放/混沌测试 SVG 图 + 33KB 真实分析 HTML(来自项目记忆)。
- Promptfoo:4 份真实评测报告 HTML(多模型对比 / 多轮对话,含真实打分与断言结果)。
- AgentEval:真实
suite.yaml测试用例配置 + 本机实测结果(5/5 通过)。
!
其余工具在来源项目中无实拍运行截图,本手册采用基于官方文档还原的示意界面并明确标注"示意",避免以假乱真。如需替换为真实截图,可在对应工具页补充。
⚠ 内容边界与隐私
i
本手册刻意排除了来源项目中的敏感内容:含真实 API Key 的
.env 文件、含真实攻击 PoC / IOC / 个人联系方式的红队样本。安全评测维度仅保留公开基准(JailbreakBench、InjecAgent、AgentDojo 等)与方法论,并已脱敏处理。符合"个人隐私信息不泄露到外网"的硬性要求。