~ / llm-debug-evaluation 首页
Knowledge Base · v2026.08

大模型 调试 & 评测 实战手册

围绕大模型调试、大模型评测、Agent 评测、大模型记忆四大模块,系统整理主流工具的安装、使用、样例与真实报告,以及分维度的评测数据集与方法论。所有内容均经真实资料溯源,修正了"凭空编造"的仓库链接与事实错误。

4核心模块
15+工具覆盖
30+评测数据集
3真实报告样例

真实素材,而非凭空示意

本手册优先使用来源项目中真实产出的素材,并明确标注哪些是"基于官方文档还原的示意"。

已嵌入的真实产物

  • LLM Space:4 张真实架构/回放/混沌测试 SVG 图 + 33KB 真实分析 HTML(来自项目记忆)。
  • Promptfoo:4 份真实评测报告 HTML(多模型对比 / 多轮对话,含真实打分与断言结果)。
  • AgentEval:真实 suite.yaml 测试用例配置 + 本机实测结果(5/5 通过)。
!
其余工具在来源项目中无实拍运行截图,本手册采用基于官方文档还原的示意界面并明确标注"示意",避免以假乱真。如需替换为真实截图,可在对应工具页补充。

内容边界与隐私

i
本手册刻意排除了来源项目中的敏感内容:含真实 API Key 的 .env 文件、含真实攻击 PoC / IOC / 个人联系方式的红队样本。安全评测维度仅保留公开基准(JailbreakBench、InjecAgent、AgentDojo 等)与方法论,并已脱敏处理。符合"个人隐私信息不泄露到外网"的硬性要求。