摘要:Agent 评测是回答"Agent 好不好、哪里好哪里不好"的系统方法论,正在从"打分动作"走向"基础设施能力"。核心公式:观测 + 评测 = 持续迭代。
来源:raw/摘录/Agent评测漫谈 —— 由浅入深讲解Agent评测.md
最后更新:2026-08-11
Agent 评测的核心目的是回答 Agent 好不好?以及到底哪里好、哪里不好? 从而为下一轮迭代指明方向。评测是 Agent 效果的"精密量具",因此不能只停留在离线打榜或 Demo 表现,必须服务于真实业务中的研发、上线、回归、优化和规模化落地。
观测 + 评测 = 持续迭代
评测方法随 AI 形态变化历经三个阶段:
| 阶段 | 回答的问题 | 评测对象 |
|---|---|---|
| 传统机器学习 | 算得准不准 | 模型输出 |
| 大模型 | 模型能力强不强 | 模型能力 |
| Agent | 能否稳定交付好的结果 | 模型 + 系统 + 工具 + 流程的复杂系统 |
Agent 的评测对象不再是单一模型,而是模型与 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合后的整体。(source: 摘录/Agent评测漫谈.md)
只看最终结果会误判:两个 Agent 可能都"做对了",但一个路径清晰、可复现,一个反复试错、靠偶然命中。因此评测至少覆盖四层:
由此,Agent 评测正从"答案评测"走向"行为评测"。
Agent 属于广义的 SaaS 层,大模型赋予泛化能力却也带来随机性,而用户期望稳定可靠的智能体。看不见的问题,几乎不可能被稳定解决——这正是 Trace 系统存在的理由:把"我想看 Case 却发现没打日志"的黑盒推理过程全路径披露。对每一个"隐形动作"的精准观测,是从"概率性生成"向"工业级可靠性"跨越的必由之路。
小结:Agent 评测既要关注结果(Response),也要关注过程(Trace / Trajectory)——即 Trajectory Evaluation 与 Response Evaluation。
Agent 评测体系必须追求业务价值与评测指标之间的解释性,而模型能力指标和业务结果指标之间存在天然鸿沟,中间需要一层面向任务系统的桥梁指标。以 AI 搜索为例:业务关心 DAU/留存/点击,搜索系统关心召回率/点击率,Agent 层则关心意图识别、检索有效性、结果整合可信度。只有把各层串起来,才能回答"为什么业务指标变差""为什么模型能力提升没带来业务收益"。
"好不好"是主观问题,主观标准必须对齐。核心认知:
最佳实践是把模糊指标下钻成细分的评测 Rubric,再把每个 Rubric 尽量二元化(是/否/未知、0/1/unknown),用 unknown 占比反查 Rubric 定义是否合理,直到人一致率、人机一致率达到可信阈值(如 85%、90%)。案例:数字站长的人机一致率可达 99%;Beam 采用二元化方案后从 62% 提升到 92%。
标注是一种动作,评测是一套目标导向的判断流程。只有在人机一致率有保障时才能称为自动化评测,否则只是机器标注。
Agent 评测的执行链路:采集 → 清洗 → 评测 → 质检 → 分析/归因,与线上 AB、持续观测共同构成 Agent 迭代的数据飞轮。
起步阶段,"让数据飞轮高效运转起来"的意义远大于"设计一个复杂精妙的评测体系"。指标体系靠 Good Case 和 Bad Case 喂养:
成熟评测团队的核心能力不是一开始就搭出完美系统,而是把线上问题、失败样本、模糊反馈不断转化为结构化评测资产。
模型能力强依赖高质量语料输入。当垂域业务知识语料匮乏(或公网无公开高质数据)时,引入行业专家知识补足模型/Agent 能力是破局关键——尤其冷启动阶段。谁来定义"好不好"?靠最懂业务、最有 Sense 的行业专家。专家对"好"定义不一致时,抽取共性的部分建设体系;非共性分歧可转化为 Agent 的不同风格或策略分支(如 AI 电销的老练激进派 vs 细水长流派),允许在不同 Benchmark 中独立评测。
Query -> Answer,更多在"回答问题"而非"执行任务",如 AI 搜索、客服机器人最本质的变化:ChatAgent 评测关心"说得好不好",长程 Agent 评测关心"事情做成没有,以及是怎么做成的"。
面向 Task 的长程 Agent 评测借鉴 Anthropic 的定义:Task 是"具有明确输入和成功标准的单个测试"。通过 Trace 获取真实执行路径,得到 (prompt - expected_behavior - trace) 三元组,对应短程 Agent 的 (query - ground_truth - answer)。
Skill 生产门槛越来越低(甚至可由 AI 辅助生成),未来需要评测的人可能是每一个创建、修改、接入 Skill 的人。本质痛点是:大家不知道怎样写好 Skill,也缺乏对 Skill 全生命周期进行评测的工具。这对评测系统提出新要求——足够简单、足够标准化、足够自动化、最好接入开发与发布流程。
ChatAgent 时代:核心评测员对齐 -> 外包对齐 -> 机评对齐。长程 Agent 场景可跳过外包:核心评测员对齐 -> 机评对齐 -> 规模化扩展。原因:长程执行轨迹信息密度高使人成为卡点、Skill 数量增长极快人工标注不可持续、基座模型能力持续突破。
人工更应做高价值标准设计和 Rubric 对齐,AI 承担规模化运行/初筛/回归验证,平台承担沉淀/回放/告警/归因。AI 评测真正要放大的,不是"机器打分"本身,而是核心评测员的判断标准。
支撑大规模 Agent 和 Skill 生态,评测基础设施至少应具备:全链路回放、Case 管理、执行沙箱(只读/可写/高风险分层)、AI 评测引擎(Rubric 驱动的人机对齐与自动判分)、报告与归因、回归机制、准入准出门禁。
长程 Agent 评测的核心术语:Task(明确输入与成功标准的单个测试)、Grader(评估某方面性能的逻辑,含多个断言/Checks)、Transcript/Trace(试验完整记录)、Outcome(环境最终状态)、Evaluation Harness(端到端评测基础设施)、Agent Harness/Scaffold(使模型作为 Agent 运行的系统)、Evaluation Suite(任务集合)。
2026 年龙虾热催生的开源评测工具:
| 软件 | 简介 |
|---|---|
| PinchBench | 专评 OpenClaw 的基准测试,强调真实场景任务模拟 |
| claw-eval | 北大发布的龙虾能力评测 |
| WildClawBench | InternLM,"野生环境"中测试 Agent——丢进真实使用场景看能否存活 |