agent-evaluation

Agent 评测

摘要:Agent 评测是回答"Agent 好不好、哪里好哪里不好"的系统方法论,正在从"打分动作"走向"基础设施能力"。核心公式:观测 + 评测 = 持续迭代

来源:raw/摘录/Agent评测漫谈 —— 由浅入深讲解Agent评测.md

最后更新:2026-08-11


评测的本质

Agent 评测的核心目的是回答 Agent 好不好?以及到底哪里好、哪里不好? 从而为下一轮迭代指明方向。评测是 Agent 效果的"精密量具",因此不能只停留在离线打榜或 Demo 表现,必须服务于真实业务中的研发、上线、回归、优化和规模化落地。

观测 + 评测 = 持续迭代

评测对象的变化:从模型到系统

评测方法随 AI 形态变化历经三个阶段:

阶段 回答的问题 评测对象
传统机器学习 算得准不准 模型输出
大模型 模型能力强不强 模型能力
Agent 能否稳定交付好的结果 模型 + 系统 + 工具 + 流程的复杂系统

Agent 的评测对象不再是单一模型,而是模型与 PromptSkill、工具链、记忆、状态管理、业务流程耦合后的整体。(source: 摘录/Agent评测漫谈.md)

四层评测

只看最终结果会误判:两个 Agent 可能都"做对了",但一个路径清晰、可复现,一个反复试错、靠偶然命中。因此评测至少覆盖四层:

由此,Agent 评测正从"答案评测"走向"行为评测"。

观测是评测的基石

Agent 属于广义的 SaaS 层,大模型赋予泛化能力却也带来随机性,而用户期望稳定可靠的智能体。看不见的问题,几乎不可能被稳定解决——这正是 Trace 系统存在的理由:把"我想看 Case 却发现没打日志"的黑盒推理过程全路径披露。对每一个"隐形动作"的精准观测,是从"概率性生成"向"工业级可靠性"跨越的必由之路。

小结:Agent 评测既要关注结果(Response),也要关注过程(Trace / Trajectory)——即 Trajectory Evaluation 与 Response Evaluation。

核心方法论

搭桥:业务指标与能力指标的解释性

Agent 评测体系必须追求业务价值与评测指标之间的解释性,而模型能力指标和业务结果指标之间存在天然鸿沟,中间需要一层面向任务系统的桥梁指标。以 AI 搜索为例:业务关心 DAU/留存/点击,搜索系统关心召回率/点击率,Agent 层则关心意图识别、检索有效性、结果整合可信度。只有把各层串起来,才能回答"为什么业务指标变差""为什么模型能力提升没带来业务收益"。

客观评测与主观评测并行

人人一致、人机一致

"好不好"是主观问题,主观标准必须对齐。核心认知:

最佳实践是把模糊指标下钻成细分的评测 Rubric,再把每个 Rubric 尽量二元化(是/否/未知、0/1/unknown),用 unknown 占比反查 Rubric 定义是否合理,直到人一致率、人机一致率达到可信阈值(如 85%、90%)。案例:数字站长的人机一致率可达 99%;Beam 采用二元化方案后从 62% 提升到 92%。

标注是一种动作,评测是一套目标导向的判断流程。只有在人机一致率有保障时才能称为自动化评测,否则只是机器标注。

评测是一门实践科学

Agent 评测的执行链路:采集 → 清洗 → 评测 → 质检 → 分析/归因,与线上 AB、持续观测共同构成 Agent 迭代的数据飞轮。

起步阶段,"让数据飞轮高效运转起来"的意义远大于"设计一个复杂精妙的评测体系"。指标体系靠 Good Case 和 Bad Case 喂养

  1. 从高频核心场景起步,先定义少量关键指标
  2. 从生产环境收集 Bad Case(价值更高,最容易暴露能力边界)
  3. 沉淀高质量 Good Case,明确什么叫"好"
  4. 把 Good/Bad Case 转成标准评测样本
  5. 用评测结果反哺 Prompt、Skill、策略和模型优化
  6. 从新的线上表现持续抽样,形成下一轮迭代

成熟评测团队的核心能力不是一开始就搭出完美系统,而是把线上问题、失败样本、模糊反馈不断转化为结构化评测资产。

专家知识补充垂域能力

模型能力强依赖高质量语料输入。当垂域业务知识语料匮乏(或公网无公开高质数据)时,引入行业专家知识补足模型/Agent 能力是破局关键——尤其冷启动阶段。谁来定义"好不好"?靠最懂业务、最有 Sense 的行业专家。专家对"好"定义不一致时,抽取共性的部分建设体系;非共性分歧可转化为 Agent 的不同风格或策略分支(如 AI 电销的老练激进派 vs 细水长流派),允许在不同 Benchmark 中独立评测。

长程 Agent 的观测评测

短程 vs 长程

最本质的变化:ChatAgent 评测关心"说得好不好",长程 Agent 评测关心"事情做成没有,以及是怎么做成的"

Task 三元组

面向 Task 的长程 Agent 评测借鉴 Anthropic 的定义:Task 是"具有明确输入和成功标准的单个测试"。通过 Trace 获取真实执行路径,得到 (prompt - expected_behavior - trace) 三元组,对应短程 Agent 的 (query - ground_truth - answer)

Skill 评测

Skill 生产门槛越来越低(甚至可由 AI 辅助生成),未来需要评测的人可能是每一个创建、修改、接入 Skill 的人。本质痛点是:大家不知道怎样写好 Skill,也缺乏对 Skill 全生命周期进行评测的工具。这对评测系统提出新要求——足够简单、足够标准化、足够自动化、最好接入开发与发布流程

人评主导走向机评主导

ChatAgent 时代:核心评测员对齐 -> 外包对齐 -> 机评对齐。长程 Agent 场景可跳过外包:核心评测员对齐 -> 机评对齐 -> 规模化扩展。原因:长程执行轨迹信息密度高使人成为卡点、Skill 数量增长极快人工标注不可持续、基座模型能力持续突破。

人工更应做高价值标准设计和 Rubric 对齐,AI 承担规模化运行/初筛/回归验证,平台承担沉淀/回放/告警/归因。AI 评测真正要放大的,不是"机器打分"本身,而是核心评测员的判断标准。

评测基础设施能力

支撑大规模 Agent 和 Skill 生态,评测基础设施至少应具备:全链路回放、Case 管理、执行沙箱(只读/可写/高风险分层)、AI 评测引擎(Rubric 驱动的人机对齐与自动判分)、报告与归因、回归机制、准入准出门禁

开源领域调研

长程 Agent 评测的核心术语:Task(明确输入与成功标准的单个测试)、Grader(评估某方面性能的逻辑,含多个断言/Checks)、Transcript/Trace(试验完整记录)、Outcome(环境最终状态)、Evaluation Harness(端到端评测基础设施)、Agent Harness/Scaffold(使模型作为 Agent 运行的系统)、Evaluation Suite(任务集合)。

2026 年龙虾热催生的开源评测工具:

软件 简介
PinchBench 专评 OpenClaw 的基准测试,强调真实场景任务模拟
claw-eval 北大发布的龙虾能力评测
WildClawBench InternLM,"野生环境"中测试 Agent——丢进真实使用场景看能否存活

相关页面