Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.039 — 2026-08-12
NEWS 约 6 分钟

Agent评测:从分数走向体系

美团用两年业务实践说明:评 Agent,不能只看分数,还要把结果、过程、成本与风险连成一套生产体系。

IMAGE — 美团技术团队

你让 AI 帮忙订一张合适的票。它最后确实订到了,但中间反复搜索、调用了十几次工具,还险些选错日期。只看“任务完成”这一项,它似乎表现不错;放进真实业务,它却可能很慢、很贵,也不够安全。

这正是 Agent 评测的新难题。AI Agent——能围绕目标分步骤行动、调用搜索或数据库等工具,并根据结果继续执行的系统——已经不只是一个模型。它的表现还受提示、工具、权限、记忆、状态管理和业务流程影响。美团图灵 Agent 评测团队据其技术博客称,在深入业务团队、经过两年实践后,形成了一套从观测、指标到样本迭代的方法。核心变化可以概括为一句话:评测正在从检查答案,走向检查整个任务系统。

本文的实践方法、案例和效果数字均来自美团技术博客,属于同一机构的经验总结,尚无独立信源复核。

做对了,还要看怎么做

传统的答案评测通常问:结果对不对。Agent 评测还要问:它走了什么路径,付出了多少成本,有没有留下风险。

美团团队将评测拆成四层:结果层看任务是否完成、输出是否可用;过程层看规划和执行步骤是否合理、稳定;效率层看耗时、Token——模型处理文字时使用的计量单位——以及工具调用次数;风险层则检查越权、误操作和安全隐患。

这四层解释了为什么两个结果相同的 Agent,工程价值可能完全不同。一个按稳定路径完成任务,另一个反复试错、偶然撞对答案。前者容易复现和优化,后者一旦规模化,成本与故障也会一起放大。

因此,团队需要记录 Trace 或 Trajectory,也就是一次任务的执行轨迹。这里不应理解为读取模型私有的“内心推理”,而是记录可观测的输入、输出、工具调用、状态、耗时、错误和关键执行步骤。可观测性就像保留完整的行车记录:最终失败时,团队能查到问题发生在哪一段,而不是只看到出发点和终点。

指标不是越多越好,关键是接得起来

模型能力变强,不一定直接带来业务增长;业务指标下降,也未必能简单归因于模型。美团团队因此主张在两者之间设置“桥梁指标”,把模型、任务系统和业务结果串起来。

以 AI 搜索为例,业务可能关心日活、留存和点击;搜索系统关心召回率与点击率;Agent 层则要检查意图识别是否准确、检索是否有效、结果整合是否可信。只有把这些层次连接起来,团队才可能解释:业务为什么变差,或者模型升级为什么没有产生收益。

评测方式也要两条腿走路。客观评测适合有明确答案、可以写成规则的高频任务;主观评测负责开放、复杂或高价值的场景。人工判断还要用来校准规则评测与 AI 评测,再把已经稳定的部分交给自动化系统。

把“感觉不错”拆成可以回答的问题

主观评测最大的麻烦,不是没人会评,而是不同的人给出不同结论,机器与人也无法对齐。

美团团队的处理办法,是把模糊指标继续下钻为 Rubric——针对某个具体维度的评分规则——并尽量改写成“是/否/未知”或“0/1/unknown”。例如,不再笼统地让评测员给回复的“口语化程度”打 0 到 10 分,而是分别检查:是否用“您”称呼骑手,是否出现特定口语词,是否包含“吧”“呢”等语气词。判断范围变窄后,分歧也更容易暴露和修正。

其中,“unknown”的比例本身也是信号。如果评测员频繁选择“不知道”,可能说明规则含糊、上下文不足,或者案例超出了规则边界。团队可以据此反复修改 Rubric,再观察人与人、人与机器的一致率。博客给出的 85%和 90%只是可信阈值示例,并非行业统一标准。

据美团团队自述,“数字站长”采用该方法后,人机一致率达到 99%;Beam 按其二元化方案改造后,一致率从 62%升至 92%。这些数字说明细化规则可能有用,但原文没有交代样本量、数据集构成、评测员数量、一致率算法、置信区间和独立复核情况,不能把它们视为普遍可复现的效果。

团队还提出由一个强势角色统一产品、运营、研发和 QA 的标准,并用“1 个‘独裁者’好过 10 个‘民主者’”概括。这是作者的组织经验,而非通用结论。更值得保留的部分是:团队需要一套能在出现分歧时落地执行的规则,同时继续用真实案例修正规则制定者的偏差。

评测集不是一次编完的题库

评测集是一组包含任务、期望结果或评分规则的代表性案例。固定样本上的离线评测便于比较版本和快速回归;真实环境中的在线评测则能发现工具失败、用户变化和生产问题。两者需要接成循环。

美团团队把这个循环分为五步:采集线上或沙箱任务,清洗和补齐上下文,开展人工或 AI 评测,质检评测标准与结果,最后分析并归因问题。评测结果再用于调整 Prompt、Skill、策略或模型,新版本上线后继续抽样。

它尤其强调 Good Case 与 Bad Case。失败样本暴露能力边界和系统短板;成功样本帮助团队定义什么叫高质量完成。博客称,其履约“数字站长”项目最初只有 20 多个指标,经过一年全面推广后扩展到近 200 个。这不是“指标越多越成熟”,而是说明评测体系会被真实问题持续改写。冷启动时,团队反而应先覆盖高频核心场景,设置少量关键指标,让数据循环先运转起来。

为什么值得关注

这套方法最有价值的地方,不是提出了一个新分数,而是重新界定了评测对象:从单一模型扩展为“模型+系统+工具+流程”,从一次离线打榜扩展到研发、上线、回归和持续优化。

说白了,生产环境需要的不是一张成绩单,而是一套故障诊断与改进机制。最终结果告诉团队“有没有做好”;执行轨迹解释“为什么”;效率和风险指标判断“能不能规模化”;持续更新的评测集则防止旧问题在新版本中重新出现。四者协同,评测才真正成为迭代系统的一部分。

局限与未知

  • 全部结论来自美团技术博客这一单一信源,案例与指标均为机构自述,缺少独立验证。
  • 99%以及 62%到 92%的效果缺少样本、评测员和计算口径等关键信息,只能作为内部案例理解。
  • 材料后半部分关于长程 Agent 的内容并不完整;“数字站长”和 Beam 的具体产品边界也未被清楚定义,因此本文不进一步推断其适用范围。

供稿材料 SOURCES — 1

← 返回 2026-08-12 · 数据板块