做出一个能演示的 Agent,和把它交给真实用户,是两回事。后者会遇到五花八门的问法、脏数据和工具故障。美团这份白皮书试图补上中间的落地手册:按冷启动、灰度扩量(先开放少量流量,再逐步放大)和自进化三个阶段,判断团队身在何处、下一步该补什么。
最值得注意的是两条相互咬合的循环。线上异常先进入 Case 池——集中保存真实问题的案例库——再做归因。如果发现评测集漏题,或评分标准本身判错,就更新评测体系;如果问题来自 Prompt、Skill(Agent 可调用的能力)、上下文管理或模型,就修改 Agent,用固定评测集回测,确认旧能力没有退化,再上线做 AB 对比。换句话说,同一批真实失败,一边校准“尺子”,一边改进产品。
这让评测不再只是上线前的一次离线考试,而是把踩过的坑沉淀成可重复检查的资产。美团强调,这套做法来自其多个业务的两年实践,但迁移到新场景仍需按业务调整。