你让装修师傅“把厨房改好”,最后很难判断他是否真的做对;如果事先约定水管不漏、插座可用、尺寸合格,验收就容易得多。使用编程 Agent 也是如此。它能读取项目、修改代码并调用测试或命令行工具,但人仍要说清目标,并判断结果是否正确。
会下令,也要会验收
Simon Willison 在个人博客中提出,高效使用编程 Agent 的关键能力,不只是让它生成代码,而是明确指示它如何修改,并有把握地验证修改是否正确落实。
这里的重点是“可验证”。一句“帮我优化这个功能”很含糊;验收标准则把目标变成可检查的条件,例如测试是否通过、接口行为是否保持不变,或性能是否达到门槛。Agent 知道终点在哪里,人也知道该拿什么判断完成与否。
验收不等于逐行盯代码
Willison 认为,有时确实需要检查 Agent 写下的每一行代码,但逐行目视并不是验证软件变更最有效的唯一方式。
这不等于“无需代码审查”。代码审查关注修改是否正确、是否容易维护、是否带来风险;自动化测试、静态检查和实际运行,则可以提供不同类型的证据。更稳妥的理解是:验收应组合多种手段,而不是把“我看过代码”当作全部保证。
为什么值得关注
编程 Agent 把写代码的成本压低后,新的瓶颈可能转向任务定义和结果判断。团队真正需要沉淀的,因而不只是提示词,而是一套清楚的验收条件:改什么、不该影响什么,以及用什么证据确认完成。
局限与未知
- 以上判断来自 Willison 的单篇个人博客,属于工程经验,尚无独立论文或实证数据交叉验证。
- 原文没有说明“其他验证方式”的具体组合,也没有提供模型、案例、效果指标或实验数字。
- “关键能力”“从来不是最有效方式”等表述较绝对,目前不宜视为行业共识。