AI 代理写完一份分析,代码能运行、图表也像模像样,不等于结论可靠。就像验算账目,不能只看公式有没有写错,还要确认原始数字、统计口径和问题本身都没跑偏。Seascapemodels 在 R-bloggers 分享了一套仍在完善的验证策略:先写分析规格——提前定下研究问题、数据口径、模型公式和验收标准——再让另一家代理做对抗式代码审查,并为数据处理设置“发现不一致就停止”的检查。
其中最值得借鉴的一步,是用“已知答案”反测整条流程。作者建议依据模型另行生成一批模拟数据,再看代理的分析能否找回预先设定的参数;若做概率推断,还可检查 95% 置信区间在大量随机数据中是否约有 95% 的时候覆盖真值。为减少两边共享同一个错误,模拟数据应放在独立的 Claude 与 R 环境中生成,并关闭记忆功能。说白了,审查重点开始从逐行读代码,转向规格是否合理、数据如何流转,以及另一套实现能否独立复算出相同结论。作者也明确称,这套办法仍是进行中的实践。