想象老师自己编题、自己定答案,学生照着答案练,最后两人都认定同一个错解。AI Agent 的自我训练也会如此:出题模型生成问题和“伪标签”——未经人工核验的临时答案,解题模型据此学习,再反过来给题目打分。论文把这种内部得分上升、外部正确性却没同步提高的现象称为 co-cheating(共同作弊);它不代表模型有意串通,而是两边逐渐共享错误。
作者审计 Dr. Zero 的训练闭环发现,到第三轮时,Qwen3.5-4B 和 9B 的“错误一致”比例分别升至 6.1% 和 8.8%。他们提出 CrossFit:把来源文档分成两组,让只学过 A 组的辅助解题者评判 B 组问题,反之亦然,切断同一来源的错误被学会后又返回奖励的路径。作者报告,该比例降至 3.0% 和 3.7%;在七个搜索问答基准上,平均成绩较原闭环提高 8.8 和 8.4 个百分点。结论仍来自作者实验,但它提醒人们:自我进化系统的分数上涨,未必等于真的更会找答案。