让一个 AI 自己答题、自己判卷,省去了标准答案,却也容易把同一个错误越练越熟。Co-RL 换成一组彼此不同的 Agent——也就是独立执行任务的模型——互相提供训练信号,试图在没有人工标签时练出更强的推理能力。
具体来说,每个 Agent 会针对同一道题生成多个答案,再用多数票形成一个临时答案;但它不拿这个答案给自己打分,而是交给另一个独立训练、且不共享参数的 Agent 作为参照。随后,强化学习——根据奖励调整模型行为的训练方式——把这种同伴反馈转化为改进信号。关键不只是“人多”,而是成员要足够不同:论文混用不同模型家族、参数规模和改写后的题目,以减少大家犯下同一种错误。
作者称,Co-RL 在七个纯文本基准上让四个语言模型平均提升 3.0%–8.6%,在四个多模态基准上让五个视觉语言模型提升 2.3%–7.2%。这些结果尚以论文自述为准,但它提供了一个值得关注的方向:当可靠标准答案越来越难获得时,多样化模型之间不完全相同的错误,本身也可能成为训练资源。