Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER HF 90 约 1 分钟

无监督推理从多Agent群体中涌现

Co-RL让不同Agent互相当老师,在没有标准答案时也能练出更强推理。

让一个 AI 自己答题、自己判卷,省去了标准答案,却也容易把同一个错误越练越熟。Co-RL 换成一组彼此不同的 Agent——也就是独立执行任务的模型——互相提供训练信号,试图在没有人工标签时练出更强的推理能力。

具体来说,每个 Agent 会针对同一道题生成多个答案,再用多数票形成一个临时答案;但它不拿这个答案给自己打分,而是交给另一个独立训练、且不共享参数的 Agent 作为参照。随后,强化学习——根据奖励调整模型行为的训练方式——把这种同伴反馈转化为改进信号。关键不只是“人多”,而是成员要足够不同:论文混用不同模型家族、参数规模和改写后的题目,以减少大家犯下同一种错误。

作者称,Co-RL 在七个纯文本基准上让四个语言模型平均提升 3.0%–8.6%,在四个多模态基准上让五个视觉语言模型提升 2.3%–7.2%。这些结果尚以论文自述为准,但它提供了一个值得关注的方向:当可靠标准答案越来越难获得时,多样化模型之间不完全相同的错误,本身也可能成为训练资源。


供稿材料 SOURCES — 1

← 返回 2026-08-22 · 学术板块