Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.015 — 2026-07-19
PAPER H 13 约 1 分钟

GFlowRL让LLM不只追逐最高奖励

GFlowRL按奖励保留多种好解法,并用批内估计解决大模型训练不稳。

让 AI 解一道题,常见训练方式像只奖励“冠军路线”:哪种解法得分最高,以后就越来越偏向哪一种,其他同样正确的思路慢慢消失。GFlowRL 想换个目标:不是只追最高奖励,而是让不同答案出现的概率大致与奖励相称。它借鉴 GFlowNet(生成流网络,一种按奖励分布生成结果的方法),以减少模式坍缩——模型过度集中于少数高分套路。

真正关键的一步,是删掉过去被视为必需的“配分函数”学习网络。配分函数用于把所有答案的奖励归一化成概率,但答案空间巨大,很难准确学习。作者发现,把这个网络换成随机噪声,效果也相近,说明它在训练中更像不稳定来源。GFlowRL 改用同一提示下已采样答案做批内 Monte Carlo 估计,也就是直接用这批样本近似整体尺度。作者报告称,该方法可扩展到最高 235B 参数的 MoE(混合专家模型,每次只调用部分子网络),并在 14B 模型上达到 2048 的 Codeforces 评分;这些效果目前仍以论文自述为准。


供稿材料 SOURCES — 1

← 返回 2026-07-19 · 学术板块