Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
PAPER H 6 约 8 分钟

RLVR赢了一次,却输掉更多可能

RLVR提高一次答对率时,可能把原本多试几次能找到的正确路径练没了。

你让 AI 解一道难题。第一次没答对,不妨再让它试几十次:只要模型还保留一条少见但正确的思路,反复尝试就可能把它找出来。现在的问题是,一种常用训练方法可能让 AI 第一次更容易答对,却把这些冷门的正确思路挤出去了。模型看起来更强,给它更多思考机会时,反而能解决更少的问题。

Todd Zhou 的论文把这个现象称为 pass@k inversion。这里的 pass@k,是让模型对同一道题生成 k 个候选答案,其中至少一个正确的概率。k=1 看单次表现;较大的 k 则看反复尝试还能覆盖多少问题。论文的核心提醒是:只汇报 pass@1,可能会掩盖模型推理边界的收缩。

本文的机制解释、实验和改进方法均来自同一研究方,尚无独立信源复核。作者也把因果机制写成诊断性解释,而非已经严格证明的普遍规律。

赢的是头一次,输的是可选项

论文研究的是 RLVR——Reinforcement Learning with Verifiable Rewards,即“可验证奖励强化学习”。它让模型反复作答,再用自动检查器判断结果,例如数学答案是否正确、程序是否通过测试。答对的推理路径得到奖励,模型以后更可能沿着类似路径作答。

这套做法很直观。问题在于,模型不是一台每次都给出同一答案的机器,而是一组可能答案的概率分布。“采样”就是从这组分布中生成一次答案。多采样几次,模型可能走出不同的中间推理路径,也可能碰到平时很少出现的正确解法。

按照论文的诊断,RLVR可能提高 pass@1,却降低大采样预算下的覆盖率。这不等于 pass@k 衡量了解法本身有多丰富;它只看 k 次里是否至少答对一次。但如果训练后允许大量尝试仍能解出的题变少,就说明某些正确路径已经更难抵达。

这与“模式坍缩”有关:训练把概率过度集中到少数高奖励路线,像学生只练一套标准解法。熟悉的题可能答得更稳,边缘题却失去了绕路找到答案的机会。标题里的“输掉更多可能”,指的正是这种覆盖损失,并不意味着所有 RLVR 训练都会如此。

最危险的是那些“差一点会”的题

作者把重点放在 boundary prompts,也就是处在模型能力边界上的题。基础模型第一次作答时很少答对,但正确推理路径并非不存在;只要反复采样,仍有机会找到。

论文用一个简化的“两种模式”来解释风险:对一道题,模型主要在正确路径和错误路径之间分配概率。如果正确路径的概率为 p,一次训练采样 G 条路径,那么完全看不到正确答案的概率是

(1p)G

p 很小时,大多数训练批次都可能没有正例。比如论文给出的示意中,若正确路径概率只有 1%,每组采样 8 次,至少看到一次正确答案的机会仅为 7.7%,整组没有正例的概率则为 92.3%。

关键之处在于:全错的一组并不会直接奖励错误答案。它只是几乎不给模型“这里其实藏着正确路线”的局部信号。与此同时,其他容易题上的更新、共享参数的变化和概率分布的持续变尖,仍可能让这条罕见路线越来越难出现。

作者将其称为 absence-of-evidence failure,即“缺少证据导致的失败”:训练不是确认了正确路径不存在,而是在来得及看到并强化它之前,就把它从策略分布中挤了出去。作者认为实验现象与这一解释一致,但没有证明它是所有训练设置下的统一因果机制。

给每道题单独决定:该练狠一点,还是先别忘

论文提出 Per-Problem Base Anchoring(PBA,每题基础模型锚定)作为概念验证。它不要求所有题都保持高多样性,而是先用冻结的基础模型采样,判断每道训练题是否已有足够的正确证据。

证据充分的题照常使用 GRPO——一种按同组答案相对奖励更新模型的强化学习方法——让正确路线更集中。风险较高的题则受到约束,不让训练后的概率分布偏离基础模型太远。说白了,PBA先区分两类情况:已经稳定会做的题,可以强化;只是偶尔能做出来的题,先保住那条微弱的正确路线。

这种按题处理的设计也解释了它与全局熵奖励或统一 KL 约束的区别。熵可以粗略理解为答案分布的分散程度;KL 约束则限制新模型偏离旧模型。全局约束要求所有题都少“变尖”,可能连容易题也一起限制。PBA只在作者认为不安全的题上锚定基础分布。

实验说明了什么

作者在 Qwen2.5-7B 上用 Omni-MATH-Train 训练,并在 Omni-MATH-Test 上比较普通 GRPO 与 PBA。评估时,每个策略对每道题采样 256 次;主要比较覆盖三个预先指定训练 seed,也就是三次采用不同随机起点的独立训练。

基础模型在 Omni-MATH-Test 上的 pass@1 为 10.2%,pass@256 为 69.1%。普通 GRPO 的三个 seed,pass@1 分别达到 25.1%、24.3%和26.0%;但 pass@256 分别为68.3%、67.6%和68.9%,都略低于基础模型。它确实更容易一次答对,却在大量尝试后覆盖了更少的问题,这正是论文所说的 inversion。

PBA 的三个 seed 中,pass@1 分别为29.0%、28.2%和29.7%,pass@256则为73.0%、72.4%和73.5%。按照作者报告,在相同训练配置下,PBA同时超过普通GRPO的单次表现和高预算覆盖率。不过论文没有给出统计显著性检验,不能把这些差距扩写成已经证实的“大幅提升”。

一项包含3000个prompt的受控诊断也呈现相同方向:普通GRPO更容易丢掉基础模型原本可通过重复采样解决的边界题;PBA则保留了更多被验证器判定为正确的罕见路径。作者还测试了全局KL、熵奖励、随机保护、丢弃受保护题和提前停止等单次设置。它们没有完整复现PBA的边界保护表现,但这些对照不是多次重复的系统调参实验,只能算支持性证据。

为什么这会动摇常用的扩展路线

不少推理流程并不押注模型一次答对,而是生成多个候选,再通过一致性、验证器、搜索、修复或程序执行挑选结果。它们的前提是:正确路径虽然罕见,却仍留在模型可采样的范围内。

因此,pass@1上涨不一定等于整套系统变强。如果训练把“偶尔能答对”改造成“永远沿着更常见的错误路线走”,增加推理次数也救不回来。真正需要同时观察的,是第一次命中率和完整的pass@k曲线,以及基础模型能解、训练后反而解不了的题。

作者进一步认为,这一风险可能延伸到由外部工具或验证器检查重复尝试的视觉语言智能体,例如视觉、空间和图表推理。不过论文只在数学验证器、Omni-MATH-Test和MATH500上提供实验;视觉任务部分仍是外推,没有直接实验支持。

局限与未知

  • 证据集中在一个模型家族、两个数学基准、三个主要比较seed,以及若干单次设置的对照实验,尚不足以说明所有RLVR算法都会缩小推理边界。
  • PBA依赖有限的基础模型采样,可能把需要保护的题错判为安全,也可能过度保护难题。它只能保存基础模型已经拥有的正确路径,不能创造原本不存在的新解法。
  • PBA是作者明确称为proof-of-concept的诊断性干预,不是成熟通用方案。论文也没有直接追踪罕见路径在训练中消失的完整过程。

这篇工作的价值,不是宣布RLVR失效,而是把评价问题改写得更完整:训练不仅要问“能否让正确答案更常出现”,还要问“是否把原本还能找到的正确答案练没了”。对于依赖多次采样的推理系统,后一个问题可能同样重要。


供稿材料 SOURCES — 1

← 返回 2026-07-27 · 学术板块