像两位老师用同一份答案,却按不同的评分尺打分:AI生成回答时是一套计算系统,训练更新时又是另一套。即使加载相同参数,两边也可能给同一个词不同概率,导致学习方向失真。论文研究的正是这种训练—推理错位。在RLVR——用可验证答案对模型做强化学习——中,它会让本应依据当前模型进行的更新悄悄“错位”,在混合专家模型上尤其明显。
常见修补方式是重要性采样:按两边概率之比重新加权。但少数剧烈分歧会把权重推得很高;简单设置固定上限,又会把误差更多压到模型没把握的词上。作者提出CIS,把概率比拆成“词本身的置信度”和“两套引擎造成的偏移”,再直接截断异常偏移。关键发现是,这种偏移的分布几乎不随置信度变化,因此可以共用一个阈值;换回权重后,上限会随置信度自动调整。
作者报告称,CIS在3个混合专家模型、5项数学推理基准上,平均成绩均高于所比较的方法,并减少了低置信度词承受的截断偏差。它的价值不只是一种新算法,也给复现不稳提供了检查路径:先核对生成端与训练端对同一词的概率,再判断问题究竟来自模型学习,还是两套引擎没有对齐。