你问 AI“图里红灯亮了吗”,它即使答对,也可能只是凭常见场景猜中。Evidence-RL要解决的正是这种“答案对了,却未必看了关键证据”:它用强化学习——通过奖惩调整模型行为——让视觉语言模型更依赖画面,而少走语言先验和数据捷径。
最巧的一步,是训练时做一次局部“遮挡测试”。其 CED 方法先找出可能支持答案的物体区域,再用邻近视觉特征的平均值替换该区域,并与同样处理无关区域的结果比较。如果拿掉关键区域后,模型对原答案的支持下降得更多,就说明答案确实依赖这处证据;训练系统会把这一信号与答题正确性一起奖励。它不需要为每道题人工标注证据区域,也不增加实际回答时的计算开销。
作者称,该方法在四种基础模型、九个公开基准上优于此前基于强化学习的后训练方法。不过现有材料未给出具体提升数字;更值得关注的是,它把训练目标从“答对”推进到了“凭对的证据答对”。