Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.088 — 2026-09-30
PAPER HF 14 约 1 分钟

奖励模型也开始走扩散路线

扩散式奖励模型不再只给一个分数,而是保留人类评价中的分歧与不确定性。

同一个 AI 回答,有人觉得很好,也有人觉得很差。传统奖励模型——代替人工反复阅卷的评分器——往往把这些意见压成一个分数,最后只剩下“平均评价”,分歧本身却消失了。

Bingxiang He 提出的 DRM(Diffusion Reward Model,扩散式奖励模型)改为学习一整套可能的评分。它先用冻结的语言模型理解问题和回答,再让轻量的 Diffusion Transformer 从随机噪声出发,多步生成奖励值。这样无需预设评分必须符合某种固定分布,也能表达“有人打高分、有人打低分”的多峰分布。

推理时,DRM 可多次采样,得到平均分、波动程度或较保守的分位数。作者称,在五个奖励模型基准上,它可匹配或超过使用相同数据和语言模型骨干的对照方法;面对重复人工标注,评审分歧越大,模型输出也越呈现多峰。不过,现有材料未给出具体提升数字,实际收益仍以论文自述为限。


供稿材料 SOURCES — 1
01
Diffusion Reward Models Hugging Face Daily Papers · PAPER
原文 ↗

← 返回 2026-09-30 · 学术板块