Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
PAPER 约 1 分钟

LLM强化学习先挑“学得会”的题

先用短跑测试挑出“学得会”的题,再把有限的强化学习算力投过去。

给学生加练习,最省时间的办法未必是按难度平均发题,而是先找出哪些题经过辅导最可能进步。LLM(大语言模型)的强化学习也有类似问题:有限算力该投给哪些训练题?这项研究指出,模型当前会不会做——即“可解性”——并不能回答它继续练习后能否提升。

作者用 Qwen3-1.7B 在 2,048 道数学推理题上训练 20 轮,发现初始通过率相近的题,后续表现可能截然不同:有些奖励持续上升,有些停滞,甚至退步。研究据此提出“可学习性”,即一道题在固定训练条件下对继续优化的正向反应。256 道重复出现在不同训练组合中的题,其可学习分组一致性达到 0.879,说明这个信号并非完全由一次训练的随机性造成。

实际使用时,TrajVal 先做一次较短的探测训练,并比较起点与终点评估,据此给每道题设置静态先验——主训练开始后固定使用的抽题偏好。作者称,它比均匀抽题更节省数据,并能叠加到动态调度方法上。不过,可学习性仍取决于模型、奖励方式和训练预算,并不是题目永恒不变的属性。


供稿材料 SOURCES — 1

← 返回 2026-08-14 · 学术板块