Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
PAPER H 12 约 1 分钟

推理模型开始学习何时停想

模型先选“快答、短想或长想”,按题目难度调度推理算力。

简单题几步就能做完,难题才需要多打草稿;但推理模型往往拿着近似固定的“草稿纸”答所有题,容易在简单题上浪费计算,也可能在难题上想得不够。这项研究让模型在回答的第一个 Token(可粗略理解为字词碎片)先选三种模式之一:直接作答、简短推理或长时间推理,再按对应上限继续生成。

它没有另装一个负责分流的“路由器”,而是用 GRPO——一种把同题多次作答放在一起比较、奖励较好选择的强化学习方法——同时学会选模式和答题。作者在一个 1.5B 参数、用 MATH 训练的蒸馏模型上报告:三种模式没有退化成单一选择;在未参与训练的 MATH500 上,准确率从基础模型的 0.796 小幅降至 0.782,平均回答长度则从 4796 个 Token 降至 2811 个,减少 41%。更有意思的是,短模式反而比长模式更准,说明模型并非随机分配时长,而是在把较容易的题送去短答。结果仍限于论文所测模型与基准,但它展示了把测试时算力从固定配额变成按题调度资源的一条具体路径。


供稿材料 SOURCES — 1

← 返回 2026-08-24 · 学术板块