Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
PAPER 约 1 分钟

扩散LLM可能先猜答案再补推理

记录填词顺序后,研究者发现扩散LLM会先锁定答案,再围着结论补推理。

像先在答题纸上写下结果,再倒推解题步骤:研究者记录扩散语言模型(从大量空位出发,多轮填词的模型)每个 Token——词或字的计算单位——何时被最终确定,发现它在数学推理中可能很早就锁死答案。这个结果值得注意,因为这类模型常被看好的优势,正是能不按从左到右的顺序填词。

在 LLaDA-8B 处理小学应用题基准 GSM8K 时,作者发现,即使模型最终写出了推理,答案通常也在整个生成过程的前四分之一确定,而推理区中间位置的 Token 要到接近一半时才确定。换句话说,后面的计算可能是在迁就一个已经不能修改的结论。更极端的是,给模型更长的作答空间反而更容易只留答案:在 256 Token 空间下,这种情况超过三分之一;到 512 Token 时达到九成。

作者认为,问题不只是模型“想提前结束”,而是任意顺序的解码器允许它过早触及并锁定远处位置;限制只能在当前最左空位附近提交 Token,便可避免这种提前下注。论文还在 Dream-7B 和 MATH-500 上复现了整体模式。不过,顺序约束会牺牲并行填词的速度优势,准确率与效率仍需权衡。


供稿材料 SOURCES — 1
01
Answer First, Reason Later: Commitment Order in Diffusion LLMs arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-10 · 学术板块