像改一份多人协作的文稿:有些句子早已定稿,却还被一轮轮重新检查。扩散语言模型也会这样——它从一批不完整的文字出发,多轮“去噪”,也就是反复修正草稿、同时填好多个位置。CAI-dLLM 想做的,是让模型按进度及时收工,把算力留给真正难定的词。
它抓住了一个很便宜的信号:第一轮置信度,也就是模型一开始对候选词有多确定。作者观察到,高置信度词几乎都能在 5 轮内稳定,低置信度词则可能变化 30 轮以上。于是,容易的词提前定稿,困难的词获得更多修改机会;如果连续几轮只定下很少新词,就停止这种低收益的“磨洋工”。这套方法不用重新训练模型,也不增加预测器。作者报告,在 LLaDA-8B-Instruct 的 GSM8K 数学题测试中,推理最快加速 18.2 倍,准确率从 76.27% 升至 77.41%;但在较难的推理任务上,最大准确率下降了 4.4 个百分点。