Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER H 37 约 1 分钟

量化后,贪心解码也会改答案

同一模型用 BF16 和 FP16 推理,贪心解码也可能生成不同答案。

同一道题、同一个模型,也明确要求每次都选“最可能的下一个词”,答案还会变吗?这篇论文发现,只要把计算精度从 BF16 换成 FP16——两种用有限位数近似小数的格式——即使硬件、提示和解码方法不变,输出也可能分道扬镳。作者测试了六个 1.1B 至 7B 参数模型、四个模型家族和三个基准,49% 至 100% 的提示出现差异;另对 12B 模型做了补充分析。

原因不只是误差越积越多。贪心解码每一步都选得分最高的词;当排名前两位的分数很接近,细小的舍入差异就可能让它们互换。一旦某一步选了不同的词,后续生成看到的历史也随之改变,最终滚成完全不同的回答。论文还报告一个反直觉结果:扩大 FP32 高精度计算的范围,跨精度一致性反而更差。效果最好的低开销方案只在前两名差距较小时,用 FP32 重算最后的输出层;作者称它在 A10G 上将完全一致率提高 22 至 36 个百分点,低批量推理的延迟开销低于 4%。不过这只是局部缓解:批量达到 8 以上或全程采用 FP8 时,收益会消失。


供稿材料 SOURCES — 1

← 返回 2026-09-26 · 学术板块