Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER 约 6 分钟

量化误差为何会越层越放大

量化不只是让平均分下降:它会按比例压缩决策优势,悄悄改变工具调用与安全拒答。

你让一个压缩过的 AI 助手订机票。它仍然知道该选哪个订票工具,却可能突然决定什么也不做。普通测试的平均分看起来没怎么变,真正影响使用的那个决定却已经翻转。这篇论文追问的正是:把模型压到更低比特后,究竟哪些决定会坏,能不能提前预测?

量化——用更少的二进制位近似保存模型里的数字——能省显存、加快运行,代价是更粗的取整和更多误差。过去常见的理解是,量化给每个决定加上一团大小近似固定的噪声。Zekun Wu、Swati Dhiman 和 Adriano Koshiyama 的论文提出,至少在他们测量的条件里,更贴切的描述是“按比例缩水”:模型原有的决策优势会被乘上一个越来越小的系数。

这里先说清标题容易造成的误会。论文发现的是端到端的决策边际呈乘性收缩,并没有证明误差在神经网络中逐层相乘或逐层放大。相反,作者测得内部扰动随网络深度增长的速率在不同位宽下近似一致,因此明确否定了自己原先设想的“位宽越低、逐层放大越快”解释。

本文数字与效果均来自这篇 arXiv 论文,尚无独立复现。

别只看答对多少,要看它赢了多少

作者不再只比较量化前后的平均准确率,而是观察每一次具体选择的“决策边际”(margin):模型最想选的答案,得分领先次选答案多少。领先 2 分的决定显然比领先 20 分的决定更容易翻盘。

研究覆盖 16 个模型、8 个模型家族、3 种量化方法,以及从 8 bit 到 2 bit 的配置。每个测试项给模型两个可以识别首个 token 的选项。token 是模型处理文字时使用的基本单位;logit 则是模型给候选输出打出的原始分数。作者记录全精度模型两个选项的 logit 之差,再与量化后的差值逐项配对。

如果固定大小的加性噪声主导结果,量化后的点应该散落在原值附近,形成宽度大致不变的点云。论文看到的主要形状却是一条斜率小于 1、穿过原点附近的线:原来领先 20 的决定和领先 2 的决定,损失的是相近比例,而不是相近分数。

作者把剩余比例称为 margin shrinkage,即“边际收缩”。论文报告的中位收缩因子在 4 bit、3 bit、2 bit 时分别为 0.86、0.33 和 0.00。换句话说,4 bit 通常还保留多数优势;到 3 bit,中位数只剩约三分之一;2 bit 的中位数落到零。但 0.00 不代表所有 2 bit 模型的边际都归零。作者还认为,2 bit 时模型对整个词表的输出已接近失去锚点,因此把它视为这套测量工具的边界,而非证明规律的核心区间。

收缩只决定“变脆”,偏移决定“往哪边坏”

按比例缩小本身不一定改变正负号,也就不一定让选择翻转。论文的完整描述还包括一个随决策类别变化的方向性“推力”:收缩削弱原有优势,推力再决定决定往哪一边倒。

工具调用最能说明这一区别。在论文的 3 bit 实验和相应任务中,“要不要调用工具”明显偏向不行动;但“已经决定调用后该选哪个工具”基本不受影响。作者报告,在 34 个模型与方法组合中,有 32 个组合的 40 道工具选择题一次也没变。与此同时,在进入明显损伤的条件下,96% 原本应该调用工具的决定翻转,而 80% 原本不该调用的决定仍然保留。模型更像是放下工具,而不是拿错工具。

安全拒答也可能以类似方式静默退化。论文测得,4 bit 下各模型在两种安全测量中都保留拒答行为;3 bit 时损失因模型大小而异;2 bit 时,各模型大约丢失一半拒答。不过,作者也提醒,严重量化时首 token 的二选一偏好未必等于模型自由生成时真正会说什么。

为什么说它更像乘法,而不只是画出来像

一条斜线还不足以排除别的解释。作者因此比较了固定噪声、带方向漂移的噪声、噪声随边际增大的模型,以及乘性模型,并用 BIC——一种会同时奖励拟合效果、惩罚额外参数的统计指标——选择更合适的描述。

在受损的工具调用与安全决策中,加性均值模型没有一次胜出。放到全部受损条件,乘性描述赢得 85% 的单元格。不过这只是“在列出的候选模型中拟合最好”,不是对底层生成机制的证明。工具结果使用任务还是一个重要例外:它的误差方差也会随边际增大,简单的恒定方差预测因此失准。

论文还检验了“许多层各自贡献近似独立误差,最后把方差加起来”的解释。作者推导出,这类模型每少 1 bit,不应损失超过一半边际;但在 183 个相邻位宽步骤中,107 个越过了这个界限,10 个受测模型都出现违例。这排除了论文设定的独立误差累积类别,却仍没有告诉我们真正的因果链条是什么。

它把风险从平均分落到了单次决定

更实用的一步是预测翻转。作者只用量化前后的边际拟合参数,没有把“这道题最终是否翻转”作为训练标签。随后在留出的决策集上预测翻转率,中位误差为 1.8 个百分点。对 131,758 次逐决策预测,expected calibration error 为 0.004;这个指标衡量的是:被预测为某个风险水平的决定,实际翻转比例是否与之接近。

这意味着边际不能再充当“领先够多就绝对安全”的证书,却仍可在校准后成为风险信号。代价是每个模型、每种位宽都要自己测一小批配对边际。论文把别的模型参数直接借过来,在 3 bit 时会产生 18—33 个百分点的误差;参数不能跨模型照搬。

对部署者而言,这比“平均准确率下降了几点”更接近真实风险。工具调用、安全拒答和普通知识题可能拥有相似的总分,却在完全不同的方向上损坏。逐决策测量能找到平均数遮住的故障,也能估计哪些具体决定最容易翻转。

局限与未知

  • 这项研究讨论的是训练后量化和以首 token 表示的单步决策。约四分之一结果单元无法可靠估计收缩斜率;2 bit 以及部分低比特激活量化下,指定二选一也可能不再代表模型自由生成的行为。
  • 论文发现了稳定的统计关系,但没有通过干预建立“某个内部变化导致边际收缩”的因果机制。注意力重排等现象只是伴随信号,不能解释为什么不同模型的耐受度不同。
  • 在作者设定的成本匹配测试和受测修复方法中,增加 1 bit 是最划算的修复,恢复的翻转决定中位比例为 0.305;这不能外推成对所有量化方案和修复技术都成立的普遍结论。

供稿材料 SOURCES — 1
01
Quantization Damage Is Multiplicative, Not Additive arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-13 · 学术板块