把大模型先拆掉一半“零件”,再把权重压成只有16种编码的4比特,部署会便宜不少,但推理、数学、编程和长文本能力也可能跟着受损。常见补救办法像让学生对着练习册重做;这篇论文提出的 QAH(Quantization-Aware Healing,量化感知恢复)则让压缩后的模型直接模仿原始大模型的输出,重新安排剩余参数的分工。
关键在于“老师”选谁。结构压缩后的高精度版本,本身已经是一次恢复出来的近似品;再让4比特模型模仿它,能力上限也会被这个中间版本卡住。QAH 因此绕过中间版本,直接以未压缩的原模型为老师,而且不要求两者结构相同。
作者在将 GPT-OSS 120B 压到 60B、再量化为 MXFP4 的流程中报告:学生模型在9项基准中的7项追平或超过量化前的 bfloat16 版本,并在 LiveCodeBench 上达到原始120B模型水平。成果被用于开放权重模型 Hypernova-60B。论文也明确把它定位为一套实用配方,而非新的基础算法;上述效果来自作者自己的流程测量。