把一张明暗差异很大的照片压缩时,最怕把有限的色阶平均分配:细节丰富的区域不够用,平坦区域却浪费了。大模型量化也有类似问题。量化是把高精度数值改用更少比特表示,以节省内存和计算,但模型内部不同方向的重要性并不均匀。KLQ 是一个个人研究项目,尝试在压缩前先认清这种差异,再决定精度该花在哪里。
作者称,KLQ 会测量空间的不均匀程度,按重要性排列特征方向,再用“注水算法”分配比特——把更多精度留给重要方向,较少精度给次要方向。它还用因果 KL 损伤衡量量化对输出分布的影响。作者自述,在 W4A4KV4(权重、激活值和 KV 缓存都用 4 比特)设置下,Llama 3.2 1B 的效果超过 SpinQuant,并接近 ReSpinQuant,且不依赖 GPTQ/LDLQ 舍入。不过项目仍是理论框架和“模拟量化”演示,没有真实计算内核,也远未达到生产可用水平;现阶段更适合作为一套可复验的方法和代码来看。