Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.099 — 2026-10-11
PAPER H 10 约 1 分钟

两比特压缩开始统一算总账

CanonQ用一套统一规则处理权重、激活和KV缓存,让模型适应三类误差的联合作用。

把大模型压到很低的位数,像把三种材质的行李塞进同一个小箱子:权重、激活值和KV缓存各有不同形状,单独压得好,放在一起却可能互相放大误差。CanonQ瞄准W2A4KV2——权重用2比特、临时计算结果用4比特、生成时的“记忆区”KV缓存用2比特——试图减少逐项调参和反复试错。

它最值得注意的一步,是先把不同数据“整理成同一种坐标”。CanonQ用固定旋转打散数值能量,再做归一化,随后让权重、激活和缓存复用按高斯分布预先设计、训练时保持冻结的量化码本。码本可以理解为一张有限的数字对照表:原值只能就近换成表中的代表值。模型再通过量化感知训练,也就是在训练时直接经历压缩误差,同时适应三条路径的联合作用。

作者称,CanonQ在LLaMA3的1B、3B和8B模型上进行联合W2A4KV2压缩时,优势最明显,并扩展测试到Qwen3-1.7B、代码生成和数学推理。不过供稿文本缺失了具体提升数字,因此目前能确认的是方法设计与作者报告的趋势,尚不能据此判断收益幅度及部署成本。


供稿材料 SOURCES — 1
01
Few Bits, One Law: Toward W2A4KV2 arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-11 · 学术板块