把大模型压到两三比特,像把一整套精密工具塞进随身盒:装得下还不够,取用太慢,照样没法干活。量化——用更少的二进制位记录模型权重——过去能把权重压得很小,但复杂的还原过程可能抵消省下的时间。Tetra瞄准的正是这一步:让基于Leech格的极低比特模型真正跑进推理服务。
它把每24个权重编码成48比特,并借助Golay码——一种用于组织和解码Leech格中点的编码结构——把巨型码本拆成可分步查找的路径。GPU无需展开整张表,只需六次表读取和两次小型查找,就能在矩阵运算中还原一组权重。论文称,这把每个权重实际从显存读取的数据量从旧方案的4.804比特降到2.148比特。
做成完整的Qwen3模型后,4B、8B和14B版本平均占2.73、2.70和2.73比特,并在作者自研引擎中分别达到每秒113.8、95.0和57.2个token。不过压缩仍有代价:三款模型的MMLU成绩比4比特AWQ低4.76、4.21和2.46分。结果均来自单张NVIDIA L40S;论文是尚未同行评审的预印本。