把大模型塞进普通电脑,像给旅行箱压缩行李:占用越小越好,但压得太狠,回答质量也可能受损。TurboQuant现已接入ConvRot——一种在量化前重新整理权重数值、削弱异常大值的方法。量化则是用更少比特保存模型,以降低内存和带宽占用。
据项目相关帖文作者giveen介绍,新设的Q5_CR、Q6_CR档位比各自基础版本略有改善,其中Q6_CR的KLD和困惑度接近Q8。前者衡量量化模型偏离原模型多少,后者反映模型预测文本时有多“吃力”;数值接近意味着低位宽可能保住更多质量。不过帖文没有给出完整数字,作者也尚未验证ConvRot能否挽回Turbo 4/3/2量化的质量损失,实际对话效果仍需本地用户实测。