把本地大模型压得更小,像收拾行李箱:每件东西都硬挤到同样大小,省空间,却可能压坏最要紧的部分。Voodoo Dynamic Quant 的做法是先判断不同张量——模型中成组存放的权重——适合哪种量化档位,再混合分配精度,争取在目标文件大小下少损失能力。它面向 GGUF,也就是本地推理常用、可封装量化权重与模型信息的文件格式。
最具体的一步,是同时准备每个张量的多种量化结果,再用梯度下降——根据误差逐步调整选择的优化方法——寻找损失更低的组合。训练时,候选权重保持不变,只调整每个张量、每种档位对应的一个选择开关,并逐渐收敛到单一档位。作者此前保留了方法,如今把工具集改用 MIT License 发布;这种宽松许可证通常允许使用、修改、再发布和商业使用,只需保留许可证与版权声明。作者曾称它在部分较小的 Qwen3.5 GGUF 模型上、最激进的量化档位达到 SOTA,但材料没有给出测试数字或独立比较,因此眼下更值得关注的是:社区终于可以自行复现、实测并继续改造它。