给大模型“瘦身”,不能只看文件名写着几比特。Nemotron-3.5-Lightning 的张量宽度不符合量化格式的分块要求,约 99% 的参数会退回更高位宽,所以一些标作低比特的 GGUF——常见模型文件格式——实际仍接近 4.70 bpw。bpw 是每个权重平均占用的 bit,比“3-bit”标签更能反映真实体积。
作者 Daxfortuna 的办法很直接:把受影响的行补齐到 256 的倍数,让低比特编码真正生效;模型计算时再裁掉补出的部分。据其测试,文件由此前最小约 18 GiB 降至 11.77 GiB,实际为 3.07 bpw,并能在 16GB 显卡上留出运行 262,144 token 上下文的空间。HumanEval 代码测试为 91.5%,与 AtomicChat 的 19.65GB 版本持平,但作者也明确说,它的误差表现不及大 6.2 GiB 的原版 IQ3_XXS。
代价是兼容性:该文件依赖补丁版 llama.cpp,目前不能直接用于原版 llama.cpp、LM Studio 或 Ollama。现有数字均来自作者自测,更多基准仍在进行。