压缩大模型,最怕的不是慢,而是机器不报错,模型却已经被悄悄改坏。Reddit 用户 gladkos 在将 DeepSeek V4 0731 的原始 safetensors——常见的模型权重文件格式——转成量化版本时,就发现了这种“静默损坏”。量化本是用低精度数字保存权重,以减少显存占用;但如果起点已经偏了,后面的速度和精度排名也就失去参照。
据作者自述,转换器默认会把 FP8 张量降为 Q8_0,导致模型在正式量化前,与原始权重的平均 KLD——衡量输出分布差异的指标——已达 0.219。反直觉的是,其118 GB、3-bit量化版本的 KLD 反而只有0.2065:默认生成的162 GB“无损”基线,偏离得更多。作者将相关张量替换为 BF16 后,才得到逐位一致的基座模型。另一个坑更显眼:若不启用 --no-lazy,token_embd.weight 会出现 NaN,也就是无效数值。
团队随后在同一套8张RTX 5090环境中统一测试38个文件。关键提醒不是谁跑得最快,而是量化前先校验转换结果;否则一个没有报错的基线,可能从一开始就不是原模型。上述结论来自作者公开实测,材料未提供独立复核。