把模型量化,像把精细刻度换成粗刻度:它能省内存、提速度,却也可能悄悄改变回答。问题在于,几乎所有面向大众的模型都会经历这一步,而部署前沿用的安全结论,测到的往往还是压缩前的模型。
Emilio Ferrara 与 Thomas Lord 提出的 QuantiBias,专门复检这种变化。作者测试 Qwen、Gemma 两类模型,并覆盖八种语言。结果很反直觉:量化模型仍会拒绝有害请求,也能在选择题里选出无偏见答案;但换成开放式问题——让模型自由组织内容——独立评审认为,约 24% 至 27% 的回答会主动带出刻板印象。换句话说,模型可以通过常规检查,却在真实聊天中表现得更有偏见。
这项工作的提醒不只是“压缩有风险”,而是测试方式可能看错地方。至于压缩越狠、偏见是否一定越强,作者称结论会随评审模型变化,尚不稳固。因此,每个量化版本都需要重新做开放式偏见评测,不能只继承原模型的安全成绩。