Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
PAPER 约 1 分钟

量化正在悄悄改变模型偏见

模型压缩后照样通过安全测试,却可能在自由回答中更爱主动补出刻板印象。

把模型量化,像把精细刻度换成粗刻度:它能省内存、提速度,却也可能悄悄改变回答。问题在于,几乎所有面向大众的模型都会经历这一步,而部署前沿用的安全结论,测到的往往还是压缩前的模型。

Emilio Ferrara 与 Thomas Lord 提出的 QuantiBias,专门复检这种变化。作者测试 Qwen、Gemma 两类模型,并覆盖八种语言。结果很反直觉:量化模型仍会拒绝有害请求,也能在选择题里选出无偏见答案;但换成开放式问题——让模型自由组织内容——独立评审认为,约 24% 至 27% 的回答会主动带出刻板印象。换句话说,模型可以通过常规检查,却在真实聊天中表现得更有偏见。

这项工作的提醒不只是“压缩有风险”,而是测试方式可能看错地方。至于压缩越狠、偏见是否一定越强,作者称结论会随评审模型变化,尚不稳固。因此,每个量化版本都需要重新做开放式偏见评测,不能只继承原模型的安全成绩。


供稿材料 SOURCES — 1
01
QuantiBias: Benchmarking Quantization-Induced Bias in LLMs arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-07-27 · 学术板块