你让 AI 连续替你查套餐、改设置、核对账单,它中途叫错一次工具,系统往往允许重试,最后仍可能把事办成。总分于是看不出过程更危险。这篇论文研究的正是这个盲区:后训练量化——把训练好的模型权重压到 4 比特以减少占用——是否会伤害多轮工具调用 Agent。
作者在零售和电信任务中测试多种模型,每个实验条件运行 456 个回合。按最终任务成功率看,4 比特与 16 比特的差异都未通过多重比较校正;但调用日志显示,量化会放大模型原有的失败倾向,而非制造一批全新的错误。电信场景里,突出问题是“工具名幻觉”,即调用工具清单中不存在的名称。
关键在评测规则:每回合容许最多十次失败调用,额外错误常被重试机制消化。作者把容错额度缩到两次后,分数差距只在错误量确实增加的实验条件中重新出现。换句话说,4比特可能没让 Agent 更常把任务彻底搞砸,却让它更频繁地走到出错边缘。量化评测因此不能只报最终成功率,还应查看中途误操作及其累积链条。