Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
PAPER 约 1 分钟

同一请求,量化后答案会分叉

本应只提速的前缀缓存,在四比特量化下让同一请求更容易走向不同答案。

同一句话问 AI 两次,模型、参数和随机种子都没变,答案却可能分叉。问题出在两个常用的省钱办法叠加后:前缀缓存会复用共享开头的中间结果,权重量化则像把模型参数的小数四舍五入。前者理应只提速,后者带来的细小误差,却可能让不同计算路径越走越远。

作者在两个推理引擎上运行 80 轮多回合工具调用任务,并固定请求顺序、采用单请求串行执行。开启缓存后,16 位精度下有 36.2% 的任务轨迹发生变化;降到四比特后,这一比例升至 75.0%。关闭缓存时,800 次重复执行则全部逐位一致。进一步恢复相同缓存状态后,缓存与重算两条路径各自都能在 40 项中完全复现,但两者仍有 14 项不同。换句话说,系统并非纯粹随机;答案还取决于请求里看不见、默认也不会重置的缓存历史。对需要测试、追踪故障或接受审计的线上服务,这意味着“相同请求”本身可能还不够。以上结果均为作者实验所述。


供稿材料 SOURCES — 1

← 返回 2026-09-10 · 学术板块