下载一个本地模型,就像买到一台能开机的电器:文件能加载、文字能生成,不代表核心功能正常。Aditi Patodiya 检查了 327 个公共量化模型制品——量化是用更少比特保存参数,以降低内存和计算成本;GGUF 则是常见的本地模型文件格式。结果显示,Ollama 官方库的 305 个制品中,有 5 个“开箱即坏”:4 个 Qwen2.5-Coder-3B 转换和 1 个 phi3.5-mini 转换,在 164 道任务及两套推理后端上均为零分,而同模型、同量化规格的独立转换可以工作。
关键不只是“发现坏文件”,而是证明不能靠输出看起来是否流畅来验货。作者称,其中两类缺陷的表面统计仍落在正常范围,只有实际执行任务才能识别。团队因此设计了 15 题冒烟测试——类似开机后先试按钮和声音的快速检查——并发布 quantcheck 工具。结论很直接:公共模型库需要在发布环节加入运行级验收。不过,这项统计只覆盖代码能力模型、8 GB 以下制品,比例不能直接外推到全部 GGUF。