在没有高端 GPU 的电脑上跑本地 AI,常见痛点不是模型装不下,而是回答得太慢。llama.cpp 的一项待合并改动,给 Q2_0——一种约 2 比特、以较低内存和计算成本换取一定精度损失的量化格式——加入了专门的 x86 VNNI 计算内核。VNNI 是处理器加速低精度向量运算的指令能力,相当于让原本绕远路的计算走上专用车道。
据 BTA_Labs 整理的作者测试,在 AMD EPYC 9645 上仅用 8 个 CPU 核心,Bonsai 8B 模型的文本生成速度从 2.39 提升至 8.20 tok/s,约为原来的 3.43 倍;tok/s 指模型每秒处理或生成的文本基本单位数量。1.7B 至 27B 模型的测试也显示约 3 至 3.6 倍提升。改动针对 Q2_0 与 Q8_0 的点积运算,并不意味着其他量化格式都会免费提速。目前该 PR 仍未合并,数据也主要来自作者控制条件下的 CPU 测试,但它说明老牌 x86 CPU 跑小模型仍有相当大的优化空间。