本地跑模型时,长提示像一大摞材料:模型要先整批读完,才能开始回答。这个“预填充”(prefill)阶段,在CPU运行IQ量化模型时尤其容易拖慢。IQ量化用更少的数值位数保存权重,能省内存,但也需要专门的解码和计算实现。llama.cpp的一项待合并优化,正试图用AVX2——让x86处理器一次处理多份数据的向量指令——加快这一步。
供稿者在EPYC 9654上用24线程、批量大小512测试。其中,Qwen3.6-27B的纯IQ3_S版本从4.75 token/s升至65.45 token/s,增幅1277.9%;困惑度从6.4753变为6.4779,差异为+0.04%。困惑度用于衡量模型预测文本的能力,通常越低越好。这个结果很亮眼,但测试刻意采用了极大的批量,供稿者也说明,批量较小时增幅会缩小。加之该优化仍是开放草案、尚未合并,它更像一个值得提前关注的CPU推理提速方向,而非已经落地的普遍结论。