让 AI 读一大段代码时,等待往往发生在它“读完再开口”的阶段。llama.cpp 这次没有改模型,而是调整 CUDA——NVIDIA GPU 的并行计算体系——中 GDN 状态的分配方式。GDN 是一种边读边汇总信息的结构;改动让每个 warp(一组同步工作的 GPU 线程)同时负责四列状态,减少线程花在调度而非计算上的时间。
作者在 RTX 4090 上测试 Qwen3.8-27B 与 Qwen3.5-9B,称提示处理吞吐最高约提升 5.5%。这对长文档和大型代码上下文更有意义,因为 prefill(模型先读完输入并建立内部状态)通常是开口前最费时的一段。补充测试中,Kimi-Linear-48B-A3B 处理 4096 个提示 token 时提升 3.4%。这是一项底层推理优化,不会增加模型知识或能力;不同 GPU、模型和量化设置下,收益仍可能不同。