Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
NEWS 约 1 分钟

超长上下文解码提速169%

llama.cpp 调整一处分派逻辑,Intel Battlemage 超长上下文解码最高提速约169%。

IMAGE — r/LocalLLaMA 日榜

让 AI 读十几万 token 的长材料后继续回答,常见瓶颈不只是“记不记得”,还有生成速度。llama.cpp 的一项未合并 PR 发现,Intel Battlemage GPU 上,一处看似很小的 SYCL 分派修正就可能明显提速。SYCL 是把推理计算派往 Intel GPU 的接口;此前使用量化 KV cache——以较低精度保存历史上下文中间结果、节省显存——时,解码会被送进 VEC 内核。作者把它改为 TILE 内核,并加入开关,方便两种路径直接对比。

提升随上下文变长而放大。作者自测显示,在 118,784 token、关闭 MTP 时,Qwen3.6-35B 的速度最高从 12.90 增至 31.80 token/s,Gemma 4 12B 则从 5.13 增至 13.81 token/s,后者提升约 168.7%;32K 场景也录得约 42%至74%的增幅。说白了,量化缓存虽然省了显存,底层若选错计算内核,仍会拖慢解码。不过这些主要是作者数据,具体 GPU 型号未披露,PR 尚未合并,也缺少独立硬件验证;开启 MTP 的一项 118K 测试仅提升14.1%。


供稿材料 SOURCES — 1

← 返回 2026-08-09 · 开源板块