Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.092 — 2026-10-04
NEWS 约 1 分钟

Qwen Flash Next再省一半索引显存

索引器改成逐头计算,长上下文显存占用约省一半,超大 MoE 本地运行再降门槛。

IMAGE — r/LocalLLaMA 日榜

跑超长上下文时,模型像要同时摊开几张巨大的检索表,显存很容易先被挤满。llama.cpp 合并的这项 Qwen Flash Next 优化,盯上的正是稀疏注意力索引器——它负责给上下文位置打分,只挑当前最值得关注的内容,避免整段重算。

此前索引器一次计算全部 4 个头,并同时保留两份三维 FP32(32 位浮点数)张量;在长上下文下,它们成了计算图里最大的缓冲区。新实现改为逐头计算,完成校正后立即累加到同一份分数中。贡献者测试称,CUDA 计算缓冲区在 128k 上下文下由 6056 MiB 降至 3748 MiB,文本生成速度从 69.3 升至 70.2 token/s;Metal 在 64k 下也由 6224 MiB 降至 3924 MiB。

这不是让整个模型显存减半,而是把索引器这部分的峰值压低。它承接了此前用 SSD、系统内存和显存分层运行超大 MoE(每次只启用部分“专家”模块)的路线:少占两三 GiB,可能就是本地机器能否跑起来的差别。上述性能数字来自 PR 贡献者的特定配置测试。


供稿材料 SOURCES — 1

← 返回 2026-10-04 · 开源板块