Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.080 — 2026-09-22
NEWS 约 5 分钟

模型自己点名该看的上下文

focus-llama让模型自己点名该看的上下文,试探长文本推理的新省算力路径。

你让 AI 阅读一整份代码库,只问某个函数为何报错。它找到相关文件后,生成答案时仍可能反复查看大量无关内容。上下文越长,这种“整本书一直摊在桌上”的做法,计算代价通常越高。focus-llama 想换一种办法:让模型先点名接下来需要哪些段落,再把其余内容从后续注意范围里移走。

这是 llama.cpp 的一个 fork——即从原项目分出的修改版本。llama.cpp 是广泛使用的本地大模型推理项目,侧重让模型在普通电脑和多种硬件上运行。这个 fork 把 Declarative Attention 接进了 llama.cpp。不过,目前关于实现情况的材料只有作者在 Reddit 的自述,尚无独立测试交叉验证。

让模型自己说“我只看这些”

Attention(注意力机制)决定模型生成每个 token——可以理解为一个词或词片段——时,可以参考上下文中的哪些位置。Declarative Attention 的关键变化,是让模型在输出中主动声明:“下面只需要看这些块。”

据 Google DeepMind 与 KAIST AI 的论文《Language Models Can Control Their Own Attention》,研究者把长文本切成约 2048 token 的“magic chunks”,并将这些块包装成模型熟悉的工具调用记录。模型随后输出类似 <focus magic_chunks="N"> 的标签,点名需要保留的块。推理引擎读到标签后,再限制后续 token 能看到的范围。

这像是让读者先从一摞资料里挑出三页,再只拿着这三页写答案。它没有另设一个 scorer——专门给文本片段打分的外部筛选器——也不要求为这套选择机制额外训练模型。按 fork 作者的说法,所需的是提示词、模型生成的标签,以及能够响应标签的推理引擎。这不等于完全没有门槛:提示如何写、模型能否选对、引擎如何真正少做计算,仍然重要。

标签不是提示,而是操作指令

focus-llama 的标签驱动模式会捕捉生成过程中的第一个 <focus> 标签,然后删除未被选中的上下文块。作者强调,这个动作只执行一次,而且不可逆。模型若点错了资料,后续生成便不能回头找回被删内容。

这里删除的是 KV token ranges。KV Cache 可以理解为模型阅读长文时留下的“计算草稿”,用于避免每生成一个 token 都从头处理上下文。原版 llama-server 不支持在生成中途操作这些范围,因此作者修改了服务器,使它能在 prefill——模型预先读入整段提示的阶段——进行到一半时,或完成之后,删除单个请求的部分 KV 记录。

fork 还提供第二序列模式 da_b,需要开启 --kv-unified,可以保留原始序列不动。对 hybrid/GDN 这类混合架构模型,限制只作用于 attention layers,即使用注意力机制的层;recurrent state——模型通过循环结构延续的内部状态——不会被裁剪。

真正难的是“少读”,不只是“不看”

这个实现值得关注,因为它把一篇论文里的注意力控制思路,推进到了 llama.cpp 这一常见本地推理项目中。模型的文本输出不再只是答案,也成了控制计算过程的指令。如果这条路径成立,长上下文推理可能不必始终把所有内容留在后续计算范围内。

但“逻辑上遮住”不等于硬件真的少读取数据。作者解释,llama.cpp 没有论文在 vLLM 中使用的 paged block table——一种按块管理缓存的机制。仅做 masking,也就是把某些位置标成不可见,并不会自动减少实际读取的 KV 数据。若要真正跳过这些数据,还需要内核支持或 compaction,即把保留内容重新紧凑排列。作者根据源码判断,当时的 CUDA 单 token 解码不会跳过被遮住的块;这属于尚待核验、也可能随版本变化的判断。

原论文在 vLLM 上报告,整体响应解码时间相对普通方案降至 Gemma 的 0.71×、Qwen 的 0.77×。这些数字来自论文,不是 focus-llama 的测试结果,因此不能据此宣称该 fork 已获得约 29% 或 23% 的加速。

局限与未知

  • 作者尚未进行正式的性能或准确率基准测试,无法确认 fork 是否复现论文收益。
  • 目前只有两个小规模 smoke test:一个 Qwen hybrid/GDN 模型和一个 tiny dense 模型,而且只检查 first-token logprobs——首个 token 的候选概率。它不能证明长文本选择正确、完整生成一致或实际更快。
  • 标签删除是一次性且不可逆的;混合模型的 recurrent state 又不受限制。误选上下文的代价、准确率变化和最终速度收益,都仍需系统测试。

供稿材料 SOURCES — 1

← 返回 2026-09-22 · 开源板块