Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 约 1 分钟

18MB缓存就能临时改写模型拒答

phantom-kv用约18MB可卸载缓存临时改变模型拒答,安全边界因此延伸到运行时状态。

IMAGE — r/LocalLLaMA 日榜

模型拒答通常像一道写进性格里的门禁:想改变它,往往得修改模型本身。开发者 Anony6666 发布的 phantom-kv 换了条路:不碰权重——决定模型基本能力与行为的参数——而是注入约 18MB 的 KV Cache。KV Cache 原本是模型生成文字时保存注意力中间结果的临时缓存;这里,一组训练好的缓存被模型当作“已经存在的对话记录”读取,从而临时改变拒答倾向。

这套状态可以按请求加载,也能随时卸载。作者称,卸载后基础模型文件仍逐字节不变,不必为不同量化版本重做权重修改,也不需要在每次生成时通过引擎钩子干预信号。演示中,基础模型拒绝讲解一个使用 API 哈希隐藏导入项的恶意软件样本;加载面向事件响应人员的“blue pill”后,同一会话给出了分析步骤,同时仍限制进攻性任务。值得警惕的也正是这一点:模型文件没变,不代表安全行为没变,部署方还得管住这些可热插拔的运行时状态。上述效果目前均来自作者自述,材料未提供独立评测。


供稿材料 SOURCES — 1

← 返回 2026-09-23 · 开源板块