Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.055 — 2026-08-28
PAPER H 3 · HF 37 约 1 分钟

提示注入防御进入在策略蒸馏

让防御跟着 Agent 自己的行动练习,并逐词识别提示注入

攻击者把恶意指令藏进网页或邮件,就像在参考资料里夹了一张伪造批示;更麻烦的是,他们还会观察 Agent 的反应,不断换措辞。只背固定攻击样本的防御,很容易被绕开。SecOPD 的思路是“在策略蒸馏”:让当前模型亲自处理带注入的输入,再沿它实际生成的回答训练。

关键变化是反馈细到每个词。以往方法常给整段回答一个好或坏的评价,难以处理“前半段正常答题、后半段服从攻击”的混合回答。SecOPD 则让同一个初始模型充当教师:教师只看移除注入后的干净输入,并逐词评估学生在受攻击输入下生成的内容,指出偏离安全回答的位置。

作者报告,在 Qwen3.6-27B 上,面对会针对防御调整策略的 PISmith 攻击,攻击成功率从此前 Meta-SecAlign 的 94.0% 降至 9.0%。在训练中未见的 Agent 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%。这些效果目前来自论文作者的实验;这里的“在策略”指训练时跟随模型生成轨迹,并不等于部署后自动从真实访问中持续学习。


供稿材料 SOURCES — 1

← 返回 2026-08-28 · 学术板块