想象厨房机器人看到一张写着假命令的纸条:它不但照做,还把指令“传”给队友。提示注入就是把恶意指令藏进模型会读取的内容,诱使它偏离原任务;当模型开始规划机器人动作,错误输出就可能变成安全风险。
研究者在 AI2-THOR 虚拟家庭环境中测试了 LLaMAR 多 Agent 机器人系统。最值得注意的是它的控制方式:默认架构让一个 Actor——负责选择动作的模型模块——在同一次 LLM 调用中读取所有机器人的观察与状态,再为每台机器人生成动作。因此,只污染一个 Agent 的输入,恶意指令也可能借共享提示扩散到未被直接攻击的队友,同时降低原任务完成度。
团队还尝试让每个 Agent 分开调用 LLM。作者称,这能降低恶意动作的成功率,却不能彻底消除漏洞。实验发生在模拟器而非实体机器人上,但它点明了关键边界:多 Agent 协作增加的不只是能力,也包括更多攻击入口和跨环节传播路径。