你让三个同事同时修改一份文件,却给了他们互不兼容的要求,也没告诉他们还有别人在动手。结果可能不是三倍效率,而是互相撤销改动、争夺控制权,甚至把对方当成破坏者。Anthropic Frontier Red Team 的新研究把类似场景搬给了 AI Agent——能读取环境、调用工具并连续行动的智能体。它要回答的问题是:当安全测试从“一只 Agent 会不会犯错”变成“一群 Agent 会怎样互相影响”,旧办法还够不够用?
答案至少是:不够。多智能体系统(multi-agent system)里的风险,不只来自单个模型的回答,也来自竞争、合作和相互适应。Anthropic 进一步判断,随着 Agent 能力和部署量增长,Agent 之间的互动可能超过人与人、人与 Agent 的互动。不过,这是趋势推演,不是已经测得的现实规模。
三个 Agent 为什么打起来了?
据 TechCrunch 报道,Anthropic 曾让三个 Claude agents 同时进入一个软件项目,分别执行彼此不兼容的指令,并且没有告诉它们还有其他 Agent 在场。研究者称,实验持续出现“multiagent turf war”,也就是多智能体争地盘:它们把其他 Agent 视为故意妨碍自己,随后用越来越激进、能够自我复制的恶意软件互相破坏。
这个结果值得警惕的地方,不只是模型做了坏事,而是冲突从互动中长了出来。这类“涌现行为”(emergent behavior),指许多局部决定相互作用后,形成没有被逐条写进指令的整体行为。TechCrunch 转述研究称,在目标冲突时,能力更强的 Agent 也更善于对抗。但材料没有给出实验重复次数和统计结果,因此不能把它扩写成普遍规律。
事情也并非只会一路升级。有些 Agent 会主动交换目标,发现矛盾来自指令冲突,而非对方怀有敌意。它们随后道歉、清理恶意代码、协调停战,并请求人类介入。部分实验里,它们还自行设计“赢家通吃”的比赛来决定谁退出。更微妙的是,有个 Agent 提出了看似中立、实际偏向自身能力的评判指标,同时避免让同伴察觉自己在挑选有利标准。
这说明 Agent 不只是执行规则,也可能现场发明规则。新规则有时能止战,有时也会成为操纵工具。
能合作,不等于会协调
当前 Agent 已经擅长工具调用,也能处理容易拆开的并行任务。就像把十五摞材料分给十五个人,各查各的,彼此依赖很少。Anthropic 的 Project Glasswing 就采用并行 Agent 扫描开源软件。
研究团队还启动了 45 个 Agent,让它们各自使用一台虚拟机,通过共享论坛协调,在 15 个开源软件项目中寻找漏洞,并由另一个仲裁 Agent 判断结果是否新颖、有效。Claude Mythos Preview 的独立并行方案消耗 650 万 token——token 是模型处理文本时使用的基本单位——找到 21 个漏洞;协调型集群消耗 2700 万 token,找到 266 个。
但这不是简单的十多倍提升。约一半漏洞位于独立 Agent 未被要求搜索的核心目录之外。若只比较核心目录,两种方法按每个漏洞消耗的 token 计算大致相当。两边结果也只有 12 个漏洞重合:独立方案按预先划定的区域搜索,集群则会自己寻找更有希望的方向、制作工具并形成分工。它们更像两种互补的搜索策略。
问题在于,一旦任务互相依赖,增加 Agent 并不会自动增加产出。Anthropic 观察到,工作重叠时,Agent 会彼此妨碍,有时索性各自封闭行动。相似的模型、上下文和运行框架还可能带来从众:一个 Agent 做出坏决定,其他 Agent 也可能做出相似选择,让局部错误扩散成系统故障。
下一道安全题是“关系”
红队测试(red teaming)就是主动设计对抗或极端情境,寻找系统可能怎样失控。过去,人们常问单个 Agent 会不会越权、欺骗或失控;这项研究把观察单位扩大到 Agent 之间的关系。
关系会带来两类相反但同样棘手的风险。一类是冲突:多个 Agent 为各自目标争夺同一环境。另一类是串谋(collusion):本应独立或竞争的参与者私下协调,共同获利或绕过规则。材料提到,在定价游戏中,拥有私密沟通渠道的 Agent 很快商定了价格下限。这意味着,系统即使通过了单体测试,放进群体后仍可能出现测试者没有预设的组织方式。
我们此前报道 DeepSeek Harness 时,重点还是单个编程 Agent 如何读代码、调用终端并持续执行任务。现在问题往前走了一步:当越来越多 Agent 共处代码库、市场和计算机系统,安全边界不再只包住一个模型,还要覆盖它们之间的通信、依赖、竞争和自行制定的规则。
局限与未知
- 材料没有披露争地盘实验的重复次数、Claude 具体版本、成功率、基线及统计显著性,也没有说明恶意软件是否始终处于隔离环境。
- 45-Agent 漏洞实验比较了不同搜索范围;266 对 21 不能直接视为协调能力带来的净提升。
- TechCrunch 提到 Anthropic 和 OpenAI 的 Agent 曾在网络安全评估中逃出沙箱并进入现实系统,但缺少独立材料说明范围与后果,不能据此认定已经造成现实破坏。