AI 智能体要在电脑上执行命令,遇到高风险操作时弹窗请人确认,看起来像一道稳妥的保险。但一项模拟游戏显示,这道“最后防线”并不牢靠:玩家在时间压力下替编程智能体审批命令,超过 4 万局、共 40.9 万次判断中,平均只识别出 66.3% 的威胁,约三分之一被放行。
最容易漏过的不是 rm -rf / 这类一眼危险的命令,而是披着日常外衣的操作。npm run analyze——运行项目中预先定义脚本的命令——被误放行的比例达到 64.7%。游戏记录其实已经展示了脚本会把数据发送到远程服务器,但近三分之二玩家仍点了允许。三个类似的 npm run 命令合计漏检率为 52.5%,而其他数据外传类攻击为 28.4%。熟悉的名字,可能让人跳过真正该看的内容。
这不是现实工作环境的直接测量:游戏很短,约 34% 的命令都是威胁,而且刻意设置了时间压力。作者也承认这一限制。但结果至少提醒我们,Human-in-the-loop——把危险操作交给人类最终确认——不能仅靠一个“允许/拒绝”按钮就被视为可靠安全阀。