你让 AI 帮公司找漏洞,它可能是安全助手;把同样的本事交给攻击者,它也可能降低入侵门槛。Astra 值得关注,正因为 OpenAI 现在无法排除它已经触及高风险网络能力的门槛。但这次披露只是初步预警,不是能力定论。
先按最高风险准备
OpenAI 于 8 月 7 日表示,内部评估显示,待发布模型 Astra 在 agent 编程和网络安全方面有明显进步。Agent 指能自主拆解任务、调用工具并连续执行步骤的 AI 系统。
公司尚不能排除 Astra 已达到“Critical”网络能力等级——这是 OpenAI 风险框架中描述极高网络能力的门槛。因此,它正把 Astra 当作首个可能达到该等级的模型处理,放慢测试和发布准备,先升级内部安全实践。
网络安全能力评估通常会测试漏洞发现、漏洞利用和攻击链规划等任务。它测的是模型“能做到什么”,不等于现实中已经发生攻击。红队测试则让内部或外部人员模拟攻击者,在广泛发布前寻找可被滥用的弱点。
防线不只设在聊天窗口
据 OpenAI 官方披露,公司已在 Astra 参与训练和评估等 agent 场景中部署全面监控,用于识别高风险行为和失准表现;同时加强访问控制与基础设施隔离。Axios 还报道称,OpenAI 暂停了部分不符合更严格安全要求的内部活动,并在升级措施期间放慢发布进程。
这件事的重要性不在于 Astra 已被证明“很会攻击”,而在于发布逻辑发生了变化:当模型可能接近高风险门槛时,安全控制不再等最终结论出来才启动。面对“双重用途”能力——既能修补漏洞,也能用于入侵——能力评估、访问限制和发布审查必须一起考虑。
局限与未知
- 目前关于 Astra 的核心信息主要来自 OpenAI 单一信源,尚缺少跨机构验证。
- OpenAI 没有公布测试方法、具体数字或最终能力等级,不能据此断言 Astra 已跨过网络攻防门槛。
- 更多内部和外部评估仍在进行,公司此次也未给出公开发布日期。