给能力越来越强的 AI 划安全线,不能只靠一句“我们很重视”。更关键的是,公司有没有提前设定危险能力的分界线,并在模型接近红线时升级防护。Anthropic 于 2026 年 8 月发布第二期风险报告,试图把这套判断过程摆到台面上。
这份报告属于其 Responsible Scaling Policy(RSP,能力越可能造成严重危害,开发和部署要求就越严格)的一部分。Anthropic 称,报告会说明其系统面临的风险,以及公司应对这些风险的准备程度。它值得关注,不只因为结论本身,也因为定期披露能让外界持续检验安全承诺是否真正变成治理流程。
不过,公开版本明确标为“Redacted”,即部分内容经过删节。这样可以避免敏感能力、攻击方法或防护细节被滥用,却也限制了外界独立核查。现有摘要未披露具体能力阈值、评估结果或防护升级情况,因此暂时不能据此判断 Anthropic 的准备是否充分。