Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
NEWS HN 1260 · 3 信源 约 8 分钟

Claude Opus 5:更强,也更少设限

Claude Opus 5用接近旗舰前沿的能力换来更低成本,也放宽部分限制,闭源模型竞争开始重画边界。

IMAGE — Anthropic (via Google News)

你让 AI 修一个复杂程序,真正麻烦的往往不是写出第一版答案,而是让它自己检查:问题是否真的解决了,有没有只修表面症状,遇到缺少工具时能不能另找办法。Anthropic 在 7 月 24 日发布的 Claude Opus 5,主打的正是这种“做完还会核查”的能力。更值得注意的是,它试图同时解决旗舰模型常见的另外两个问题:价格高,以及使用限制多。

Opus 是 Anthropic 通常用于高能力型号的名称。所谓旗舰模型,就是产品线中处理复杂任务最强、通常也最昂贵的一档。Anthropic 称,Opus 5 的智能水平接近更前沿的 Claude Fable 5,价格却约为后者一半;与上一代 Opus 4.8 相比,它维持相同定价,但整体性能明显提升。与此同时,据 TechCrunch 报道,它的安全分类器预计比 Fable 5 少触发 85%。这不是“安全措施减少 85%”,更不等于取消限制,而是部分请求更少被拦下。

这些能力和成本数字大多来自 Anthropic 自测。TechCrunch 可以印证发布及公告内容,但不等于完成了独立复测。理解这一点,是阅读下面成绩的前提。

更强,主要强在把事情做完

Anthropic 对 Opus 5 的核心描述,不只是“答题分数更高”,而是更擅长检查自己的工作,并持续修改到任务成功。这种能力对编程和办公自动化尤其重要:用户要的不是一段看起来合理的文字,而是一个能运行的程序,或一套真正执行完的流程。

官方给出的一个例子很直观。模型拿到一张机器零件图,需要编写代码,在 FreeCAD 中重建三维模型,但测试刻意没有提供直接查看图纸的办法。Opus 5 自己写了一套计算机视觉流程——也就是让程序从像素中提取形状和几何关系——再完成零件重建。Anthropic 称,它多次成功;相同条件下,其他模型尝试五次仍未完成。

另一次测试中,Opus 5 处理一个流行开源软件包的真实故障。它找到根因,还修复了社区补丁遗漏的边缘情况;对比模型只消除了表面症状,随后便宣布问题解决。类似地,一家交易公司的工程师让它搭建新交易所的市场数据接口。没有实时数据可供验证时,模型又自行建立测试工具,检查代码能否正确解析数据。

这些案例想说明的,不是模型突然拥有人的判断力,而是它在长任务中更愿意补齐缺失步骤。过去的模型常像一位交稿很快、却不复查的助手;Opus 5 的卖点,是开始把“验证”也当成任务的一部分。不过,这些仍是官方测试和早期客户案例,材料没有提供完整样本量或失败率。

接近更贵的模型,但不是处处领先

成本是这次换代的另一条主线。闭源模型由厂商托管,用户通过产品或 API 使用,不能下载核心权重自行部署。因此,能力、价格和使用规则都掌握在厂商手中。模型即便更强,如果每完成一次任务都贵很多,也未必适合日常使用。

在软件工程测试 Frontier-Bench v0.1 上,Anthropic 称 Opus 5 超过其他参评模型,并以更低的单任务成本,取得 Opus 4.8 两倍以上的表现。CursorBench 3.2 测试则允许模型使用不同的 effort 设置,也就是让用户在“投入更多计算争取更好答案”和“少用 token、提高速度并降低成本”之间选择。在最高 effort 下,Opus 5 距 Fable 5 的峰值分数不到 0.5%,单任务成本约为后者一半。

在 OSWorld 2.0——衡量模型操作电脑能力的基准——上,官方称 Opus 5 只花略高于 Fable 5 三分之一的成本,就超过了后者的最佳结果。它也在若干官方基准上领先 Fable 5,但并非全面胜出:Anthropic 明确表示,Opus 5 在网络安全任务上仍落后于 Mythos 5。

其他官方成绩也很醒目。ARC-AGI 3 要求模型处理新问题,Opus 5 得分约为次优模型的三倍;在测试端到端商业流程的 Zapier AutomationBench 上,相同单任务成本下,其通过率约为次优模型的 1.5 倍。生命科学方面,Anthropic 的内部基准显示,它在有机化学任务上比 Opus 4.8 高 10.2 个百分点,在预测蛋白质序列变化如何影响功能的任务上高 7.7 个百分点。

这些数字覆盖的任务很广,却不能简单合并成“所有方面都更强”。其中一些来自内部基准,材料也没有给出完整方法、样本量和误差范围。更稳妥的结论是:按照 Anthropic 公布的评测,Opus 5 把接近 Fable 5 的部分能力带到了更低的成本档位。目前它已成为 Claude Max 的默认模型,也是 Claude Pro 中最强的型号。

“更少设限”到底少了什么?

模型限制,也叫 guardrails,是厂商通过训练和产品规则设定的拒答或行为边界。它决定模型能处理哪些请求,也关系到滥用风险由谁承担。TechCrunch 报道称,Opus 5 相比 Fable 5 受到的限制更少,其安全分类器预计少触发 85%。安全分类器可以理解为请求进入模型前后的“检查岗”:它判断内容是否触碰风险规则。

边界并没有消失。网络安全任务就是一个清楚的例子:Opus 5 可以从源代码中寻找漏洞,因为这种工作更可能用于防御;但它不能扫描软件二进制文件寻找漏洞。利用漏洞和渗透测试等用途也仍有实质性保护措施。因此,“更少设限”准确说是部分规则触发得更少,而不是模型不再设防。

Anthropic 还推出可选测试功能 Automatic Fallbacks。当请求触发安全分类器时,系统不会只返回错误,而会自动把请求转给能力较弱的模型,尽量给 API 用户一个可用回应。这个设计减少了工作流突然中断的概率,但材料没有说明降级后能完成哪些任务,也没有给出误路由情况。

数据规则也有差别。据 TechCrunch 报道,Opus 5 不适用覆盖 Fable 5 和 Mythos 5 的 30 天数据保留政策。这里不能写成“Opus 5 不保留数据”:不受某项具体政策约束,与完全没有数据留存不是一回事,现有材料没有给出更细的处理方式。

为什么值得关注

这次发布把闭源模型竞争中的三条轴线放到了一起:能力有多强,完成任务要花多少钱,厂商允许它做什么。过去,用户往往需要在这三者之间取舍。Opus 5 的主张是,用约一半价格接近 Fable 5 的前沿智能,同时减少安全分类器的触发。

社交平台上还有一种说法,称 Grok 4.5 与 Opus 5 是仅有的位于 Pareto frontier(帕累托前沿)上的模型。这个术语表示:综合多个指标后,一个方案没有被另一方案全面压过。但原帖没有说明比较了哪些模型、指标和成本,也没有给出计算方法,因此不能据此认定两者就是可靠的综合前两名。

真正值得继续观察的,是这种组合会不会成为新常态:旗舰能力不再必然对应最高价格,较少拒答也不必然意味着取消所有安全边界。如果 Opus 5 的官方成绩经得起更广泛使用和独立测试,其他闭源厂商面对的就不只是“谁的模型更强”,而是“谁能以更低成本,把能力和规则调到更实用的位置”。

局限与未知

  • 绝大多数精确性能数字来自 Anthropic 自测,部分还是内部基准;现有材料缺少完整方法、样本量、误差范围和独立复测。
  • “少触发 85%”只描述安全分类器相对 Fable 5 的触发频率,不能推导为整体安全措施减少 85%;Automatic Fallbacks 的实际效果也尚无详细数据。
  • Frontier-Bench、ARC-AGI 3 等评测的定义与公开可复现性,在现有材料中没有充分说明。Opus 5 的真实优势能否覆盖日常复杂任务,仍要等待更多外部证据。

供稿材料 SOURCES — 3

← 返回 2026-07-25 · 科技板块