你让 AI 接手一个大型代码库,改完登录流程,再检查相关文件、运行测试、修掉新问题。难点不只是“会不会写代码”,而是它能否记住前面看过什么,连续推进许多步骤,并把做过的事交代清楚。Claude Opus 5.5 瞄准的正是这类任务。
据 OpenRouter 页面,Anthropic 已发布 Claude Opus 5.5,用它接替 Opus 5,作为面向高难度推理、编程和长周期 Agent 任务的旗舰模型。Agent——能围绕目标调用工具、检查结果并继续行动的 AI——在编码场景里可能跨文件修改代码、运行测试,再根据结果返工。更直接的变化来自 Anthropic 的 Claude Code 发布记录:Opus 5.5 已成为这款命令行编码 Agent 的默认 Opus 模型。
这里要把标题中的三个层级拆开。百万 token 上下文得到 OpenRouter 与 Claude Code 发布记录的共同支持;“默认”只发生在 Claude Code 的 Opus 选择中,不能扩写成 Anthropic API 或所有 Claude 产品的默认模型;“旗舰”则来自 OpenRouter 的定位。本文的能力描述主要来自这一页面,尚缺完整测试方法与对照数据。
一次能读更多,也要连续做得下去
Opus 5.5 支持 100 万 token 的上下文窗口。上下文窗口就是模型一次任务中能够容纳的输入与输出总量,可以把它理解成工作台的面积:工作台更大,能同时摊开更多代码和文档,不必频繁收起再拿回来。但面积大不等于每一页都能准确读懂,更不保证模型能在很长的任务里始终抓住重点。
OpenRouter 称,它尤其擅长大型代码库里的多步骤修改、代码审查与缺陷发现,也面向金融和科学分析,以及密集图表、示意图和截图的读取。页面还称,相比 Opus 5,新模型完成相近任务所需的步骤和 token 更少,工作汇报也更直白。不过材料没有给出这些说法的任务样本、具体节省比例或对照过程,因此更适合看成产品方的能力定位,而不是已经充分验证的结论。
它的 thinking 始终采用 adaptive,也就是模型会按任务调整推理投入。开发者主要通过 effort 控制思考深度、等待时间和成本:难题可以提高投入,重视响应速度的任务则可以降低。这个设计把选型从“只挑一个模型”变成“同一个模型还要挑工作强度”。
百万窗口不是免费的仓库
标准实时调用的标价是每百万输入 token 4 美元、每百万输出 token 20 美元。缓存读取为每百万 token 0.20 美元。缓存——保存模型已经处理过的重复上下文,供后续请求复用——对大型代码库尤其重要,因为同一批文件可能在多轮修改中反复送入模型。窗口容量决定“装得下多少”,缓存价格则会影响“反复使用要花多少”。
批处理版本的价格是每百万输入 token 2 美元、输出 token 10 美元。批处理适合不要求即时返回、可以集中排队的任务,不能与标准实时价格混为一谈。OpenRouter 标注的发布日期为 2026 年 9 月 22 日;该日期目前只有这一来源明确给出。
我们此前讨论 GPT-6 Astra 时,曾用“上下文、长周期 Agent、标准版与批处理版”观察旗舰产品线。Opus 5.5 也适合沿用这套框架。真正影响开发者的,不只是一个榜单总分,而是它能读多少、能连续做多久、等待多长时间,以及每轮输入输出如何计费。
分数提供坐标,不提供结论
Artificial Analysis 给出的成绩包括 Intelligence Index 57.6、长上下文相关的 AA-LCR 84.7%,以及 SciCode 66.9%。这些测试使用的是 Adaptive Reasoning、Max Effort、Default Fallback 配置,意味着模型被允许采用较高推理投入。材料没有提供同表中的竞争模型、误差范围或成本与速度对照,因此这些数字只能说明该配置下的测量结果,不能据此宣称它全面领先。
比跑分更值得观察的是默认入口的变化。Claude Code 用户如果继续使用默认 Opus,实际工作流会自然迁移到 5.5。默认项会减少主动选型的步骤,也会把百万上下文、adaptive thinking 和新的计价方式直接带进日常编码。
据 Anthropic Institute 与 Associated Press 报道,Opus 5.5 上线前四天,Anthropic 披露 Claude 已主导公司约 26% 的模型研发任务,约 90% 的研发工作有 Claude 参与;这里的“主导”仍包含人类监督。于是,新旗舰进入的并非一条空白工具链:Claude 所在的研发系统已经参与制造自己的后继者。公司同时警告,这种加速可能让人类更难理解或控制系统。
局限与未知
- 材料没有披露百万上下文在不同长度、不同代码库上的实际利用率;“装得下”不能直接等同于“找得准、改得对”。
- “更少步骤和 token”“更强的编程与分析能力”缺少样本量、方法和 Opus 5 的详细对照,应等待独立复测。
- 现有材料能确认的是 Claude Code 中的默认 Opus 变更,不能外推为 Anthropic 全产品或整个行业的默认旗舰。