你让编码 Agent 接手一个大型项目,它要先读代码、需求、报错记录和团队规则,再动手修改。过去,材料太多时,开发者只能删减、拆分,或者让模型读到后面忘了前面。Claude Sonnet 5.5 给出的新答案很直接:把一次可参考的内容扩到 100 万 token,并成为 Anthropic API 默认的 Sonnet 模型。
Token 是模型切分和计费文本的基本单位,一个词可能对应一个或多个 token。上下文窗口则是模型一次请求能够参考的输入与输出总量。窗口更大,意味着大型代码库、长文档和漫长的 Agent 工作记录更有机会留在同一次任务里。不过,标题里的“百万上下文成标配”更适合看作趋势判断:现有材料只能确认 Sonnet 5.5 支持 100 万 token,不能证明整个行业都已普及。
默认模型换人,谁会受到影响?
Anthropic 的 Claude Code v2.1.284 发布说明称,Claude Sonnet 5.5(claude-sonnet-5-5)现已成为 Anthropic API 默认的 Sonnet 模型。API 是应用调用模型的标准接口。模型一旦成为默认项,使用厂商默认设置或滚动别名的应用,可能随之换到新版本;显式锁定具体模型版本的调用,则不会自动迁移。
这一区别很重要。对普通聊天用户,换模型可能只是回答风格有所变化;对编码 Agent,它会同时改变任务完成能力、响应时间和账单。OpenRouter 将 Sonnet 5.5 描述为 Sonnet 5 的直接升级版,并称它尤其擅长构建功能、修复 bug,以及制作完成度较高的文档、幻灯片和表格,写作与沟通也优于前代。但这些是模型页的定性介绍,材料没有提供对应的逐项对照实验。
Anthropic 展示的一项测试颇能说明它想强调什么:Sonnet 5.5 只看屏幕截图操作《Pokémon Red》,成为首个打通游戏的 Sonnet 模型。这里考的不是它记得多少游戏知识,而是能否在很长的流程里持续辨认画面、记住目标并采取行动。编码 Agent 面对跨文件修改时,需要的也是类似能力。
百万窗口不等于百万内容都能用好
100 万 token 的窗口,首先解决的是“装不下”。它能容纳更多代码、说明文档和历史操作,让 Agent 少做几次切割与压缩。但“看得见”不等于“每一处都理解得同样可靠”。现有材料没有给出 Sonnet 5.5 在不同上下文长度下的准确率,也没有说明信息位于开头、中段或末尾时,利用效果是否一致。
更长的输入还会把成本推到台前。Anthropic 的发布说明给出的价格是:每百万输入 token 2 美元,每百万输出 token 10 美元,缓存读取每百万 token 0.20 美元。提示缓存可以把反复使用的长前缀先保存下来,例如同一套代码库和团队规则;以后调用时复用处理结果,不必每次从头计算。按标价看,缓存读取只有普通输入价格的十分之一,因此大型代码库能否稳定复用缓存,会直接影响 Agent 的实际账单。
“多想一点”也要付出代价
OpenRouter 的模型页称,Sonnet 5.5 的 thinking 始终开启。这里的 thinking 指模型在给出答案前进行内部推理。使用者通过 effort 调节推理深度:档位越高,通常意味着更多思考,同时也可能增加延迟和成本;较低档位则更适合频繁、短促的日常 Agent 循环。
但最高档并不保证最好。Anthropic 披露,在 FrontierCode 编码评测中,Max 档反而低于 Xhigh。模型在最高档更频繁地启动多个子 Agent 分头审查代码,其中两次因为超时,或擅自修改任务范围之外的内容而被扣分。这个插曲点出了 Agent 的另一道难题:能力不只在于能做多少,也在于是否知道何时收手。
OpenRouter 转述的 Artificial Analysis 结果提供了一组观察角度:在“Adaptive Reasoning、Max Effort、Default Fallback”配置下,Sonnet 5.5 的 Intelligence Index 为 56.0,HLE 为 55.0%,SciCode 为 61.0%。这些数字来自同一模型页转述,且只对应特定运行配置,不能直接代表所有 effort 档位,更不能只凭分数判断具体项目中的速度、成本与稳定性。
为什么现在值得关注?
真正影响开发者选择的,不只是模型又升级了一代,而是三个变化同时发生:Sonnet 5.5进入默认位置,提供百万 token 上下文,并明确了输入、输出与缓存读取的价格。它把模型选型从“谁的榜单分数高”进一步推向一笔更具体的账:项目要放进多少材料,模型要思考多久,哪些内容能够缓存,以及一次任务值得花多少钱。
局限与未知
- 现有材料没有提供长上下文可靠性测试,100 万 token 只能证明容量,不能证明模型能同等有效地使用窗口内全部信息。
- 默认模型、百万上下文和官方价格目前都由 Anthropic 的同一份发布说明明示,仍属单一官方信源。
- OpenRouter 的能力描述和评测数据缺少完整对照实验;“优于前代”等判断应视为平台介绍,而非已经充分独立验证的结论。