你把一整个代码库交给 AI,让它查一个偶发故障。它刚读完关键文件,后面的对话、测试结果和修改记录又把前面的内容挤了出去。最后,它可能局部看得懂,却无法把漫长的调查串起来。Claude Fable 5.1 想改善的正是这类任务:让模型一次带上更多材料,并在多轮工具调用中持续工作。
这次值得关注,不只是因为 Anthropic 发布了新模型。它还同步修改了 Claude Code 的默认选择和计费条件。模型能力、工作入口与成本一起变化,会直接影响开发团队是否升级。以下性能描述主要来自 Anthropic 的产品文案,尚无公开基准、样本量和测试方法支撑;速度数据则来自 OpenRouter 的动态观测。
一百万 token,给长任务腾出空间
Claude Fable 5.1(模型标识 claude-fable-5-1)于 2026 年 9 月 1 日发布,上下文窗口为 100 万 token。Token 是模型处理文字时使用的基本计量单位;上下文窗口则是一次请求中可以共同处理的输入与输出总量。
窗口变大,意味着完整代码库、长文档,以及 Agent 多轮执行留下的任务轨迹,更有机会同时留在模型眼前。这里的 Agent,是会自行拆解任务、读取文件、调用工具、运行测试并反复修正的程序,不只是接着补几行代码。
但一百万 token 不是“记住一切”的保证。它只扩大了可用空间,模型能否准确找到很早以前的线索、在长任务中保持判断一致,仍要看实际使用表现。
Anthropic 提供了一个很能说明目标场景的案例:一家投资机构被一个约百万次运行才出现一次的崩溃困扰,团队追查四五年仍未解释。该机构一位高级投资组合经理称,Fable 5.1 反汇编了外部供应商的程序库,又把结果与 core dump——程序崩溃时留下的内存快照——对照,最终把问题指向供应商代码。这个故事来自 Anthropic,不能当作独立评测;但它清楚展示了产品定位:接手那些资料多、步骤长、人工排查成本过高的疑难任务。
升级重点不只是“写代码更好”
Anthropic 称,Fable 5.1 相比 Fable 5 的主要增益集中在 agentic coding、长时间运行的 Agent 工作流和知识工作,尤其包括跨文件的长代码重构、前端与视觉代码生成,以及金融和分析任务。它生成的计划与摘要通常也更简洁。
这些说法目前都是概括性描述。“全面提升”和“最大增益”属于发布方的产品判断,材料没有给出对照模型、测试题目或成功率。因此,更稳妥的理解不是“新版本已经在所有任务上获胜”,而是 Anthropic 正把 Fable 系列进一步推向需要规划、操作工具和持续修正的工作。
OpenRouter 观测到,该模型在其路由环境下,最佳供应商的 P50 吞吐量为每秒 70 token,P50 延迟为 4.62 秒。P50 可以理解为中位数:一半请求快于这个数,一半慢于它。这些数据会随供应商和路由情况变化,不代表 Anthropic 官方端点,也不能视为稳定承诺。
默认模型变了,成本账也变了
据 Anthropic 的 Claude Code 发布记录,Fable 5.1 已成为 Claude Code 默认的 Fable 模型。这个“默认”只适用于 Claude Code,不能外推为 Anthropic 所有产品或 API 的统一默认选项。
价格是每百万输入 token 10 美元、每百万输出 token 50 美元。输出单价是输入的五倍,因此长任务的成本不只取决于塞进去多少材料,也取决于模型最终生成多少内容。
更值得留意的是缓存读取价:每百万 token 只需 0.25 美元。提示缓存会复用模型此前处理过的长段输入,避免每一轮都重新计算。若同一百万 token 的代码库或文档可以命中缓存,仅比较这部分输入,读取费用是普通输入的四十分之一。对反复携带同一批材料的 Agent 会话,这可能比标价本身更影响总成本;输出仍按输出价格另计。
为什么现在值得看
这次更新把三个原本分开的选择绑在了一起:模型能装下多少材料,Agent 能连续工作多久,以及每轮调用要花多少钱。百万上下文让长任务具备了更大的操作空间;Claude Code 默认切换,则会让更多开发者无需主动选型便接触新版本;低价缓存读取又鼓励应用反复复用大型代码库和文档。
换句话说,Fable 5.1 的关键不在一次回答是否更漂亮,而在它能否把数十步工作稳定做完,并让这种工作在成本上可以持续。对开发者而言,真正需要测试的也不是单道题,而是完整流程:读文件、制定计划、修改、测试、遇错后继续,以及最终交付可核查的结果。
局限与未知
- Anthropic 没有在材料中披露性能结论对应的基准测试、样本量和方法,所谓“全面提升”尚不能独立验证。
- 一百万 token 说明容量上限,不等于模型一定能可靠利用窗口远端的信息。
- OpenRouter 的速度和延迟来自多供应商路由环境,会动态变化,不能直接代表所有接入方式。