你让 AI 给一栋住满人的老楼换水管,难点不在拧紧某个接头,而在先看懂整套管线,安排多人施工,最后确认别处没有漏水。大型软件项目也一样:改一处代码,可能牵动许多相互依赖的模块。普通代码补全擅长写几行新代码,却未必能独立收拾这种跨文件、跨步骤的工程任务。
Meta 在 8 月 5 日发布的 Muse Code,瞄准的正是这道难题。它目前处于 beta 阶段,是一个运行在终端里的编程 Agent——也就是在 AI 模型之外接入文件、命令行和测试工具,让系统能够先规划,再改代码并运行检查。Meta 把它直接摆进了与 OpenAI、Anthropic 竞争的位置。真正值得看的,不是它又会写代码了,而是它试图把规划、修改、协作和验证连成一条完整工作流。
需要先说明:发布及产品定位得到 Bloomberg、WSJ、TechCrunch 等多个载体印证,但本文涉及的运行细节和案例大多仍来自 Meta 自述,尚不能视为第三方验证结果。
它想接手的,不是一小段代码
代码仓库(repository)集中保存一个项目的源码、配置、测试和历史记录。仓库越大,模块之间的关系越复杂。一个看似简单的新功能,可能要同时调整界面、数据处理、权限和测试。
据 Meta 发布材料,Muse Code 可以围绕这类任务规划改动、编写代码并验证结果。换句话说,用户给它的目标可以是一项工程任务,而不只是“补完这个函数”。它由 Muse Spark 1.2 驱动;这是 Muse Spark 1.1 的编程向升级版本。
Muse Code 还会让专用后台 Agent 在整个会话中保持活动。后台 Agent 是可以持续或异步工作的执行单元。Meta 的说法是,它会随着会话推进积累上下文,不必每接到一个任务都从头开始理解项目。这个设计很适合大型仓库,因为真正费力的部分,往往不是生成某一段代码,而是持续记住项目结构、此前做过什么,以及哪些改动彼此相关。
大任务来了,就把工位分开
任务足够大时,Muse Code 可以启动多个 sub-agent,也就是把工作拆给多个子执行单元并行处理。关键在于,这些子 Agent 不会挤在同一个工作目录里改文件,而是在彼此隔离的 Git worktree 中工作。
Git worktree 可以从同一个仓库建立多个独立工作目录。可以把它理解成给几名施工人员各发一套项目副本:大家同时动手,先避免直接覆盖彼此的文件,之后再汇总和验证。用户原本正在使用的 working copy——当前工作目录——也不会被这些并行改动直接触碰。
Meta 称,它曾在测试中让 Muse Code 同时为一款游戏构建六项功能,且没有发生代码冲突。这个案例直观展示了并行 worktree 的卖点,但它只是 Meta 的内部测试。没有冲突也不等于六项功能都正确,更不代表系统在其他大型项目中能稳定复现同样表现。
长时间工作,也得留下“行车记录”
长周期 Agent 有一个现实问题:模型调用工具越多,运行时间越长,中途出错和丢失进度的代价就越高。据 Meta 自述,Muse Code 会在实际执行前,把每次模型调用、工具运行和文件编辑写进本地事件日志。若任务中途崩溃,它可以依据日志从断点恢复,不必重新提示。
Meta 还公布了一项压力测试:Muse Spark 1.2 在 NVIDIA Hopper 上执行内核优化任务时,24 小时内进行了超过 1,000 次工具调用。这里的“内核”指底层计算程序,而工具调用可以包括读取文件、运行命令或检查结果。这个数字至少说明 Meta 正在把模型训练和产品设计推向长时间、多步骤的工作方式。但材料没有给出优化前后的具体指标,也没有第三方复现,因此不能据此判断它最终把程序优化得多好。
模型和工具,是一起练的
Muse Spark 1.2 不只是被装进 Muse Code。Simon Willison 转述的 Meta 官方材料称,两者进行了协同训练,让模型熟悉 Muse Code 的工具和任务流程。Meta 还增加了编程任务的训练算力,扩展训练环境的多样性,并覆盖长周期任务、整库生成、大型端到端项目和 auto-research——让系统借助工具持续探索与执行的研究型任务。
这透露出一个重要方向:编程 Agent 的竞争,正在从“哪家模型更会写一段代码”,转向“哪套系统能在一个真实项目里工作得更久”。模型要记住目标,必要时压缩已经积累的上下文,还要协调子 Agent。代码生成只是其中一环。
为什么这次发布值得看
Muse Code 对 OpenAI 和 Anthropic 的挑战,首先是产品形态上的正面竞争。Bloomberg 和 WSJ 都把这次发布放在三家公司争夺编程 Agent 市场的背景下。Meta选择的大型代码库,则是很明确的切口:完整工程任务更难,但也更接近团队真正愿意交给工具的工作。
第二个看点是并行方式。多个 Agent 同时写代码并不稀奇,难的是隔离改动、协调结果并统一验证。Muse Code 用 worktree 降低相互覆盖的风险,再把后台 Agent、日志和恢复机制接到同一条流程里。单个功能都不神秘,组合起来才构成它对“长任务”的回答。
最后是价格。Meta AI 负责人 Alexandr Wang 接受 WSJ 采访时称,Muse Code 在许多工作流中尤其具有成本优势;产品可用一条命令安装,并提供 contributor tier 作为起步方案。不过,现有材料没有具体价格、计费口径或同类产品对比。因此,“更便宜”目前仍是 Meta 的营销性主张,而不是可以核算的结论。
局限与未知
- Muse Code 仍处于 beta。材料没有提供公开基准、任务成功率、验证通过率或第三方大型仓库测试。
- “六项功能无冲突”、24 小时超过 1,000 次工具调用,以及崩溃后恢复等说法都来自 Meta 自测或自述;它们展示了设计目标,但尚不足以证明稳定能力。
- 多 Agent 并行能减少文件覆盖,却不能自动保证改动正确。材料也没有披露它如何合并结果、处理逻辑冲突,以及在验证失败后怎样决策。