你让 AI 独自改一个复杂项目,真正麻烦的往往不是它不会写某一行代码,而是工作一久就忘了进度、偏离目标,或者调用工具后不知道如何收拾结果。Prime Agent 想解决的正是这类问题:它不是一个新的基础模型,而是套在模型外面的编码与研究执行框架,面向通用任务和长时间运行的自主工作。
不过,目前关于它的具体信息只来自一篇转述项目官方材料的 Reddit 帖子。以下功能、成绩和比较均属 Prime Agent 一方的主张,尚无独立信源印证。
改的不是模型,而是模型的工作台
这类执行框架常被称为 Agent harness。可以把模型看成一名工作人员,harness 则是它的工作台和办事流程,负责提示、工具、循环、状态保存和错误处理。同一个模型换一套工作台,完成任务的方式和结果都可能明显不同。
据该 Reddit 帖子介绍,Prime Agent 是一个开源的编码与研究 Agent,并将自己定位为可“自我改进”的 RLM harness。这里的 RLM 是原帖使用的框架称呼,但帖子没有进一步解释其完整定义。
它所谓的“自我改进”,目前更准确的理解是:模型可以修改 harness state,也就是执行框架保存的工作状态。它不等于模型自己重新训练权重,更不能直接理解成模型会持续、自主地进化。帖子也没有说明这种状态修改如何发生、能否跨任务保留,以及改进是否稳定可复现。
让长任务不只靠聊天记录硬撑
Prime Agent 提到三项关键能力。
第一是程序化工具调用。模型通过结构化指令操作搜索、终端或代码编辑器,而不只是给出一段自然语言建议。换句话说,它不只说“应该改文件”,还要把判断转成可执行步骤。
第二是“把上下文作为变量”。上下文就是 Agent 当前掌握的任务信息。将它作为可操作的变量,意味着框架试图更主动地组织和调用这些信息,而不是把全部历史记录一股脑塞回模型。原帖称这种设计兼顾 token 效率和表达能力;token 可以理解为模型处理文字时使用的基本计量单位。不过,帖子没有披露具体的上下文管理机制或节省幅度。
第三是多智能体消息传递,即让多个 Agent 交换任务信息。它可能适合把复杂工作拆开协作,但原帖没有说明如何分工、如何处理冲突,也没有给出多 Agent 相比单 Agent 的单独实验。
这些设计瞄准了长时自主任务的核心难点:Agent 要连续规划、执行和检查,还要在多轮操作之间保存进度,处理中断,并避免越做越偏。
95.5%意味着什么?
原帖称,Prime Agent 在 ARC-AGI-3 上取得 95.5%,超过 human-expert baseline,也就是人类专家基线。它还宣称,这种提升并非只出现在一个基准上;多种模型换用 Prime Agent 后,相比各自的专有 harness 都有“显著提升”。
这组数字值得注意,但暂时不能展开成可靠的横向结论。Agent 的基准成绩不仅取决于底层模型,还受执行框架、可用工具和运行预算影响。原帖没有交代 ARC-AGI-3 的具体评测版本、计分口径、运行预算、是否使用测试时扩展,也没有定义人类专家基线。
标题还声称 Prime Agent 超过 Codex、Claude Code(CC)和 pi,但正文没有提供具体模型、任务、对照版本、分数或实验条件。因此,“超越”目前更像项目方的概括性宣传,不能视为已经完成的严格比较。
为什么值得关注
Prime Agent 最有意思的地方,不是又增加了一个编码 Agent 名字,而是把竞争焦点往外推了一层:底层模型固然重要,模型如何调用工具、整理上下文、保存状态和持续执行,也可能决定最终表现。
原帖称 Prime Agent 基于 pi 构建,并以开放许可证完整开源。如果项目确实开放了足够完整的实现和评测材料,开发者便有机会检查、修改和复现实验,而不必只接受封闭产品给出的结果。这也是执行框架能否真正“可持续优化”的关键。
局限与未知
- 目前只有一篇带推广性质的 Reddit 帖子,95.5%及跨模型提升均缺少独立评测印证。
- “超越 Codex、Claude Code 和 pi”没有配套对照数据,比较范围和实验条件不清楚。
- 尚未确认具体许可证类型,以及仓库是否包含完整评测代码和可复现实验;“自我改进”也不应被解读为模型权重自主训练。