普通软件升级,是工程师改完代码、审查通过,再发布新版本。Ouroboros把这套流程交给编码Agent——能查看项目、调用工具并修改文件的AI系统——用于改造自己的运行框架。这里的“自我改进”不是重新训练模型,而是调整包在模型外的软件骨架,包括工具、提示、上下文整理方式和核心代码。
关键在于,改动不会悄悄生效。Agent写入代码后,旧的审查凭证立即失效;系统先做自动检查,为待提交改动生成“指纹”,收集审查意见,并在提交前再次核对指纹。只有经过这条路径的提交,才会成为后续任务的运行版本。它既可把“继续改进自己”当作下一项任务,也可从日常工作暴露的故障和低效中提出修补。
作者称,Ouroboros在包含89项终端任务的Terminal-Bench 2.1上取得86.97%,轨迹审计后为86.74%。不过,基准测试使用冻结版本,与持续演化的线上实例分开;这一结果也只说明特定端到端任务表现,不能等同于所有编程场景都可靠。