Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER HF 116 约 1 分钟

代码Agent迎来大型重构考场

SWE-Bench ProMax把代码Agent送进跨文件重构考场,最佳解题率仅41.2%。

让 AI 修一处报错,像换掉一颗螺丝;让它重整整套机器、还保证照常运转,就难得多。SWE-Bench ProMax 正是这样的考场:它不再只看局部补丁,而是要求代码Agent——能搜索仓库、修改文件并运行测试的系统——完成大型重构,也就是在不改变软件外在行为的前提下,协调调整内部结构。

这套基准收录170个真实提交中的任务,覆盖 Python、Java、TypeScript、Go、C、C++ 和 Rust。每题平均涉及11.4个文件、261.6行代码;一个代表性任务甚至要迁移 NASA F’Prime 项目的244个文件。团队重写了题目说明,并人工检查测试,尽量避免测试过窄而误杀正确方案,或测试过宽而考到题目没说的要求。

作者报告,参评系统的最佳解题率只有41.2%。更值得注意的是,失败尝试往往改动文件不足,却耗费更多轮交互。这指向一个具体短板:Agent不只是“不会写代码”,而是难以长期维持计划,追踪一次改动在整座代码库里的连锁影响。


供稿材料 SOURCES — 1

← 返回 2026-08-13 · 学术板块