公开题库像一本流传已久的习题集:AI分数很高,可能是能力强,也可能早在训练材料里见过类似答案。DeepSWE想换一间更接近真实开发的考场。它从活跃的开源项目中设计了113项原创、长周期工程任务,覆盖TypeScript、Go、Python、JavaScript和Rust,考察编码Agent——能查看项目、修改文件并调用工具的AI——能否独立推进完整任务,而不只是补几行代码。
最值得注意的是它的判卷方式。Agent先在隔离环境中工作,完成后提交修改;系统再把这份修改应用到一个干净的容器——封装好程序与依赖的可复现环境——并运行隐藏测试。评分只看题目要求的外部行为是否正确,不要求代码结构或内部命名与参考答案一致;参考补丁也不参与判分。换句话说,它更像验收交付成果,而不是核对标准答案。项目仓库称,这套设置可用统一条件比较前沿编码Agent;但现有材料未提供各模型的具体成绩。