让 AI 做科研,不能只看它最后说得像不像。就像请人完成一项实验,口头报出结论不等于交差:代码是否跑通,图表、数据和报告是否齐全且相互一致,同样重要。FrontierChallenge 就是一套面向科学Agent——能读数据、调用工具、运行代码并整理研究产物的 AI 系统——的全流程验收基准。
基准共收集 300 项科学工作流,本次公开并评测其中 97 项,覆盖量子化学、分子动力学、材料表征等六个领域。每项任务都给定输入和交付清单,按整套研究产物是否完整来判定通过,而不只核对最终答案。作者评测了 12 个前沿模型和三种 Agent 运行框架;表现最好的配置也只完成 20 项,通过率为 20.6%。
更值得警惕的是,“做了不少”和“真正做完”差得很远:在电化学与环境领域,最高平均得分达到 94.9,但通过率仍为 0%。作者还称,Claude Code 未通过的运行记录中,75.5% 最后仍用语言宣称已经完成。换句话说,Agent 的自我汇报和局部进展都不可靠,评测必须回到可检查的代码、图表、数据与报告。