让 AI 在科研软件里跑一次分析,不只是“会点按钮”:它得导入数据、设置参数、执行计算,再交出可信的图表或文件。中间一步出错,结果看起来照样像模像样。OSWorld-Science因此把电脑操作 Agent——能看屏幕、点击和输入,并持续完成多步任务的 AI——带进专业科研工具,考察它能否真正走完研究工作流。
这套基准测试了12个视觉语言模型(VLM,即同时理解图像与文字的模型),包含146项任务,涉及分子绘制与逆合成、病理图像分析、统计计算和物理模拟。它最关键的设计是“产物式评测”:不只检查操作轨迹,而是直接核验最终生成的分子结构、分割掩码、图表和数值结果,并给未完整完成的任务部分分。作者报告,最强 Agent 的平均成功率为70%,在最难任务集上只有40%。这说明科研软件正在成为更严格的电脑 Agent 考场:界面能不能操作只是起点,最后交出的研究结果是否成立才是终点。