拿到一篇介绍新工具的论文,就像拿到一份只讲原理、却省略不少操作细节的菜谱。你还要寻找代码,安装依赖,配置运行环境,弄懂输入格式和参数,才能真正用起来。对不熟悉编程的研究者来说,读懂论文和用上论文,是两件相隔很远的事。
James Zou团队发表于Nature的论文提出Paper2Agent:它把论文正文、补充材料、数据、代码和工作流封装成一个可对话、可执行的AI Agent。这个Agent不只是复述摘要,还能调用论文里的工具,把方法用到新数据上。作者称它为“虚拟通讯作者”——通讯作者原本负责回答方法、数据和复现问题,现在其中一部分工作可以由系统即时完成。
需要先纠正标题里一个容易引起误会的说法:Paper2Agent由Zou所在的研究团队开发,Nature是论文和配套报道的发布平台,并不是材料明确显示的产品推出方。以下案例结果主要来自原论文及Nature报道,目前材料没有提供独立第三方复现。
从“读论文”变成“请论文做事”
传统论文是被动的。它可以告诉你一种计算方法为什么有效,却不能替你配置环境、检查参数或运行代码。即使代码仓库维护得很好,读者仍可能要安装软件依赖,申请API密钥,创建正确的输入对象,再辨认输出究竟代表什么。
论文以AlphaGenome为例。它是一种用于预测DNA序列性质的模型。研究者若想用代码分析某个遗传变异,需要理解其API——也就是软件向外提供的调用接口——以及对象、参数和输出类型。Paper2Agent希望把这些操作压缩成一句自然语言请求,例如,请系统解释某个变异对肌肉细胞染色质可及性的预期影响。
这里的AI Agent也不是普通聊天机器人。它由大语言模型驱动,但还能调用外部代码、数据和工具,规划并执行多步任务。换句话说,聊天只是入口,实际运行论文方法才是关键。
它怎样把论文“装”进Agent?
Paper2Agent的核心做法,是为论文建立一个MCP server。MCP,即Model Context Protocol,可以理解为一套标准插座:它把不同工具和数据整理成大语言模型能够识别、调用的接口。
系统先读取论文正文、补充材料、数据集、代码和工作流,再让多个Agent分析论文的关键贡献,把相关能力做成MCP工具。随后,它自动生成并运行测试,继续修正这些工具,提高整个MCP的稳健性。最后,研究者可将这个server连接到Claude Code等聊天Agent,用日常语言提问,让系统在回答时调用论文对应的真实工作流。
这一步改变的不只是界面。过去,读者先理解论文,再自行拼接代码和数据;现在,系统尝试把这些分散的研究产物预先编排成一个操作入口。论文因此从“供人阅读的说明书”,变成“能够演示并执行自身方法的系统”。
它也接续了更早的可执行论文、Papers with Code、Binder、CodeOcean和论文转代码系统。那些工作让代码更容易找到或运行,但理解代码、针对新项目修改输入,以及把多个方法串起来,仍然可能需要专业经验。Paper2Agent增加的是自然语言交互和Agent执行层。
三类案例,展示了什么?
作者用Paper2Agent构建了基于AlphaGenome、Scanpy和TISSUE的Agent。后两者被用于单细胞和空间转录组分析。论文报告称,这些Agent能够复现原论文结果,也能处理原论文没有预设的新用户查询。不过,这些验证目前来自作者自己的案例研究。
Nature记者Kaia Glickman报道,系统为AlphaGenome论文建立Agent约用了45分钟,计算成本为14美元。在遗传学问题测试中,该Agent取得了报道所称的“近乎完美准确率”,并超过包括Biomni在内的其他生物医学Agent。这里要保留一点距离:现有材料没有给出具体分数、样本量和完整基线配置,“近乎完美”和“顶尖”也带有明显的宣传色彩,因此不能据此判断它在更广泛任务中的水平。
另一个案例更能说明这种交互方式的潜力。研究团队让Agent解释一个与“坏胆固醇”相关的单碱基变化,并判断可能的因果基因。Nature报道称,它给出了一个不同于AlphaGenome原论文的候选答案。Zou表示,AlphaGenome的遗传变异数据同时支持两种假设。
这不是说Agent发现了“真正的致病基因”。材料没有显示新结论经过实验验证。它说明的是另一件事:当论文的方法可以被重新调用,读者就能用不同问题和分析路径审视原有结论,而不必从配置全部工具开始。
论文还报告,多篇论文对应的Agent可以彼此协作,并共同完成银屑病因果基因的优先排序。所谓协作,不是Agent互相聊天,而是一个任务可以调用不同论文封装出的专门能力。单篇论文由此可能成为更大科研工作流里的一个组件。
为什么值得现在关注?
Paper2Agent真正触碰的是科研传播的基本单位。今天发表的通常是一篇正文,再附上代码、数据和补充文件。它们彼此相关,却往往分散在不同位置,也需要读者自己恢复环境、参数和处理顺序。可复现性的困难,常常就藏在这些没有完全写进正文的步骤里。
如果这些研究产物能被统一封装,论文交付的就不只是结论,还包括一个能够答疑、演示、运行和适配新数据的入口。对跨领域研究者尤其如此:他们不必先成为某套软件的熟练用户,才能试着提出一个科学问题。
但价值也取决于系统是否真的调用了正确代码、使用了正确数据,以及回答能否追溯到论文材料和实际运行结果。“论文活了”不等于“论文永远正确”。一个会执行的方法,更方便被采用,也更方便被检验;它仍然不会自动消除原研究中的假设、偏差或错误。
局限与未知
- 目前材料中的复现、新查询和跨Agent协作结果均由作者报告,尚无独立第三方复现实验。
- Nature报道的准确率比较缺少具体分数、样本量和基线配置,无法据此判断优势有多稳定、能否推广到其他论文。
- 胆固醇案例只表明数据可支持不同假设,不代表Agent提出的因果基因已经得到实验确认。
Paper2Agent最值得看的地方,不是让AI再多读几篇论文,而是把论文从网页和PDF变成可以直接操作的研究接口。它提出了一种新的可能:未来阅读一项工作,也许不只是在结论下画线,而是当场请它展示方法、处理你的数据,并与另一篇论文一起工作。