你把一篇论文交给AI,不告诉它正确答案,只让它照着论文重新做实验,看看能否得到相近结果。这比“读完后概括一下”难得多:AI既要理解作者做了什么,也要写代码、安排实验、核对结果,还得在失败后判断下一步。伦敦AI实验室Inherent发布的Faraday,想成为能独立完成这套流程的“研究队友”。
据TechCrunch报道,这家由Google DeepMind前员工创办、刚完成5000万美元种子轮融资的公司宣称,Faraday在论文复现任务上超过了Anthropic Claude Opus 4.8和OpenAI GPT-5.5。不过,目前所有关键结果都来自Inherent自述,尚无论文、评测报告、代码或第三方实验可供核验。
复现不是把代码抄一遍
论文复现,是根据论文中的描述重新实现方法,再检查能否得到相近结果。它同时考验阅读理解、编程、实验设计和误差分析。比如结果对不上时,系统不能只宣布失败,还要判断问题来自代码、实验设置,还是论文没有写清的细节。
这也解释了为什么复现适合检验科研Agent——一种能拆解研究任务、调用代码和计算工具,并根据实验结果继续调整的AI系统。Inherent联合创始人兼首席科学家Edward Hughes对TechCrunch说,许多博士生也从复现论文开始。对AI而言,这是一场接近真实科研流程的综合考试。
27B模型背后,还有Codex
Inherent称,Faraday的底层模型是拥有270亿参数的Qwen 3.6。参数是模型训练后保存的内部数值,常被用来粗略描述模型规模。公司把它与体量更大的Claude Opus 4.8和GPT-5.5并列比较,强调较小模型也能在特定任务中领先。
但这里有个不能略过的细节:Faraday执行编程工作时,会调用OpenAI GPT-5.5 Codex。换句话说,它不是只靠一个27B模型完成全部任务,而是一个包含外部前沿编码模型的复合Agent系统。因此,现有材料不足以支持“27B模型击败GPT-5.5”这种说法,也不能仅凭主模型较小,就推出整个系统更便宜。
Faraday采用强化学习训练——系统从结果获得奖励,而不是只照着预先写好的规则行动。Inherent希望它不仅能复现结论,还能形成所谓“research taste”:判断哪些实验值得做,以及怎样设计实验。这个目标比单纯追求答案正确更接近研究工作,但“品味”目前只是公司提出的概念,报道没有给出可验证的评分办法。
真正值得看的,是怎么比
如果科研Agent最终要发现新知识,它首先得证明自己能可靠地重建已有知识。Faraday因此值得关注:它试图把文献理解、代码编写、实验运行和结果核对串成完整闭环。Inherent的长期目标,也是开发能跨多个科学领域作出贡献的AI scientist agent。
问题在于,判断“超过”其他产品离不开基准评测,也就是用统一任务和评分方法比较系统。论文样本怎么选、成功如何定义、允许多少计算资源、有没有人工介入,都会改变结论。TechCrunch的报道没有披露这些关键设置。
局限与未知
- 没有公开基准名称、论文样本、任务数量、成功率、评分规则或统计显著性,性能排名暂时无法独立检验。
- 报道没有说明各系统获得的计算预算和人工帮助是否一致,也没有拆分Qwen 3.6与GPT-5.5 Codex各自贡献。
- “research taste”尚无公开量表;Faraday能否从复现旧论文走向发现新知识,仍是长期目标,不是已被证明的能力。
眼下更稳妥的结论是:Faraday展示了一条有意思的系统路线,但还没有提供足够证据,证明这条路线已经领先。下一步最重要的不是更响亮的模型对比,而是公开一套别人能够重复的评测。