Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
PAPER 约 5 分钟

AI科学家,离真正研究还很远

AI能连续做实验、写论文,却仍不善于判断什么值得研究,也不会及时推翻自己的方向。

想象你请一位助手研究一个难题。它查了很多资料,连续做了几百次实验,还写出一篇像模像样的论文。可当真正做过这道题的人来检查,发现它很早就选错了方向,此后只是不断缩小结论,最后几乎没说出什么有价值的新东西。

这正是 Nature 报道所追问的落差:今天的“AI科学家”已经能完成不少科研动作,却还不能因此被视为真正理解研究。这里的 AI 科学家不是一个聊天模型,而是一套 Agent 流程——把提出思路、查阅文献、设计和运行实验、分析结果、写论文与自我检查串在一起。问题不再只是它能不能产出内容,而是它能不能判断方向、识别失败,并说服最懂问题的人。

本文事实均来自 Matthew Hutson 在 Nature 的单篇报道,尚无独立材料交叉印证;其中系统配置、实验评价和受访者判断,也应按单一信源理解。

不再只看论文“像不像”

自动化科研此前已经跨过了一道显眼的门槛。Nature 报道称,Sakana AI 团队在 2024 年发布 The AI Scientist,并在次年 3 月于 Nature 发表改进版本的结果。系统围绕机器学习的缺陷开展研究。它生成的论文中,有 3 篇被提交至一个会议 workshop 接受同行评议,其中 1 篇得分达到接收标准。

但“达到接收标准”不等于已经正式接收,更不能证明系统拥有独立科研能力。同行评议——论文发表前由同领域研究者检查方法、证据和意义——本来是一道质量关。不过 Kapoor 认为,尤其在 AI 研究中,它并不是可靠的论文质量指标。普通审稿人时间有限,也未必熟悉论文背后的每个选择。

因此,Princeton University 的计算机科学家 Sayash Kapoor 与同事提出了“shadow evaluation”,可以理解为“影子评估”:让 AI 在与真实论文相同的研究问题上另做一遍,再请原论文作者检查结果。原作者不仅熟悉领域,也清楚这个问题最难的地方在哪里,更容易看出 AI 是真的推进了研究,还是只做出了论文的外形。

团队选取了 2 篇投稿至当年 NeurIPS 的论文。AI 根据各自的研究问题独立开展研究并写作。一个任务是设计精确控制 chatbot personality 的方法;另一个是为某类神经网络设计故障检测器。

它很能干,但不太会改主意

这套系统以 Claude Opus 4.8 为基础,运行在修改版 OpenClaw 中,外层还有一套用于给出通用指令和检查进度的“脚手架”。它可以创建 sub-agents——把部分任务交给多个子代理;也能访问互联网和软件库、调用处理器运行实验,并使用模拟同行评议的软件。每篇论文给它 6 天时间和 3,000 美元计算额度。

工程执行是它表现最好的一部分。按 Nature 的转述,系统可以在数天内运行数百次实验,没有陷入无法解决的报错循环。它能完成扎实的文献综述,也得到了一些小发现。它还会识别自己的虚假陈述,即常说的“幻觉”,并没有通过钻评分规则的空子来取巧。

真正的问题出现在科研判断上。两篇原论文的作者分别只给出 2/6 和 1/6 的总分。系统往往先挑选少数几个假设,很快押注其中一个;当路线效果不好时,它又不愿充分回头探索。后续的自我评审也不够尖锐,于是它继续沿着最初的选择推进,只能一再收缩主张,直到结论所剩无几。

这像一位执行力很强、却不善于止损的研究助理:实验做得快,记录也完整,但缺少那句关键追问——“是不是问题本身想错了?”

新概念不等于好研究

研究想法以前没人写过,只能说明它可能“新”。研究价值还要求回答:为什么这个问题值得解决,结果会改变什么,失败之后又该换哪条路。AI可以组合出新概念,却未必理解哪些差异重要。

科研还包含说服。一个结果不能只给出答案,还要提供证据、对照实验和清楚论证,并预判领域专家会怎样质疑。shadow evaluation 的意义,正是把评价者从一般审稿人换成最了解问题的原作者,让“论文看起来完整”与“研究真正站得住”更难混为一谈。

Nature 报道据此认为,自动化 AI 研究目前更擅长优化已有技术,是否能产生真正突破仍受质疑。Kapoor 也明确表示,开放式研究的全面自动化目前还看不到实现前景,AI尚不能取代人类研究者。这些都是概括性判断,报道没有给出量化边界。

局限与未知

  • 评估只有两个任务,且两项最终得分和细节均来自同一篇二手报道,不能据此概括所有学科或所有自动研究系统。
  • 报道展示了系统执行实验、查文献和发现小结果的能力,但没有提供各项表现的完整数字,也没有说明这些能力如何与其他系统比较。
  • 这次失败指出了“过早选定方向、自我批评不足”这一具体问题,却尚未回答它能否通过更好的评估、训练或流程设计得到解决。

供稿材料 SOURCES — 1

← 返回 2026-08-15 · 学术板块