Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.038 — 2026-08-11
PAPER 约 3 分钟

AI开始给科学文献查陈年旧账

AI Agent 不只找论文,还开始核查旧数据与实验结果;但最终裁决仍离不开人。

你查一本用了几十年的工具书,发现其中一个数字和 AI 算出的结果对不上。直觉上,多半是 AI 又答错了。但研究者翻回最早的实验记录,结果错的竟是工具书。AI 正从“帮人找论文”的检索助手,变成检查科学知识链条的质量审计员。

这类科学 AI Agent,是能分步骤检索资料、调用数据库并核对结果的 AI 系统,像一个会自己跑查证流程的研究助理。不过,本文的案例和数字均来自《Nature》的一篇报道,尚无材料可供独立交叉核验。

从一个不对劲的沸点查起

据《Nature》报道,浙江实验室理论化学家 Sebastian Pios 使用 AI 预测若干分子的沸点时,发现结果与一个已有 75 年历史的参考数据库冲突。

沸点是液体蒸气压力与外界压力相等时的温度。化学家会用它辅助辨认物质、设计蒸馏条件。参考数据库则像公共工具书,把这类实验测量值整理成可查询条目。一个错误数字如果长期被引用,就可能继续进入论文和实验方案。

Pios 最初也怀疑模型。但他人工回查原始文献后,确认问题出在数据库,而不是模型。这里需要分清:AI 提示了异常,真正完成确认的是人。

同一模型还发现了两类旧错误:一篇论文中的笔误,以及一组错误的百年前沸点测量值。材料没有说明这些错误具体影响过哪些研究,因此不能把“可能造成麻烦”进一步写成已经导致错误结论。

它还能检查论文是否经得起重跑

AI 审计不只是在数据库里找可疑数字。SAI Labs 是一家营利性研究审查公司。据《Nature》转述,该公司在 2026 年 7 月 22 日发布分析,用 AI agents 核查了 168 篇获选在 ICML 2026 作口头报告的论文。

这些 agents 先提取论文的核心论断,再下载配套资源;条件允许时重跑实验,最后将所得结果与作者报告的数据比较。换句话说,它不只读结论,还试着检查支撑结论的过程。

在至少有 5 条论断可供评估的 92 篇论文中,只有 34 篇有超过五分之二的论断被 agents 复现;只有 8 篇超过 80% 的论断被成功重复。

这组数字看起来醒目,却不能反过来理解为其余论文都有错。材料没有交代“可供评估”“条件允许”及“成功复现”的具体标准。各篇论文实际纳入评估的论断数也可能不同,因此论文之间未必能直接横向比较。

真正的变化是规模

人工查错并不新鲜。变化在于,AI 可以用人力难以达到的速度扫描大量论文和数据库。它适合先找出冲突、异常和无法重复的结果,再把值得深挖的线索交给研究者。

这改变了 AI 在科研中的位置:它不再只是把已有知识送到人面前,也开始追问这些知识是否可靠。对一个由论文、数据库和引用层层搭起的体系来说,批量发现可疑地基,本身就很有价值。

局限与未知

  • 现阶段的 AI 核查工具也会犯错,不能成为无需监督的裁判;最终判断仍需人工核对原始材料。
  • SAI Labs 的复现率来自公司自身分析,且可能带有产品展示动机;缺少判定标准,数字只能按其原始口径理解。
  • 材料未提供 Pios 的原始研究或 SAI Labs 分析全文,现有具体事实均只有一个独立报道来源。

供稿材料 SOURCES — 1

← 返回 2026-08-11 · 学术板块