Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER 约 4 分钟

论文更多了,科学却可能更差

一项模型研究警告:LLM 能让论文变多,但若评价仍重数量,科学未必因此做得更好。

你有了一台能把研究流程全面提速的机器。原来一年完成几篇论文,现在可以更快找题、做初步实验、画图和写稿。省下来的时间会不会用来补实验、查漏洞、磨文字?不一定。若考核首先看论文数量,更合理的选择可能是马上开始下一篇。

Nature 报道的一项建模研究,把 LLM、研究者的时间分配和“多发表”的激励放进同一个系统。模型预测,科学家采用 LLM 后可能“做得更多,却没那么精细”,而不是“数量不变、质量更好”。但这只是尚未经过同行评审的预印本所作的模型预测,不是对现实科研质量下降的直接观测。

把科研拆成三段看

建模研究会把现实中的角色、行为和激励简化成可计算的规则,再观察整个系统可能走向哪里。它适合揭示一种机制,却不能证明现实已经照着模型发生。

研究者把科研流程分成三部分。第一是发现阶段:提出假设,做初步实验,判断一个项目值不值得继续。第二是必要开发工作,例如制作图表和起草论文。第三是酌情开发工作,例如追加实验和润色文字。前两类工作决定论文能否尽快产出;第三类工作则可能让论文更充分、更精细。

研究采用“最优觅食理论”(optimal-foraging theory)分析时间分配。这套理论原本研究动物如何在节省资源的同时获得最多能量。放到科研里,可以把研究者想成在多个项目之间寻找最佳投入方式:时间有限,怎样安排才能获得更高回报?这里的回报与发表相连。

模型还给了 LLM 一个相当理想的设定:便宜、快速而且准确。在这一前提下,LLM 能加快发现、必要开发和酌情开发三个阶段。问题在于,流程全面提速并不自动等于论文质量提高。

省下时间,不等于多做验证

关键不只在工具,还在奖励什么。

发表激励,是指论文数量、发表场所或引用等指标与职业回报相连。按照 Nature 对模型结果的转述,当发现阶段和必要开发工作变快,研究者便能更快完成论文。若评价体系持续奖励产量,他们就缺少动力把省下的时间继续投入补充实验和文字打磨,更可能转向下一项工作。

换句话说,LLM 改变了科研的成本,却没有改写科研评价的目标。工具让“再发一篇”更容易,原有激励便可能把这部分效率主要转化为数量,而不是完善程度。

研究共同作者、University of Washington 生物学家 Carl Bergstrom 因而认为,预测结果主要映照的是科研体系重数量、轻质量的问题。按他的说法,LLM 很少是问题本身,更像一面镜子,照出早已存在的制度缺陷。这是作者对模型结果的解释,并不意味着 LLM 生成的内容必然降低科学质量。

为什么值得现在看

这项研究把讨论从“AI 能不能帮人写论文”推到了更大的问题:当一种提效工具进入既有评价体系,效率最终会流向哪里?

如果职业回报主要跟产量挂钩,更快的工具可能放大产量;如果评价真正鼓励深入验证,节省下来的时间才更可能用于把同一项工作做得更扎实。模型的尖锐之处正在这里:技术进步不会自行决定科学进步,制度会决定新增效率被怎样使用。

局限与未知

  • Nature 报道称,该研究于 7 月 19 日发布在 arXiv,报道时尚未经过同行评审。现有材料只有这一篇独立报道。
  • 摘录没有说明“质量”或“完善程度”如何量化,也缺少模型参数、敏感性分析和反方评价,无法判断结论对不同设定有多稳健。
  • 模型假设 LLM 便宜、快速且准确。现实中的错误、核查成本、学科差异和使用方式都可能改变结果。

供稿材料 SOURCES — 1

← 返回 2026-08-02 · 学术板块