Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER 约 4 分钟

会说“不确定”的LLM开始设计实验

GOLLuM把不确定性纳入实验选样:少做实验,也更会挑下一项。

你面前有上千种化学配方,但预算只够试几十种。每次都挑当前看起来最好的,可能错过陌生却更优的方案;一味尝鲜,又可能把钱耗在无望的组合上。实验优化真正难的,不是提出更多候选,而是判断下一次最值得试哪一个。

Nature Machine Intelligence 的这项工作把大语言模型的科学知识与贝叶斯优化结合起来。研究者提出 GOLLuM(Gaussian Process Optimized LLMs),让模型不仅预测实验表现,还把“不确定到什么程度”纳入下一项实验的选择。这里的“会说不确定”并非模型用自然语言承认没把握,而是优化系统获得了可用于决策的不确定性信号。

把知识丰富的助手接上风险仪表盘

传统的贝叶斯优化(Bayesian Optimization)会建立一个简化的预测模型,同时估计预测有多不确定。它借助获取函数——把预期收益和不确定性合成选样分数的规则——在两件事之间取舍:利用当前看来最好的方案,或探索尚未摸清的区域。

这套办法适合实验昂贵、次数有限的场景,难点却在输入。以化学反应为例,研究者通常要先把分子结构、催化机理等知识制成专用描述符。换成晶体、催化剂或药物设计,原来的表示往往无法直接迁移,每个领域近乎重新开始。

LLM 正好有相反的特点:它从大量文本中学到跨领域知识,却容易给出听起来笃定、实际错误的答案。实验室不能把这种自信直接当作决策依据。GOLLuM 的关键做法,是让 LLM 与高斯过程(Gaussian Process,GP——一种能同时给出预测和不确定性的统计模型)共同训练,并使用 GP 的边际似然作为训练目标。换句话说,它不让语言模型单独拍板,而是把语言表示放进一套成熟的概率优化机制里。

训练信号还会重塑 LLM 的 embedding——模型给实验对象生成的数字化表示。普通 embedding 更容易按文字或语义相似度排列;GOLLuM 则让实验结果相近的样本在表示空间中靠拢,把高表现和低表现区域逐渐分开。

它不是写方案,而是在候选中做取舍

论文展示了这种表示变化对应的实验规律。在 Buchwald–Hartwig 交叉偶联反应中,模型把碘化物试剂聚到高产率区域,并把表现较差的氯化物分开。类似结构也出现在其他领域:醚—醇溶剂体系、催化剂空间中的 Mn–Na–W 区域,以及光开关分子的结构—性质趋势。

这些结果容易让人产生“AI 已能自主设计实验”的印象,但更准确的说法是:GOLLuM 根据已有结果,对预定义候选空间中的下一项实验进行排序或选择。材料没有显示它能独立提出完整实验流程、执行实验或处理安全问题。

少试一些,能否找到更多好结果?

据论文作者报告,GOLLuM 从仅有的 10 个低表现初始实验出发,在有机合成、材料科学、过程化学和分子设计的 23 项任务上进行了测试,平均排名高于所有参比方法。作者还称,它用少 40% 以上的实验即可达到传统贝叶斯优化的效果。

最直观的数字来自 Buchwald–Hartwig 基准:GOLLuM 发现高表现反应的比例为 43%,采用专家设计的量子化学描述符或先进 LLM 的方法为 24%—25%。如果这一优势能在更多设置中成立,它意味着实验预算不变时,研究者可能更快碰到值得继续投入的方向。

为什么值得关注

这项工作的意义不只是给 LLM 加一个更好的评分器。它尝试改变基础模型的专业化路径:不靠不断增加训练数据,而是用实验结果和不确定性提供更有信息量的学习信号。模型已有的跨领域知识负责提供表示,概率模型则负责约束风险和探索节奏。

这也把评价重点从“AI 能否给出一个像样答案”推向“它能否在有限成本下连续做出合理选择”。对真实科研而言,后一个问题往往更重要。

局限与未知

  • 所有效果数字均来自同一篇论文,尚无独立复现或外部团队验证。
  • “少 40% 以上实验”具体对应哪些任务、指标及汇总方式,供稿未披露;43% 对 24%—25% 也缺少样本量、阈值定义和不确定区间。
  • GOLLuM 获得的是服务于优化决策的不确定性信号。现有材料不足以证明 LLM 已能可靠表达自身认知不确定性,更不能把候选排序等同于自主完成完整实验设计。

供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块