你让 AI 设计晶体,就像请人从一座几乎无边的仓库里挑零件、拼结构。它最稳妥的做法,往往是在见过的样品附近小修小改。但真正有价值的候选,可能藏在更远处。Imperial College London 的 Hyunsoo Park 与 Aron Walsh 尝试给生成过程加上一套“沿途评分”:不只要求结构像真的,还奖励新颖、稳定和多样,引导模型主动改变搜索方向。
这项研究于 2026 年 7 月 6 日发表于 Nature Machine Intelligence。下述方法与数据均来自该刊披露的信息;目前材料没有独立研究或实验合成结果可供交叉验证。
不只会生成,还要知道往哪走
晶体生成模型会学习已知晶体里的元素种类、原子位置和晶格排列,再提出新结构。问题在于,学得越像,模型越容易停留在训练数据附近。生成结果看起来合理,却未必足够新颖。
作者采用扩散模型——先把结构逐步扰乱,再学习一步步去除噪声,像把模糊草图反复修整成完整设计。新方法把潜空间去噪扩散模型当作强化学习策略。潜空间是模型内部用来表示结构的压缩空间;强化学习则像训练员按结果打分:模型生成一组候选,奖励函数评分,模型随后更常采用高分路线。
这里的关键是 GRPO。它不要求每个候选都有一份绝对标准答案,而是比较同一组候选的相对得分,再更新模型。奖励同时考虑三件事:候选是否新颖、预测上是否稳定,以及整批结果是否足够多样。
稳定性指热力学稳定性,即一种结构相对其他竞争相是否容易分解。研究用机器学习力场估算“高于凸包的能量”;这个数越接近零,通常意味着结构越稳定。这样能降低反复计算的成本,但计算稳定不等于实验室里一定能合成。
数字显示,搜索方向确实变了
在 Alex-MP-20 数据集上,研究者让每个模型生成 1 万个尚未做几何优化的结构。Chemeleon2 加入强化学习后,mSUN 从 15.9% 升至 61.3%。mSUN 统计同时满足亚稳、唯一和新颖三个条件的候选比例。换句话说,模型产出的“同时过三关”候选明显增多。
拆开看,新颖性从 62.3% 升至 97.5%,亚稳候选比例从 51.2% 升至 72.1%。代价也很清楚:唯一性从 99.4% 降至 88.7%,说明重复生成有所增加。作者还测试了按目标带隙生成材料,表明奖励不只可以规定“更稳、更新”,也能加入功能目标。
值得关注的不是又多了一个生成器
这项工作的意义,在于强化学习开始介入科学搜索的过程。它不只是接过一个问题、优化最后答案,而是在生成途中持续改变模型偏好的路线。对材料设计来说,这相当于把“探索哪里”本身也变成可训练对象。
不过,这还不是发现新材料的终点。生成结构只是计算候选,材料是否可合成、性能是否成立,仍需进一步验证。
局限与未知
- 更强的多样性奖励可能诱使模型生成元素组成过度复杂的晶体来“刷分”。
- 高元体系的参考相图较稀疏,数据库可能漏掉竞争相,从而高估候选的热力学稳定性。
- 现有材料未提供实验合成、真实性能验证或独立复现,不能把这些结果写成“已经发现新材料”。