你让一个人去解一道公认极难的题,他试了650种办法,全都失败。第二天,他叫来约60个助手继续找路。最后,大题依然没解开,团队却在旁边一项几十年缓慢推进的指标上,向前跨了一大步。
这正是Anthropic披露的一次数学研究实验。一个尚未公开的Claude研究模型没有证明黎曼猜想,但把一个相关结果的比例下界从41.6%提高到67.2%。这里的“下界”,是数学上能够严格保证“至少有这么多”,不是完成进度。准确地说,新结果主张:至少67.2%的相关非平凡零点位于临界线上。它不等于“黎曼猜想被证明了67.2%”,也不能推出其余32.8%的零点不在线上。
目前材料主要来自Anthropic的公告、论文与配套文档,以及据此报道的媒体。结果经过内部检查、专家审阅和形式化验证,但材料没有显示它已完成传统同行评审,也没有独立研究团队复现。
它推进的到底是什么?
黎曼猜想研究的是素数分布背后的精细规律。它的核心对象叫黎曼ζ函数。所谓函数的“零点”,就是让函数值变成零的输入。黎曼猜想关心其中一类“非平凡零点”,并主张它们在复平面上的实部全都等于 。这条位置固定的直线通常称为临界线。
完整证明要求一个“全部成立”的结论。难点在于,检查再多具体零点,也不能替代对无限多个零点的证明。于是,数学家还会研究一个阶段性问题:能否严格证明至少一定比例的非平凡零点落在临界线上?
Anthropic称,Claude把这个可保证的比例从41.6%推到了67.2%。变化显著,但它与“全部”之间仍有本质差距。比例下界提高,只说明证明覆盖的范围扩大了;没有被下界覆盖的部分,状态仍然未知。
650次失败之后,换成一支AI队伍
据TechCrunch报道,实验最初直接要求模型尝试证明黎曼猜想。模型共探索了650种思路,没有解决原问题。随后,它在约一天半内协调约60个子智能体继续工作,总计消耗3100万输出Token。Token可以理解为模型处理和生成文字时使用的基本计量单位。
这是一种多智能体协作:多个AI agent分别探索、检查和汇总同一个任务,像把一间研究室拆成若干工作台。论文脚注给出的分工很具体:2个子智能体提出关键数学思路,13个贡献辅助想法,30个探索其他方向但未成功,13个负责验证,最后2个协助撰写初稿。
这组数字有两层意思。第一,失败不是边角料,而是主要工作量:一半子智能体没有找到可用方向。第二,最终结果并非某次回答突然命中,而是经过搜索、分工和相互检查逐步收敛。AI在这里更像一套可并行运转的研究流程,而不只是一个解题聊天框。
据qbitai转述的Anthropic信息,这些智能体还运行了2400条Shell命令,编写数百个Python脚本,并进行了数千次数值检验;它们从arXiv下载并检查了54篇论文,用来排查结果是否已有先例。这些细节目前属于单一来源转述,适合用来理解实验规模,不能视为独立核验。
可检查,比“答对了”更重要
开放数学问题没有现成答案可对照。模型写出一段看似流畅的推导,价值有限;关键是别人能否逐步检查它。
材料显示,Anthropic内部两名数学家检查了结果,团队还使用开源证明助手Lean进行了形式化。Lean可以把证明写成计算机能够逐步核对的形式,帮助发现跳步或不符合规则的推导。据qbitai报道,这个Lean版本还通过了名为Comparator的标准工具测试;解析数论专家Brian Conrey和Dan Goldston审阅了论文。后两项信息均只有一个独立信源。
这些检查提高了结果的可核验性,却不应被写成“学界已经确认”。形式化证明能检查被编码进去的论证,专家审阅也不同于完整的传统同行评审。现阶段更稳妥的说法是:这项工作给出了公开可检查的研究结果,并已经历多层验证,但外部学术共同体仍需时间消化和复核。
为什么这次值得看
黎曼猜想仍然原封未动。真正值得关注的,是Claude在一个没有标准答案的开放问题上,完成了从广泛试错、调用文献、数值检验,到交叉验证、整理证明和形式化的较完整流程。
这不意味着AI已经能够独立接管数学研究。它更像一个难得的可观察案例:当模型获得足够的计算预算和分工机制,它可能在终极目标失败后,识别并推进一个仍有研究价值的相关问题。对前沿数学而言,阶段性结果本来就可能重要,并不只有彻底证明猜想才算进展。
局限与未知
- 材料没有提供完整推导细节,无法据此向普通读者解释41.6%到67.2%的关键数学步骤;相关完整论文题为《67% of the zeroes are on the line》,另有过程文档《How the two-thirds argument was found: two agent runs and their literature》。
- 现有多个报道的一致表述,大量来自同一份Anthropic公告或论文,不等于已有多组独立复现。
- Anthropic认为,这套方法大概率不能直接通向黎曼猜想的完整证明。它推进的是相关边界,不是把世纪难题切走了三分之二。