Anthropic未发布版Claude尝试证明黎曼猜想失败,但在解析数论领域取得突破:将黎曼ζ函数已知位于临界线上的非平凡零点比例下界从41.6%大幅提升至67.2%,创37年来最大单次进步,相关成果经内部数学家验证并完成Lean形式化证明。
AI 向新的数学难题发起了挑战,这次是「黎曼猜想」。
一个诞生于 1859 年的数学猜想,悬而未决 167 年,还挂着 100 万美元奖金。最近Anthropic 内部有人给尚未发布的 Claude 研究版本布置了一个近乎「不讲道理」的任务:
认真尝试一下黎曼猜想。

Bun 联合创始人 Jarred Sumner,他于去年 12 月加入 Anthropic
Claude 确实认真试了。它先后提出 650 个思路,全部失败。随后又重新组织约 60 个 Claude 子 Agent,连续工作一天半,执行 2400 次 Shell 命令,写下数百个 Python 脚本,做了数千次数值检验。最终,黎曼猜想依旧没有被攻克。
但在这次失败的尝试中,Claude 碰到了另一个结果。Anthropic 披露,这个尚未发布的 Claude 研究版本,将黎曼 ζ 函数中已知至少位于临界线上的零点比例下界,由 41.6% 提高到了 67.2%。

换句话说,人类此前能够证明,至少 41.6% 的相关零点符合黎曼猜想所预测的位置;Claude 给出的结果,则把这个可证明的比例推进到了 67.2%。
一家风投公司 Menlo Ventures 合伙人、研究者 Deedy 表示,「Claude 这次的结果简直离谱,可能是自 2013 年有界素数间隔突破以来,解析数论领域最重大的进展。它把能够严格证明位于临界线上的黎曼 ζ 函数零点比例,一口气提高了 25.6 个百分点。而在此前 37 年里,数学家们总共只把这个数字提高了 0.8 个百分点。」

Anthropic 两名数学家随后研究并验证了 Claude 的论文,Claude 还给出了对应的 Lean 形式化证明。数论学家 Brian Conrey 和 Dan Goldston 也在较短时间内审阅了论文。
Anthropic 强调,这套方法预计无法直接导向黎曼猜想的最终证明。但这次结果依然提供了一个值得关注的信号:前沿模型的数学能力,正在开始触及真正没有现成答案的研究问题。
黎曼猜想之所以重要,与素数有关。黎曼 ζ 函数与素数的分布存在深刻联系。1859 年,德国数学家伯恩哈德・黎曼提出猜想:ζ 函数所有 “非平凡零点” 的实部都应该等于 1/2。
在复平面上,这意味着这些零点全部落在一条垂直线上,也就是著名的临界线。
这个看似抽象的问题影响非常广。大量关于素数分布的数学结论,都可以在假设黎曼猜想成立的前提下得到更精确的结果。它也因此成为克雷数学研究所七大「千禧年难题」之一,完整证明或推翻它都可以获得 100 万美元奖金。
过去一个多世纪里,没有人能够证明所有非平凡零点都落在临界线上,但数学家可以证明其中一定有一部分位于那里。
于是,一个相对现实的问题出现了:我们至少能够证明多大比例的零点落在临界线上?经过数十年的推进,这个比例的已知下界逐渐提高到了约 41.6%。
Claude 这次推进的正是这个数字。
Claude 得到结果所依赖的基础,并非凭空出现。
1973 年,数学家 Hugh Montgomery 研究 ζ 函数零点的分布时,引入了一系列重要方法。不过,其中部分分析依赖黎曼猜想成立这一前提。近年来,数学家们的一系列工作,进一步发展了相关技术,使其中一些方法可以在不预先假设黎曼猜想成立的情况下使用。
这意味着,它们有机会反过来帮助研究「究竟有多少零点位于临界线上」。Claude 在这些工作的基础上,又结合了 Enrico Bombieri 在 2000 年前后发表的相关研究,找到了一个新的组合方式。
最终得到的结果是:至少 67.2% 的相关零点位于临界线上。相比此前 41.6% 的已知下界,提高了 25.6 个百分点。
从技术上看,Claude 构造了一个合适的函数空间,并利用 Weil 诱导出的二次型,将位于临界线上的零点和偏离临界线的零点分别对应到正定与负定方向。随后,它利用二次型的秩与一阶、二阶矩信息之间的关系建立不等式。
Anthropic 的数学家认为,其中一个关键点,在于 Claude 没有分别处理正定和负定部分,而是将整个空间放到同一个框架内分析,同时允许二次型具有非对角结构。结合此前数论研究者已经建立的结果,这一步最终导出了 67.2% 的下界。
这里需要特别说明:Anthropic 目前并没有声称这套技术能够继续一路推进到 100%,更没有声称 Claude 距离证明黎曼猜想只差 32.8%。
67.2% 是一个相关问题上的下界改进,与完整证明黎曼猜想之间仍然存在巨大的理论距离。
这次实验同样值得关注的,还有 Claude 解决问题的方式。整个结果是在两轮 Claude Code 会话中得到的,总计消耗约 3100 万输出 Token。
最初,Jarred Sumner 给 Claude 下达的要求非常开放:认真尝试一下黎曼猜想。
Sumner 本人并非数学家,也没有为 Claude 指定具体数学路线。
第一轮里,Claude 生成并尝试了大约 650 个想法。全部失败。
Sumner 随后让它继续尝试。第二轮持续约一天半。
Claude 组织了约 60 个子 Agent,把问题拆成多个方向并行探索。这些 Agent 一共执行了约 2400 次 Shell 命令,编写数百个 Python 脚本,并针对已知的 ζ 函数零点进行了数千次数值检查。
不同子 Agent 之间还会互相审阅结果。
按照 Anthropic 的说法,Sumner 在这一阶段几乎没有提供数学上的指导。他主要做的事情,是不断告诉 Claude「继续」「再试试」「相信自己」。Anthropic 甚至提到,Claude 一开始对自己能否在这样一个著名开放问题上取得真正进展相当怀疑。直到持续探索之后,这个新下界才逐渐出现。
找到结果后,Claude 又启动了一轮自我验证。一些子 Agent 专门负责检查证明,一些寻找反例;Claude 还下载了 54 篇 arXiv 论文,检查类似结果是否已经由其他数学家得到。
随后,它又让独立 Agent 从头重新推导了一遍结果。确认没有明显问题之后,Claude 主动建议将结果整理成论文,并明确提出:应该找一位真正的数论专家进行人工验证。
Anthropic 内部数学家 Levent Alpöge 和 Ralph Furman 随后开始检查论文,分析它与既有文献之间的关系。与此同时,Claude 还与 Anthropic 员工 Eric Easley 合作,把关键结果形式化为 Lean 证明。这份形式化结果已经通过 Lean 标准验证工具 Comparator 的检查。
Anthropic 还邀请了研究黎曼 ζ 函数的数学家 Brian Conrey 和 Dan Goldston 审阅论文。因此,目前更准确的说法是:Anthropic 内部数学家已经对结果进行了研究和验证,并完成了机器可检查的形式化证明,同时两位外部领域专家对论文进行了审阅。这与已经完成传统学术同行评议、形成数学界共识,仍然是两个不同阶段。
更多链接:
claude 论文:https://www-cdn.anthropic.com/564f962e60643842f5fcb4a17c9dbc8f608f1c37.pdf
claude 项目地址:https://github.com/anthropics/zeta-23-lean
参考链接:
https://x.com/AnthropicAI/status/2086867246073401655
https://www.anthropic.com/research/riemann-zeta
https://x.com/jarredsumner/status/2086869681785500011
本文来自微信公众号“机器之心”,作者:关注AI数学的机器之心