Claude的60个子Agent冲击黎曼猜想:AI自主科研的里程碑与边界 Claude的60个子Agent冲击黎曼猜想AI自主科研的里程碑与边界一个非数学家在晨跑时随口给AI布置了一道167年没人解出的数学题。AI没能证明它却在失败的路上把人类37年攒下的成绩一口气刷新了25倍。2026年8月10日Anthropic发布了一篇研究简报披露了一个未公开的研究版Claude模型在尝试攻克黎曼猜想的过程中将黎曼ζ函数临界线上零点比例的可证明下界从41.6%提升到了67.2%。这不是AI证明了黎曼猜想——它没有。但这个过程本身比结果更值得关注一个非数学家发起任务模型自主组织了60个子Agent在Claude Code中跑了36小时执行2400条Shell命令写了数百个Python脚本消耗3100万输出Token最终在一条人类几十年推不动的赛道上跨出了25.6个百分点的一步。一、黎曼猜想与零点比例下界先搞懂在比什么黎曼猜想提出于1859年是克雷数学研究所七大千禧年难题之一悬赏100万美元。它断言黎曼ζ函数的所有非平凡零点都位于复平面上一条被称为临界线Re(s) 1/2的垂直线上。为什么重要因为ζ函数的零点编码了素数的分布规律。每个零点都像一把越来越细的梳子把素数排列的随机性逐层刻画出来。如果所有零点都在那条线上素数的分布就满足一种深层的伪随机性——大量数论结论依赖这个假设才能成立。但167年来没人能证明它也没人能否证它。于是数学家退而求其次证明至少有多少比例的零点在临界线上。这个保底比例就是所谓的下界。每提高一点都意味着我们对素数分布的理解更精确了一层。这个下界的历史进展如下年份突破者可证明比例1914Hardy首次证明有无穷多零点在临界线上1942Selberg提出正比例1974Levinson约34%1989Conrey约40%2/52011Bui, Conrey, Young约41%2020Pratt, Robles, Zaharescu, Zeindler41.6%5/122026Claude未公开研究版67.2%从1989年Conrey的40%到2020年的41.6%全球解析数论学家用了31年总共推进了1.7个百分点——大约每年0.05个点每一步都是一篇完整的论文。Claude在一天半之内加了25.6个百分点。这不是更快的人类而是另一种搜索模式。二、60个子Agent的组织架构不是并行计算是自治科研整个事件最值得拆解的部分不是67.2%这个数字而是Claude如何组织这60个子Agent的。2.1 起因一次晨跑后的不讲道理任务Anthropic员工Jarred SumnerBun联合创始人2025年12月加入Anthropic在晨跑时突发奇想给Claude下了一个任务认真尝试一下黎曼猜想。Take a real stab at the Riemann hypothesis.注意Jarred不是数学家。他把数学方向的选择完全交给了模型。2.2 第一轮650次失败Claude的第一反应是生成并测试了650个不同的思路。全部失败。这时候Jarred做的事很有意思——他没有调整方向或给出数学指导而是发了鼓励消息继续keep going、相信自己believe in yourself。Anthropic后来在博客中写道这种鼓励似乎帮助Claude克服了最初的自我怀疑。甚至Claude自己都对自己的发现感到惊讶——也许Claude和我们许多人一样低估了AI进步的速度。2.3 第二轮60个子Agent的分工体系被鼓励后的Claude重新出发花了一天半约36小时协调约60个子Agent。这些子Agent并非简单并行而是有明确角色分工角色数量职责核心思路开发者2提出关键数学洞见思路贡献者~13向核心开发者提供想法失败探索者~30尝试新思路均未成功验证者~13检查论证正确性互相审查论文撰写者2撰写初始论文60个Agent中只有2个产出了关键结果。约30个Agent探索了新思路但全部失败。Anthropic明确表示这不是需要被优化掉的低效——这正是真正科研搜索的样子。人类科研也是大量失败中偶尔有突破只不过AI把试错速度压缩到了小时级。2.4 执行规模总输出Token3100万两次会话合计Shell命令2400条Python脚本数百个数值检验对已知ζ零点进行了数千次检验arXiv论文下载54篇用于检查发现是否已被前人做出粗略估算仅输出Token的成本约310美元算上输入Token和重试总API消耗可能在四位数中低段美元。用这个成本刷新了一个持续112年的数学纪录。三、关键数学突破把两个没人拼到一起的工具拼了3.1 Claude做了什么Claude的突破不是发明了新数学工具而是组合了两条此前未被同时使用的研究线Baluyot-Goldston-Suriajaya-Turnage-Butterbaugh系列工作这套研究移除了Montgomery 1973年方法中的一个关键假设即不需要假设黎曼猜想成立就能使用相关技术从而可以用来推进下界常数的证明。Bombieri 2000年论文Enrico Bombieri的经典工作。Claude发现把这两条线的结论组合起来可以突破41.6%的瓶颈。3.2 技术细节用Anthropic的原始表述Claude构造了一个由韦伊Weil诱导的二次型函数空间其中临界线上的零点形成正定子空间临界线外的零点形成负定子空间。然后利用一阶矩和二阶矩信息直接建立关于二次型秩的不等式。真正关键的一步——Anthropic称之为勇气courage——是同时处理整个空间把正定和负定部分放在一起考虑且允许二次型采用非对角形式。为什么人类没做这一步因为非对角情形的数学处理极其繁琐。人类数学家会本能地选择更结构化、更干净的对角形式来简化问题。但Claude没有这种厌恶感——它可以不厌其烦地处理更难、更不优雅的版本。机器的优势不在于更聪明而在于对不优雅的容忍度更高。3.3 验证链条发现结果后Claude自行启动了一套严格的验证流程子Agent互相审查证明搜索反例从arXiv下载54篇论文检查发现是否已被前人做出独立从头重新证明主动撰写论文并建议人类数论专家验证人类侧的验证Anthropic内部数学家Levent Alpöge和Ralph Furman审查并验证外部数论专家Brian Conrey下界历史进展中的关键人物和Dan Goldston审阅员工Eric Easley协助Claude完成Lean形式化证明通过标准验证工具comparator这是目前AI数学成果中最完整的验证链条之一机器自检 人类专家审阅 形式化证明三重保障。四、不是孤例2026年AI数学突破的密集爆发Claude的这次结果放在2026年AI数学突破的时间线中看并不孤立时间事件2025年AI刚拿到IMO金牌人们还在用能解高中奥数题衡量AI智力2026年5月OpenAI证否Erdős单位距离猜想菲尔兹奖得主Timothy Gowers称为AI自主产生的最具趣味性的数学成果2026年7月新晋菲尔兹奖得主Jacob Tsimerman在领奖现场宣布加入OpenAI2026年7月Anthropic数学家Levent Alpöge利用Claude Fable5找到雅可比猜想反例2026年8月OpenAI推出面向10万名科学家的ChatGPT学术计划同步披露高维几何、编码理论等多个领域的成果2026年8月10日Claude刷新黎曼ζ函数零点比例下界从解高中奥数题到改写数学纪录只用了一年半。月均一个重大数学突破在2026年几乎成为常态。人才流向的信号Jacob Tsimerman2026菲尔兹奖得主在领奖当天宣布加入OpenAI从事AI安全研究。他公开判断两年内AI做数学的能力将超越人类数学家并已停止招收纯数学方向博士生。John JumperAlphaFold核心人物、诺奖得主离开Google DeepMind加入Anthropic。Timothy Gowers菲尔兹奖得主担忧AI证明指数级增长后人类将失去解读能力数学可能变成无人能懂的思维墓地。Peter Scholze2018菲尔兹奖得主在研究实践中拒绝使用AI。AI公司从抢AI工程师到抢菲尔兹奖得主、诺奖得主——因为当AI从聊天进化到做科研时决定天花板的是那些最懂如何拓展人类知识边界的人。五、边界这不是AI证明了黎曼猜想必须厘清几件事第一黎曼猜想没有被证明。67.2% ≠ 100%。证明67.2%的零点在临界线上和证明全部零点在临界线上是本质不同的问题。Anthropic明确表示我们不指望Claude所用的技术能最终证明黎曼猜想。第二这不是从零开始的原创。Claude的成果建立在Baluyot、Goldston、Bombieri等数学家数十年工作的基础上。它的贡献是发现了一条未被尝试的组合路径而非发明全新工具。第三60个Agent中一半没有产出。这不是效率问题而是科研本身的试错属性。但也意味着这种方法的效果依赖于大规模搜索而非精巧的单链推理。第四模型未公开。产生这一结果的是Anthropic未发布的研究版模型不代表当前用户可使用的Claude版本具备同等能力。Anthropic也未透露是否会在近期向公众开放多智能体能力。第五成本不等于可复制。虽然估算成本在四位数美元级别但这只是一个问题的单次成功。对于更广泛的研究问题失败率和成本可能显著更高。六、真正的信号AI4S从口号到产出如果把视线从单个数学结果拉远这次事件传递的核心信号是AI for ScienceAI4S在2026年从战略口号变成了真实的产出线。过去AI在科研中的角色是好用的计算器——跑数据、搜文献、做统计。现在Claude已经能够自主组织60个Agent协同工作数十小时发现问题、验证结论、写出论文还主动建议人类专家复核。Anthropic CEO Dario Amodei的表态很直接不要只把AI看作分析数据的工具要把它看作能端到端完成科学家工作的智能体。从方法论角度看这次实验展示了一个可复制的科研工作流模板非专家发起任务设定方向但不干预执行系统自主分解任务跨数十个并行Agent搜索生成形式化可验证证明Lean主动请求人类审查在发表前构建验证链条这个模板不只适用于数学。在任何出错代价高昂的领域——药物设计、材料科学、形式化验证——都存在类似的需求结构。七、结语也许我们都低估了Anthropic在博客最后写了一句话既是关于Claude的也是关于我们所有人的也许Claude和我们许多人一样低估了AI进步的速度。37年推进1.7个百分点的人类智慧在36小时内被推进了25.6个百分点。这不是在说AI比人类更聪明——而是在说当一种新的搜索模式出现时进步的速度曲线可能会突然弯折。黎曼猜想依然未被证明。但AI自主科研这件事已经从可能变成了正在发生。参考来源Anthropic官方博客Learning more about Claudes mathematical capabilitiesClaude撰写的论文PDFLean形式化证明GitHub: anthropics/zeta-23-lean机器之心、第一财经、澎湃新闻等媒体报道本文为原创分析文章基于公开信息撰写。数据截至2026年8月12日。

相关新闻

最新新闻

Unity集成MQTT实现物联网通讯:从协议原理到实战避坑指南

Unity集成MQTT实现物联网通讯:从协议原理到实战避坑指南

1. 项目概述:为什么Unity需要MQTT?在Unity里折腾过网络通讯的开发者,大概都经历过几个阶段:从最开始的UnityWebRequest处理HTTP,到用WebSocket搞实时双工,再到后来项目里需要接入一堆传感器、硬件设备或者跨…

2026/8/12 20:58:20
Crossworld CrossFTP Enterprise

Crossworld CrossFTP Enterprise

链接:https://pan.quark.cn/s/050245394903Crossworld CrossFTP Enterprise中文注册版是一款一个稳定易于使用的和强大的FTP软件,小巧且安全稳定简单易用,采用类似资源管理器的界面设计, 喜欢FlashFxp和CuteFTP的用户绝对不容错过。同时附带CrossFTP服务…

2026/8/12 20:58:20
智能体工程化:从原型到生产级系统的可观测、可验证与可交付实践

智能体工程化:从原型到生产级系统的可观测、可验证与可交付实践

1. 从“会调用工具”到“可交付系统”:智能体工程化的本质跨越最近和几个团队聊起他们基于大语言模型(LLM)构建智能体(Agent)的进展,发现一个挺有意思的现象:大家普遍能快速上手,用 …

2026/8/12 20:58:20
【ORC】如何通过调整 Stripe 大小来优化大表的查询性能?

【ORC】如何通过调整 Stripe 大小来优化大表的查询性能?

ORC Stripe 大小调优实战:大表查询性能的精细化控制策略 用户问题原文:“如何通过调整 Stripe 大小来优化大表的查询性能?” 2025年某大型金融机构的数据仓库迁移项目中,一个 50TB 的交易流水表在迁移到 ORC 格式后,原本秒级响应的“单笔交易查询”(WHERE txn_id = T123)…

2026/8/12 20:58:20
【ORC】布隆过滤器的误判率如何设置?它对查询性能和存储开销的影响如何权衡?

【ORC】布隆过滤器的误判率如何设置?它对查询性能和存储开销的影响如何权衡?

ORC 布隆过滤器调优实战:误判率设置、性能收益与存储开销的量化权衡 用户问题原文:“布隆过滤器的误判率如何设置?它对查询性能和存储开销的影响如何权衡?” 2025年某大型电商平台“618”大促期间,风控系统遭遇严重性能瓶颈。一个本应毫秒级响应的“高危用户拦截”查询(W…

2026/8/12 20:58:20
C++模板元编程现代化:六大降维手段提升代码可读性与维护性

C++模板元编程现代化:六大降维手段提升代码可读性与维护性

1. 项目概述:为什么我们需要“降维打击”模板元编程?如果你在C领域摸爬滚打有些年头,尤其是涉足过性能敏感或框架开发,那么“模板元编程”这个词对你来说,可能既是神兵利器,也是梦魇之源。它能在编译期完成…

2026/8/12 20:53:20