Claude 用 11 天验证完费马大定理,国赛只给你 74 小时:AI 到底能替你干到哪一步 Claude 用 11 天验证完费马大定理国赛只给你 74 小时AI 到底能替你干到哪一步11 天对 74 小时1300 万行代码对一场比赛的完整赛程。当 Anthropic 在 9 月 4 日宣布 Claude 用 11 天完成了费马大定理的首个端到端、可由机器逐行检查的 Lean 形式化证明时数学圈震动的是「11 天」而 6.8 万支正在备赛全国大学生数学建模竞赛的队伍更该读懂的是另一个数从 9 月 10 日 18 时发题到 9 月 13 日 20 时收卷2026 高教社杯只给他们约 74 个小时。最强的模型想在机器严格可验证的意义上拿下一个定理也要以天计、以千万行代码计指望 AI 在赛场替你完成机理建模与严格推理是一个需要重新校准的预期。这场形式化证明的主角是清华姚班校友彭天翼主导、与哥伦比亚大学合作者一起推进的项目。Claude 在 11 天里写下约 1300 万行 Lean 代码产出约 3.03 万个可验证定理其中约 2.95 万个进入最终证明消耗约 60 亿输出 token代码规模超过 Lean 核心数学库 Mathlib 的五倍是迄今最大的 Lean 证明项目。它证明的不是新定理而是把英国数学家怀尔斯 1995 年那篇 129 页的人类证明完整转写成机器能逐行核验的形式去掉每一个「这里显然」的跳步。一、一场机器验证的账单11 天、1300 万行、60 亿 token先把这场证明的成本账单摆出来。时间上Claude 从开始到跑出「PROVED」用了 11 天过程中数十个智能体并行协作人类只偶尔给出高层方向比如「尽快推进 Mazur 定理」。规模上约 1300 万行 Lean 代码是什么概念Lean 社区最核心的数学库 Mathlib 是数代数学家与工程师多年累积的成果这次单次证明写出的代码量是它的五倍以上。另一个数字是 60 亿输出 token按当前主流模型的推理成本估算这是一笔普通研究团队难以独立承担的算力账单。为什么这么贵。形式化证明要求把每一步推理都拆到机器能自动检查的粒度任何一个隐藏假设、任何一次「显然」都会被编译器当场驳回。Claude 并不是一次成功项目早期数十个智能体并行时一度陷入混乱互相不知道对方证明了什么早期失败尝试贡献的代码只占最终成果的 7%。团队为此开发了 Prove2Me 平台把整个证明拆成一张有向无环图让每个智能体知道下一步该证明哪个节点定理陈述与证明分开保存避免一个智能体修改证明方法时破坏其他人的依赖。二、把「严格证明」放回 74 小时赛程AI 的边界在哪把这场证明的成本带回国赛语境结论很直接。国赛要求队伍在 74 小时里完成选题、建模、求解、检验、写论文和做支撑材料绝大多数题目需要的推理深度远达不到费马大定理的量级但「把每一步都做对、可检验、可复现」的要求是相通的。一个队伍如果把「让 AI 替我完成从机理分析到模型推导的整条链」等同于让它在 74 小时里完成一次小规模的严格证明工程这个预期大概率会在某个环节崩掉。更现实的分工是AI 能加速的是检索、初筛、代码调试、格式整理和查重这类「并行度高、试错成本低」的环节而真正决定论文上限的机理建模、假设检验、结果解读仍然依赖人的判断。原因在于建模题没有标准答案一个看似合理的模型可能在数据上跑不通也可能跑通了但解释不了现象这种需要来回推翻重来的探索恰恰是当前 AI 最不擅长的长链自主过程它擅长的是在给定目标后快速执行而不是替人类定义「什么才是对的问题」。费马大定理项目里的人类角色可以作为参照彭天翼团队做的事情是定义里程碑、判断哪些子问题先攻、在数十个智能体陷入混乱时给出高层方向。这套分工放在 74 小时赛程里几乎可以原样平移人负责设问与决策AI 负责执行与试错。三、74 小时里 AI 真正能提速的四个环节把 AI 放进国赛的正确位置是把它当加速器而不是代笔。具体到赛程有四类工作适合交给 AI第一文献与数据检索快速定位类似问题的经典模型和可用数据集把读题后的前两个小时从「大海捞针」变成「按图索骥」。第二代码调试与语法检查建模过程中大量时间耗在报错和改 bug 上用代码辅助工具把这类机械劳动压缩能省出几小时给真正的建模讨论。第三论文语言的润色与格式整理让成稿阶段少在排版上耗人。第四查重与自查交卷前用工具扫一遍文字与结构的明显问题。需要谨慎的是另外三类让 AI 直接给出完整模型、让 AI 替你写核心推导过程、让 AI 生成大段结论性文字。这三类一旦出了错人很难在 74 小时的末尾发现因为 AI 的错误往往是「看起来完全合理」的错误。费马大定理项目里人类可以事后花数天去核验每一行代码国赛队伍没有这个时间窗口把未经核验的 AI 产出直接写进论文等于在交卷前埋下一颗自己看不见的雷。四、今年评阅端多了一道「过程」的尺子AI 的边界不只是能力问题还是规则问题。2026 年是国赛第一次把 AI 工具整体写进规则参赛队用了 AI 就要交声明和一份名为「AI 工具使用详情」的支撑材料写明用了什么工具、用在哪个环节、提示方式、以及人工核验情况。评阅专家手里的材料比往年多了这一层意味着评阅不再只看论文结果像不像人写的也开始看过程痕迹经不经得起问。任何直接由 AI 生成、未经人工实质加工的核心建模内容一旦被识别出来轻则按违规处理重则直接取消评奖资格。这让「人机分工」从效率问题变成了合规问题。队伍在 74 小时里用什么工具、在哪一步用、保留了什么过程记录都要在交卷时讲得清楚。与其到交卷前才补一份含糊的声明不如从开赛第一小时就按「每个 AI 参与环节都留痕、都有人复核」的方式推进这样写出来的详情 PDF 才经得起评阅端的追问。五、给 74 小时的人机分工建议落到操作层面可以按赛程把 AI 放进固定的时间段。发题后前两小时用 AI 做赛题关键词检索与同类问题盘点人负责定题建模主阶段AI 只承担代码实现与调试模型选择、假设设定、参数解释全部由人完成每用一次 AI 生成的内容都当场人工复核成稿阶段AI 做语言润色与格式整理人通读全文检查逻辑一致性。这样分配AI 的价值被放在它最擅长的地方人也守住了评阅端最看重的建模主导权。费马大定理的故事给了一个值得记住的参照系即便最先进的模型在机器可验证的严格标准下完成一次大规模证明也要 11 天和千万行代码。国赛的 74 小时很短但它并不要求队伍在「机器严格可验证」的意义上证明什么它要求的是人在有限时间里做出合理的模型并用论文讲清楚。把 AI 当加速器、把自己当主导者这个分工想明白了74 小时才真正够用。AI 能替你把每一步做快但「做什么、为什么这么做」这一步74 小时里只能由人来定。

相关新闻

最新新闻

多商户SaaS化ERP系统设计:多仓库库存与扫码进销存实战

多商户SaaS化ERP系统设计:多仓库库存与扫码进销存实战

简介:一套基于PHP的SaaS版多商户多仓库ERP进销存管理系统源码,面向需要快速搭建云端多商户平台的技术人员、创业者或中小企业。系统支持无限开通商户,用户可前端自助注册,由后台管理员审核并设置到期时间与权限;支持多…

2026/9/8 10:09:55
高并发系统缓存架构实战:从原理到Redis最佳实践

高并发系统缓存架构实战:从原理到Redis最佳实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/8 10:09:55
ComfyUI从零安装到AI绘画实战:节点式工作流详解

ComfyUI从零安装到AI绘画实战:节点式工作流详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/8 10:09:55
glibc升级风险解析:为什么不能轻易动Linux的根基

glibc升级风险解析:为什么不能轻易动Linux的根基

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/8 10:09:55
基于SpringBoot的差旅报销管理系统的设计与实现(程序+文档+讲解)

基于SpringBoot的差旅报销管理系统的设计与实现(程序+文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/9/8 10:09:55
1D-CNN实现多元时间序列分类:原理、实践与踩坑指南

1D-CNN实现多元时间序列分类:原理、实践与踩坑指南

简介:一份面向多元时间序列分类任务的一维卷积神经网络(1D-CNN)实战资源,适合正在学习时序数据挖掘、深度学习分类模型的开发者和研究人员。资源基于TSC-CNN项目,完整涵盖模型设计思路与可运行代码,有助于理…

2026/9/8 10:04:55