姚班校友主导,Claude攻克费马大定理首个完整形式化证明
硅星人Pro · 科技资讯
硅星人Pro 2026-09-06 10:17 北京 人类和费马大定理纠缠了三个半世纪,Claude这次只用了11天!? 文章转载于量子位 作者:梦瑶 人类和费马大定理纠缠了三个半世纪,Claude这次只用了11天!? 刚刚,Anthropic宣布,Claude完成了首个端到端、可由计算机完整检查的 费马大定理证明 。 约1300万行Lean代码、超过3万个中间定理、最终证明使用其中约29500个。 整个工程规模,已经超过Lean核心数学库Mathlib的 5倍 。 这次Claude没有发现一个全新的费马大定理证明。 它完成的是另一件同样工程量《惊人》的工作: 把人类数学家能够读懂的证明,彻底翻译成计算机能够一行一行检查、没有任何「这里显然」的形式化证明。 而这件事,数学界原本是按多年工程来准备的???? 1 350多年数学史,被Claude塞进1300万行Lean 先快速说一下费马大定理到底是什么。 其指的是,对于任意整数n>2,都不存在正整数a、b、c,使: aⁿ+bⁿ=cⁿ 。 这个命题看起来极其简单,难度却高得离谱!! 从17世纪费马留下这个命题开始,欧拉、勒让德、库默尔等一代代数学家不断往前推进,始终没能拿下完整证明。 直到1993年,英国数学家Andrew Wiles第一次公开宣布证明费马大定理。 随后审查发现其中存在关键缺口。 Wiles又花了大约一年时间和Richard Taylor一起修补,最终在1994年完成证明,到这里,困扰数学界350多年的命题才终于被攻克。。。 But!数学界随后又给自己挖了一个更工程化的坑—— 能不能让计算机,也百分之百确认这份证明成立捏? 这就是所谓的「形式化」。 简单理解,普通数学论文是写给数学家看的,人脑看到很多步骤,可以直接说:嗯,这里显然成立~ 但Lean这种专门检查数学证明的程序系统证明助手,可不吃这一套。。。 我们可以把 Lean 理解成数学世界里的「超级严格编译器」—— 数学家或者AI负责把定理、定义和证明一步一步写成Lean能够理解的形式;Lean则负责检查,每一个推导到底有没有从前面的公理和定理合法地走出来。 这也是为什么形式化一个大型现代数学证明,工作量经常大得惊人!! 2000年代,计算机科学家就已经提出过形式化Wiles证明的设想。 到2024年,帝国理工学院Kevin Buzzard等人才正式启动一个多年社区项目,准备使用Lean完成费马大定理形式化,光项目第一阶段的技术蓝图,就写了86页。 结果Claude来了之后:11天。 Anthropic研究员Tianyi Peng最初其实没打算一口气干完这事儿。 作为早年是信息学竞赛尖子, Tianyi Peng 曾获全国青少年信息学奥赛选拔赛第八名,2017年从 清华姚班 本科毕业,2023年获MIT博士学位。 如今,他是哥伦比亚大学助理教授、Anthropic研究员,长期聚焦强化学习、AI Agent与形式化工具。 开始吧,他只是想测试一下,Claude究竟能把这个项目往前推多远。 最后,没成想,Claude直接一路干到了终点。。。 整个过程中,不同Agent被同时拉起来并行工作。 有的负责补数学定义,有的专门攻中间引理,有的沿着已有成果继续往更高层定理推进,还有Agent负责把不同部分重新拼回整个证明体系。 最后堆出来的成果,是约1300万行Lean代码、超过3万个中间定理。 而这个代码量,甚至超过Lean核心数学库Mathlib自身规模的5倍!!! Anthropic对此也表示,完整证明只依赖Lean三个标准公理,而且他们还专门通过比较程序确认,Claude最终证明的定理陈述,与Mathlib里的费马大定理完全一致。 也就是说,至少在逻辑检查这件事上,不能靠模型自己说「我证明完了」。 而裁判,正是Lean。 1 Claude也曾组团组到失忆,最后靠Harness救回来 不过Claude这11天,也没一路开挂到底。 项目刚开始时,多Agent协作很快撞上了一个如今几乎所有大型Agent系统都会遇到的问题—— 人一多,活一多,项目开始乱了。。。(doge) Anthropic透露,早期Agent虽然很快拿下了一些结果,但随着工程规模扩大,它们逐渐跟不上整个项目的状态,也越来越难有效协作。 这些失败尝试留下的代码,最终只占成品非模板代码的大约7%。 真正的转折点,是团队换上了一个叫 「Prove2Me」 的平台—— 这是Tianyi Peng及其哥伦比亚大学合作者专门为数学形式化搭建的一套协作系统。 我们可以把它理解成,给几十个Claude装上了一套数学版项目管理系统。 Prove2Me会把整个证明拆成一个由定理节点组成的DAG,也就是有向无环图。 哪个定理已经证明了,哪个还缺前置条件,下一步该攻哪个节点,Ag