9 月 4 日,Anthropic 宣布 Claude 以“基本自主”的方式在 11 天内完成了费马大定理在 Lean 编程语言中的完整形式化证明——这是该定理第一个端到端、可由计算机逐行检查的证明版本。需要说明的是,这并非推翻或重写数学史上的证明:怀尔斯 1995 年的证明依然是人类数学的里程碑。Claude 做的是另一件工程量同样惊人的事:把面向数学家、允许大量省略的证明,彻底翻译成计算机能逐一验证、不存在任何“显然”跳步的形式化语言。

Claude 到底做了什么

Anthropic 官方博客,Claude 在 11 天里写出约 1300 万行 Lean 代码,过程中证明约 3.03 万个中间定理,最终证明使用了其中约 2.95 万个——整体代码量超过 Lean 核心数学库 Mathlib 的 5 倍。最终证明通过 Lean 校验,只依赖 Lean 的三个标准公理,并且通过比对程序确认:Claude 所证定理的陈述与 Mathlib 中费马大定理的陈述完全一致。换言之,裁判不是模型自己,而是 Lean。

这次形式化沿用的是怀尔斯证明的简化路线(Darmon、Diamond 与 Taylor 的表述)。人类提供的数学指导相当有限:主导该项目的 Anthropic 研究员、哥伦比亚大学助理教授田鹏(清华姚班 2017 届本科、MIT 2023 届博士)主要给出“某定理优先推进”这类高层指令。负责审阅的帝国理工学院教授 Kevin Buzzard(他本人正领导一个多年期社区形式化项目)将其评价为“非凡的自动形式化成果”。

多智能体协作也曾“翻车”

Claude 并非一路顺风。Anthropic 透露,项目早期多个智能体很快拿下一些结果,但随着规模扩大逐渐丢失项目全局状态、协作效率骤降;这些失败尝试只占最终成品非模板代码的约 7%。转折点是换用 Prove2Me(田鹏与合作者为数学形式化打造的开放协作平台):它把整个证明拆成由定理节点组成的有向无环图,哪个已证、哪个缺前置条件一目了然,并把定理陈述与证明分开管理以加速 Lean 编译,还保留每条定理的自然语言描述方便搜索复用。据量子位报道,正是在这套 Prove2Me 加基于 Claude Code 的 multi-agent harness 下,几十个 Claude 才真正像一支数学团队一样协作。

整次运行消耗约 60 亿个输出 token,使用的内部通用研究模型能力大致相当于 Claude Fable 5.1。Anthropic 还做了一个小实验:仅用三个个人 Claude Max 套餐、完全通过 Prove2Me 协作,三天内就形式化完成了维诺格拉多夫三素数定理。

为什么这比“一个定理”更重要

这件事的意义不在费马,而在“验证”。人类审阅长证明往往以年计——怀尔斯自己的证明当年也经历了数月核查、并一度被发现存在关键缺口。如果 AI 能快速把大型现代证明搬进形式化系统,审稿人就有了一件能严格检查 AI 生成数学的工具,数学文献中的潜在错误也更容易被揪出来。Buzzard 对 Anthropic 表示:如果现在就能自动形式化费马大定理,那离自动形式化现代数学文献就只差一步。

对桌面 AI 用户的启发

这类“几十个智能体连续工作近两周”的工程,是自主 AI 在任务结构清晰、状态可追踪、进展可验证时能做到什么的预演。把尺度放回日常,道理相同:智能体可不可信,取决于它身边有没有清晰的边界与检查点。像 MOOGH 这样的本地桌面客户端,就把这层结构放在你自己电脑上——文件、审批与历史都留在本机,模型只负责干活。

想在自己的电脑上体验有边界、可追溯的智能体工作流?下载 MOOGH Windows 版,让强大模型在你的文件上安全地干活。