Claude 把零点比例扒到67.2%,但这可能根本不是一个数学故事
41.6%到67.2%,这个数字如果放在数学系 seminar 上,够一个年轻学者吃十年。但放在 Anthropic 的 PR 稿里,我更愿意把它读成一个关于推理链路的商业信号,而不是黎曼猜想的临终遗言。
先说这个突破本身。黎曼 ζ 函数临界线上零点比例的下界,从41.6%被推到67.2%,这在解析数论里是实打实的进展。过去几十年这个数字被一点点往上挪,每次挪动都是论文级别的工程。Claude 用几天时间自主完成,不管用了什么内部推理技巧,这个结果本身是可以用传统数学方法验证的。所以我不怀疑这个数字的真实性,我怀疑的是另一件事:它是怎么被推出来的。
Anthropic 没有公开这个研究版模型的推理过程,只说了“持续数天、模型自主完成”。这句话放在数学界,核心矛盾就出来了。数学共同体认的是可验证的证明链,不是一个模型告诉你说“我算出来是67.2%”。莱布尼茨当年跟牛顿争微积分,争的是思想方法,不是计算结果。现在 Claude 给了一个数字,但整个推理链条是黑箱,这等于把数学变成了神谕。这让我想起上个月 Fable 5 证伪雅可比猜想的事,当时也是“未公开模型”完成,结果到现在数学界还在吵怎么复核。两件事放一起,Anthropic 的套路很清楚了:用数学难题当推理能力的压力测试,而不是真的想解决黎曼猜想。
从三个维度来看这件事,我反而觉得它更像一次商业定位的宣示。
这是对“AI 只会语言处理”这个刻板印象的正面回击。数学推理一直被认为是符号逻辑的堡垒,大模型在这块长期被质疑是“高级模式匹配”。Claude 把零点比例往前推了一大步,不管过程如何,这个结果本身就是对“模式匹配论”最有力的反驳。Anthropic 选择黎曼猜想而不是其他问题,是有意为之。这个猜想的知名度在公众和学术界都很高,而且它自带“百年未解”的戏剧性。配合之前 Fable 5 的雅可比猜想证伪,Anthropic 正在建立一条“AI 可以发现新数学”的叙事线。这条线如果被市场接受,它就不再是卖 API 的,而是卖“前沿发现能力”的。
但这里有个问题,ChatGPT 那边也在做类似的事。上个月 ChatGPT 用一页纸解开了埃尔德什悬赏难题,手法和 Claude 这次几乎一样:未公开模型、自主完成、结果惊人。两家头部实验室都在用数学难题当推理能力的广告牌,这让我有点怀疑,是不是底层的大模型能力已经摸到某个共同瓶颈,所以大家不约而同地转向“极限测试”来制造差异化。如果是这样,那这次黎曼突破的真正看点就不是数学,而是推理链路的可验证性。
我自己的判断是,未来半年这个赛道会分化成两条路线。一条是“结果导向”,我管它叫“黑箱冲击”,模型给出结论,人类负责验证,验证不过就返工。另一条是“可解释推理”,模型把每一步推理过程拆成可审计的中间步骤,人类可以逐条检查。现在 Anthropic 和 OpenAI 都压在第一条路线上,但数学界要的是第二条。我上周在 Project 里试过让 Claude 解一个偏微分方程的数值解,它能给我对的数字,但让它把推导步骤写出来,就开始含糊了。这个体验多少让我对“自主证明”的含金量有点保留。
还有一个没被讨论的视角,版权。Anthropic 前阵子和作家群体那笔十五亿美元和解案刚落地,说明他们的训练数据里用了大量受版权保护的文本。数学论文的版权归属和文学作品不一样,但推理路径如果和某篇未公开的论文草稿重合,这个争议以后会很难缠。不过这些都是后话,现在急着下结论也没意思。
说回黎曼猜想本身。67.2%这个数字确实漂亮,但如果你去问一个做解析数论的朋友,他大概率会告诉你,这个方向的真正难点不在零点比例的下界,而在如何把下界的推进转化为对临界线本质结构的理解。换句话说,Claude 往前迈了一大步,但这一步迈在了一条已经被验证过的路上,而不是开辟了新路。这就像你开车从北京到上海,Claude 把平均时速大幅提升,但它并没有发现一条新的高速。
所以我的建议是,关注这个结果,但别急着把它当成“AI 解决千年难题”的里程碑。数学界会花几个月复核这个67.2%,如果证明过程能被拆解成可验证的推理链,那这是真正的突破;如果只是模型内部的某种隐式计算,那它更像一个工程奇迹,而不是数学发现。对做 AI 行业的人来说,真正值得盯的是 Anthropic 下一步会不会开放这个模型的推理日志。如果开了,说明他们对可验证性有底气;如果不开,那这个67.2%就只是一个精心包装的营销数字。
我这边测下来,Claude 的能力确实在快速逼近一个临界点,但离“可信任的数学合作者”还有一段距离。这个距离不是算力能填平的,是透明度和可审计性。
物界前沿