社区讨论 · 政策

花了两天翻完Astra那249页论文,说点不一样的

路过路过8月8日2026/08/08 196 浏览

我花了两天试了一下,把OpenAI这篇Astra的249页论文从头翻到尾,又把数学家的指控帖和OpenAI的回应来回看了几遍。先说结论:这事值得关注,但跟网上吵的方向不太一样。

先给不混数学圈的朋友解释一下背景。Astra是OpenAI下一代模型,7月31号发了篇249页的论文,声称用大约2000美元的算力成本,在数学和理论计算机科学领域解决了十个长期未解问题,涉及高维几何、编码理论、群论、量子复杂性这些。十个问题里不少是厄尔多什这种大神留下的编号问题,比如第146号、第180号、第183号。

结果Scientific American那边报道,多名数学家跳出来说OpenAI没给已有研究成果应有的署名致谢,涉嫌学术不端。

我这边测下来,论文本身写得确实扎实,每个问题都给了具体构造和证明思路,还配了Lean形式化验证的代码。这点上OpenAI没偷懒。但翻到参考文献部分,确实有些地方处理得比较粗糙,有些关键的前人工作被一笔带过,甚至直接没提。有个研究同领域的数学家点名的几篇基础文献,我在论文里确实没找到对应引用。

这种事怎么说呢。学术圈里引用不规范挺常见,但Astra这个体量,这个宣传力度,出这种问题就有点尴尬了。尤其OpenAI自己在回应里说,理解数学家们对"莱顿人工智能与数学宣言"的疑虑,但又强调不能把完全由AI生成的证明归功于人类。这话听着有点偷换概念,因为指控的核心不是"归功于谁",而是"用了别人的成果不打招呼"。

OpenAI的回应里还提到,人类的职责是协助准备手稿、做形式化验证,对最终结果负责。这个定位我觉得没问题,AI生成论证,人来验证把关,流程上说得通。但"负责"两个字,恰恰包括了引用规范这块。你用了前人的结果当跳板,哪怕论证是AI推的,该谢的还是要谢。

优点方面,Astra这次展示的能力确实惊人,尤其是在数学这种需要长链条推理的领域。成本控制也很亮眼,2000美元级别的算力就干出这种活,比我之前试过的几个模型效率高不少。我上周刚上手DeepSeek-V4-Flash那阵子,跑过类似的推理任务,token消耗完全不是一个量级。

缺点也很明显。开源透明性还是老问题,模型本身不开放,论文里的核心论证虽然给了Lean代码,但中间的生成过程完全黑箱。引用规范这块确实有待改进,数学这种学科,历史积累就是地基,不打招呼就踩上去,迟早出问题。

适合谁呢?关注AI科研能力上限的人,这篇论文值得细读。想靠这个学数学的,别指望,Astra的推理过程没公开,你能看到的是结果和验证代码。不适合谁?想拿这个当学术范本的,算了,先等等看OpenAI怎么回应质疑再说。

这事最大的意义可能不在数学本身,而在AI参与科研的规范问题。以前是人写论文引用不规范,现在AI写论文引用不规范,但背后是几百个数学家几千小时的劳动成果。算力民主化是好事,但成果归属的规则,得先立起来。

3 条回复

?
Ctrl + Enter 快速回复
薛工
薛工8月9日

Lean形式化验证能确保结论正确,但中间推理的黑箱部分还是让人心里没底。引用问题可能不只是疏忽,而是模型本身在生成时就没能区分“自己推导”和“借用前人思路”。

郭观海
郭观海8月9日

引用不规范这事,换到硬件产品上就是供应商资料不写来源,后面出问题背锅都找不到人。不过两千美元算力能干出这个活,成本控制确实有点意思,就看这功能能不能落地到实际场景里了。

苏苏
苏苏8月8日

参考文献都能处理得那么糙……这跟我用WorkBuddy记后厨账一个道理,漏一笔账月底对账就抓瞎。细节都做不好的东西,谁敢信它能解决厄尔多什的难题啊。