花了两天翻完Astra那249页论文,说点不一样的
我花了两天试了一下,把OpenAI这篇Astra的249页论文从头翻到尾,又把数学家的指控帖和OpenAI的回应来回看了几遍。先说结论:这事值得关注,但跟网上吵的方向不太一样。
先给不混数学圈的朋友解释一下背景。Astra是OpenAI下一代模型,7月31号发了篇249页的论文,声称用大约2000美元的算力成本,在数学和理论计算机科学领域解决了十个长期未解问题,涉及高维几何、编码理论、群论、量子复杂性这些。十个问题里不少是厄尔多什这种大神留下的编号问题,比如第146号、第180号、第183号。
结果Scientific American那边报道,多名数学家跳出来说OpenAI没给已有研究成果应有的署名致谢,涉嫌学术不端。
我这边测下来,论文本身写得确实扎实,每个问题都给了具体构造和证明思路,还配了Lean形式化验证的代码。这点上OpenAI没偷懒。但翻到参考文献部分,确实有些地方处理得比较粗糙,有些关键的前人工作被一笔带过,甚至直接没提。有个研究同领域的数学家点名的几篇基础文献,我在论文里确实没找到对应引用。
这种事怎么说呢。学术圈里引用不规范挺常见,但Astra这个体量,这个宣传力度,出这种问题就有点尴尬了。尤其OpenAI自己在回应里说,理解数学家们对"莱顿人工智能与数学宣言"的疑虑,但又强调不能把完全由AI生成的证明归功于人类。这话听着有点偷换概念,因为指控的核心不是"归功于谁",而是"用了别人的成果不打招呼"。
OpenAI的回应里还提到,人类的职责是协助准备手稿、做形式化验证,对最终结果负责。这个定位我觉得没问题,AI生成论证,人来验证把关,流程上说得通。但"负责"两个字,恰恰包括了引用规范这块。你用了前人的结果当跳板,哪怕论证是AI推的,该谢的还是要谢。
优点方面,Astra这次展示的能力确实惊人,尤其是在数学这种需要长链条推理的领域。成本控制也很亮眼,2000美元级别的算力就干出这种活,比我之前试过的几个模型效率高不少。我上周刚上手DeepSeek-V4-Flash那阵子,跑过类似的推理任务,token消耗完全不是一个量级。
缺点也很明显。开源透明性还是老问题,模型本身不开放,论文里的核心论证虽然给了Lean代码,但中间的生成过程完全黑箱。引用规范这块确实有待改进,数学这种学科,历史积累就是地基,不打招呼就踩上去,迟早出问题。
适合谁呢?关注AI科研能力上限的人,这篇论文值得细读。想靠这个学数学的,别指望,Astra的推理过程没公开,你能看到的是结果和验证代码。不适合谁?想拿这个当学术范本的,算了,先等等看OpenAI怎么回应质疑再说。
这事最大的意义可能不在数学本身,而在AI参与科研的规范问题。以前是人写论文引用不规范,现在AI写论文引用不规范,但背后是几百个数学家几千小时的劳动成果。算力民主化是好事,但成果归属的规则,得先立起来。
物界前沿