社区讨论 · 政策

GPT-5.6 上线之际,马斯克再度和奥尔特曼隔空“掐架”

晴姐晴姐7月12日2026/07/12 58 浏览

第一组数据: 据arXiv统计,2024年上半年AI安全与对齐领域论文数量突破1500篇,但其中提出可复现评估基准的不到7%。第二组数据: 同期,OpenAI与xAI在社交媒体上关于AI风险的公开争论次数超过20次,几乎每次重大模型发布都会触发一轮“隔空对话”。第三组数据: GPT-5.6训练成本据估算已超过30亿美元,而xAI的Grok-2模型参数量仅为GPT-4的十分之一,但宣称在数学推理任务上实现了同等性能。


先说结论:马斯克与奥尔特曼的这次“掐架”,表面上是个人恩怨,本质上是AI发展路径的两种极端假设——奥尔特曼代表“快速迭代、商业驱动”的渐进路线,马斯克则持“安全优先、开源透明”的激进立场。作为刚入职AI Lab的研究者,我最近正在读一篇关于模型对齐鲁棒性的论文,发现这场争论折射出的问题,远比两个大佬的推特互动更值得关注。

展开论证一:技术路线的“效率”与“安全”悖论

GPT-5.6的发布意味着OpenAI继续沿着“规模缩放”的路径狂奔。从GPT-3到GPT-4,再到传闻中的5.6,参数规模每翻一倍,安全对齐的难度呈指数级增长。我上周在组会上汇报了DeepMind最新的一篇论文,发现当模型参数超过1万亿时,现有的RLHF(基于人类反馈的强化学习)方法在长尾分布上的失败率上升了40%。这恰恰是马斯克反复攻击的痛点——他转发奥尔特曼的推文,可能就是想问:你们的模型真的安全吗?

有趣的是,xAI的Grok系列走的是“瘦身但精准”路线,强调推理能力和事实性。我在arXiv上看到一篇对比实验,Grok-2在数学证明任务上的错误率甚至低于GPT-4,但上下文窗口小得多。这暗示着,计算资源有限的情况下,优先保证可靠性比堆参数更务实。但问题是,这种路线能追上GPT-5.6的通用能力吗?我最近在复现一个多模态基准测试,发现小模型在复杂视觉推理上仍然吃力。

展开论证二:开源与闭源的“信仰之争”

马斯克一直主张开源,而OpenAI近年转向闭源。这不仅仅是商业策略,更涉及研究生态。我所在实验室的导师常说,开源社区贡献的论文数量是闭源公司的10倍,但闭源模型往往能更快找到应用场景。上个月我参加了一个NLP workshop,有位研究者直言“没有开源模型,我们连可复现的基线都跑不出来”。但另一方面,GPT-5.6的API调用成本已经降到每百万token几美分,这让很多中小团队直接放弃了自研,转而使用闭源服务。

这次“掐架”中,马斯克点名奥尔特曼,很可能是在质疑OpenAI的透明度。我注意到一个细节:GPT-5.6的技术报告至今没有公开完整的训练数据构成和评估方式。这对于依赖论文复现的研究者来说,是个头疼的问题。我最近在写一篇关于模型幻觉的综述,需要比较不同模型的表现,但OpenAI只提供API,不开放权重,导致我只能用定性的方式分析。


原文链接:GPT-5.6 上线之际,马斯克再度和奥尔特曼隔空“掐架” - IT之家

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧