社区讨论 · 政策

2万亿参数:马斯克的赌注是Scaling Law的最后一舞还是新篇章?

麦肯曹麦肯曹7月18日2026/07/18 65 浏览

当模型参数从1.5万亿跃升至2万亿,增长的这5000亿参数究竟意味着什么——是边际收益递减,还是质变临界点?马斯克在X上轻描淡写的一句“Grok 4.6训练进入最后阶段,下周完成初步训练”,背后是xAI对Scaling Law近乎偏执的信仰。但在这个算力成本飙升、推理效率被反复拷问的节点,一味的堆参数真是最优解吗?

从行业趋势来看,大模型竞赛已进入第二阶段:前半程是“谁更快达到千亿参数”,后半程是“谁能用更少的参数做更多的事”。OpenAI、Google、Anthropic无一例外都在追求“小模型+长上下文+高推理效率”的组合,而xAI逆势而上,把参数规模推到一个新高度。这让我想起麦肯锡做战略分析时常用的一个框架:任何技术路线的选择,本质上都是对“资源投入、时间窗口、竞争壁垒”三者的权衡。马斯克的选择,透露出他独特的战略判断。

先看xAI的SWOT分析:

优势(Strengths):马斯克拥有特斯拉的Dojo超级计算机集群,且xAI的算力可以依托X平台(原Twitter)的实时数据流。2万亿参数模型若能训练成功,将直接碾压当前所有开源和闭源模型的规模天花板,在复杂推理、多模态融合、长文本理解等场景上理论上具备绝对优势。

劣势(Weaknesses):训练成本极高,2万亿参数的训练算力需求按当前A100/H100市价估算,单次训练成本可能超过2亿美元。而且推理成本同样惊人——一个2万亿参数的模型,每次推理的token成本会是1.5万亿版本的数倍,这违背了xAI宣称的“让AI更便宜”的初衷。更重要的是,xAI目前的团队规模远小于OpenAI和Google,能否在工程层面稳控如此庞大的模型存在不确定性。

机会(Opportunities):马斯克手握X平台的海量用户生成内容,Grok可以直接接入X进行实时检索和对话,形成数据飞轮。如果Grok 4.6的推理速度能如马斯克所说“远超当前版本”,它可能成为第一个同时具备“超大参数+实时数据+低延迟”的商用模型,在金融分析、舆情监控、实时问答等场景建立护城河。

威胁(Threats):OpenAI的GPT-5传闻已在路上,Google的Gemini 2.0也在加速。更关键的是,Meta的Llama 3.1 405B虽然参数仅4千亿,但通过开源生态吸引了大量开发者,形成了“参数少但应用广”的格局。如果xAI专注参数堆砌而忽视应用生态,很可能步IBM Watson的后尘——技术强大但商业落地困难。

对比两个路线:xAI的“堆参数” vs. 行业的“效率优先”。

对标海外案例,最值得参考的是Meta的Llama 3.1 405B。Meta选择了一条完全不同的路:参数规模控制在一个可负担的范围(405B),但通过MoE(混合专家架构)、多轮强化学习、以及开源策略,让模型在推理、编程、数学等基准测试上逼近甚至超越GPT-4o。更关键的是,开源让全球开发者围绕它构建了丰富的工具链和垂直应用,形成网络效应。反观xAI,Grok至今仅通过X Premium订阅用户使用,封闭生态限制了其数据反馈和迭代速度。

!(https://bbs-physixfrontier-com-data.oss-cn-hongkong.aliyuncs.com/collector/article-images/20260718/forum_1625_xha8b

原文链接:马斯克:Grok 4.6 训练进入最后阶段,2 万亿参数模型下周完成初步训练 - IT之家

1 条回复

?
Ctrl + Enter 快速回复
韩梦瑶
韩梦瑶7月24日(已编辑)

自己组装过一台多卡服务器,对这种算力需求深有体会。2万亿参数单次训练成本2亿美元,推理成本更吓人。如果xAI不搞开源,那生态优势就完全被Llama 3.1的405B抢走了,堆参数不如堆应用。