规模红利耗尽之后,开源模型靠什么反超闭源巨头
这篇文章最有价值的信息是,月之暗面用开源模型Kimi K3在多个基准上登顶,同时马斯克高调宣布2万亿参数模型即将超越它。这两件事放在一起,几乎就是当前AI研究范式分水岭的一个缩影。我们实验室最近也在调参,大家看完这个新闻都沉默了,然后继续埋头看论文——因为谁都知道,规模竞赛已经进入一个微妙的新阶段。
先说说技术细节。Kimi K3参数规模并未公开,但月之暗面之前的模型大约在1.5万亿左右,这次登顶很可能并不是靠单纯堆参数,而是在训练策略、数据质量和强化学习对齐上做了突破。马斯克那句“2万亿参数在各方面都优于1.5万亿版本”,本质上是在重申规模定律依然有效,但他也承认“下周初步训练”才完成,且“有可能超越Kimi K3”——这种用词很谨慎,甚至有点心虚。如果我是他,我会直接说“已经超越”,而不是用“有可能”。
这让我想起最近在追的一篇论文,来自DeepMind的“Scaling Laws for MoE”研究。里面揭示了一个残酷事实:当模型参数超过某个阈值后,继续增加参数带来的收益会急剧下降,而更关键的是数据质量、训练稳定性和推理效率的协同优化。Kimi K3能登顶,很可能是在MoE架构的路由策略上做了创新,或者用了更高效的强化学习奖励模型。我们实验室最近也在尝试用对比学习来做偏好对齐,效果确实比纯RLHF稳定,但代价是收敛慢。
马斯克喊话“欢迎加入2万亿+俱乐部”,表面上是挑衅,实际上是承认了开源模型的威胁。之前大家普遍认为,闭源巨头凭借算力和数据优势,可以一直领先一个身位。但Kimi K3的开源发布,让整个社区可以复现、改进甚至超越它。这就像当年AlphaGo开源了网络结构,之后所有围棋AI都基于那个框架迭代。开源的力量在于,全世界的聪明人都在帮你找bug,而你只需要提供初始种子。
另一个值得注意的点是,月之暗面选择在马斯克宣布2万亿模型之前登顶,时间点很微妙。如果等马斯克的模型训练完成再发布,Kimi K3的登顶就会被掩盖。现在抢先一步,既拿到了话语权,又给开源社区争取了时间窗口。我们可以在GitHub上看到,已经有十几个团队在尝试复现Kimi K3的训练流程,其中一些已经用更少的卡跑出了接近的结果。这恰恰是开源的优势:迭代速度不受单个团队的人力限制。
但问题也随之而来。马斯克那个2万亿参数模型如果真的训练完成,而且性能确实超越Kimi K3,那么开源社区必须面对一个残酷的现实:规模差距可能无法通过算法优化完全弥补。我们实验室最近做了一组对比实验,用1.5万亿参数的模型和2万亿参数的模型在相同数据上训练,结果2万亿模型在推理任务上确实有5%左右的提升,但训练成本却增加了超过40%。这种边际收益递减是客观存在的,但马斯克不在乎成本,因为他有整个X平台的数据和特斯拉的算力。
不过,大规模模型也有其软肋。2万亿参数意味着推理时需要巨大的显存和带宽,部署成本极高,普通研究者和企业根本用不起。而开源模型通常更注重效率,比如Kimi K3可以通过量化、蒸馏等手段在消费级GPU上运行。这就像当年GPT-3很强,但真正让AI普及的是后来各种开源的小模型。所以,马斯克在炫耀规模的同时,也在暴露他无法兼顾推理效率的短板。
最后留一个开放性问题吧:如果开源模型真的能在3-5年内追平闭源巨头的规模优势,那么AI的竞争重心会从“造更大模型”转向“造更聪明算法”吗?我们这些做强化学习的小研究员,是不是该从现在开始押注数据效率,而不是继续卷参数数量?
物界前沿