
当美国大模型开始“抄”中国作业:一个研一学生的观察
刚进实验室那会儿,导师让我复现一篇NeurIPS论文的实验。我对着开源代码敲了三天,终于跑出一个结果,却比论文里宣称的低了五个百分点。我怀疑自己写错了,跑去问师兄。师兄看了一眼说:“你用的超参数不对,作者其实用了另一种trick,但没写在论文里。”我这才明白,学术圈的“抄作业”从来不是复制粘贴,而是得猜透人家没写出来的那些门道。
最近读到一条新闻,OpenAI前首席技术官穆拉蒂创立的Thinking Machines发布了首款模型Inkling。标题让我一愣——“沿用DeepSeek架构,美国大模型开始抄中国作业”。我忍不住点进去看,发现Inkling的混合专家架构主要沿用DeepSeek-V3,后训练冷启动还用了Kimi K2.5等开放模型生成的数据。这就像我当年对着师兄的代码改参数,只不过这次,抄作业的人变成了美国顶尖的AI团队。
短期看:一个“高配版”中国模型,但没抄好
从短期视角看,Inkling的出现是一个标志性事件。过去我们总说中国大模型在追赶美国,从GPT-3抄到Llama,现在轮到美国团队直接借鉴中国模型的架构了。这说明DeepSeek-V3的混合专家(MoE)架构确实有其独到之处——在同等计算资源下,MoE可以激活更少的参数,从而降低推理成本。穆拉蒂选择“沿用”这个架构,等于用行动承认了DeepSeek在工程上的创新。
但有意思的是,Inkling在多项基准评测中落后于Kimi K2.5。这就像一个学生抄了学霸的解题步骤,却因为没理解底层逻辑,反而比原版考得差。我猜问题出在“后训练冷启动”这一步。Kimi K2.5生成的数据虽然开放,但模型的训练数据质量、对话策略、奖励模型这些软实力,可能才是真正的护城河。穆拉蒂团队拿到了“食材”,却没有掌握“火候”。
这让我想起实验室里常见的现象:有人从GitHub上克隆了别人的项目,想换个数据集跑出同样效果,结果发现训练代码里隐藏着很多针对原始数据集的预处理逻辑。架构可以抄,但数据分布、训练细节这些“隐性知识”很难复制。
配图也应该放在这里,但我先插入图片:
长期看:中国开源生态的“反哺”效应,以及美国可能的反超
从长期视角看,这件事的意义超出了单一模型对比。它说明中国大模型的开源策略正在产生“反哺”效应——当DeepSeek、Kimi等团队选择开源模型权重甚至训练数据时,他们实际上在定义一种技术标准。美国公司如果不自己从头训一个更先进的架构,就只能用这些开源成果作为起点。这有点像Linux在操作系统领域的角色:微软最终不得不接纳开源,因为整个生态已经被Linux定义了。
但我也有一点担忧。穆拉蒂团队虽然在第一轮评测中落后,但他们有更强的工程能力和资金储备。短期看他们抄作业没抄好,长期看他们可能基于这些架构做出更高效的改进。我在读论文时注意到,很多突破性工作往往来自对现有架构的“微创新”,而不是完全重起炉灶。美国团队如果吃透了DeepSeek MoE的机制,再结合他们在强化学习、数据合成上的积累,完全有可能在下一代模型上反超。
[!abstract] 这就像实验室里,新来的师弟虽然复现不出师兄的最高分,但他在理解原理后,可能用更简洁的代码实现同样功能。创新的起点往往是模仿,关键是模仿之后能否超越。
我的研究心得:不要只关注“抄没抄对”,要关注“为什么能抄”
作为一个刚入行的学生,这个新闻给我的最大启发是:开放的学术生态才是技术进步的真正加速器。DeepSeek选择开源,Kimi选择开放
原文链接:https://www.tmtpost.com/8073623.html
物界前沿