AI公司的“双标”困境:从数据共用到模型护城河
这就像一个人一边在公共图书馆借书抄书,还宣称“知识共享是进步的基石”,另一边却偷偷给自己的书架装上指纹锁,生怕别人翻他笔记。纳德拉这次点名批评Anthropic等模型公司,在我看来,戳中的不只是商业竞争里的虚伪,更是整个AI研究社区还没来得及解决的底层矛盾:我们到底该用什么规则来处理“训练数据”和“模型蒸馏”这两件事?
我最近在组会里正好跟师兄争论过这个点。我们组做的是分布式训练,但隔壁组有同学在做蒸馏相关的论文,经常抱怨“想复现Anthropic的Claude 3.5 Sonnet效果,但人家API返回的logits做了限制,蒸馏根本做不了”。而另一边,这些公司自己训练模型时,又把互联网上各种文本、图片、代码一股脑抓去训练,美其名曰“合理使用”(fair use)。这种不对称,确实让人不舒服。
两条路线的对比:开源生态 vs 护城河逻辑
我们可以把当前AI模型公司的立场分成两条路线,正好形成对比:
-
路线A:开源/半开源,拥抱蒸馏
- 代表:Meta的Llama系列、Mistral、部分学术模型
- 逻辑:公开权重,允许微调和蒸馏,甚至鼓励社区贡献
- 代价:模型可能被竞品快速复制能力,商业变现困难
- 纳德拉的微软其实也部分站在这条线上——Azure提供了很多开源模型的托管服务,但微软自己也有闭源的Phi系列,立场并不纯粹
-
路线B:闭源+严控蒸馏
- 代表:Anthropic、OpenAI(GPT-4之后)、Google部分模型
- 逻辑:API调用协议里明确禁止“使用输出训练竞争模型”,技术上限制logits返回、限制上下文长度
- 代价:被指责“双标”——自己训练时用公开数据,别人想用他们的输出训练就被禁
- 纳德拉批评的就是这条路线
[!quote] 纳德拉的原话:“一些模型厂商一边主张拥有利用公开数据训练AI模型的‘合理使用’,一边又限制他人蒸馏自己的模型。” 这句话其实点出了一个法律和伦理的灰色地带:如果公开数据可以被合理使用,那模型输出的数据算不算“公开数据”?
蒸馏技术:为什么它成了敏感点
作为一个刚入行的研究者,我最近读了一篇论文叫《The Unreasonable Effectiveness of Distillation》,里面提到大模型蒸馏的收益非常惊人——用一个小模型通过模仿大模型的输出,可以在很多任务上达到90%以上的性能。这意味着,如果你能拿到一个闭源模型的大量输出数据,你就能以极低成本复现一个类似能力的模型。
这解释了为什么Anthropic和OpenAI要拼命限制蒸馏。因为他们投入了数十亿美元训练出来的模型,如果被人通过API批量调用、蒸馏出近似模型,那他们的商业壁垒就瞬间崩塌。但问题在于,他们自己训练模型时,用的也是互联网上的公开数据——包括别人的论文、博客、代码,甚至竞争对手的模型输出(如果没被禁止的话)。这种“只许州官放火,不许百姓点灯”的立场,在学术圈里非常不受欢迎。
法律上的“合理使用”争议
我最近在补一些AI法律课程,了解到“合理使用”在美国版权法里是一个很模糊的原则。它主要考察四个因素:使用的目的(商业还是非营利)、原作品的性质、使用比例、对市场的影响。AI公司训练模型时,通常声称自己使用的是“非商业性的研究目的”或“转换性使用”,但最终模型还是被用于商业服务。这个矛盾一直没有被法院彻底厘清。
而蒸馏这件事,在法律上更复杂。如果我把一个模型的输出当作“数据”来训练另一个模型,这个“输出”本身是否受版权保护?如果模型生成的文本是全新的,那它可能没有版权;但如果它生成了与训练数据高度相似的文本,就可能侵权。目前没有一个清晰的判例。
[!note] 一个有趣的视角:如果模型训练时的“合理使用”成立,那么蒸馏时使用模型输出也应该成立,因为输出本质上也是公开数据的一部分。但模型公司显然不这么认为——他们想把自己模型的输出定义为“受保护的服务成果”,而不是“公开数据”。
我自己的判断:行业需要新的社会契约
纳德拉这次批评,表面上是商业竞争里的互相指责,但深层次反映了AI产业正在从一个“数据共有”的野蛮生长阶段,转向“模型私有”的圈地运动。我最担心的是,如果这种“双标”成为常态,最终会伤害整个研究社区。
- 对大公司来说,他们可以继续用公开数据训练,但禁止别人用他们的输出数据,这会导致数据流向单向化——小公司和学术机构越来越难获得高质量的训练资源。
- 对研究者来说,我们可能面临一个“模型暗箱”时代:所有闭源模型
物界前沿