
蒸馏风波之后,模型能力不是唯一指标
标题:蒸馏风波之后,模型能力之外还要看可替换性
9月9日,CISA、NSA、FBI 联合警告,点名六家中国 AI 公司,包括 DeepSeek、Alibaba、Moonshot AI,称其自 2024 年底起,用工业级蒸馏从 GPT、Claude 等美国前沿模型批量抽能力。据说,有美国头部模型公司也披露过类似活动。报告称,这是核心开发方式。
过去选型主要看模型能力、成本和集成,跑分高、补全快,单价、缓存、并发,API 是否顺手。现在要多想一层,能力来源能不能解释,合规事故会不会放大成本,换供应商要不要重写链路。
这件事会落到工具链里,形成隐性依赖。调用模型时,实际买到的包括补全、训练数据、许可证、评估口径,以及对方和上游模型之间的关系。
蒸馏在工程上很具体。拿一个强模型生成大量输入输出,清洗后喂给弱模型,让它学格式、学推理链、学工具调用习惯。跟 Copilot 比的话,我们早就在做类似事,让大模型生成单测,再把样例放进内部知识库,给小模型做微调。差别只在规模、来源和许可。
我这边用 DeepSeek 和 Qwen 大约一个月,主要跑代码摘要和文档初稿。DeepSeek 的中文代码解释比较省事,Qwen 在长文档抽取上够用。物界这个插件刚试几天,补全逻辑有优点,但长上下文一长就忘。问题也明显,供应商换底座后,我的 prompt、评测集、fallback 都要重调。所谓稳定,很多时候只是接口没改,内部行为早变了。
企业真正要处理的是能力是否可审计。比如一个代码审查工具声称自研,但输出风格、漏洞模式、误报特征都像从某个商业模型蒸馏来的。客户会追问训练边界、评估来源、许可证链条能不能提供。答不上来,效果问题就变成供应链问题。
我之前写过《把 AI 生成内容里的水挤出来》,工具选型也一样。别只问哪个模型聪明,要问能不能换。标准接口、本地代理、私有评测集、响应留痕,听起来不性感,但采购和审计时很管用。
我最近刚上手 Edge AI Daily,里面反复提技术管制风险,跟这次警告是同一类问题。蒸馏不一定违法,中国模型也不必然不能用,企业不能继续把模型当黑盒。至少三件事要做,关键任务保留人工预处理,脏数据别让模型自动洗,建立自己的小评测集,不靠厂商 benchmark,给模型调用加版本号和日志,出问题能定位是 prompt、底座还是业务逻辑。
我的判断是,未来半年到一年,企业采购会先筛可替换性,再看模型能力。跑分仍然有用,但采购门槛会更多。模型网关、评估代理、合规留痕工具会有一波需求。对独立开发者也是提醒,别把产品押在某个模型的补全手感上。产品最好把模型当可替换零件。
📌 本文编译自 TechRadar,原文见 https://www.techradar.com/pro/security/fbi-nsa-warn-chinese-ai-companies-like-deepseek-and-alibaba-are-reportedly-carrying-out-industrial-scale-distillation-campaigns-to-boost-their-models
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿