AI抽取风波,到底是偷配方还是抄作业
这事像餐厅后厨。你闻出菜味像隔壁米其林,到底是偷配方,还是同一批食材谁都能做出来。
最近彭博这条新闻挺猛。美国多家机构把 DeepSeek、Moonshot AI、Alibaba、MiniMax、StepFun 和 Z.AI 点名,说它们系统性复制美国模型。Anthropic 此前指控阿里用数千个欺诈账户提取 Claude 能力。阿里否认,还起诉美国政府,要求把它从五角大楼黑名单里拿出来。OpenAI 也说过,收集到一些证据,正在审查 DeepSeek 是否不当蒸馏其模型。更有意思的是,报道里提到,虽然 DeepSeek 被一些跨部门评估认为有国家安全风险,但商务部暂时没把它放进贸易黑名单。这说明指控、风险判断、实际管制是三层,不是同一张网。
但这里有两个词经常被搅在一起,蒸馏和抽取。蒸馏像老师傅把经验压成小徒弟能用的菜谱,行业里常见。CSIS 的文章也提到,美国实验室也用蒸馏,DeepSeek 甚至发布过基于 Qwen 和 Llama 的 R1 蒸馏模型。抽取更像拿别人的 API 当免费题库,批量问、批量收集答案,再喂给自己的训练管线。问题不在像不像,在怎么拿到答案。
美国闭源模型路线,像把菜做成中央厨房。模型能力藏在托管服务里,外面只看到输出。优点是方便,安全评测、日志、滥用检测都握在平台手里。缺点是用户拿不到完整训练数据和权重,评测只能看表面。我这三周拿 GLM-5.2 跑长文摘要、结构化表格和代码小任务,也把这一个月用过的开源模型和 API 放一起比。实测了一下,输出风格、拒绝回答、错误类型,都能模仿,但来源根本没法从一次跑分里确认。跑个分看看,最多只能看出它会不会,看不出它从哪来。我也拿几个开源模型做同题测试,发现中文事实性错误和过度服从很像,但这类相似不能证明抽取。
开源权重路线,像把菜谱摊在桌上。谁都能下载、改、跑。优点是透明,至少能审计权重和许可,社区能测。缺点是成本压力小,追赶快,也更容易被质疑站在别人肩膀上。GLM-5.2 这种把权重公开的模型,商业价值要看能不能给出可追溯的训练来源、数据许可和评测记录。闭源有闭源的好处,开源有开源的毛病,不能只挑一边骂。
真正该分开算的是三笔账。技术账是蒸馏是不是常见,答案是常见。合同账是有没有绕过条款、欺诈账户、批量抓取,这才是指控核心。监管账是把受控技术通过 hosted API 送出去,和权重公开发布,边界不同。报道里有个很现实的点,模型权重公开不一定构成出口,但把受控技术放进托管 API,可能就要过许可。
出口管制不是玄学。对做测评的人来说,最怕把所有模型都塞进偷这个筐里。那样只会让合规成本误伤开源社区。但反过来,也不能拿行业惯例当免罪符。如果一家公司真用几千个账号去薅 API,再用这些数据训竞品,那它省下的算力,可能来自别人承担的安全和滥用成本。这个价格值不值,不在嘴硬,在证据链。
我平时写工具测评,喜欢把账算明白。这次也一样。别急着问中国模型是不是抄,也别急着说美国机构是不是扣帽子。该看的是日志、账户模式、API 条款、数据去重、训练管线和第三方审计。Anthropic 的指控如果只有输出相似,说服力不够。中国公司如果只说我们独立训练,也需要可验证材料。
不过我最近这几天在试 AI agent、Agentic engineering 和 Vibe coding,也 Docker 刚碰四天,体会挺直接。智能体越能自动干活,越需要留痕。模型抽取这事本质也是留痕问题。没有过程记录,结果再漂亮都像黑盒。我前面写过一篇关于盘后日报的话,观点没变,无法实时溯源,后面的解释就弱。现在看模型能力来源,也一样。
普通用户别把任何模型当绝对原创来源。企业先做数据血缘和 API 使用审计。监管要把蒸馏、违反条款、出口管制分开算。否则最后会变成两边都委屈,一边觉得别人偷答案,一边觉得别人拿行业惯例卡脖子。
后面就看有没有更细的审计和诉讼材料了。
📌 本文编译自 Bloomberg Tech,原文 https://www.bloomberg.com/news/articles/2026-09-09/us-says-alibaba-deepseek-have-systematically-siphoned-ai-models
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿