先让你随便抄,再要求你交代出处,日本这盘AI棋有点意思
像一间急着补课的补习班,先是跟学生说参考资料随便抄,不用管原作者同不同意,抄着抄着发现家长不干了,又赶紧补了一条规矩:抄了谁的,必须登记在案。日本政府这两天放出的风声就是后半句:打算要求AI公司披露训练数据来源。
这事得从头捋。今年早些时候,日本在AI训练数据上的态度基本是敞开大门,明确说不会对训练AI所用的数据实施版权保护。非营利还是商业目的,哪怕是从非法网站拿到的数据,只要搞得到就能用。当时连LeCun都发文说,日本成了机器学习的天堂。学术界和商界一片敲锣打鼓,觉得终于有个国家敢在数据上放开手脚了。
但放开归放开,日本内部一直有人心里打鼓。数字化担当大臣松本尚那句话说得很直白,跟不上AI发展,日本会沦为AI殖民地。这句话说在个人数据保护法修正案敲定的时候。一边放开版权,一边又在隐私问题上松绑,当时的争议就不小。结果几个月过去,风向变了,政府现在要往回找补,让AI公司交代训练数据到底从哪来的。
有意思的地方在这。日本前后这两步,看起来方向相反,其实目的可能是同一个:补课。放开版权,是想解决AI的数据供给问题,让模型先跑起来。要求披露,是想解决数据的社会信任问题,让企业和民众敢用。两步棋都奔着快速追赶去,但合在一起就拧巴了。
我这两周用GPT-5.6和AI agent跑项目,对训练数据这事多少有点切身体会。你喂给模型的东西,混合了公开资料、用户内容、第三方数据集,有时候还有用户自己传上去的私有文档。真要去追每一段文本的来龙去脉,工程量大得吓人。我平时做调查报道,查一个新闻来源都要来回复核好几遍,AI公司要披露的是整个训练语料的出处,这个复杂度不是一个量级的。
而且这里有个更绕的问题。如果今年早些时候已经放开了版权,意味着不少公司可能已经用非法或灰色来源的数据把模型训完了。现在要求披露,这些公司怎么交代?坦白说数据来自盗版站?还是含糊其辞说来自公开网络?如果披露了会面临追责,那就没人愿意好好披露;如果不追责,那披露就成了一张废纸。日本首部AI法今年5月通过的时候,连针对恶劣行为的惩罚措施都没写,现在这个披露要求会不会也是没有牙齿的,很值得打个问号。
对比一下欧洲的路线,欧盟AI法案是先把风险分级,高风险场景卡得死死的。美国的路线是行业自律加行政命令,边走边看。日本跟这两条路都不一样,它走的是先放纵后收口,先让你把东西造出来,再要求你交代原料。这个路径有一个致命问题,模型不是做完就固定不动的,迭代、微调、蒸馏,每一轮都会引入新的数据。今天披露了,明天模型更新了,又要重新披露。披露不是一次性的,是持续性的义务。日本的企业本来在AI投入上就偏保守,再加一道持续披露的枷锁,到底是促进发展还是徒增负担,我持保留意见。
我查了下这份报道的背景,日本是真的急了。错过了互联网,错过了新能源车,AI这波再赶不上,整个经济盘子都没什么故事可讲。但着急的人容易做自相矛盾的决定。前脚说数据随便用,后脚说必须交代来源,这中间没有一个过渡,企业怎么适应?我这两天在试PHP,刚上手的时候也这样,一会儿觉得这个写法对,一会儿又推翻重来,折腾到最后反而不知道哪条路是对的。日本现在的AI政策就给我这种感觉,方向在动,但每一步都在给上一步打补丁。
当然,也可能我想偏了。披露训练数据这件事,从长期看确实是让行业更透明、更健康的方向。如果日本真能摸索出一套可操作的披露机制,让数据来源可追溯,同时不影响模型迭代速度,那它反而走出了一条跟欧美都不一样的路。毕竟LeCun夸过它是机器学习的天堂,天堂里也得有规矩,这个道理谁都懂。
问题只在于,先放开后收紧这套打法,数据已经流出去的这半年多,企业手里那些模型,到底还清白不清白。
本文编译自 Hacker News,原文:https://www.japantimes.co.jp/news/2026/08/19/japan/ai-training-data-disclosure/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿