社区讨论 · 政策

50种语言的背后,谁在悄悄污染语料库

论文看不完论文看不完8月13日2026/08/13 213 浏览

我最近在实验室看论文,看累了就爱刷点技术圈的新闻放松。今天刷到一条,说Web Scraper这个浏览器插件用AI一口气翻译成了50种语言。乍一听挺酷的,一个工具从英文扩展到半个地球的语言,用户门槛直接削平。但紧接着我又刷到另一条研究,说亚马逊的科学家发现,现在网上超过一半的句子都被翻译成了两种或更多语言,其中大量是AI翻译的。两个消息搁一块儿看,忽然就觉得哪里不太对劲。

做网站翻译这事,放到三四年前是个正经工程。我在学校帮老师做过一个小工具的中文版,那时候还是找翻译公司按字数报价,来回校对了好几个星期。现在倒好,把界面字符串丢给大模型,一个晚上就出50种语言。效率确实吓人,质量呢?我点开Web Scraper的公告看了看,他们自己也承认,翻译是AI生成的,后续靠社区反馈修正。这态度还算诚实,但那句“后续靠社区修正”让我有点担心,一个插件火了可能有几百万用户,可那些小语种的用户本来就没几个,谁去修?修了又怎么保证改对?

我更在意的是另一层。翻译本身不是问题,问题是这些AI翻译的内容正在悄悄回流到模型训练数据里。亚马逊那个研究说得很直白,现在网上大量句子是机器翻的,翻完又被别的模型抓去训练,等于模型在拿自己的输出当教材。这让我想起上周在本地跑GGUF模型时遇到的一件怪事,我拿一个70B的模型问一个中文成语,它答得驴唇不对马嘴,里头的解释怎么看都像从英文直译过来的。当时我以为是量化精度的问题,换了好几个量化等级都一样,后来查了半天,发现是训练数据里混了机翻的语料。模型自己都不知道自己在说什么。

这就形成了一个循环。小语种内容少,AI翻译来凑,凑出来的内容质量不稳定,但搜索引擎和训练爬虫分辨不出来,照样抓走。抓走之后,下一轮模型就学会了这种“翻译腔”,生成的内容更别扭。我导师前几天还念叨,说现在审稿碰到的论文英文越来越“通顺”了,但总感觉哪里不对,像隔了一层。我当时没接话,现在想想,可能就是这个原因。

Web Scraper这产品本身没毛病,甚至可以说是个好样本。用AI翻译降低本地化成本,让一个工具服务全球用户,这事我举双手赞成。我也不是说要抵制AI翻译,事实上我自己写教程的时候也会拿它当草稿底子。问题在于,翻译行业的行话叫“译后编辑”,就是机器翻完人得再过一遍。现在很多场景把这步省了,直接发布,直接进语料库。省了这一道工序,短期看是省了钱,长期看是在给整个生态掺沙子。

我身边有个做独立开发的朋友,产品卖到日本和巴西,用的就是AI翻译。他跟我说,用户反馈里确实有说“读得懂但别扭”的,但日本用户通常比较客气,说多了就习惯了。巴西用户就直接多了,有人干脆说,你能不能把英文版给我看。这个反馈挺有意思:AI翻译的门槛是降下来了,但用户对内容的信任度也降下来了。你连界面都懒得找真人翻译,我凭什么相信你的产品靠谱?

写到这里,我忽然想到一个更实际的问题。现在这些AI翻译的网页,Google的爬虫是按照什么原则收录的?我在网上翻了翻,发现连SEO圈的人都在争论,说AI翻译的内容到底算不算原创,算不算高质量内容。大家都没底。可以预见的是,未来几年我们搜到的小语种网页,会越来越多地带着机翻味。这就像河流上游的化工厂,你现在喝水还没事,但鱼已经慢慢变少了。等发现不对劲的时候,整条河都脏了。

我倒不是想唱衰AI翻译,只是觉得这件事得有个度。翻译完至少要让人工过一遍,至少要在页面上标注“AI生成,仅供参考”。这话说出来像个老古董,但你看维基百科,志愿者一条条手工翻译的词条,直到今天还是质量标杆。技术解决的是规模问题,解决不了信任问题。现在这个信任缺口还不大,但等它大到用户开始怀疑“网上还有没有真话”的时候,就补不回来了。

那么问题来了:当AI翻译的内容多到一定程度,原生的语言表达还剩多少?我们这一代人,可能得亲眼看着一门语言的“纯净度”被慢慢稀释掉。这话有点重,但我是真这么想的。


:pushpin: 本文编译自 Hacker News,原文:How Web Scraper was translated into 50 languages with AI | Web Scraper
版权归原作者所有,本文为基于公开报道的编译与独立分析。

2 条回复

?
Ctrl + Enter 快速回复
盒马出来的

笑死,我前两天刚用这插件试了试小语种,翻得跟机翻初稿似的……有些词根本就不是那个意思。社区修正?等有人发现都啥时候了

冯sir
冯sir8月13日

不同意,这结论太绝对了。我拿Claude跑了阵子小语种翻译,质量并没有楼主担心的那么糟。AI翻译反而能先把骨架搭起来,人工修起来比从零翻译快多了。语料库被污染是问题,但把锅全甩给AI不太公平。