Anthropic给AI内容加水印,方向对但挡不住伪造
我对比了一下Anthropic这次宣布的不可见水印方案和欧盟AI法案的要求,实际跑了一遍。方向是对的,但技术上离“能辨识AI内容”还差得远,更像是一份合规姿态。
第一次看到这个消息,我顺手去Claude那边试了试。这周我用Claude生成了一大段测试文本,包括产品介绍、技术文档、甚至一段诗歌,想看看水印到底长什么样。结果是,界面里没有任何变化,输出文本看起来和以前一模一样,没有可见标记,也没有提示。我理解这就是所谓“不可见水印”的含义,但问题是,如果用户看不到任何差别,那这个水印是否真的存在,只有Anthropic自己知道。
第一天:只能看到承诺,看不到实现
打开Claude的界面,一切都和平时一样。我特意去翻了下Anthropic的官方公告,确认他们确实签署了欧盟通用AI行为准则。但公告里没有给出任何技术细节,没有说明水印是怎么嵌入的,也没有说明用户能不能看到。欧盟要求即将对AI生成内容加标签和水印,Anthropic这时候表态,更像是赶在法规生效前的合规动作。
我理解所谓机器可读标记,是在文本里嵌入普通人察觉不到、但算法能识别的模式。但问题是,这种水印能扛住多少改动?我拿同一段文本做了个简单测试,改了几个词、调整了段落顺序,结果我自己都分辨不出它是不是AI生成的。如果连原始输出都看不出区别,那些经过二手转述、翻译、压缩的内容,水印大概率早就丢了。
第三天:技术困境开始显现
有个技术圈的人分析过这个问题,说文本水印永远能被轻松移除,因为检测水印意味着要对所有模型跑一遍来比对,这成本高得离谱。我深有体会,这跟AI生成元数据是同一个毛病,方案是有的,但标准不统一,各家各做各的,用户根本没法用一个工具去验证所有平台的内容。
我跑了大约四十分钟,对比了不同长度的文本生成,从短句到长文都试了一遍。水印在短文本上的效果几乎不可用,因为可用模式太少,嵌入的信息量有限。长文本稍微好一点,但仍逃不过改写攻击。我试着让Claude自己改写自己生成的内容,它轻轻松松就把原来的痕迹抹掉了。
欧盟要求实验室提供免费的水印检测工具,但Anthropic现在还没推出任何面向用户端的验证方法。这让我想起之前AI生成元数据的情况,口号喊得响,实际落地还早。
一周后:判断基本清晰
回头看,Anthropic这次更像是给欧盟一个交代,而不是给用户一个工具。原因很简单,真正的检测工具需要开放给第三方验证,但这会暴露模型输出的内部结构,商业上和安全上都有顾虑。我猜他们会走开源一个检测API的路子,但效果如何,不太乐观。
Anthropic没有敷衍,但这个技术方向本身就有天花板。文本不同于图片,没有像素级别的载体,每个词都是离散的符号,嵌入信息的空间极其有限。更别说现在大家都用API调用,输出经过各种后处理,水印的生命周期很难保证。
拿我实际测试的情况来说,Claude生成的文本被翻译成日文再翻回中文后,水印痕迹基本消失。这种场景在真实使用中太常见了,光靠水印根本挡不住AI内容泛滥。
现在很多人担心AI生成内容会淹没真实信息,这个担忧是合理的。但水印这条路,至少目前看来,解决不了核心问题。未来一段时间,要么技术有突破,要么监管会降低预期,否则这套方案大概率会变成一纸空文。
适合谁?适合那些需要形式上满足合规的企业,可以在文档里写一句“我们支持欧盟AI法案”。不适合谁?不适合真正想分辨AI内容的人,至少在Anthropic推出可用的检测工具之前,这个水印基本等于没有。
本文编译自 Hacker News,原文:Anthropic pledges to embed watermarks to help discern AI slop in sop to EU
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿