给Claude加隐形水印,工程上比想象中难
Anthropic 给 Claude 文本加隐形水印这件事,技术难度被严重低估了,网友吵的隐私问题反而不是重点。
Anthropic 这次响应欧盟AI法案透明度规范,给文本加机器可读水印,图片加签名元数据,方向上没毛病。但作为一个在昇腾上跟算子打交道的人,我第一反应是:文本水印这东西,实现起来比看起来复杂得多,而且它跟图片水印完全不是一回事。
图片加签名元数据,本质上是查户口,在文件头里塞一段数字签名,标注来源和生成时间。SVG、PNG、JPG 这些格式都有元数据区,往里写东西不碰像素,实现成本很低,检测也容易,读文件头就行。但缺点同样明显:只要有人把图片重新编码一次,元数据就没了。截图、转格式、压缩,任何一步都能把签名洗掉,属于防君子不防小人。
文本水印则是另一种玩法。要在不改变语义和阅读体验的前提下,把信息嵌进词汇或句法的统计分布里。比如某些词在特定上下文中被选中的概率,或者句子的长度分布、句式结构,都可以作为载体。这个技术路线业内讨论了好几年,真正落到产品里做的没几家,因为要在采样阶段动手脚,直接影响生成质量。
我这边测下来,嵌入水印对生成分布的影响,类似编译器里做算子融合时动了数值精度,表面上看着没变化,跑起来才发现累积误差。模型生成时每个 token 的选择概率本身是连续的,你要在里面塞一个可检测的统计特征,就得人为制造局部偏移。偏移小了检测不出来,偏移大了文本质量肉眼可见地下降。这个平衡点,调起来非常费劲。
而且检测端也是个大问题。文本水印不像图片元数据那样读文件头就行,检测需要跑统计模型,把整段文本的词汇分布跟基准分布做对比。这意味着检测成本不低,要做成 API 服务,每次检测都得过一遍推理。如果水印嵌入端是免费的,检测端收费,那整个商业模式就变成了谁在使用入口谁买单。OpenAI 之前也提过类似方案,但一直没全量落地,估计就是卡在检测端的算力成本上。
还有个现实问题:水印在复制粘贴和部分编辑后还能存活,这个承诺很漂亮,但边界条件太多。改动到什么程度开始失效?翻译算不算编辑?改写算不算?如果用户让 Claude 生成一段文本,自己改掉三分之一再发布,水印还在不在?Anthropic 自己都说了,某些情况下生成内容可能没有水印,比如 AI 参与度不够高的时候。这个豁免条件本身就是一个大洞,等于承认了技术方案的局限性。
网友吵的隐私问题,我反而觉得不是核心。Claude 生成的内容本来就归用户所有,加个隐形水印不改变所有权,也不影响你拿去商用。
更值得关注的是这套机制能不能跑通,以及它会不会成为行业标配之后形成新的进入壁垒。毕竟现在大模型厂商都在卷透明度,欧盟法案在后面推着,水印能力迟早变成基础功能。
但话说回来,水印这东西跟加密一样,永远是道高一尺魔高一丈。有检测就有反检测,有嵌入就有剥离。文本水印目前最大的软肋在于:它依赖统计特征,而统计特征天然可以被改写破坏。未来大概率会出现专门的水印清洗工具,用低成本改写把特征抹掉。这不是危言耸听,图像水印这些年就是这么被玩坏的。
我的判断是:Claude 这次的文本水印方案,技术上能落地,但效果会打折扣。它能挡住大部分普通用户的无意传播,挡不住有意的清洗。相比之下,如果从生成时就绑定用户身份信息,配上可验证的签名机制,做成完整链路,或许比在统计分布里塞特征更抗清洗。Anthropic 现在做的只是第一步,后面还有很长一段路要走。
物界前沿