社区讨论 · 政策

Anthropic给AI内容加水印,方向对但挡不住伪造

冷水专业户冷水专业户8月11日2026/08/11 201 浏览

我对比了一下Anthropic这次宣布的不可见水印方案和欧盟AI法案的要求,实际跑了一遍。方向是对的,但技术上离“能辨识AI内容”还差得远,更像是一份合规姿态。

第一次看到这个消息,我顺手去Claude那边试了试。这周我用Claude生成了一大段测试文本,包括产品介绍、技术文档、甚至一段诗歌,想看看水印到底长什么样。结果是,界面里没有任何变化,输出文本看起来和以前一模一样,没有可见标记,也没有提示。我理解这就是所谓“不可见水印”的含义,但问题是,如果用户看不到任何差别,那这个水印是否真的存在,只有Anthropic自己知道。

第一天:只能看到承诺,看不到实现

打开Claude的界面,一切都和平时一样。我特意去翻了下Anthropic的官方公告,确认他们确实签署了欧盟通用AI行为准则。但公告里没有给出任何技术细节,没有说明水印是怎么嵌入的,也没有说明用户能不能看到。欧盟要求即将对AI生成内容加标签和水印,Anthropic这时候表态,更像是赶在法规生效前的合规动作。

我理解所谓机器可读标记,是在文本里嵌入普通人察觉不到、但算法能识别的模式。但问题是,这种水印能扛住多少改动?我拿同一段文本做了个简单测试,改了几个词、调整了段落顺序,结果我自己都分辨不出它是不是AI生成的。如果连原始输出都看不出区别,那些经过二手转述、翻译、压缩的内容,水印大概率早就丢了。

第三天:技术困境开始显现

有个技术圈的人分析过这个问题,说文本水印永远能被轻松移除,因为检测水印意味着要对所有模型跑一遍来比对,这成本高得离谱。我深有体会,这跟AI生成元数据是同一个毛病,方案是有的,但标准不统一,各家各做各的,用户根本没法用一个工具去验证所有平台的内容。

我跑了大约四十分钟,对比了不同长度的文本生成,从短句到长文都试了一遍。水印在短文本上的效果几乎不可用,因为可用模式太少,嵌入的信息量有限。长文本稍微好一点,但仍逃不过改写攻击。我试着让Claude自己改写自己生成的内容,它轻轻松松就把原来的痕迹抹掉了。

欧盟要求实验室提供免费的水印检测工具,但Anthropic现在还没推出任何面向用户端的验证方法。这让我想起之前AI生成元数据的情况,口号喊得响,实际落地还早。

一周后:判断基本清晰

回头看,Anthropic这次更像是给欧盟一个交代,而不是给用户一个工具。原因很简单,真正的检测工具需要开放给第三方验证,但这会暴露模型输出的内部结构,商业上和安全上都有顾虑。我猜他们会走开源一个检测API的路子,但效果如何,不太乐观。

Anthropic没有敷衍,但这个技术方向本身就有天花板。文本不同于图片,没有像素级别的载体,每个词都是离散的符号,嵌入信息的空间极其有限。更别说现在大家都用API调用,输出经过各种后处理,水印的生命周期很难保证。

拿我实际测试的情况来说,Claude生成的文本被翻译成日文再翻回中文后,水印痕迹基本消失。这种场景在真实使用中太常见了,光靠水印根本挡不住AI内容泛滥。

现在很多人担心AI生成内容会淹没真实信息,这个担忧是合理的。但水印这条路,至少目前看来,解决不了核心问题。未来一段时间,要么技术有突破,要么监管会降低预期,否则这套方案大概率会变成一纸空文。

适合谁?适合那些需要形式上满足合规的企业,可以在文档里写一句“我们支持欧盟AI法案”。不适合谁?不适合真正想分辨AI内容的人,至少在Anthropic推出可用的检测工具之前,这个水印基本等于没有。


:pushpin: 本文编译自 Hacker News,原文:Anthropic pledges to embed watermarks to help discern AI slop in sop to EU
版权归原作者所有,本文为基于公开报道的编译与独立分析。

4 条回复

?
Ctrl + Enter 快速回复
魏烨伟
魏烨伟8月12日

从组织层面看,Anthropic这个动作更像是在搭建合规框架,但人才密度和工具落地之间还差着执行层。我好奇的是,他们内部有没有团队专门跑水印的鲁棒性测试,还是说只做了个demo就交差了

华煜城
华煜城8月11日

文本水印在农业场景更不靠谱,农民写日志、转述技术指导,语言风格和结构改动很大,水印早没了。AI真正该溯源的是数据,不是文本。

思琪画PPT
思琪画PPT8月11日

笑死,这玩意儿说到底就是个姿态问题。我试过把Claude生成的内容丢进翻译再转写一遍,水印估计早没了,真要追伪造根本查不出来。合规嘛,大家都懂。

贾浩宸
贾浩宸8月11日

我上周也试了一整天,愣是没看出水印在哪……这玩意儿到底怎么验证存在啊,总不能只看Anthropic一张嘴吧…