刚刚,Anthropic给Claude装了隐形卧底!全球生效

新智元 2026-08-15 17:07

刚刚,Anthropic给Claude装了隐形卧底!全球生效图1

  新智元报道  

刚刚,Anthropic给Claude装了隐形卧底!全球生效图2


你用Claude写的东西,即将能被全世界查出来!

就在刚刚,Anthropic发了一篇博客,首次公开解释了Claude文本水印的技术细节。

最新一批模型已经全部内置,老模型也在适配的路上。

从此,你的助手就成了Anthropic安插的卧底。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图3

Anthropic这篇官博很长,核心就这几条:

刚刚,Anthropic给Claude装了隐形卧底!全球生效图4

刚刚,Anthropic给Claude装了隐形卧底!全球生效图5
标记怎么藏进去的


这么说吧。

Claude写字是一个词一个词蹦的。每蹦一个词之前,先算出一堆候选词,每个带一个概率。

当好几个词概率差不多的时候,选谁都行。「阴沉的天空」和「灰蒙蒙的天空」意思一样,选哪个纯看随机数怎么掷。

水印动的就是这个随机数。

以前这个随机数没有规律,谁也预测不了。现在Anthropic用密钥算出一串有规律的数把它给替掉了。

最狠的是,Claude不会因此写出别扭的句子,也不会突然蹦出一个你没见过的生僻词。

但拿着密钥的人,可以直接从你的文字里把规律给验出来。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图6

打个比方。

餐厅里红烧肉和糖醋排骨都68块,口味一样好,服务员推荐哪个看心情。

现在餐厅给服务员发了一本暗号本,上一桌点了鱼就推荐红烧肉,点了鸡就推荐糖醋排骨。

一周下来,两道菜卖出去的总量没什么变化。但经理翻一遍点单记录,就知道哪些推荐是按暗号本来的。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图7

这个思路最早是Scott Aaronson 2022年还在OpenAI时提出的。谷歌DeepMind接过去做成了产品级方案SynthID-Text,2024年发在Nature上。

谷歌曾拿自家Gemini做过实测。他们给一部分真实用户悄悄开了水印,然后对比有水印和没水印的用户反馈,结果发现点赞和点踩在统计上并没有显著差异。

值得一提的是,这跟市面上Pangram之类的AI检测工具完全不同。

那些工具没有密钥,只能靠猜文风,猜错是常态。但有了水印之后,就不用猜了,直接拿验密钥就行。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图8

刚刚,Anthropic给Claude装了隐形卧底!全球生效图9
这个卧底比你想的更不靠谱


Anthropic官博里有这么一句:水印只作用于Claude「选择」的词。

想想这意味着什么。

先说翻译。

你写了一篇中文文章让Claude翻成英文。每个英文词都是Claude选的,水印信号拉满。但思想和观点全是你的。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图10

代码也有问题。

大部分位置需要精确输出,水印插不进去。但注释和变量命名有自由度,水印能嵌进去。

至于会不会产生bug,Anthropic说可以忽略不计。

但对工程师来说,「可以忽略」从来不等于「没有」。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图11

短文本好不到哪去。

写个一两百字的邮件回复,可选择的词就那么几个,水印根本留不下什么。

纯事实更是死角。

「牛顿最著名的著作叫做Principia……」后面只能跟Mathematica,没有第二个选项。越是精确表达,水印越没有发挥空间。

到了校对,水印几乎失灵。

你写了三千字的文章丢给Claude改错别字。它改了二十来个地方,整篇文章99%是你写的。那二十个改动里,水印确实留不下多少痕迹。

但问题是,你怎么证明那99%是你自己写的?

刚刚,Anthropic给Claude装了隐形卧底!全球生效图12

硅谷知名科技博主Ben Thompson直接开炮:「我很庆幸自己从来没养成把校对稿直接复制粘贴的习惯。」

而且就算水印测出来了,它也回答不了一个关键问题:这段话是Claude从头写的,还是你写了初稿、Claude帮你大改的?

Anthropic自己承认,水印只能判断Claude「可能参与过」,再细就分不了了。

换句话说就是,用过Claude的人,一律得准备自证清白。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图13

刚刚,Anthropic给Claude装了隐形卧底!全球生效图14

4美分擦掉一切


2026年7月的一项研究发现,这种水印的移除率,高达98.3%。

具体来说,研究者把带水印的文本丢进AI释义工具,让AI换个说法重写一遍。

其中,59篇被检出水印的文本里,跑完之后58篇的水印直接消失。

按当前定价,处理一篇千字文章大约4美分。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图15

而且检测API一旦公开,矛盾还会进一步加深。

因为任何人都能拿它反向优化,改一个词跑一次检测,直到水印信号降到安全线以下。

密码学里管这叫「逃避预言机」。

所以Anthropic的检测API至今「即将推出」,细节「仍在确定中」。


刚刚,Anthropic给Claude装了隐形卧底!全球生效图16
圆珠笔不是作者


不过,就算把这些技术问题全部解决,也依然绕不开一个更根本的问题:

你不会因为用Word写文章,就把Word列为共同作者。


而Anthropic的这种水印,无异于要求一支圆珠笔宣传自己是作者。


一段文字被追溯到Claude,然后呢?

按照Anthropic官方的说法,水印不改变作品所有权,也不改变法律责任归属。

刚刚,Anthropic给Claude装了隐形卧底!全球生效图17

所以现实就是:你的助手留下了记号,但这个记号既证明不了你有罪,也保护不了你清白。

参考资料:

https://www.anthropic.com/news/claude-text-watermark


编辑:摩西


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

刚刚,Anthropic给Claude装了隐形卧底!全球生效图18

刚刚,Anthropic给Claude装了隐形卧底!全球生效图19

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
IC
more
Physical AI 挺进深海“禁区”,海洋通用机器人解锁新质生产力密码
Q2吸金115亿美元!Anthropic 创14倍神仙增速,华尔街估值体系失语
WRC逛展不过瘾?晚上来聊具身智能硬核真问题!Xbotics开发者After Party 等你来
Automattic旗下人脉管理应用Mesh登陆安卓,AI重构社交关系链
用于驾驶舱控制器的理想IC
【倒计时5天】ICDIA 2026 完整议程!AI、具身智能、3D IC一应俱全!
早报|长鑫科技市值首超腾讯;Anthropic将上市,或成史上最大IPO;银行能办结婚证了;美国对进口无人机最高征100%关税
三个Claude互相封号、投毒、栽赃!Anthropic:一个AI安全,一群AI未必
ICLR 2027截稿时间改了,和ICRA相差十天!怎么选?
Anthropic详解Claude文本水印机制:合规欧盟AI法案,代码受影响极小
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号