找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4665

积分

0

好友

607

主题
发表于 1 小时前 | 查看: 3| 回复: 0

前几天在 X 上冲浪的时候,看到有人在讨论“AI 生成文本中嵌入不可见的数字水印”这个话题:

X平台讨论Claude文本水印的帖子与官方说明截图

在 AI 生成的图片、视频里面加水印已经见怪不怪了,但在文字里搞水印,听起来还真有点新鲜。顺着这个话题,我找到了 Claude 官方发布的一篇公告:

Claude官方公告:Claude如何标记AI生成的内容

Claude官方公告:如何标记AI生成内容

公告里明确提到,在 2026 年 8 月 2 日之后,Claude 全球范围内全产品输出的文本,都支持嵌入式水印:

Claude机器可读标记涵盖范围

这个嵌入式水印到底是什么?官方也给出了对应解释:

Claude嵌入水印与来源元数据说明

注意这句关键表述:

由于水印是文本的一部分,当文本被复制和粘贴到其他地方时,它会随之传播。

翻译过来就是:文本即水印,水印即文本,两者是共生关系。它不是往文本里插入一些不可见字符,也不是在结尾标注“这段由 AI 生成”这种低级手段。而是当你让它生成一段文本后,水印就藏在这段文本里面,你根本察觉不到。

比如让 AI 生成一段文本,它回复的内容可能就带着“嵌入式水印”,但肉眼完全看不出差异。这就是公告里说的:您看不到它,它不会改变响应的含义、质量或可读性。

哦,对了。上面这个例子实际上用的是 ChatGPT,为什么不用 Claude 呢?别问,问就是账号被“夹”了。

好气哦表情包

反正你能领会到意思就行。

怎么搞的

那么问题来了,嵌入式水印到底是怎么实现的?

在 X 上有个大佬做了拆解,我截取了关键部分:

GPTZero CTO解析Claude水印方法推文截图

理解这段话之前,我先去了解了一下这位大佬。他说自己是 GPTZero 的 CTO。GPTZero 是一个 AI 内容检测工具,主要用来判断一段文字“像不像 AI 生成的”。这是它的官网:

GPTZero官网

GPTZero AI检测工具界面

他们还做了一个有意思的网站,检测各个平台上 AI 创作内容的占比:

GPTZero AI Vision

GPTZero扫描各平台AI内容占比

比如 X 上,针对扫描到的内容,有 12.3% 是 100% 由 AI 生成的。这个网站还预测,五年后 LinkedIn 上的内容将 100% 由 AI 生成:

AI生成内容在各平台增长趋势预测

虽然官方没有公开“嵌入式水印”的核心原理,但 GPTZero CTO 的技术分析应该大差不差。再看看他说的这段话:

文本水印生成与检测过程截图

寥寥数语,就是完整的技术原理。简单翻译一下:AI 生成文本时,每次选择下一个词,都会给一部分词的权重调高一点,而这个“权重调整规则”,水印检测器也知道。当你对一段文本做检测时,只要发现模型特别偏爱某些词,而这些词的权重有过调整,就能判断这段文字很可能来自带水印的模型。

你不需要完全理解,先记住这个要点:“嵌入式水印”不是往文本里插入特殊字符,也不改变句子的原始含义,而是把水印藏在“选词规律”里,检测机制就是统计这个规律。

我举个简单例子。假设词库里只有 10 个词:

苹果、香蕉、橘子、葡萄、汽车、飞机、火车、电脑、手机、小说

然后我们有一条秘密规则,把这些词分成两部分。一部分是“绿集”:

苹果、橘子、汽车、电脑、小说

另一部分是“红集”:

香蕉、葡萄、飞机、火车、手机

绿集和红集各占 50%。这里的绿集、红集只是集合名称,没有特殊含义,你想叫 A 集、B 集都行。

正常情况下,让 AI 随机选词,绿集和红集的概率五五分,都是 50%。比如让它连续随机选择 100 次水果,按五五分的逻辑,结果可能是:

  • 绿集中的苹果 25 个
  • 绿集中的橘子 25 个
  • 红集中的香蕉 25 个
  • 红集中的葡萄 25 个

绿集红集各占一半。但如果我悄悄给 AI 加了一条规则:每次选词时稍微提高绿集 token 的采样概率。那么结果可能变成:

  • 绿集中的苹果 35 个
  • 绿集中的橘子 35 个
  • 红集中的香蕉 15 个
  • 红集中的葡萄 15 个

绿集占比提升到 70%,红集下降到 30%。把这个结果喂给检测器,检测器会产生疑问:如果是完全随机的文本,为什么绿集出现了 70%,而不是接近 50%?这个偏差已经大到不太可能是随机波动。

不对劲,十分有十分的不对劲。

答案很可能只有一个:这是模型故意的。目的就是让检测器感知到绿集词汇的比例异常。而这个“异常比例”,就是大模型留下的水印。

你可能会问:如果绿集永远都是“苹果、橘子、汽车、电脑、小说”这些词,那各路大佬多分析几波,不是很容易就被发现吗?

如果你也这么想,那说明问到了点子上。看看大佬是怎么说的:

哈希值重加权概率说明截图

这句话的意思就是:每生成一个 token,绿集都会变化。决定绿集怎么变化的,是“前文 + 密钥”。

再举一个例子。假设 AI 已经输出了“歪歪写的文章”,现在要生成下一个 token。算法拿到前面生成的 token 以及一个密钥,进行哈希计算:

Hash(前文 + 密钥)

假设哈希结果是 856746212,这个数字可以作为“随机种子”,利用它把词库打乱。比如原始词库是:

不错、很好、好看、非jier棒、还行、真好、可以、将就

打乱后变成:

非jier棒、还行、真好、不错、可以、将就、很好、好看

然后前 4 个作为绿集,后 4 个作为红集。这里为了写文章方便,词库里放的是中文短语,实际情况下每个就是一个具体的 token。前面我们约定了让模型更偏爱绿集,所以模型最终选择了“非jier棒”。拼起来就是:歪歪写的文章非jier棒。

当 AI 再次生成下一个 token 时,Hash 算法中的“前文”发生了变化,哈希值也随之变化,词库的打乱逻辑也会跟着变。所以每一个 token 的位置,都可能对应完全不同的绿集和红集。

这里还有一个非常关键的东西:密钥。你想想,如果没有密钥会怎样?所有人都知道“前文 → Hash → 绿集”的计算规则,那攻击者就能自己算出每个位置的绿集,然后专门避开这些词,水印自然很容易被破坏。

但有了密钥,情况就完全不一样了。AI 生成文本时,用这个密钥决定当前这一轮哪些 token 属于绿集;检测时,检测器再用同一个密钥重新计算出当时的绿集,然后统计文本有没有明显偏向绿集。

所以真正重要的不是“绿集”本身,而是只有掌握密钥的人,才能知道某个位置当时哪些词属于绿集。整个过程里,绿集是动态的,密钥决定绿集如何变化。密钥既然是密钥,肯定被藏得好好的,不容易被攻破。这个机制下,绿集和红集很难被逆向出来。

如果你还是没明白,那就上大白话。什么是嵌入式水印?简单粗暴地说:把所有单词一半放名单 A,一半放名单 B。正常情况下,写完一篇文章,名单 A 和名单 B 的词量应该各占一半,比例偏差不会太大。但支持“嵌入式水印”的 Claude 写出的文章,可能有 70% 的词汇属于集合 A。检测时,如果集合 A 和 B 的占比偏离 50% 过大,就可以高度怀疑这段文本来自带水印机制的大模型。而且它写的过程中,会基于前面的词和一个密钥,再随机划分一次集合。

这个解释很粗暴,但能让你理解“水印即选词规律”这个精髓。所以基于上面的解释,你应该能明白,把 Claude 输出的文本自己手打一遍,或者用 OCR 图片识别一遍,并不会去除水印。到这里你应该品出味道了,再回头看那句“文本即水印,水印即文本”,就知道歪师傅并没有乱说。

破解之道

了解原理之后,你应该意识到这玩意其实不好破解。最容易想到的办法是把 AI 生成的文本改几个词,水印不就被破坏了吗?

改写确实能破坏水印,但效果没想象中那么好。因为水印不是几个特别的词,而是一个概率。比如 AI 生成的文本绿集占比 75%,你改了几处后变成 66%,AI 的水印还是能被检测出来。当然,如果你整个推翻重写,把绿集拉回 50% 左右,检测就有可能通过,但这样的工作量也不小。

目前 Claude 官方还没有推出文本嵌入式水印的检测工具。等这类工具面向互联网开放后,可能一定程度上会被逆向。不过在 GitHub 上,已经有手快的老哥搓出了“水印去除器”:

watermarks-remover

GitHub水印去除器项目说明

但这个工具的说明里也明确提到,由于官方目前还没提供专门的检查工具,他也只能通过改写、翻译等方式,尽最大努力去破坏水印:

文本标记工作原理英文文档截图

等官方的检测工具开放出来,又会是一场精彩的攻防之战。

这是个好事啊

关于 AI 给文本加嵌入式水印这件事,我个人的观点是:

这是个好事啊表情包

总体来说,我觉得给 AI 生成内容加上这样的嵌入式水印,是一件好事。甚至这可能只是一个开始。

以前我们判断一段文字是不是 AI 写的,更多靠“像不像”的感觉,纯靠个人体感去判断 AI 味儿。现在有了嵌入式水印,对应的验证工具可能很快就面向大众开放。当验证工具普及后,一定会有人研究如何攻击它。但“攻防”本来就是技术发展的常态,你有新的攻击方式,水印方案也会继续升级,这注定是一场长期的攻防。

谁攻谁防,其实我都不太关注。我真正期待的是,它能在这个过程中再进一步。以后不要只告诉我“这是一篇有 AI 痕迹的内容”,而是告诉我:这段内容大约有 30% 的部分经过 AI 生成或修改。甚至直接告诉我:哪些地方是 AI 写的,哪些地方是人写的,哪些地方经过 AI 修改。因为这才真正解决了我们未来可能遇到的问题。

比如我写了一篇文章,写完后把它扔给 AI,让它帮我检查错别字、调整病句、润色几个表达。如果最后检测器告诉我“这篇文章是 AI 生成的”,那我肯定会觉得有点冤。

所以我觉得,AI 文本的嵌入式水印真正应该解决的,不是简单粗暴地区分“AI”和“人类”,而是让内容的生产过程变得更加透明。谁写的,谁改的,AI 参与了多少,人类又参与了多少。这些信息如果都能被可靠地记录下来,面对 AI 生成内容时,我们就不需要再靠猜。这可能才是 AI 水印真正有价值的地方。

因为进入 AI 时代之后,我们缺的从来都不是内容,而是对内容的信任。

最后,附上 GPTZero CTO 推文的完整截图:

GPTZero CTO关于AI水印的完整推文

本文由云栈社区整理分享,更多 AI 与开发技术干货,欢迎常来逛逛。




上一篇:从 Tool 到 Agent:三层架构与 Workflow 核心拆解
下一篇:Flask 之父评 DeepSeek Harness 开源:受启发想重新审视选择
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-18 04:15 , Processed in 0.910198 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表