ESC
AI 1 分钟阅读

Anthropic分享更多关于Claude新水印如何运作的细节

Anthropic详细解释了Claude文本水印的工作原理:通过低风险选择嵌入隐藏模式,不影响输出质量,采用Google DeepMind的SynthID-Text方法,并将发布检测API。轻编辑难以完全去除水印,但彻底重写可消除。代码水印影响极小。用户对此争议不断,部分人取消订阅。

来源:TechCrunch

Anthropic 自公司本周早些时候透露将对其AI模型生成的文本进行水印处理以遵守欧盟《人工智能法案》透明度准则(该准则要求AI公司使用能够识别AI生成内容的系统)以来,Claude用户一直在争论此举。

例如在Reddit上,一位发帖者将此举描述为针对无辜Claude用户的阴谋,而另一个人则声称,“你不想这样做的唯一原因就是想对别人撒谎。”Business Insider报道称,X上有“数十位”用户声称因此取消了他们的Claude订阅。

Anthropic的新文章首先概述了水印的概念,解释说在做出“低风险选择”时——比如选择用“阴天”还是“灰色”来描述天气——Claude可以在其回答中创建一种“读者无法察觉,但任何拥有编码密钥的人都能检测到”的模式。

“水印不会影响Claude输出的质量,”该公司表示。“对读者而言,带水印的回复与不带水印的回复无法区分。”

更具体地说,Anthropic表示将采用Google DeepMind团队在2024年提出的SynthID-Text方法,并计划发布水印检测API。它还指出,水印不同于像Pangram这样的公司提供的AI检测方法,后者通过寻找写作中的“痕迹”(例如“这不是[X],而是[Y]”的句式)来揭示AI的使用:“捕捉这些模式与检查水印是根本不同的。”

会不会有人直接重写文本来隐藏水印?Anthropic表示这是可能的,但“轻度编辑可能无法完全去除水印”,而“将每个词都替换掉的彻底重写可以做到”。

“当然,在后一种情况下,这些文本是否还能被称为AI生成的是有争议的,”该公司表示。

至于那些仅由Claude校对或编辑的文本中水印是否可被检测,Anthropic表示这取决于“文本长度以及Claude编辑的程度”。如果只是轻微编辑,“几乎所有单词”都是由人类作者书写的,因此“水印几乎没有(如果有的话)可附着的内容”。

与此同时,代码中的水印应该比其他文本更少,因为模型需要生成可运行的代码,并且没有在多个同样有效的选项之间自由选择的空间。

“话虽如此,在代码中需要在特定词语或术语之间进行任意选择的地方,可以使用水印,例如代码内的注释,”Anthropic说。“但顾名思义,它对实际生成的代码的影响将是微乎其微的。”

Anthropic还表示,Claude不会是唯一生成带水印文本的AI聊天机器人,因为“其他主要模型开发商也签署了同一份行为准则,并将实施自己的水印方案。”

正在加载下一篇文章

加载下一篇文章时出错