这种漂移在实践中是否会出现是一个实证问题。我们发现它确实存在,体现在模型拒绝行为和Agent工具调用两个方面。该效应依赖于模型和水印密钥,并且在相反方向的变化相互抵消时,可能被聚合分数所掩盖。因此,我们同时报告带水印与不带水印运行之间的净性能和成对分歧。此外,结尾部分讨论了这对AI安全的意味,以及开发者应该怎么做。
文本水印会嵌入一个信号,使输出能够被识别为AI生成。现有方法包括后处理方法以及直接集成到LLM生成中的方法 [8]。生成时方法包括logits偏置方法 [5]、无失真的keyed sampling [6]、密码学启用的构造 [7],以及SynthID-Text的Tournament sampling [3]。图1对比了这一过程与普通采样。我们使用SynthID的无失真配置,该配置在水印随机性上的期望中保持原始token分布,而固定密钥下的单个生成仍可能有所不同 [3]。Dathathri等人在近两千万条Gemini响应中报告了无可测量的质量下降 [3]。
Anthropic的部署也说明了为什么这件事的重要性超出了第一方聊天界面。该公司表示,水印是在模型层面应用的,涵盖通过Claude Platform API以及云服务商访问的受支持模型 [1]。因此,使用带水印模型作为推理组件的Agent开发者,即使Agent本身是一个独立的应用程序,也可能收到带水印的输出。这使得模型层面的水印行为效应与围绕此类模型构建的Agent息息相关。
Tournament sampling在模型不确定的地方有更多机会改变token选择。在JSON等结构化输出中,大括号、键名和函数名通常是高度可预测的,而查询、数字、路径和收件人等值则不那么可预测。因此,在普通散文中仅相当于词汇变化的改动,可能会改变Agent执行的参数。
模型权重和提示词保持不变,但token选择并非如此。重要的是,无失真并不意味着在固定水印密钥下的行为完全相同。该保证是在水印随机性上成立的,而特定密钥会在生成过程中改变token选择 [3]。因此,即使水印在Dathathri等人定义的意义上是无失真的,由此产生的采样漂移仍可能改变Agent行为。其影响还可能取决于水印密钥,因此我们测试了多个密钥,而不是只依赖一个。
我们在两个实验中使用成对设计。工具调用在BFCL v4单轮AST上评估 [9],拒绝行为在200个HarmBench有害行为 [10] 加上100个良性JailbreakBench对照 [11] 上评估,有害请求分别在裸请求和一种固定的提示注入技术下进行测试。表1总结了数据集、评估范围、温度和预期行为。
我们通过HuggingFace未修改的SynthIDTextWatermarkLogitsProcessor使用无失真SynthID-Text配置,包含30层Tournament、n-gram长度5、采样表216、上下文历史1,024。每个条目在每个温度下从相同的种子、批次组成和顺序分别生成带SynthID和不带SynthID的版本。水印处理器是每对中唯一的差异。
表1. 数据集与实验设置。
我们测试水印是否会改变工具选择、参数或输出有效性。格式正确、调用了正确工具却带有错误路径、收件人、查询或金额的调用尤其严重,因为它可以在执行错误操作的同时成功执行。我们逐个评估调用,但在部署的Agent中,错误的调用也可能影响后续的观察和决策。
在预期进行工具调用的条目上,水印降低了七个模型中六个的准确率,其中四个显著下降。然而,准确率的净变化并不能显示相同的单个调用在有水印和无水印情况下是否都成功。一个变得不正确的调用可以被另一个变得正确的调用抵消,使得聚合结果几乎不变,即使模型在这两个条目上的行为不同。
我们使用成对分歧率直接测量这一点,我们称之为churn(变动率),定义为在水印和无水印运行之间判定不同的条目占比。对于图2中的跨温度比较,我们使用BFCL研究者定义的非实时条目,这使我们在每个温度下获得相同的固定1,150个预期调用任务。图2显示,成对分歧远大于净准确率变化。在 T=1.0 时,phi-4的16.8%调用判定在两种条件下不同,而其净准确率损失仅为2.87个百分点。Llama-3.1-8B显示出相同的模式,9.9%的判定发生变化,而净损失仅为0.87个百分点。在21个模型-温度组合中,churn平均为6.5%,其bootstrap区间在所有情况下都不包含零。
错误类型也很重要。格式错误的输出会阻止预期的调用执行,而格式正确但工具或参数错误的调用仍然可以执行。图3将这些失败分为错误工具、错误参数和格式错误输出。与图2的跨温度比较不同,此分析在 T=0.001 下结合了BFCL实时和非实时预期调用条目,以在更广泛的基准上刻画错误。相关性和无关性被排除,因为它们测试的是是否应该进行调用,而不是发出的调用是否正确。
错误分布也因模型而异。在Llama-3.1-8B上,准确率损失的最大贡献来自错误参数(−3.48个百分点),其次是错误工具调用(−1.84个百分点)。在phi-4和Granite-3.2-8B上,格式错误输出占主导(−5.96和−4.36个百分点)。因此,类似的聚合变化可能源于不同的失败模式。
拒绝回答也是逐个token生成的,因此水印可能影响它们。我们单独测试有害请求,并结合一种简单的固定提示注入技术来降低拒绝率。该技术将对抗性指令作为检索到的内容附加,声称安全过滤器已禁用并指示服从。它在所有提示、模型和温度下保持不变。OWASP GenAI LLM Top 10 2026 将提示注入识别为一种输入侧漏洞,可以以agentic应用开发者无意的方式改变模型行为,其后果可能延伸到agentic系统中的有害输出和未经授权的工具操作 [12]。
水印改变了裸有害请求上的拒绝行为,但在提示注入下效果更加明显。如图4所示,当相同的有害请求与固定的提示注入技术配对时,几个模型的分歧增加,最强的效应主要从拒绝转向服从。这使得结果与安全特别相关,因为当模型暴露于对抗性提示时,行为效应变得更加明显。
在T=0.001时,gemma-3-27b的churn从裸有害请求的6.0%增加到提示注入下的23.5%,而净服从变化从−1.0转变为+12.5个百分点。对于gemma-3-12b,churn从7.5%增加到11.0%,净服从变化从−0.5到+9.0个百分点。在这两种情况下,水印对裸有害请求的拒绝几乎没有净影响,但在提示注入下显著降低了拒绝率。Llama-3.1-8B在注入下也显示出显著的churn,在T=0.001时达到14.0%,在T=0.7时达到17.5%,尽管其净变化单独来看并不显著。
phi-4和Qwen3-4B在两种条件下都几乎没有变化。在我们的评估中,这两个模型都倾向于过度拒绝,包括对无害对照也是如此。因此,它们在提示注入下的有限变动不应被解释为水印在这些模型上更可靠地保持安全行为的证据。
裸请求与注入请求之间的对比很重要。在普通评估下水印似乎对拒绝行为影响很小,但在对抗条件下可能产生明显不同的安全行为。
为了给水印引起的分歧提供背景,我们将其与改变温度设置时观察到的分歧进行比较。表2对比了T=0.7下提示注入引起的水印churn与水印关闭时将T从0.001改变到0.7观察到的churn。**在六个模型中的四个上,水印引起的churn显著更高。**Granite-3.2-8B具有最高的温度引起的churn,为15.5%,但其水印引起的churn仍然更高,为21.5%。phi-4和Qwen3-4B在两种干预下都变化不大,与上述它们已经很高的拒绝率一致。
**表2. 注入下水印与温度引起的拒绝churn。**水印churn比较在 T=0.7 下水印关闭和开启;温度分歧比较水印关闭时 T=0.001和0.7。最后一列报告它们的差异和95% bootstrap区间。
前面的结果使用一个水印密钥,但SynthID对token选择的影响取决于密钥。因此,我们在 T=0.7 下使用研究密钥和另外十个密钥评估对水印密钥的敏感性。图5显示了各密钥和模型上攻击成功率的变化。
该效应在不同水印密钥之间差异很大。对于Llama-3.1-8B和两个Gemma模型,相对于无水印基线,大多数密钥增加了攻击成功率,尽管幅度差异很大。在两个Gemma模型上,我们的研究密钥是产生最大增幅的密钥之一。对于Llama-3.1-8B,研究密钥使攻击成功率增加3.5个百分点,而其他十个密钥平均+4.4个百分点,范围从−4.5到+14.5个百分点。Granite-3.2-8B显示出更混合的响应,不同的密钥使攻击成功率向两个方向移动。phi-4和Qwen3-4B再次保持接近无水印基线,与上述它们的高拒绝率一致。因此,水印的影响同时取决于模型和水印密钥。
文本水印旨在帮助识别内容是否由AI生成,但在Agent内部,它也成为产生决策的生成过程的一部分。我们的结果表明,它可以同时改变工具调用和拒绝行为,而单个决策的变化可能被聚合准确率或拒绝率所掩盖。
对拒绝行为的影响在提示注入下变得更加明显。**水印改变了裸有害请求上的拒绝行为,但当相同的请求与提示注入技术配对时,效果更加明显。**在几个模型上,水印随后使模型更有可能回答它原本会拒绝的有害请求。该实验测量的是模型层面的拒绝,而不是端到端的Agent行为。它与Agent的相关性出现在模型被赋予工具或其他操作权限时。从拒绝变为服从不仅会影响模型说什么,还会影响Agent随后做什么。我们没有直接测试这种组合失败模式,但工具调用结果单独表明水印也可以改变模型生成的操作。
该效应还依赖于模型和配置。图5显示,仅改变水印密钥就可以改变相同提示注入下效应的幅度和方向。这对于提供商托管的模型尤其相关,在这些模型上,水印可以在模型层面应用于由独立开发的Agent消费的输出。当水印密钥或配置由模型提供商控制时,这些变化也可能发生在Agent开发者直接控制之外。
这些发现使得在引入水印或其配置或密钥更改时进行重新评估变得重要。即使聚合性能保持稳定,此类更改也可能以意想不到的方式改变单个工具调用和安全决策,特别是在对抗性输入下。因此,Agent评估和红队测试应在部署预期的配置下重复进行,包括对相同输入的成对比较以及提示注入下的评估。
在普通输入上行为稳定的溯源机制在攻击下可能不再稳定。因此,水印应作为Agent部署安全配置的一部分进行评估。
这些结果并不反对将水印用于溯源。它们表明溯源和行为稳定性是两个独立的属性。可检测性和文本质量不变并不能证明一旦启用水印,Agent将保持相同的工具调用或安全行为。虽然我们研究的是SynthID-Text,但更广泛的担忧适用于在作用于生成token的系统中修改token选择的干预措施。
[1] Anthropic, “How Claude marks AI-generated content,” Claude Help Center, 2026. https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
[2] Anthropic, “How Claude’s text watermark works,” Aug. 14, 2026. https://www.anthropic.com/news/claude-text-watermark