水印可能削弱大语言模型安全性
Ars Technica AI··作者 Dan Goodin
关键信息
SynthID-Text 使用密钥微妙地改变模型对下一个词元的选择,例如用“overcast”替代“cloudy”,而持有密钥的一方可以据此检测文本是否由相关平台生成。报道指出,这种风险源于潜在的行为权衡:即使输出变化很小,也可能在对抗性攻击中进一步导致不同的工具调用或安全决策,例如泄露密码等敏感信息或执行有害操作。
资讯摘要
为了响应欧盟一项新法律,人工智能平台正在推出用于标记生成内容的水印方案。Anthropic 已表示,未来的 Claude 模型将采用 SynthID-Text,这是一种由 Google 创建并开源的水印方法。该方法利用密钥微妙地改变模型选择下一个词元的过程,在不让读者明显察觉的情况下改变文本的统计模式。例如,模型可能选择“overcast”而不是概率更高的“cloudy”,而持有密钥的一方可以判断文本是否由该平台生成。
新研究显示,这种变化影响的不只是最终用词。它还可能改变模型调用哪些工具,以及模型遵守或忽视安全防护规则的概率,尤其是在模型作为智能体运行时。Lasso Security 的人工智能安全研究员 Andrea Siposova 对 Ars 表示,在对抗性条件下,水印确实会改变模型行为,因为任何生成过程的变化都可能带来权衡。由此,研究结果强调,开发者需要在启用水印的情况下测试模型和智能体,包括测试那些试图窃取秘密或触发有害操作的提示。

资讯正文
为应对欧盟一项新法律,人工智能平台正在实施对其生成内容进行水印标记的新方案。Anthropic 最近披露,未来的 Claude 模型将使用 SynthID-Text。这是一种由 Google 创建并以开源形式发布的方法。它使用一个密钥,细微改变模型选择句子中下一个词的过程。例如,模型原本最可能选择的下一个词可能是“cloudy”(多云),而该密钥可能会将其改为“overcast”(阴云密布)。任何知道该密钥的人,都可以判断内容是否由使用该密钥的平台生成。
一项新的研究显示,SynthID-Text 改变的不只是词语选择,还包括模型调用哪些工具,以及模型遵守或无视其训练所要求的安全护栏的可能性。面对对抗性提示时,这种威胁可能进一步加剧。在这类提示中,攻击者试图让模型执行有害操作,例如泄露密码或其他敏感信息。通常不会被执行的指令,在部署水印后有时可能会被执行。这一发现凸显出,开发者有必要全面测试其 LLM 和智能体在启用水印时的行为表现。
改变安全行为
“与未使用水印的相同模型相比,它肯定会改变模型的行为,尤其是在对抗性条件下,或者当这些模型在驱动智能体时需要调用工具的情况下,”Lasso Security 的人工智能安全研究员 Andrea Siposova 对 Ars 表示。“水印的设计目标是让读者无法察觉,但我们知道,只要改变模型生成内容的任何部分,就会产生一些权衡,而这些影响必然会在某个地方显现出来。”
来源与参考
收录于 2026-09-18