Claude文本水印机制公开:随机性调控嵌入验证信号

Anthropic近日公布其Claude模型所采用的文本水印技术实现原理,该方法通过微调生成过程中词语选择的随机分布,在不改变语义连贯性与语言自然度的前提下,将不可见的验证标记嵌入输出内容中。

改写手段可高效规避水印检测,成功率高达98.3%

一项2026年7月发布的研究揭示,借助专门设计的AI改写工具,几乎全部带水印文本均能被成功去标识——在测试样本中,59篇含水印文章中有58篇在重写后无法被现有系统识别,单篇1000词内容的处理成本约为4美分。

水印存在局限性:低自由度场景下难以生效

Anthropic承认,当文本生成受限于词汇选择空间时,如翻译任务、代码片段、简短邮件或事实性陈述等情境,水印信号极易被稀释甚至失效;同时,该技术无法判断模型参与程度,也无法作为证明某文本唯一由Claude生成的法律证据。