Anthropic 公布了一套专为 Claude 聊天机器人生成内容设计的全新水印系统细节。该公司表示,这项技术不会降低回复质量,普通用户完全无法察觉水印的存在,但搭载密钥的专用检测系统可以识别出水印。
Anthropic 引入该水印,是为了遵守欧盟《人工智能透明度准则》。该准则要求采用技术手段,能够识别出由人工智能生成的内容。
Anthropic 采用的水印方案为 SynthID-Text,由 Google DeepMind 团队于 2024 年发布。其核心机制并非在文本中插入可见符号或元数据,而是利用语言模型生成过程中的“选择自由度”嵌入统计模式。
具体而言,当 Claude 在生成过程中面临多个语义相近的候选词时(例如“happy”与“joyful”),系统会在不影响语义和流畅度的前提下,依据预设算法优先选择特定词汇。这些看似随机的“低风险选择”组合起来,便构成了一段可被检测的隐藏序列。
对读者而言,带水印的文本与自然生成的文本在可读性、逻辑性和风格上完全一致;但对持有检测密钥的系统来说,这种统计偏差足以确认内容的 AI 来源。
为便于第三方验证,Anthropic 计划开放一个专用 API,允许开发者、平台或监管机构提交文本以核查是否含有 Claude 水印。
该水印机制依靠识别文本内特定模式实现。举例来说,当 Claude 在多个同义词语之间做选择时,系统会利用这类 “低风险” 选词机会构建隐藏模式。对于阅读者而言,携带水印的文本和普通文本看不出任何区别。
不过,文本经过编辑后,水印可能部分失效或是被完全清除。Anthropic 称,轻度编辑基本无法彻底去除水印;但如果对文本大幅改写、几乎替换全部词汇,水印就会消失。
倘若 Claude 只是对人类撰写的原文做少量修改,水印将很难被检测到。该公司解释,这种场景下绝大部分文字依旧来自人类创作,水印系统几乎没有可嵌入标记的空间。
对于程序代码,水印效果会更弱。原因在于模型编写代码时,可供选择的等效表达方式十分有限。不过,水印标记可以施加在注释这类代码元素上。
Anthropic 同时强调,并非只有 Claude 会启用文本水印。其他签署了欧盟相关行为准则的主流大模型厂商,也计划落地各自的内容标记系统。
值得一提的是,并非所有用户都认可这次改动。部分用户在 Reddit 发帖吐槽,认为这套水印本质是追踪用户,属于无端对用户进行怀疑。也有观点认为这类标记机制十分虚伪,尤其 Claude 本身就在使用其他企业研发的技术来产出内容。