水印要是肉眼看得见,创作者嫌丑;要是完全查不到,监管过不了关——Anthropic把「看不见但可检测」写成了合规说明书。
Anthropic是美国人工智能公司,主力产品为Claude系列模型与相关Agent能力。欧盟《人工智能法案》要求面向其市场的系统对AI生成内容做可识别标记;Anthropic与多家厂商签署相关透明度行为准则后,开始在Claude输出侧落地文本水印,并同步说明技术边界,以回应「会不会伤质量、会不会暴露用户、代码会不会被改坏」等集中疑问。
公司于8月14日在官网发布《How Claude’s text watermark works》。官方要点可核对如下:未来Claude模型生成文本将携带水印,用于估计「Claude是否参与过写作」;方法基于Google DeepMind发表于《Nature》的SynthID-Text思路,只改变模型在近义候选词之间做随机选择时的随机源,不向文本插入隐藏字符,也不增加额外token费用;读者肉眼无法区分有无水印文本;水印不绑定个人、组织或会话身份;事实性段落与必须精确的代码位置水印更稀疏,因可替换词更少;轻度编辑未必能去净水印,彻底重写则可能;公司还将为图片等文件附加C2PA内容凭证,并计划提供水印检测API。
可以把机制想成掷骰子换皮:
对教育与企业合规,这是把「AI参与度」从语感猜测变成可检测信号;对重度改写、校对与硬代码场景,检测力会明显下降,官方也承认水印不能证明「整篇由Claude原创」,更不能替代著作权判断。与此前行业讨论的「可见角标」路线不同,Anthropic选择不可见统计水印 + 文件侧C2PA,更贴近「不影响阅读体验、仍可事后抽检」的折中。
需要把边界读清楚。水印回答的是概率性参与,不是作者身份或版权归属;全球同步上线,是因区域隔离方案尚未成熟。下一观察点是检测API开放节奏,以及其他签署同一行为准则的厂商如何落地各自密钥体系——合规动作会扩散,密钥不会共享。