研究进展·Hacker News

Anthropic 在 Claude 中加入文本水印以符合法规要求

Anthropic 表示,未来的 Claude 模型将生成包含可检测水印的文本,用于判断文本是否由 Claude 参与生成。该水印通过改变生成下一词时使用的随机源来留下难以肉眼察觉的模式,且不会在文本中加入额外字符或影响输出质量。对用户意味着阅读体验不变,但拥有密钥的一方可以评估文本由 Claude 生成的概率。

Anthropic 宣布,未来的 Claude 模型会在生成文本时加入水印。公司解释,这种水印通过在模型选择下一词时替换随机数源来产生模式;生成过程仍包含随机性,但选择依据由密钥和前文共同决定的随机序列。文本中没有额外字符或隐藏信息,读者无法凭肉眼分辨水印与否。

Anthropic 说,水印不会对 Claude 的输出质量、创意水平或可读性产生实际影响。在内部测试以及参考 Google DeepMind 在 SynthID-Text 论文和相关流量试验中的结果中,水印与非水印输出在质量评价上没有统计学区别。水印也不需要额外的 token,不会增加费用,并且不包含可追溯到具体个人、组织或对话的身份信息。

该水印方法属于 SynthID-Text 的变体,设计思想可追溯到 2022 年的相关提议。Anthropic 指出,自 8 月 2 日起,欧盟要求在其市场提供服务的 AI 提供者对生成内容进行标记,其他主要模型开发者也已签署相同的行为准则并将实施各自的水印方案。Anthropic 同时强调,水印只能用于评估“该文本有多少可能部分由 Claude 撰写”,不能确认文本是否由人类写成。

原文出处

How Claude's text watermarking works

anthropic.com

#Anthropic#Claude#水印#模型安全

本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。