OpenAI在欧盟默认给ChatGPT文本加水印

OpenAI近日宣布,未来数周内将为欧盟境内所有订阅档位的ChatGPT与Codex用户默认启用水印功能:模型生成的文本将携带一种人眼无法察觉、但检测器可以识别的统计印记,名为textGrain。这是对欧盟《人工智能法案》第50条透明度义务的直接回应——该条款自今年8月2日起要求AI企业以机器可识别的方式标记生成内容,存量系统的宽限期到12月2日截止,违规最高可处以1500万欧元或全球营业额3%的罚款。
textGrain并非在文字里藏入隐藏字符,而是用一个密钥微调模型在每个词上的选择倾向,让文本整体呈现可验证的统计模式;由于印记内嵌于用词本身,复制粘贴也不会丢失。OpenAI与宾夕法尼亚大学、耶鲁大学研究人员联合发布的技术报告显示,在1%误报率下,400词元(约300个英文单词)的未编辑文本检出率约95%,200词元约80%;但把一成词汇换成同义词,检出率就从92%跌到66%,改写四分之一后只剩17%,数学解答和翻译类文本的识别效果更差。
OpenAI明确表示,发布初期不会把文本水印设为全球默认,欧盟之外的用户暂不受影响;全球API客户即日起可自愿为部分模型开启水印,默认关闭,云合作伙伴版本将在未来数周跟进。检测工具不向公众开放,仅向经审核的研究人员和专家组织按个案开放,康奈尔、苏黎世联邦理工学院等机构在首批名单中。公司同时提醒:水印不能衡量人类贡献多少、不能认定权属、不识别用户身份;反过来,检测不到水印也不能证明文本由人类撰写。
基准测试显示水印几乎不损伤模型质量——OpenAI公布的对比数据中,加水印后的智能体基准得分甚至略高。竞争对手Anthropic已从8月起对Claude生成的文本在全球范围内加水印,一度引发部分用户强烈反对。《华尔街日报》2024年曾报道,OpenAI更早便已研发出文本水印技术,但担心用户流向提供「无水印」服务的竞争对手而迟迟未发布。随着欧盟规则落地,这层商业顾虑正式让位于合规压力。
编译自 Ars Technica,原标题:"OpenAI will watermark ChatGPT outputs by default—but only in the EU"