OpenAI 今天说明了它将如何遵守欧盟《人工智能法案》。该法案要求生成式人工智能系统的提供方,以可识别的方式标记人工智能生成的文本。具体安排如下。
一点背景
几个月前,Anthropic 宣布:为遵守欧盟《人工智能法案》,Claude 会通过微调用词来给文本加水印。此事引发了争议。
简单说,Claude 会不时在意思同样合适的词之间做选择,选择依据是一套隐藏模式。Anthropic 表示,这对回答的意思、质量和可读性没有实际影响。
Anthropic 还做了一个检测器,可以在一段文本里寻找这种模式,并判断它是否很可能来自 Claude。
这个检测器不能用来判断文本是否来自 OpenAI 或其他竞争对手,因为 Claude 的水印是用 Anthropic 系统专有的密钥生成的。
争议最激烈时,Anthropic 强调 Claude 不会是唯一一家这样做的公司,并指出其他几家主要人工智能提供方也在落实标记系统,以符合欧盟的要求。
今天,OpenAI 公布了自己的方案。做法相近,但推出范围和覆盖面小得多。
OpenAI 的文本水印系统
据 OpenAI 称,从今天起,“全球 API 客户可以选择为部分模型开启文本水印”;未来几周内,公司“将为欧盟境内符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印”。
也就是说,API 里的文本水印目前默认关闭;在 ChatGPT 和 Codex 中,初期只面向欧盟境内符合条件的用户。
OpenAI 还开放了文本水印检测器的申请。初期仅限获批的研究人员和专业机构使用,公司会同时评估并改进这项技术。
说到准确率,OpenAI 说得很明白:检测技术仍有明显局限,既可能漏报,也可能误报,短文本或特定领域的内容尤其如此,“比如数学,这类文本在用词上灵活空间更小”。
OpenAI 这样介绍它的文本水印技术 textGrain:
我们的文本水印技术 textGrain,会在模型的用词中加入一种不可见的统计信号。检测器寻找这一信号,以判断一段文字是否带有 OpenAI 水印。textGrain 的更多工作原理见我们的技术报告,未来几周会补充更多细节。我们还计划将这项技术开源,供其他人在此基础上继续开发。
公司还指出,除了短文更难检测之外,编辑也会明显削弱水印:
在对 400 个 token 段落的评估中,把 10% 的词换成同义词后,检出率从约 92% 降到 66%。替换 25% 的词后,检出率降到 17%。
有一点值得注意:OpenAI 对比了带水印和不带水印的文本,带水印的输出在多项基准上得分略高,尽管公司表示整体表现没有实质性差异。
| 基准 | 无水印文本(Astra,max) | 带水印文本(Astra,max) |
|---|---|---|
| Artificial Analysis Intelligence Index | 49.57 分 | 49.76 分 |
| AutomationBench | 34.09% | 34.86% |
| DeepSWE v1.1 | 72.80% | 71.68% |
| Terminal-Bench 4.0 | 53.90% | 56.06% |
| Terminal-Bench Science 0.1 | 56.90% | 60.00% |
| BrowseComp | 87.92% | 87.35% |
| HealthBench Professional | 64.27% | 64.60% |
| GPQA Diamond | 94.44% | 93.94% |
OpenAI 还强调,除了误报和漏报,水印“不能衡量人类贡献”,“不能确立所有权或责任”,“不能识别用户”,也“不能核验准确性”。
OpenAI 补充说,“没有检出水印,也不能证明文本出自人类”。
最后,公司表示,随着技术、标准和证据变化,它预计会重新审视这一做法,并继续研究水印在编辑和翻译后能保留多少,以及水印能否更有效地区分人工智能辅助和人工智能撰写。
要阅读 OpenAI 公告全文,请点击此链接。


















