德里高等法院驳回ANI针对OpenAI的禁令申请
The Decoder··作者 Matthias Bastian
关键信息
法院认为ANI没有证明经济损害或直接竞争,因为新闻业务和AI服务属于不同领域。法院还指出,新闻事实本身不受版权保护;至于基于RAG的输出,法院认为目前还不能下结论,但主案中可能会把这类输出视为“向公众传播”。
资讯摘要
德里高等法院驳回了印度主要新闻机构之一亚洲新闻国际社(ANI)针对 OpenAI 提出的初步禁令申请。ANI 在诉讼中主张,OpenAI 既在训练 AI 模型时使用了其受版权保护的内容,也在 ChatGPT 的输出中侵犯了其版权。班萨尔法官没有批准临时救济,并且同时否定了“训练”和“输出”两方面的申请。法院认为,ANI 没有证明 ChatGPT 逐字复制了其文章,而其提交的样本大多发布于相关模型训练截止日期之后。OpenAI 说明,GPT-4 的训练数据截至 2022 年 4 月,GPT-4o 的训练数据截至 2024 年 4 月,而 ANI 引用的文章主要来自 2024 年 8 月和 9 月。
法官还指出,ANI 使用了对抗性提示词,明确要求模型“完全照抄”文章,但即便如此,ANI 仍未能拿出一条逐字复制的结果。对于输出问题,法院初步认为相关相似性可能来自 RAG,但 ANI 在申请中没有正面处理这一点,因此这一问题留待正式审理时再决定。关于训练本身,法院初步将 AI 训练纳入印度版权法中关于“私人或个人使用,包括研究”的例外,并提出前提条件,例如训练材料必须来自合法来源,且不能来自影子图书馆或未经许可访问的付费内容。法院的公平性分析也倾向 OpenAI,因为 ANI 没有证明模型记住了其作品,也没有证明 OpenAI 给 ANI 造成了经济损害。法官还强调,语言模型对教育、研究和无障碍访问具有公共利益。

资讯正文
德里高等法院在驳回印度主要新闻机构的版权禁令后,给了 OpenAI 一场胜利
要点
- 德里高等法院驳回了印度新闻机构 ANI 针对 OpenAI 提出的初步禁令申请,后者涉嫌侵犯版权。
- ANI 无法证明 ChatGPT 原封不动地复制了其文章。作为证据提交的文章均是在模型已经完成训练之后发表的。
- 法官认定 OpenAI 和该新闻机构分属不同领域,因此未对 ANI 造成经济损害,并确认语言模型在教育、研究和可及性方面具有公共利益。
在一项中间裁定中,德里高等法院驳回了印度新闻机构 Asian News International(ANI)针对 OpenAI 提出的初步禁令申请。
作为印度最大的新闻机构之一,ANI 因 OpenAI 在人工智能训练中使用受版权保护的材料以及 ChatGPT 输出内容而提起诉讼。法官 Amit Bansal 对这两项主张都拒绝了所请求的救济。
这一裁定涉及记忆化、检索增强生成(RAG)以及人工智能训练的法律地位。人工智能版权法专家 Andres Guadamuz 称,这一裁定是 OpenAI 早期的一项重要胜利。
ANI 的证据削弱了其版权主张
ANI 向法院提交了若干 ChatGPT 输出,称这些内容是其文章的实质性复制。此举适得其反,因为 OpenAI 证明所使用的模型 GPT-4 和 GPT-4o 的训练数据分别截至 2022 年 4 月和 2024 年 4 月。而 ANI 引用的文章大多发布于 2024 年 8 月和 9 月,因此不可能包含在训练数据中。
法官的初步看法是,这些相似之处源于 RAG,即检索增强生成,它允许语言模型像搜索引擎一样实时检索网络信息。ANI 在其提交材料中并未提及 RAG,因此法院无法就此作出最终裁定。法官表示,基于 RAG 的输出可能构成“向公众传播”,这一问题将由法院在实体审理中处理。
ANI 的案件随后进一步削弱。该机构使用了对抗性提示,明确告诉模型要“精确地”复现文章。即便如此,ANI 也未能提供任何一份逐字复制文本。法官认为,新闻文章中的事实通常不受版权保护,而在本案中,复述主题和标题并不构成与 ANI 的直接竞争。
证据同样不能支持 ANI 的说法,即 OpenAI 会将训练数据永久存储在其模型中,并可按要求逐字复现该机构的作品。不过,法院将在实体审理中重新审视这一问题。
法院初步将人工智能训练视为合理使用
ANI 还未能证明,为人工智能训练而复制其作品构成版权侵权。双方均同意 OpenAI 在训练过程中使用了 ANI 内容,但 OpenAI 认为,这些材料在整个数据集中只占极小一部分,而且模型提取的只是语法、句法和语言模式等非表达性要素。
法官审视了印度版权法中的例外条款,并依据一项涵盖“私人或个人使用,包括研究”的条款,将“研究”作了足够宽泛的理解,以涵盖人工智能训练。
为使该例外成立,法官设定了条件。训练副本必须来自合法来源,不能来自影子图书馆或未经许可访问的付费墙网站。OpenAI 也从未将这些训练副本公开,而只是将其内部处理。Guadamuz 说,这是法院首次明确认定,AI 训练属于私人使用例外。
法院进行了三项公平使用测试,并在三项上都支持了 OpenAI。OpenAI 对 ANI 作品的使用仅限于训练,因为没有证明存在记忆或复制。ANI 也无法证明经济损害,因为两家公司处于不同领域。即便用户向 ChatGPT 询问 ANI 的新闻标题,模型返回的也只是主题,最多不过几个文章标题。
法官援引了美国案件,包括 Bartz v. Anthropic 和 Kadrey v. Meta,这些案件认定语言模型的输出具有变革性。他还提到了此前的 Google Books 裁决。
法官还认定,经过训练的语言模型能够改善信息获取、支持教育、推进科学研究、帮助软件开发、实现翻译,并为残障人士创造工具。
国际 AI 版权案件呈现出复杂的分化局面
德里这项裁决加入了全球范围内不断增长的一系列法院判决之列,而这些判决得出的结论彼此冲突。在美国,法官驳回了 Raw Story 和 AlterNet 针对 OpenAI 提起的诉讼,因为原告无法证明足够的损害,而且出现完全复制的可能性很低。该法院还裁定,事实不受版权保护。
GitHub Copilot 案也未获成功,原告无法拿出哪怕一个相同代码的例子。另一方面,The Intercept 通过一项 DMCA 投诉获得了部分胜利,涉及在训练前被剔除的受版权保护材料。
在 Ross Intelligence v. Thomson Reuters 一案中,法院拒绝适用公平使用,因为这款 AI 研究工具直接与 Thomson Reuters 的法律数据库 Westlaw 竞争,使该使用不具变革性。法院强调,这一裁决仅适用于这一非生成式用例,不能扩展到大型语言模型。
在 Anthropic 一案中,旧金山一家联邦法院称,用受版权保护作品进行 AI 训练“极具”变革性,这是有利于公平使用的强烈信号。但法院也提出了“Napster 类比”,因为 Anthropic 使用了来自影子图书馆的盗版书籍作为训练数据。公平使用并不涵盖非法获取的材料。Anthropic 后来就使用这些盗版副本向图书作者支付了 15 亿美元。
美国版权局驳回了 AI 行业的说法,即对“海量受版权保护作品”进行训练可广泛构成公平使用。撰写该报告的官员在报告发布后不久即被特朗普政府解职。
在欧洲,两家法院几乎同时得出了相反的结论。慕尼黑地区法院在 GEMA 一案中裁定,歌曲歌词可以在模型权重中被复现,因此这构成一种与版权相关的复制。伦敦高等法院驳回了 Getty Images 诉 Stability AI 一案,裁定 AI 模型并不是“侵权复制品”。而显示语言模型能够记忆受版权保护书籍的新研究,可能会进一步推动关于“记忆化”的争论。
在所有这些案件中,同样的核心问题仍未解决。AI 模型会永久存储训练数据吗?训练能否被认定为合理使用?合法获取的数据与非法获取的数据界限在哪里?而通过对抗性提示生成的复制内容,是否反映了正常使用?
AI 与媒体面临的不只是版权问题
除了版权之外,媒体行业还面临另一个悬而未决的问题。即便法院裁定 AI 训练是合法的,AI 驱动的搜索产品仍可能重创新闻市场。皮尤研究中心(Pew Research Center)最近的一项研究显示,在谷歌 AI Overviews 的情况下,用户点击外部网站的比例降至仅 8%,而没有 AI 摘要时为 15%。用户在获得 AI 回复后往往就停止搜索,不再查看其他来源。
对于像 ANI 这样的新闻机构来说,这意味着即使不存在直接的版权侵权,能够总结新闻、让用户无需点击原始来源的 AI 系统,也可能随着时间推移侵蚀行业的商业模式。
慕尼黑 I 地区法院最近还裁定,谷歌要为其 AI 摘要中的虚假主张承担直接责任,因为这些内容被视为独立内容,而非搜索结果。传统上为搜索引擎运营商提供保护的有限责任,并不适用于 AI 生成的摘要。
这一裁定也可能与 ChatGPT 基于 RAG 的回复相关。当 AI 系统对新闻进行概括并提出独立判断时,其运营方实际上就成了媒体提供者,并承担随之而来的全部责任。这种变化也可能迫使法院重新审视合理使用。公平性测试中的一个关键因素,是新产品是否与其训练所依据的作品形成竞争。如果 AI 摘要取代了访问新闻网站的需求,法官可能会更难认定这种使用并不具有竞争性。
没有炒作的 AI 新闻——由人类精选
订阅 THE DECODER,可享受无广告阅读、每周 AI 新闻简报、我们独家的“AI Radar”前沿报告(每年六次)、完整档案访问权限,以及评论区访问权限。
来源与参考