用受版权保护的书训练AI仍存法律争议

TechCrunch AI··作者 Amanda Silberling

关键信息

文章解释说,这类案件通常取决于“合理使用”,尤其是训练行为是否被视为具有“转换性”,以及是否会损害原作品的市场。TechCrunch 还指出,美国版权法自 1976 年以来没有更新,这使法官只能用旧规则来处理现代 AI 系统。

资讯摘要

TechCrunch 认为,用受版权保护的书籍训练 AI 模型的合法性远比表面看起来复杂。文章开头指出,ChatGPT、Gemini、Claude 等系统都基于海量出版物训练,其中包括书籍、学术论文和网络文章。文章随后强调了明显的矛盾:许多作者表示,他们的作品在未同意、也不知情的情况下被用于构建可能削弱其生计的工具。可是,文中受访律师认为,法律并不能简单地对应这种道德直觉。文章最重要的案例之一是 William Alsup 法官在 Anthropic 案中的裁定:他批准了对作者的 15 亿美元和解,但同时认为模型训练本身是合法的。该案中受到处罚的,是 Anthropic 从非法影子图书馆获取书籍,而不是把版权文本用于训练 AI 这一行为本身。

Alsup 还将 LLM 训练类比为作家阅读文学作品,从中创造出新东西,而不是直接复制原作。TechCrunch 引述的法律专家表示,这种理解实际上可能更有利于 AI 公司,因为版权法通常关注的是“复制”,而不是单纯的“使用”或“阅读”。文章指出,这场争论很大程度上取决于“合理使用”,尤其是使用是否具有转换性,以及是否会与原作品形成市场竞争。文章还提到,美国相关版权法自 1976 年以来就没有更新,这使法院只能用几十年前的法律框架去处理 AI 时代的新问题。多位律师认为,这也导致当前法律环境极不稳定,类似案件可能会因为法官对目的、市场影响和直接竞争的判断不同而出现不同结果。

用受版权保护的书训练AI仍存法律争议

资讯正文

你现在大概已经知道,支撑 ChatGPT、Gemini、Claude 以及其他聊天机器人的 AI 模型,是在看似无限的已发布作品数据库上训练出来的,这些数据库包含数亿本书籍、网络文章、学术论文,几乎囊括了你能在互联网上找到的任何内容。绝大多数已出版作者在不知情、也未同意的情况下,实际上都为同一批 AI 工具的发展作出了贡献,而这些工具又可能削弱他们的生计。这样看起来很不合法,对吧?

现实并没有这么简单。

“我认为,整个法律领域和整个技术领域的其中一个问题在于,事情很多、很复杂,”专注于知识产权、版权和技术的律师 Cathy Gellis 告诉 TechCrunch,“情况非常复杂,而且无论支持还是反对,大家对正在发生的事情都有很多强烈情绪。”

去年,在此类案件中最早的裁决之一里,William Alsup 法官裁定 Anthropic 向一批作家支付高达 15 亿美元的版权和解金,因为这些作家的作品被用于训练该公司的 AI 模型。表面上看,这似乎是对作者有利的一次道德胜利,但 Alsup 法官实际上认定 Anthropic 的 AI 训练是合法的。Alsup 惩罚 Anthropic 的,是其从非法的网络影子图书馆中盗版了这些书。

法官写道:“就像任何立志成为作家的读者一样,Anthropic 的大语言模型(LLM)对作品进行训练,并不是为了抢先一步去复制或取代它们,而是为了转过一个急弯,创造出不同的东西。”他把 LLM 吸收数万亿词语的方式,比作作家对文学作品的研读。

Gellis 认为,这一裁决对 AI 公司更有利。到 2028 年,一家预计年收入约 2000 亿美元的公司,15 亿美元的罚金又算得了什么呢?

“我认为,总体来说,这对 AI 训练是个好消息,因为他审视了发生了什么,并且确实把它看作类似于阅读受版权保护的作品,而不是复制受版权保护的作品,”Gellis 说,“版权法的核心在于‘复制’,但它并不以使用作品、体验作品、消费作品、阅读作品为前提。”

版权法自 1976 年以来就没有更新过,这意味着,法官在面对这些有可能塑造 AI 行业未来的法律问题时,必须尝试理解 50 年前制定的指导原则该如何适用。

“现在每个人都非常担心,因为法律说法非常混乱,而原因就在于这个问题,”JWL International 的 IP & Media Practice 高级律师兼创始人 Jason Henderson 告诉 TechCrunch,“他们知道 AI 模型是在海量内容上训练出来的,而法律实际上还没有真正跟上这个问题。”

这些问题往往取决于合理使用法——也就是说,使用受版权保护作品的方式,是否“具有足够的变形性(transformative)”,以至于在法律上可以被允许。”

合理使用是版权法中的一个例外,允许在未经明确许可的情况下使用受版权保护的材料,从而通过批评、戏仿、教育以及其他方式,保护对受版权作品进行评论和迭代的能力。法官在判断某项使用是否属于合理使用时会考虑具体因素,包括作品的目的和性质、使用的数量以及对市场的影响。

“版权始终关乎保护并扩大市场,”Henderson指出。“法院在 AI 案件中的推理其实有些各说各话。通常更容易胜出的情况是:如果你是在利用别人的财产进行训练,而且你的目的就是直接竞争,那么法院会对此不以为然……如果你所做的事情不会构成竞争,那么法院往往会寻找理由认定这是可以的。”

Henderson 指的是一宗案件:媒体和科技公司 Thomson Reuters 起诉研究公司 Ross Intelligence,称其为打造一个具有竞争性的、基于 AI 的法律平台而复制了自己的内容。

“Ross 的使用并不具有变革性,因为它并没有比 Thomson Reuters 的内容拥有‘进一步的目的或不同的性质’,”Stephanos Bibas 法官去年写道。

在那起案件中,Bibas 法官认定,利用 Reuters 的内容来训练、并打造一个会与其直接竞争的新平台,并不属于合理使用。尽管作者们可能会主张,聊天机器人通过使用他们的作品生成新的、合成的书籍,实际上是在与他们竞争,但这一论点迄今尚未在法庭上胜出。

当谈到 AI 与版权之间的关系时,Gellis 认为,把我们实际讨论的内容缩小范围会很有帮助——从 AI 训练的角度看待版权,与我们谈论 AI 生成内容的版权归属,思路是很不一样的。

在 Thaler v. Perlmutter 一案中,法院裁定,如果一部作品是 100% 由 AI 生成的,那么它不具备版权,这又引出了一个全新的难题——我们如何明确证明一部作品是否由 AI 生成;如果是,我们又如何知道其中有多少比例是由 AI 创作或协助完成的?

“如果你用 [Microsoft] Word 写小说,并运行拼写检查,我们其实都能比较放心地说,Word 并不拥有你的小说,”Gellis 说。“[AI] 正迫使我们去审视很多我们曾经一度忽略的决定。”

目前,大多数 AI 公司仍因这些问题卷入待决诉讼,这意味着我们短期内不会得到这些问题的明确答案。

“你会看到,最初的几轮交锋已经产生了影响,而这种影响本身也可能在其他法院作出不同裁决后被推翻。要等到诉讼进入后续阶段,才会弄清究竟哪一种观点会胜出,”Gellis 说。“但与此同时,所有这些判决都在塑造正在发生的一切。AI 公司如果忽视它们,那就有点愚蠢了。”

来源与参考

  1. 原始链接
  2. Is it legal to train AI models on copyrighted books? It’s complicated | TechCrunch

收录于 2026-08-24