微软称 Copilot 很少复现《纽约时报》文本
The Verge AI··作者 Lauren Feiner
关键信息
微软表示,这 820 万条聊天记录是因为包含了可能关联新闻网站的关键词而被选出,因此最有可能包含原告作品。该公司还称,一位为调查新闻中心工作的专家发现了 51 起“实质性重合”案例,而《纽约时报》则不同意微软的解释,并表示这些文件证明微软和 OpenAI 通过盗用其内容打造商业产品。
资讯摘要
微软正试图通过主张 Copilot 几乎不会复现受版权保护文本中的有意义大段内容,来削弱《纽约时报》、图书作者和其他出版商提出的版权诉求。在最新的法庭文件中,该公司表示,研究人员审查了 820 万条 Copilot 对话,而这批数据本身就存在偏向性,因为它是通过与新闻网站相关的关键词筛选出来的,更可能触及原告作品。尽管如此,微软称只有 59,545 条聊天记录与用于为模型提供依据的新闻材料至少有 16 个单词重合。微软还补充说,一位为调查新闻中心工作的专家在 CIR 作品中发现了 51 起“实质性重合”案例,而在作者方诉讼中,一位专家在这 820 万条对话中只找到了 24 条回复与原文至少有 30 个单词匹配。微软还表示,在评估的 212 本书中,只有 10 本出现了任何匹配。
基于这些数据,微软认为,偶尔出现文本复现并不足以否定大语言模型训练的变革性用途,也支持其认为使用受版权保护材料训练应被视为合理使用的立场。这些文件是在微软申请简易判决时提交的,如果法官同意,案件可能会在较早阶段结束。原告则认为,证据开示已经显示微软和 OpenAI 利用了他们的作品来构建可直接竞争、甚至替代其新闻和图书产品的商业服务。如果法官拒绝微软的请求,诉讼将继续进行。

资讯正文
微软表示,在与包括《纽约时报》和图书作者在内的出版商打版权官司之际,它在新的法律文件中称,Copilot 几乎从不会复现新闻文章和书中的整句内容,更不用说足以替代原作的实质性片段了。
作为这起诉讼取证程序的一部分,微软向一位受新闻出版商聘请的专家提供了 820 万条 Copilot 聊天日志。微软称,这些日志是特意挑选出来的,“因为它们命中了会牵涉到使用新闻原告网站的关键词,因此最有可能包含新闻原告的作品。”公司表示,随后的分析显示,其中 59,545 条与用于为 AI 模型提供基础的新闻内容至少有 16 个相同单词。微软说,调查报道中心(Center for Investigative Reporting)的一位专家在数据集中发现了 51 起与 CIR 作品“实质性重叠”的实例。类似地,在作者方诉讼中,一位专家发现,这 820 万次与 Copilot 的对话里,只有 24 条回复包含至少 30 个匹配词。微软称,在评估的 212 本书中,只有 10 本有任何匹配。
《纽约时报》不同意微软的结论。时报首席律师 Ian Crosby 在一份声明中说:“在取证过程中披露的文件和证词只会得出一个结论:微软和 OpenAI 从《纽约时报》那里窃取内容,用于打造可替代其新闻报道、威胁其业务并削弱其行业的商业产品。”他表示,“我们期待微软和 OpenAI 因其盗窃行为被追责。”调查报道中心和作者协会(Authors Guild)没有立即回应置评请求。
微软认为,这些数字强化了其观点,即在 AI 训练数据集中使用受版权保护的内容应被视为合理使用。微软称,像 Copilot 这样的系统确实依赖受版权保护的材料,但由此产生的系统用途与原始材料有显著不同。公司总结说,这些系统有时会复现部分文本,“几乎不能削弱大语言模型训练的变革性目的”。
这些文件是出版商和作者对微软与 OpenAI 提起的法律战的一部分。原告称,这两家公司基于他们的作品构建产品,如今又通过在一定程度上照搬受版权保护的内容,直接与他们竞争。新闻出版商和图书作者的诉求已被合并到一名法官名下,以简化流程,尽管出版商和作者对此提出了异议。微软于周五提交了这份文件,因为它正请求法官作出简易判决,这将使案件在早期阶段结束。(特朗普政府本周也就《纽约时报》一案提交了利益陈述,支持 OpenAI。)如果法官站在出版商和作者一边,这场法律战将继续在法庭上进行。
来源与参考
收录于 2026-09-05