微软内部警告预见了人工智能驱动的网络恶性循环。

The Verge AI··作者 Terrence O'Brien

关键信息

最尖锐的评论来自微软应用科学主管 Brent Hecht;微软表示,这些言论只是该员工刻意提出的对立性观点,并不代表公司的立场或法律判断。文件援引的其他材料显示,OpenAI 知道 GPT-4 可能记忆并逐字复现受版权保护的文本,而一名 OpenAI 代表据称并不了解任何识别和移除付费墙内容的训练数据处理措施。

资讯摘要

《纽约时报》提交并新近解封的文件显示,微软和 OpenAI 内部有人曾预见到其业务可能严重损害网络内容经济。微软主管 Brent Hecht 将 ChatGPT 和 Copilot 对素材的采集称为“人类历史上最大规模的劳动成果窃取”,并认为两家公司的抗辩完全嘲弄了合理使用原则。微软否认这些言论代表公司立场;另一份文件则称,Hecht 的职责就是提出不同、学术化且面向未来的批评,而不是阐述公司政策。微软另一份内部文件警告,其人工智能内容战略已经形成“恶性循环”,因为最终产品正在威胁提供关键内容的出版商和创作者赖以生存的经济基础。

诉讼文件还援引 Satya Nadella 的说法,指出聊天机器人可以取代传统搜索,并降低用户直接访问原始来源的必要性。尽管 Nadella 据称表示付费墙后的内容应当获得许可,一名 OpenAI 代表却表示,他不知道公司曾采取措施从训练数据中识别或排除这类内容。OpenAI 的内部讨论还承认,防止模型记忆对于减少版权侵权非常重要,而且 GPT-4 已经记住了大量素材,这支持了原告关于逐字复现风险早已为公司所知的主张。

微软内部警告预见了人工智能驱动的网络恶性循环。

资讯正文

最近解封的法庭文件显示,在《纽约时报》起诉 OpenAI 和 Microsoft 的案件中,有不少内容对这两家公司相当不利。两家公司自己的文件曾警告称,它们正在开启一个会损害网络生态的“厄运循环”;文件还将抓取数据训练模型的行为形容为“人类历史上规模最大的劳动成果盗窃”,并称这种做法“彻底嘲弄了合理使用这一概念”。

文件中许多最引人注目的言论都来自 Microsoft 应用科学总监 Brent Hecht。不过,该公司一直试图与 Hecht 的观点保持距离。Microsoft 发言人 Alex Haurek 对 The Verge 表示:“这些评论反映的是一名员工的个人观点,并非法律分析,也不代表公司的立场。”

在另一份法庭文件中,Microsoft AI 数据战略与运营总经理 Jordan Usdan 将 Hecht 的角色描述为专门提出对立意见。他表示,Hecht“对于 AI 数据生态系统应如何运作持有不同于主流、偏学术且具有前瞻性的观点,Microsoft 聘用他就是为了引入非对称、未来主义和学术性的视角……至于他对 AI 可能给内容创作者带来的影响所持的理论观点,他也不是代表 Microsoft 发言的人。”

但无论 Microsoft 是否愿意为这些言论负责,显然它们已经成为现实。Google Zero 真实存在!AI 正在吞噬整个网络!

《纽约时报》的诉状中还有许多来自不同人士的惊人言论,其中包括 Satya Nadella、Sam Altman 以及其他 OpenAI 员工。以下是这份长达 92 页的文件中的部分要点。

“一场惊人的盗窃”

引言部分引用了 Hecht 和 OpenAI 的 ChatGPT 负责人(推测为 Nick Turley)的话,这些内容似乎表明,两家公司知道自己会对《纽约时报》这样的出版商构成“生存威胁”。Hecht 将 ChatGPT 和 Copilot 收集数据的行为称为“人类历史上规模最大的劳动成果盗窃”,并表示 Microsoft 的辩护“彻底嘲弄了‘合理使用’这一概念”。

这是一个“厄运循环”

Satya Nadella 承认,聊天机器人基本上已经取代了搜索,人们也不再需要直接前往信息来源获取信息。但或许更不利的是,Microsoft 的一份内部文件写道:“我们的 AI 内容战略已经开启了一个‘厄运循环’,它将同时损害我们的模型和整个网络的表现:一种终端产品威胁其关键供应商的经济基础,是极为罕见的情况,但这正是我们围绕‘内容供应链’为大语言模型业务造成的局面。”

那甚至都不是一个真正的数字

不要被 OpenAI 或 Microsoft 所谓出于利他目的的说法蒙蔽。相比之下,OpenAI 联合创始人 Greg Brockman 更感兴趣的是通过商业化 AI 可能赚到的“天文数字”财富。

付费墙算什么

尽管 Nadella 后来曾表示,“任何设有付费墙的内容都应该获得许可”,但一名 OpenAI 代表承认,他“不知道”公司曾采取任何措施来检测或移除训练数据中的付费内容。

“极其擅长复述”

OpenAI 内部似乎非常清楚,ChatGPT 往往会“逐字”复制受版权保护的材料。尽管公司承认,“防止记忆”对于“尽量减少版权侵权”十分重要,但员工也承认,GPT-4“记住了海量数据,因此会极其擅长复述”。

诉状随后列举了多个例子:在回应查询时,ChatGPT 会直接输出大段复制自《纽约时报》、The Mercury News、《丹佛邮报》、LifeHacker 和 Eurogamer 文章的文字。

“吸走”他们的全部作品

Microsoft 知道,其大规模抓取整个互联网的做法会引发怎样的观感,并承认:“几乎没有人原本打算让他们[原文如此]创作的内容以这种方式被使用,他们也没有因内容被使用而获得报酬。”

“人类劳动的替代品”

OpenAI 政策主管 Jack Clark 已经预见到了后果。他表示,公司正在“创造能够替代那些定义社会‘文化’之人所付出劳动的系统”。内部文件将 ChatGPT 描述为“现代报刊亭”。随后,文件还引用 OpenAI 的 Nick Turley 的话称,一旦从其聊天机器人那里获得答案,就“没有充分理由再点击”指向原始来源的链接。

摧毁自己的供应链

文件援引 Microsoft 的说法称,“LLM 是一种会摧毁自身供应链的产品”,因为在许多情况下,它会取代自身的训练数据来源。

OpenAI 知道自己正在扼杀引荐流量

OpenAI 自己的媒体和经济专家认为,《纽约时报》等网站引荐流量的下降,直接源于 Google AI Overviews 等 AI 摘要功能。他们推测,来自搜索引擎的引荐流量降幅可能高达 60%。

微软发言人 Haurek 警告称:“Satya 的证词与微软在本案中的立场完全一致。他谈论的是广泛的原则,以及人们查找和消费信息的方式正在发生的变化。这些观察不应与有关提交法院审理的版权问题的结论混为一谈;微软已在其书面文件中阐述了对此的立场。”

但根据这份新近解封的文件,情况似乎已经相当清楚:微软和 OpenAI 都知道,它们将对出版业及其雇用的“数百万人”造成不可挽回的伤害,并因此损害自己的产品,却仍然为了追逐“天文数字般”的财富而继续推进——哪怕这意味着陷入“末日循环”也在所不惜。

来源与参考

  1. 原始链接
  2. OpenAI and Microsoft knew they were starting a ‘doom loop’ for the web

收录于 2026-09-19