ESC
AI 1 分钟阅读

OpenAI与Microsoft明知自己正在为互联网开启“末日循环”

《纽约时报》诉OpenAI与Microsoft案最新解封的法庭文件显示,两家公司内部文件早已警告AI数据抓取是“人类历史上最大规模的劳动窃取”,其AI内容战略开启了损害整个互联网的“末日循环”。文件引用Nadella、Brockman等高管言论:GPT-4“在复述方面出奇地强”、训练数据未清除付费墙内容、LLM“摧毁自身供应链”,令“合理使用”抗辩沦为笑柄。

来源:The Verge

最近,在《纽约时报》起诉OpenAI和Microsoft一案中最新解封的法庭文件相当具有杀伤力。这些公司自己的文件警告称,它们正在启动一个将损害整个互联网的“末日循环”(doom loop),将其为训练模型而抓取数据的行为描述为“人类历史上最大规模的劳动窃取”,并称这“让‘合理使用’(fair use)的理念沦为彻底的笑柄”。

文件中最引人注目的许多言论来自Microsoft应用科学总监Brent Hecht。不过,该公司一直试图与Hecht的说法保持距离。Microsoft发言人Alex Haurek告诉The Verge:“这些言论仅反映一名员工的个人观点,并非法律分析,也不代表公司的立场。”

在另一份法庭文件中,Microsoft AI数据战略与运营总经理Jordan Usdan将Hecht的角色定性为对抗性的。他表示,Hecht“对AI数据生态系统应如何运作持有不同的、学术性的和前瞻性的观点,受雇于Microsoft正是为了带来不对称的、未来主义的和学术性的观点……就其对AI可能影响内容创作者的理论观点而言,他也并非Microsoft的代言人。”

但无论Microsoft是否愿意为这些言论背书,显然“这一切都成真了”。Google Zero是真的!AI正在吞噬互联网!

《纽约时报》的起诉书中还有许多来自Satya Nadella、Sam Altman和其他OpenAI员工等各方人士的惊人言论。以下是这份92页文件中的一些亮点。

“一起令人震惊的盗窃”

本案,用Microsoft应用科学总监[Brent Hecht]的话说,是关于“一起规模空前的令人震惊的盗窃”;SF1437,或许堪称“人类历史上最大规模的劳动窃取”。SF1652。被告在未经许可的情况下,反复完整复制数百万篇原告享有版权的文章,用于生产具有替代性的商业AI产品。OpenAI的ChatGPT负责人写道,“出版商”面临这些产品的“生存威胁”,SF1466,他说,这些产品“在很大程度上具有替代性,就是这样”,并且“随着它们变得越来越好,替代性会越来越强”。SF1473-74。这些自认彻底摧毁了被告的“合理使用”抗辩,因为替代性是“版权的头号大敌”。Andy Warhol Foundation for the Visual Arts, Inc. v. Goldsmith, 598 U.S. 508, 528 (2023)。正如同一位Microsoft高管所承认的,如果被告凭借这一抗辩获胜,可以说是“让‘合理使用’的理念沦为彻底的笑柄”。SF1450。

引言部分引用了Hecht和OpenAI ChatGPT负责人(据推测是Nick Turley)的话,似乎表明这些公司深知自己对《纽约时报》等出版商构成了“生存威胁”(existential threat)。Hecht称ChatGPT和Copilot对数据的搜集是“人类历史上最大规模的劳动窃取”,并表示Microsoft的辩护“让‘合理使用’的理念沦为彻底的笑柄”。

这是一个“末日循环”

Microsoft CEO Satya Nadella在宣誓下同意,与聊天机器人对话“已经取代了……在AI平台上直接向你提供信息,而无需访问底层来源”。SF1432。Microsoft的一份文件承认,在这场较量中没有人是赢家:“我们的AI内容战略已经开启了一个‘末日循环’,它将同时损害我们模型的性能和整个互联网:终端产品威胁其核心供应商的经济基础是极不寻常的,但这就是我们为自己的LLM业务在‘内容供应链’方面造成的局面。”

Satya Nadella承认,聊天机器人基本上已经取代了搜索,人们无需再直接访问原始来源获取信息。但更具杀伤力的或许是Microsoft的一份内部文件,其中写道:“我们的AI内容战略已经开启了一个‘末日循环’,它将同时损害我们模型的性能和整个互联网:终端产品威胁其核心供应商的经济基础是极不寻常的,但这就是我们为自己的LLM业务在‘内容供应链’方面造成的局面。”

这甚至不是一个真实的数字

大约同一时期,OpenAI联合创始人Greg Brockman写道,他从希望通过OpenAI技术商业化获得的“数不尽的钱”中“深受激励”。SF630。近日有报道称,OpenAI正计划以1万亿美元估值进行IPO。

不要被OpenAI或Microsoft所谓的利他意图所迷惑。OpenAI联合创始人Greg Brockman更感兴趣的是通过商业化AI可能赚取的“数不尽的钱”(gazillions)。

付费墙算什么

OpenAI和Microsoft内部人员在获取数据时无视了规避付费墙和违反使用条款等问题。SF521-47, 790-92。例如,OpenAI的公司代表作证称,他不知道训练数据集中“有任何检测付费墙内容的努力”,也“没有从训练数据集中删除付费墙内容的努力”。

尽管Nadella后来被引述称“任何付费墙内容都应获得授权”,但一位OpenAI代表承认,他“不知道”有任何检测或从训练数据中删除付费墙内容的努力。

“在复述方面出奇地强”

同年,OpenAI承认其API“可能会逐字输出现有内容”。SF945。到2021年,OpenAI认为“防止记忆”对“合理使用(合规)和尽量减少模型输出中的版权侵犯”很重要。SF946。2022年6月,OpenAI员工承认GPT-4将“记住海量数据,因此在复述方面会出奇地强”。

从内部来看,OpenAI似乎非常清楚ChatGPT有逐字复制受版权保护材料的倾向。尽管它承认“防止记忆”对于“尽量减少版权侵犯”很重要,但员工们承认GPT-4“记住了海量数据,因此在复述方面会出奇地强”。

起诉书随后列举了多个例子,显示ChatGPT在回应查询时直接输出了来自《纽约时报》、《Mercury News》、《The Denver Post》、LifeHacker和Eurogamer文章的长段文字。

“吸走”他们所有的作品

正如Microsoft所承认的:“全世界数百万人很快将认为大模型‘吸走’他们所有的作品是一种规模空前的令人震惊的盗窃”,并承认“几乎没有人打算让自己创作的内容被以这种方式使用,也没有人为此获得报酬”。

Microsoft深知其对整个互联网的大规模抓取会被如何看待,并承认“几乎没有人打算让自己创作的内容被以这种方式使用,也没有人为此获得报酬”。

“人类劳动的替代品”

OpenAI政策总监Jack Clark同样写道:“[O]ur work on AI and Creativity is going to increasingly lead to us creating systems that substitute for the labor of the people that define the ‘culture’ of society[.]” SF1677。OpenAI内部文件将ChatGPT描述为“现代报摊”,SF1500,并吹嘘ChatGPT提供“快速、及时的答案……这些答案以前你需要去搜索引擎才能获得”,包括“最新体育比分、新闻、股票报价等”。

OpenAI政策总监Jack Clark看到了不祥之兆,称OpenAI正在“创造替代那些定义社会‘文化’的人们的劳动的系统”。内部文件将ChatGPT描述为“现代报摊”。OpenAI的Nick Turley后来被引述称,一旦你从聊天机器人那里得到答案,就“没有充分理由再点击”来源链接。

摧毁自己的供应链

被告承认了这种设计的可预见后果。据Microsoft称,“LLM的前景主要在于与它们获取内容的领域相同的知识工作领域……它们自然地与自己的内容供应链竞争。”SF1798。它们替代了生产其所训练的原始内容(包括报纸和书籍等)的“人们的劳动”。SF1452, 1677。生成式AI存在“现实风险”,可能“严重扰乱生成基础模型所训练数据的人们自身的就业”。SF1467。“LLM是一种摧毁其供应链的产品。”

Microsoft被引述承认“LLM是一种摧毁自身供应链的产品”,因为它在许多情况下替代了自己的训练数据。

OpenAI知道自己正在扼杀导流流量

OpenAI另一位经济专家Goldfarb博士认为:“《纽约时报》旗下资产导流流量的下降是由多种因素共同驱动的”,其中包括“例如Google AI Overviews”。SF1784, 1786。Goldfarb博士还认为,“Google引入AI概览可能使DNP的搜索导流下降了20%至60%”。SF1785。OpenAI媒体专家Sinnreich博士基于2026年Reuters Institute的分析认为,“自Google引入AI概览以来,来自Google Search和Google Discover的出版商导流流量大幅下降(Discover从每月超过50亿次导流降至不足40亿次,Search从远超30亿次降至略高于20亿次)”。SF1787。Sinnreich博士还承认,Google导流的下降与AI生成的摘要等因素有关。

OpenAI自己的媒体和经济专家将《纽约时报》等网站的导流流量下降直接归因于Google AI Overviews等AI摘要。他们推测搜索导流可能下降了多达60%。

Microsoft发言人Haurek谨慎表示:“Satya的证词与Microsoft在本案中的立场完全一致。他谈论的是人们查找和消费信息方式所涉及的广泛原则和正在发生的变化。不应将这些观察与法庭面临的版权问题结论相混淆,Microsoft在其提交的文件中对这些问题作出了回应。”

但基于这份最新解封的文件,似乎相当清楚的是,Microsoft和OpenAI都明知自己将给出版业及其雇用的“数百万人”造成不可挽回的伤害,并进而损害自己的产品,但为了追逐“数不尽的”金钱,它们仍然一往无前——末日循环又何足惧。

作者:Terrence O’Brien