OpenAI与微软内部文件曝光:明知会损害网络仍推进AI训练
纽约时报诉OpenAI和微软案中解封的文件显示,两家公司内部早知道其AI训练数据抓取会损害网络生态,甚至称其为“人类历史上最大规模的劳动盗窃”。文件还承认AI产品导致搜索推荐流量下降高达60%。这对依赖网络内容生态的独立开发者和内容创作者意味着,AI巨头的发展模式可能正在摧毁其自身赖以生存的内容供应链。
纽约时报起诉OpenAI和微软一案中,近期解封的法院文件展示了令人震惊的内部认知。两家公司的内部文件明确警告,其AI内容策略已启动一个“末日循环”,将同时损害自身模型性能和整个网络生态。微软内部文件甚至写道:“一个终端产品威胁到其核心供应商的经济基础,这是极不寻常的,但这就是我们为自己的LLM业务在‘内容供应链’方面创造的状况。”
文件中大量引人注目的言论来自微软应用科学总监Brent Hecht,他将ChatGPT和Copilot抓取数据的行为称为“人类历史上最大规模的劳动盗窃”,并称微软的辩护“彻底嘲弄了‘合理使用’的概念”。不过微软发言人表示,这些评论仅代表一位员工的个人观点,不代表公司立场。微软AI数据战略与运营总经理Jordan Usdan则淡化其角色,称Hecht的视角偏学术和前瞻性。
文件还揭示,OpenAI内部对ChatGPT复制受版权保护内容的能力心知肚明。员工承认GPT-4“记住了大量数据,因此在逐字重现方面将极其出色”。尽管公司声称重视“防止记忆”以减少版权侵权,但内部仍承认“没有理由点击链接”查看来源。OpenAI媒体与经济专家将纽约时报等网站的推荐流量下降归因于AI摘要,并推测搜索推荐可能已下降60%。
此外,OpenAI联合创始人Greg Brockman对通过商业AI可能赚取的“数不清”的美元更感兴趣。虽然微软CEO萨蒂亚·纳德拉后来表示“任何付费墙内容都应获得许可”,但OpenAI代表承认“不知道”有任何检测或移除训练数据中付费内容的措施。文件总结道,两家公司明知会不可逆地伤害出版业及其雇佣的“数百万人”,仍为了追求巨额利润而执意推进。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。