据 TechCrunch 报道,《纽约时报》对 OpenAI 与微软提起的版权诉讼近日解封了新文件。微软应用科学总监 Brent Hecht 在 2023 年 1 月的内部备忘录中,把大规模复制新闻内容称为“人类历史上最大规模的劳动盗窃”,并形容其规模令人震惊、前所未有。
TechCrunch 提醒,这批新信息大多出自《纽约时报》一方的诉状,底层证据仍处于封存状态,因此相关引语缺少原始语境。Ars Technica 和《华尔街日报》同期也报道了文件解封,本文所列细节以 TechCrunch 的报道为准。
文件包含一组微软内部数据:与传统必应搜索相比,Copilot 答案引擎让《纽约时报》域名的点击率最多下降 93%。Hecht 在 2024 年 1 月的内部演示中把这种下滑描述为恶性循环,认为它会同时损害微软的模型和整个网络。另一份微软文件写道,一个终端产品威胁其内容供应链关键供应方的经济基础,这种局面非常反常。
关于替代效应的表述同样密集。OpenAI 的 ChatGPT 负责人 Nick Turley 在内部沟通中写道,出版商面临生存级别的威胁,此类产品在很大程度上替代了他们的工作,且会随着模型变强而加剧。OpenAI 总裁 Greg Brockman 称这些模型很擅长新闻。微软 CEO 纳德拉今年早些时候在证词中承认,与聊天机器人对话已经替代了访问原始网站,并表示付费墙内的内容无论用于检索增强还是训练都应获得授权;如果当初知道 OpenAI 抓取了付费墙内容训练模型,他会动用微软的权利要求 OpenAI 重新训练。
抓取规模首次有了具体数字。OpenAI 的中期训练数据集包含超过 91692 份《纽约时报》、《每日新闻》和调查报道中心的作品副本;一个源自 Common Crawl 的数据集,光 nytimes.com 的文档就超过 200 万份;名为 Project Mango 的数据合作产出的训练集,包含至少 160903 部新闻原告的独立作品。诉状还称,OpenAI 把完整的 GPT-3 训练集交给了微软,微软则通过 Project Taxi 和 Project Mango 向 OpenAI 回传训练数据。
原告同时指控一系列主动行为:OpenAI 员工设计了绕过《纽约时报》付费墙且不被察觉的办法,研究员 Nick Ryder 分享该办法时 Brockman 回复表示赞许;从必应索引抓取内容;搭建了严重依赖新闻内容的 WebText、WebText2 数据集;并在训练数据进入模型前刻意删除版权声明,以免模型向用户输出这些声明。
这些材料出现在一个总体对 AI 公司有利的司法环境里。法官们大多接受训练属于合理使用的抗辩,特朗普政府本月还提交了支持 OpenAI 无授权训练的意见书。但合理使用的判断标准之一,是使用行为是否损害原作品的市场,这批内部表态恰好落在这个问题上。《每日新闻》代理律师 Steven Lieberman 向 TechCrunch 表示:"这里首次披露的证据表明,OpenAI 和微软知道他们做的事是错的。"OpenAI 与微软均未回应置评请求。
93% 的点击率降幅为营销和搜索团队提供了一个来自 AI 平台内部的参照,但它只反映微软对单一出版商的测量,不能直接视为行业平均值。解封材料可能增加监管机构和出版商对抓取、授权与署名的压力,但结果仍不确定。相关规则的变化会影响答案引擎可以使用哪些内容,以及来源需要以何种方式呈现。依赖 AI 系统引用获得曝光的品牌,需要持续关注授权争议对可用来源范围的影响。



