【TechWeb】美国当地时间9月17日,《纽约时报》及其他新闻媒体机构向法院提交了最新诉讼文件。文件显示,OpenAI在明知其AI工具对出版商构成“生存威胁”的情况下,仍复制了数百万篇受版权保护的文章,用于打造潜在价值高达“天文数字”的AI技术。《纽约时报》等机构目前正向OpenAI寻求数十亿美元的损害赔偿,共同被告还包括微软。
案件的争议焦点在于:OpenAI与微软是否通过利用出版商内容训练模型而侵犯版权法。《纽约时报》律师称,被告未经许可,反复完整复制数百万篇受版权保护的文章,以开发具有替代性的商业AI产品,且OpenAI对此完全知情。
新披露的证据包括:OpenAI联合创始人、现任总裁格雷格·布罗克曼(Greg Brockman)大约在2017年写道,他“被那些天文数字般的财富深深驱动”,希望通过OpenAI技术的商业化获得这笔财富;OpenAI旗下ChatGPT负责人曾在内部文件中写道,AI产品对出版商构成“生存威胁”,这些产品“在很大程度上具有替代性,就是这样,而且随着它们变得更好,替代性会越来越强”。
诉讼还引用了微软应用科学总监布伦特·赫克特(Brent Hecht)的话。赫克特据称曾写道,用受版权保护的内容训练大语言模型是“一场规模空前的惊人盗窃”,此案若由OpenAI、微软胜诉,将“彻底嘲弄‘合理使用’这一理念”。
除原文提及内容外,本次解封文件还披露了更多OpenAI与微软高管的内部言论:微软CEO萨蒂亚·纳德拉(Satya Nadella)在为该案所作的证词中表示,与聊天机器人的对话已经“替代”了用户访问出版商网站的行为;OpenAI高级高管尼克·特利(Nick Turley)写道,“我们的产品在很大程度上具有替代性,就是这样”;OpenAI政策总监杰克·克拉克(Jack Clark)亦在内部写道,公司的工作“将日益导致我们创造出能够替代那些定义社会‘文化’之人的劳动力的系统”。
付费墙问题也被详细披露。诉讼文件称,OpenAI采用了“越界且具有欺骗性”的手段获取付费墙后的内容,而布罗克曼当时已知悉这一做法:当一名员工告诉布罗克曼“有办法绕过《纽约时报》付费墙”后,布罗克曼回应道:“啊,不错。”
微软内部对训练行为的定性更为尖锐。据华尔街见闻报道,赫克特博士表示,在未经许可的情况下复制数百万篇新闻文章,可能构成“人类历史上最大规模的劳动力盗窃”。此外,微软自己的数据显示,与传统搜索引擎相比,使用其AI回答工具的用户对原始内容的点击率低了83%至93%——这一数据直接印证了“替代效应”的存在。
纳德拉在证词中还表示,付费墙内的内容应获得授权才能用于AI训练;如果当时“得知OpenAI抓取并利用付费墙后的信息进行训练”,他会依据两家公司当时的协议,行使微软的权利,要求OpenAI“重新训练其模型”。
微软周四对纳德拉证词作出回应称,其“谈的是广泛原则以及人们查找和消费信息方式正在发生的变化”,并非对本案核心“版权问题的结论”;对于赫克特的言论,微软表示“这些言论反映的是一名员工的个人观点,并非法律分析”。
OpenAI方面则一直辩称,根据版权法,利用公开可获得的内容训练模型属于“合理使用”,这一法律依据与搜索引擎访问相关内容时采用的理由类似——其大语言模型会对原始内容进行转换,而不是复制,且不会成为《纽约时报》或其他出版物的替代品。此外,OpenAI还辩称,由于出版商当时未通过robots.txt等方式屏蔽其爬虫,其访问行为属于“默示授权”。OpenAI未立即回应置评请求,该公司此前曾表示:“本案不是人类创作与AI之争,而是《纽约时报》想以牺牲惠及所有人的进步为代价,谋求一笔不该得的横财。”
此案是版权持有人针对AI公司提起的数十起诉讼中最受关注的案件之一,其判决结果将直接影响“合理使用”原则在AI训练场景下的法律边界。据华尔街见闻报道,此案已被并入美国多区诉讼,由一位法官统一审理,特朗普政府已就此表态,敦促法院裁定用版权作品训练AI属于“合理使用”——这为案件增添了行政分支介入的变量。
出版商一方则警告“替代效应”已在发生:ChatGPT发布后,谷歌等公司加速推出AI摘要功能,网站流量被AI生成内容稀释。目前许多出版商已经屏蔽OpenAI等AI公司的爬虫访问其网站,而这被OpenAI支持者批评为“将阻碍开放网络的发展”。
