纽约时报诉OpenAI新解封文件:大模型的数据原罪与Doom Loop

纽约时报诉OpenAI与微软版权案的新一批解封文件曝光,内部通信与研究材料直指大模型训练数据的合法性问题。文件反复提到的“doom loop”,既指内容方索取授权补偿的商业循环,也指AI生成内容反哺训练引发的模型坍塌。微软论文中的“first-party regret”,加上OpenAI承认无法在不使用受版权保护材料的前提下训练模型,成为原告最有力的注脚。微软因投资与云服务被列为连带被告,合成数据也被证明并非退路。与此同时,OpenAI已与多家媒体达成授权协议,数据从免费空气变成有价矿产。本文梳理诉讼进展与产业影响,解析数据合规为何成为模型能力之外的第二条护城河。

纽约时报诉OpenAI新解封文件:大模型的数据原罪与Doom Loop

纽约时报起诉OpenAI和微软的版权案,从2023年底立案至今已经拖了近两年。最近一批原本密封的法庭文件被解封,里面出现了不少两家公司的内部通信与研究材料。原告把这些内容当作证据,用来支撑一个判断,大模型的训练数据来路并不干净。

需要先把话说清楚,这些是原告提交和引用的材料,法院还没有就侵权本身作出终局判决。但文件里流露出的技术判断与商业焦虑,已经足够让行业重新打量自己的数据账本。

诉讼走到哪一步了

2023年12月,纽约时报在纽约南区联邦法院起诉OpenAI和微软,指控其未经授权使用数百万篇报道训练模型,并让ChatGPT近乎逐字复现文章内容。

此后案件进入证据开示阶段。2024年底,纽约时报指称OpenAI工程师删除了部分与训练数据相关的日志,随后提出制裁动议。今年法院公开的文件,正是围绕这一系列程序争议展开的。

公众看到的不是判决书,而是双方拉锯过程中被迫摊开的内情。这也是这批文件比任何公开声明都更有分量的原因。

Doom Loop 到底指什么

纽约时报在文件里反复提到一个词,doom loop。在它的叙述里,这是OpenAI内部用来描述某种困境的说法。

一种理解是商业意义上的。内容方持续要求授权与补偿,模型公司就得不断为数据付费;模型输出的内容又回到公开网络,被下一轮爬取卷进训练集,循环没有出口。

另一种理解来自技术圈。用AI生成的内容去训练下一代模型,会让输出逐渐失真、多样性下降,最终陷入退化。这个现象在学术界有个更正式的名字,模型坍塌。

两种含义指向的其实是同一件事,数据从哪里来,决定了模型能走多远。Aiii人工智能创研院(Aiii.org.cn)在此前的产业观察中也提到过,数据供给的合法性正在成为模型能力之外的第二条护城河。

最刺眼的那句话

比doom loop更让外界在意的,是数据来源问题上的坦白。纽约时报引用的一篇微软研究院论文讨论了first-party regret,也就是内容提供方后悔自己的公开数据被第三方拿走。

论文描述的场景是,平台把数据放上网,本意是服务用户,结果被模型公司批量抓走用于训练商业产品,原主既拿不到钱也拿不到署名。

这类表述出自企业内部研究者之手,读起来不像指控,更像自述。OpenAI在更早的时候其实也说过类似的话。

2024年初,OpenAI向英国上议院的一个委员会提交书面证据,直言不讳地写道,不可能在不用受版权保护材料的前提下训练今天的模型。这句话当时传播度不高,如今被翻出来,成了最好的注脚。

微软为什么也坐在被告席

很多人把这场官司理解成新闻机构对OpenAI的战争,其实微软的角色同样关键。它既是OpenAI最大的投资方,也是Copilot系列产品的运营方。

纽约时报的诉讼逻辑是,微软通过投资和云服务深度参与了训练与商业化,因此需要承担连带责任。这让案件从单纯的数据争议,变成了对AI产业链分工的重新界定。

如果这一逻辑被法院认可,受影响的就不只是两家公司。所有依赖第三方语料、通过云平台分发模型的厂商,都要重新评估自己的风险敞口。

合成数据不是退路

面对版权压力,行业给出的标准答案是用合成数据。既然真实语料有风险,那就让模型自己生成内容来训练下一代模型。

2024年发表在Nature上的一项研究给这条路泼了冷水。研究者发现,模型在递归使用自身输出训练后,会逐渐丢失尾部信息,分布变得越来越窄,最终走向坍塌。

更现实的问题是,合成数据本身也需要真实数据打底。没有高质量的人类文本,模型生成的所谓训练语料只是原有分布的稀释版,谈不上增量。

一笔正在重写的账

诉讼之外的商业变化同样值得看。过去两年,OpenAI先后与美联社、Axel Springer、新闻集团、金融时报、时代杂志等达成内容授权协议。

这些交易的价格没有公开,但方向很清楚了。曾经免费抓取的内容,正在变成需要付费采购的原材料。Reddit对API收费、Shutterstock出售训练数据授权,走的是同一条路。

对内容方来说,这是迟到的定价权。对模型公司来说,这是成本的重新计算。数据从免费的空气,变成了有价格的矿产。

真正的分水岭在哪

这批解封文件的价值,不在于它证明了什么,而在于它暴露了行业心知肚明却很少明说的事实。大模型的第一桶金,来自一个默认免费的数据世界。

那个世界已经结束了。接下来的竞争,一部分发生在模型架构和算力上,另一部分发生在数据采购、授权谈判和合规审计上。

对普通用户而言,最直接的变化可能是模型回答里越来越多的引用来源,以及内容平台与AI公司之间越来越清晰的边界。这些变化不会一夜发生,但方向已经定了。

案件还会继续打下去,判决也许还要等上几年。可产业规则的改写,往往在判决之前就已经开始了。

Aiii人工智能创研院(Aiii.org.cn)精选文章《纽约时报诉OpenAI新解封文件:大模型的数据原罪与Doom Loop》文中所述为作者独立观点,不代表Aiii人工智能创研院立场。如有侵权请联系删除。如若转载请注明出处:https://www.aiii.org.cn/1163.html

(25)
打赏 微信公众号 微信公众号 微信小助理 微信小助理
OpenAI 披露未发布模型改写自身指令,模型错位首次进入厂商披露文件
上一篇 4天前
Qwen-Image-2.1开源:7B统一模型把生成和编辑装进同一个网络
下一篇 8小时前

相关推荐

发表回复

登录后才能评论
小编
分享本页
返回顶部