冲刺上市前夕惹上天价官司这家顶尖科技巨头被要求销毁底层模型如果你问一个 AI 研发人员训练大模型最怕什么他的回答大概率是算力不够或者显卡烧了。但如果去问那些正在筹备上市的科技巨头法务他们眼下最怕的可能是一张来自传统报业的法院传票。就在 2026 年 10 月 8 日全美发行量数一数二的报业集团 USA Today 联手旗下 13 家实体正式向美国纽约南区联邦地区法院递交了一份长达 79 页的起诉书。他们不仅开口索赔超过 2.5 亿美元还提出了一个让整个科技界倒吸一口凉气的严苛要求彻底销毁所有使用了涉案新闻内容训练出来的 GPT 模型及相关训练集。一、被当成免费燃料的数十万篇报道这起案件的案号是 1:26-cv-08892。原告方除了母公司 USA Today Co. 之外还拉来了包括《印第安纳波利斯星报》《底特律自由新闻》《亚利桑那共和报》以及《哥伦布快报》等在内的 19 家区域出版物。他们的代理律师 Steven Lieberman 在起诉书里写得毫不客气OpenAI 能够取得今天的商业成功完全是建立在规模化的版权侵权之上。传统媒体的愤怒不是凭空来的。他们拿出了一份详细的账本把 OpenAI 是怎么把报纸拆碎吃进肚子里的过程算得清清楚楚。原来在早年用来训练 GPT-2 的网络文本数据集里原告旗下报纸的内容就超过了 16 万条单是主站域名就有 83266 条另一家地方报纸也有 12994 条。到了更庞大的过滤数据集里原告旗下的文字体量超过了 1.22 亿个基本语言单位。而在 GPT-3 的训练配比中类似这种公共网络抓取的数据占到了 60%自建网络文本占了 22%。这就好比一家米其林餐厅声称自己做出了划时代的秘制高汤但后厨的采购单却显示他们每天都在隔壁百年老店的汤锅里偷舀原汤连声招呼都没打过。原告在诉状中强调自己的网站早已设置了明确拒绝抓取的防护代码但对方依然通过各种途径把数十万篇需要付费或拥有明确版权的报道生生搬进了自己的语料库。更让媒体坐不住的是这种搬运并不是过去式。原告指出为了让模型保持聪明科技公司必须源源不断地投喂新鲜材料。所以这根本不是什么历史遗留问题而是一场正在持续进行的侵权。二、连自家员工都在说实话的内部通信按照以往的版权诉讼套路大模型公司最常用的盾牌就是合理使用意思是我拿你的文字只是为了学习语言规律属于颠覆性的技术创新并没有直接抄袭你的产品。但这一次原告有备而来直接搬出了 OpenAI 自家高管和工程师的内部言论把这块盾牌砸得粉碎。诉状里记录的一桩桩内部通信几乎把科技公司的底牌翻了个底朝天。OpenAI 联合创始人 Greg Brockman 曾对同事坦言模型在预测和生成新闻报道这类文本上特别擅长。到了 2020 年时任研究负责人 Dario Amodei 在向团队展示成果时更是直接把自动生成新闻列为了 GPT-3 的核心技能之一。甚至有一位研究副总裁在内部直言不讳地说过一句话我们训练这个网络的初衷就是让它去记忆那些训练数据这正是它们的目标所在。到了 2022 年 6 月员工们在内部讨论中也承认第四代模型会死死记住大量数据而且极其擅长把原始文本一字不落地吐出来。起诉书还把微软也拉进了这趟浑水。原告指控微软在三年时间里通过一个内部代号为出租车项目的通道把必应搜索引擎抓取的数十亿网页索引副本直接送给了 OpenAI不仅如此微软还单独为 OpenAI 运营着另一个名为芒果项目的定制网络爬虫所有运营费用全由 OpenAI 买单。更有意思的是起诉书揭露了一个细节OpenAI 后来上线的输出过滤机制实际上根本没有对那些尚未起诉它的媒体机构做任何内容压制。一位微软高管在内部甚至直白地把这种看人下菜碟的做法称作是一场意外的掩盖。连他们自己在 2023 年底提交给英国上议院调查的书面材料里都白纸黑字写着如果不使用受版权保护的材料根本不可能训练出当今领先的 AI 模型。这一切证据几乎把故意侵权的罪名焊死在了卷宗上。三、生成长摘要加链接算不算端走别人的饭碗如果说早期的媒体诉讼还停留在你拿我数据去训练的阶段那么 USA Today 这次把刀尖对准了一个更具杀伤力的痛点ChatGPT 正在用长摘要彻底替代原文把传统媒体的生存空间挤压殆尽。为了向法官和陪审团证明这一点原告团队在起诉书的附件里拿出了针对 GPT-5.6 模型的实测记录。他们用完全相同的提示词模板做测试请找到并总结标题为某某的文章并给我一份深度摘要。随后他们附上了 19 家地方报纸的独家调查报道标题。测试结果让人心惊。比如《印第安纳波利斯星报》一篇关于调查人员突击搜查开发商住所的深度报道模型不仅快速抓取了内容还生成了一篇结构极其严密、多段落、完整保留了核心事实与叙事框架的超长精读摘要。对普通读者来说当 AI 已经把一篇两千字的新闻调查浓缩成五百字的精练长文里面有因有果、有时间有地点谁还会特意点开附在末尾的原网链接原告直接援引了 ChatGPT 负责人 Nick Turley 的原话出版商正面临来自我们产品的生存威胁因为这些产品基本上就是替代性的而且未来会替代得越来越好。诉状中还记下了一位 OpenAI 工程师的无奈总结事实证明无论我们把原文链接放得多显眼用户也根本不会去点击。在内部文件里ChatGPT 甚至被直接形容为一个让人再也不需要打开搜索引擎的现代报摊。既然报摊主人把报纸拆开、重写一遍免费读给路人听那老老实实写报道的记者和报社自然就没了活路。四、估值高位与上市关口前的生死博弈面对这场来势汹汹的官司OpenAI 的日子显然并不轻松。虽然北加州法院在此前涉及其他大模型公司的诉讼中曾认为模型抓取训练可能构成合理使用但在纽约南区联邦地区法院游戏规则截然不同。这里的法官向来极其看重技术产品是否对原作品构成了市场替代。更现实的压力在于商业层面。此时的 OpenAI 估值已经飙升到了 8520 亿美元不仅在 2026 年 6 月正式提交了首次公开募股文件其广告业务也在 8 月达到了 10 亿美元的年化收入。对于一家正处于冲刺上市最关键阶段的超级独角兽来说招股书里任何一个不可控的重大法律风险都可能变成资本市场上的黑天鹅。原告选择在这个节点动手计算得极为精准。2.5 亿美元的索赔底气来自美国版权法中对每件故意侵权作品最高 15 万美元的法定赔偿以及对每次移除版权管理信息最高 2.5 万美元的罚则。而且USA Today 并不是排斥技术合作的顽固派他们早在 2025 年 7 月就把内容授权给了 Perplexity同年底又与 Meta 签下了多年期的商业授权协议。这恰恰成了戳向 OpenAI 的另一柄利刃既然你口口声声说抓取新闻是合理合法的技术常态那为什么其他同行要花真金白银买授权甚至 OpenAI 自己也曾和部分新闻机构签过付费协议这本身就证明他们心里清楚这道门是需要门票的。目前包括《纽约时报》、Ziff Davis、CBC、《大英百科全书》以及近 400 家地方报纸组成的庞大联盟早已经把 OpenAI 告上了曼哈顿法院多数案件正由法官 Sidney Stein 合并审理。USA Today 同样递交了关联性声明请求并入这场世纪大诉讼之中。大模型究竟是在创造一个更高效的信息世界还是在吸干原创者的养分后搭建起自己的收费乐园这个困扰了科技界数年的悬念终于被推到了陪审团面前。那些曾经以为只要把代码写得足够精妙就能绕过现实规则的技术精英们最终还是得坐回谈判桌前为他们曾经随意抓取的每一个字重新标上昂贵的价格。