冲刺上市前夕惹上天价官司,这家顶尖科技巨头被要求销毁底层模型
冲刺上市前夕惹上天价官司这家顶尖科技巨头被要求销毁底层模型如果你问一个 AI 研发人员训练大模型最怕什么他的回答大概率是算力不够或者显卡烧了。但如果去问那些正在筹备上市的科技巨头法务他们眼下最怕的可能是一张来自传统报业的法院传票。就在 2026 年 10 月 8 日全美发行量数一数二的报业集团 USA Today 联手旗下 13 家实体正式向美国纽约南区联邦地区法院递交了一份长达 79 页的起诉书。他们不仅开口索赔超过 2.5 亿美元还提出了一个让整个科技界倒吸一口凉气的严苛要求彻底销毁所有使用了涉案新闻内容训练出来的 GPT 模型及相关训练集。一、被当成免费燃料的数十万篇报道这起案件的案号是 1:26-cv-08892。原告方除了母公司 USA Today Co. 之外还拉来了包括《印第安纳波利斯星报》《底特律自由新闻》《亚利桑那共和报》以及《哥伦布快报》等在内的 19 家区域出版物。他们的代理律师 Steven Lieberman 在起诉书里写得毫不客气OpenAI 能够取得今天的商业成功完全是建立在规模化的版权侵权之上。传统媒体的愤怒不是凭空来的。他们拿出了一份详细的账本把 OpenAI 是怎么把报纸拆碎吃进肚子里的过程算得清清楚楚。原来在早年用来训练 GPT-2 的网络文本数据集里原告旗下报纸的内容就超过了 16 万条单是主站域名就有 83266 条另一家地方报纸也有 12994 条。到了更庞大的过滤数据集里原告旗下的文字体量超过了 1.22 亿个基本语言单位。而在 GPT-3 的训练配比中类似这种公共网络抓取的数据占到了 60%自建网络文本占了 22%。这就好比一家米其林餐厅声称自己做出了划时代的秘制高汤但后厨的采购单却显示他们每天都在隔壁百年老店的汤锅里偷舀原汤连声招呼都没打过。原告在诉状中强调自己的网站早已设置了明确拒绝抓取的防护代码但对方依然通过各种途径把数十万篇需要付费或拥有明确版权的报道生生搬进了自己的语料库。更让媒体坐不住的是这种搬运并不是过去式。原告指出为了让模型保持聪明科技公司必须源源不断地投喂新鲜材料。所以这根本不是什么历史遗留问题而是一场正在持续进行的侵权。二、连自家员工都在说实话的内部通信按照以往的版权诉讼套路大模型公司最常用的盾牌就是合理使用意思是我拿你的文字只是为了学习语言规律属于颠覆性的技术创新并没有直接抄袭你的产品。但这一次原告有备而来直接搬出了 OpenAI 自家高管和工程师的内部言论把这块盾牌砸得粉碎。诉状里记录的一桩桩内部通信几乎把科技公司的底牌翻了个底朝天。OpenAI 联合创始人 Greg Brockman 曾对同事坦言模型在预测和生成新闻报道这类文本上特别擅长。到了 2020 年时任研究负责人 Dario Amodei 在向团队展示成果时更是直接把自动生成新闻列为了 GPT-3 的核心技能之一。甚至有一位研究副总裁在内部直言不讳地说过一句话我们训练这个网络的初衷就是让它去记忆那些训练数据这正是它们的目标所在。到了 2022 年 6 月员工们在内部讨论中也承认第四代模型会死死记住大量数据而且极其擅长把原始文本一字不落地吐出来。起诉书还把微软也拉进了这趟浑水。原告指控微软在三年时间里通过一个内部代号为出租车项目的通道把必应搜索引擎抓取的数十亿网页索引副本直接送给了 OpenAI不仅如此微软还单独为 OpenAI 运营着另一个名为芒果项目的定制网络爬虫所有运营费用全由 OpenAI 买单。更有意思的是起诉书揭露了一个细节OpenAI 后来上线的输出过滤机制实际上根本没有对那些尚未起诉它的媒体机构做任何内容压制。一位微软高管在内部甚至直白地把这种看人下菜碟的做法称作是一场意外的掩盖。连他们自己在 2023 年底提交给英国上议院调查的书面材料里都白纸黑字写着如果不使用受版权保护的材料根本不可能训练出当今领先的 AI 模型。这一切证据几乎把故意侵权的罪名焊死在了卷宗上。三、生成长摘要加链接算不算端走别人的饭碗如果说早期的媒体诉讼还停留在你拿我数据去训练的阶段那么 USA Today 这次把刀尖对准了一个更具杀伤力的痛点ChatGPT 正在用长摘要彻底替代原文把传统媒体的生存空间挤压殆尽。为了向法官和陪审团证明这一点原告团队在起诉书的附件里拿出了针对 GPT-5.6 模型的实测记录。他们用完全相同的提示词模板做测试请找到并总结标题为某某的文章并给我一份深度摘要。随后他们附上了 19 家地方报纸的独家调查报道标题。测试结果让人心惊。比如《印第安纳波利斯星报》一篇关于调查人员突击搜查开发商住所的深度报道模型不仅快速抓取了内容还生成了一篇结构极其严密、多段落、完整保留了核心事实与叙事框架的超长精读摘要。对普通读者来说当 AI 已经把一篇两千字的新闻调查浓缩成五百字的精练长文里面有因有果、有时间有地点谁还会特意点开附在末尾的原网链接原告直接援引了 ChatGPT 负责人 Nick Turley 的原话出版商正面临来自我们产品的生存威胁因为这些产品基本上就是替代性的而且未来会替代得越来越好。诉状中还记下了一位 OpenAI 工程师的无奈总结事实证明无论我们把原文链接放得多显眼用户也根本不会去点击。在内部文件里ChatGPT 甚至被直接形容为一个让人再也不需要打开搜索引擎的现代报摊。既然报摊主人把报纸拆开、重写一遍免费读给路人听那老老实实写报道的记者和报社自然就没了活路。四、估值高位与上市关口前的生死博弈面对这场来势汹汹的官司OpenAI 的日子显然并不轻松。虽然北加州法院在此前涉及其他大模型公司的诉讼中曾认为模型抓取训练可能构成合理使用但在纽约南区联邦地区法院游戏规则截然不同。这里的法官向来极其看重技术产品是否对原作品构成了市场替代。更现实的压力在于商业层面。此时的 OpenAI 估值已经飙升到了 8520 亿美元不仅在 2026 年 6 月正式提交了首次公开募股文件其广告业务也在 8 月达到了 10 亿美元的年化收入。对于一家正处于冲刺上市最关键阶段的超级独角兽来说招股书里任何一个不可控的重大法律风险都可能变成资本市场上的黑天鹅。原告选择在这个节点动手计算得极为精准。2.5 亿美元的索赔底气来自美国版权法中对每件故意侵权作品最高 15 万美元的法定赔偿以及对每次移除版权管理信息最高 2.5 万美元的罚则。而且USA Today 并不是排斥技术合作的顽固派他们早在 2025 年 7 月就把内容授权给了 Perplexity同年底又与 Meta 签下了多年期的商业授权协议。这恰恰成了戳向 OpenAI 的另一柄利刃既然你口口声声说抓取新闻是合理合法的技术常态那为什么其他同行要花真金白银买授权甚至 OpenAI 自己也曾和部分新闻机构签过付费协议这本身就证明他们心里清楚这道门是需要门票的。目前包括《纽约时报》、Ziff Davis、CBC、《大英百科全书》以及近 400 家地方报纸组成的庞大联盟早已经把 OpenAI 告上了曼哈顿法院多数案件正由法官 Sidney Stein 合并审理。USA Today 同样递交了关联性声明请求并入这场世纪大诉讼之中。大模型究竟是在创造一个更高效的信息世界还是在吸干原创者的养分后搭建起自己的收费乐园这个困扰了科技界数年的悬念终于被推到了陪审团面前。那些曾经以为只要把代码写得足够精妙就能绕过现实规则的技术精英们最终还是得坐回谈判桌前为他们曾经随意抓取的每一个字重新标上昂贵的价格。

相关新闻

PostgreSQL + pgvector + RRF 混合检索替代向量数据库的落地实践

PostgreSQL + pgvector + RRF 混合检索替代向量数据库的落地实践

这事得从一笔账单说起。去年年底,项目里的向量数据库服务快到期了,我看了眼续费单,再对照我们过去三个月的实际调用量,心底那杆秤就开始晃了。随后我花了一个周末,把基于 PostgreSQL 的方案搭了出来:pgvect…

2026/10/11 8:57:43 阅读更多 →
从内核到挂载点:拆解 Docker 镜像分层与卷挂载的真实运行轨迹

从内核到挂载点:拆解 Docker 镜像分层与卷挂载的真实运行轨迹

2026-10-10 16:35:08

2026/10/11 8:57:43 阅读更多 →
GammaGL 一口气兼容 TF/PyTorch/Paddle/MindSpore:图神经网络生态的「端水大师」能带来什么

GammaGL 一口气兼容 TF/PyTorch/Paddle/MindSpore:图神经网络生态的「端水大师」能带来什么

GammaGL 一口气兼容 TF/PyTorch/Paddle/MindSpore:图神经网络生态的「端水大师」能带来什么 【免费下载链接】tensorflow An Open Source Machine Learning Framework for Everyone 项目地址: https://gitcode.com/GitHub_Trending/te/tensorflow 图神经网络…

2026/10/11 8:57:43 阅读更多 →

最新新闻

GAMMA InSAR命令行处理全流程:从SLC到形变图的10步硬核实践

GAMMA InSAR命令行处理全流程:从SLC到形变图的10步硬核实践

简介:本资源是一份面向遥感科学、测绘工程及地球物理领域研究者与高年级研究生的GAMMA软件InSAR处理技术详解课件,聚焦合成孔径雷达干涉测量的核心流程与实操要点。课件系统梳理了从多视处理、SLC配准、干涉纹图生成,到基线估算、平地效应去除…

2026/10/11 9:41:46 阅读更多 →
汉字简体繁体对照表数据库设计:从字符集到词级转换的完整方案

汉字简体繁体对照表数据库设计:从字符集到词级转换的完整方案

简介:《汉字简体繁体参照表》是一份面向开发者、数据分析师及语言处理学习者的实用数据集,收录约4792条简体与繁体汉字映射关系,可支撑多语言软件简繁切换、文本预处理、数据清洗与学术研究等场景。资源包共4个文件,压缩包仅162KB…

2026/10/11 9:41:46 阅读更多 →
DeepSeek R1本地部署:GGUF校验、llama-server配置与Web/CLI调用全链路指南

DeepSeek R1本地部署:GGUF校验、llama-server配置与Web/CLI调用全链路指南

简介:本资源是一份面向AI开发者与本地大模型实践者的DeepSeek R1全链路部署指南,聚焦Windows平台下的轻量化本地运行与交互式Web访问,解决模型部署门槛高、环境配置复杂、客户端调用不直观等实际痛点。资源为单文件PDF文档(1.54MB…

2026/10/11 9:41:46 阅读更多 →
rea 缩写解析:响应式编程与实时系统核心原理及工程实践

rea 缩写解析:响应式编程与实时系统核心原理及工程实践

1. 从“rea”这个标题说起:一个被低估的万能缩写第一次看到“rea”这个标题的时候,我脑子里蹦出来的第一反应是——这大概率又是一个被缩写玩坏的项目名。做技术的人都有这个毛病,喜欢把长名字砍成三四个字母,图省事、图输入快&am…

2026/10/11 9:41:46 阅读更多 →
基于SpringBoot的仓库管理系统实战:从库存业务到并发部署

基于SpringBoot的仓库管理系统实战:从库存业务到并发部署

1. 先从项目说起:这套仓库管理系统到底解决什么问题前阵子帮一个做五金配件贸易的朋友整理仓库管理流程,发现他们还在用Excel记录出入库,库存对不上、订单发货漏单是家常便饭。聊到最后,他提了一个很实在的需求:要一套…

2026/10/11 9:41:46 阅读更多 →
央国企信创数字化落地指南:从研究报告到迁移实操与避坑

央国企信创数字化落地指南:从研究报告到迁移实操与避坑

简介:这份《2025年央国企信创数字化研究报告》面向央国企数字化负责人、信创从业者及关注AI产业趋势的研究人员,系统梳理2025年人工智能在信创建设中的技术演进与落地路径,帮助读者把握从推理计算、合成数据到量子AI融合的关键方向。资源为单…

2026/10/11 9:40:46 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →