USA Today 母公司起诉 OpenAI:称未经授权用数十万篇新闻文章训练模型,索赔超 2.5 亿美元

USA Today 母公司起诉 OpenAI:称未经授权用数十万篇新闻文章训练模型,索赔超 2.5 亿美元

《今日美国》母公司 USA Today Co.(原甘尼特集团)于 10 月 8 日在纽约南区联邦法院起诉 OpenAI,指控其未经授权使用旗下 19 家报纸的数十万篇新闻文章训练 GPT 系列模型,并要求赔偿超过 2.5 亿美元。这是出版商诉 AI 公司的版权战中又一块重要拼图。

要点

1. 证据翔实,诉状直指训练语料:长达 79 页的诉状称,OpenAI 内部语料 WebText 中含有该集团超 16 万条文章条目,其中 usatoday.com 独占 8.3 万条;其出版物域名在 C4 数据集中的内容超过 1.22 亿 token。诉状还引用 OpenAI 内部沟通——联合创始人格雷格·布罗克曼称模型"特别擅长预测新闻文章文本",一位研究副总裁则说"训练网络就是让它们记住数据"。

2. GPT-5.6 输出样本成呈堂证供:诉状附上 GPT-5.6 的输出实例,显示模型被要求按标题找文章时,能输出大段多章节摘要,复述原文的结构组织——涉及《印第安纳波利斯星报》《底特律自由报》等多家地方报纸的文章。原告主张,OpenAI 是在有意把模型训练成新闻的"代餐":正如 ChatGPT 负责人承认的,"一旦 ChatGPT 给出答案,就没理由再点原文链接"。

3. 并入纽约南区合并版权诉讼:诉状同日提交了关联性声明,要求并入该法院已合并审理的 OpenAI 版权侵权诉讼(MDL),原告名单已包括《纽约时报》、调查报道中心等多家机构。案件结果可能重塑"网页抓取+模型训练"的行业规则边界。

原文链接:点击查看原文,正文为摘要整理,仅供参考。

XLinkedInFacebook