9 月 22 日,纽约时报诉微软、OpenAI 版权案的一组解封法庭文件,把 AI 行业讳莫如深的一层掀开了。文件里有两句话格外刺眼:微软内部备忘录称行业的自动网页抓取是"前所未有的惊人盗窃",是"人类历史上最大的劳动盗窃";而同一时期,微软 Copilot 的回答引擎把指向纽约时报域名的引荐流量削减了最高 93%。
这不是又一场"科技公司又被起诉"的常规诉讼。它直接打在生成式 AI 最脆弱的地基上——训练数据和答案是怎么来的,又夺走了谁的什么。
93% 流量削减,意味着什么
先理解这个数字的分量。传统新闻媒体的主要生存逻辑是:搜索引擎和社交平台把用户"引荐"到自家网站,靠广告和订阅变现。引荐流量(referral traffic)就是这条生命线的水流。
文件显示,Copilot 这类"答案引擎"出现后,用户不再点开链接、不再进入原站,而是直接读到 AI 揉碎后的摘要。时报域名的引荐流量因此最高跌了 93%。这不是"用户少看了点",而是把内容创作者的获客入口几乎堵死——读者还在,但都留在了 AI 的对话框里。
更微妙的是,这正是微软内部自己人早有预警的事。2023 年 1 月的备忘录里,应用科学总监 Brent Hecht 就把自动网页抓取定性为"前所未有的惊人盗窃",一年后他进一步警告:AI 答案引擎会制造一个经济"doom loop(厄运循环)"——原创信息创作者赚不到钱、停止产出,AI 也就没了可学的新养料。
自己人点破的,恰恰是行业对外最不愿承认的闭环。
"最大盗窃"四个字的分量
Hecht 的两句原话值得原样摆出来:自动化网页抓取是"an astonishing theft of unprecedented proportions"(前所未有比例的惊人盗窃),以及"the largest theft of labor in human history"(人类历史上最大的劳动盗窃)。
一个科技公司高管用"盗窃劳动"形容自家产品的数据来源,这在解封前是不可想象的。它的杀伤力在于:这些不是原告的一面之词,而是被告方内部的、未被要求公开的自白。
文件还详述了系统性绕过付费墙、以及故意剥离数百万篇被抓取文章的版权元数据。这两点很关键——它们把事情从"合理使用(fair-use)的灰色边界"推到了"是否有意规避权属标识"的更暗处。合理使用至少预设"转换性使用",而如果连版权标记都被主动抹掉,转换性的辩护理由就弱了。
为什么这事动摇的是 whole industry 的防御
纽约时报的案子只是冰山一角,但解封文件的意义超出这一案。过去几年,整个生成式 AI 行业赖以对抗版权诉讼的核心盾牌,是"合理使用"——即模型训练是对受版权作品的"转换性使用",类似人类阅读后创作,而非简单复制。
但内部备忘录承认"盗窃劳动"、承认流量被系统性夺走、承认元数据被剥离,这些证据直接攻击盾牌的两块基石:一是"使用是否真的转换、而非替代原作",二是"行业是否真诚相信自己在合法边界内"。当被告自己的总监写下"这是盗窃",原告的律师就有了把行业真实意图摊在陪审团面前的弹药。
这也解释了为什么这类案件比"某张图被模型仿冒风格"的纠纷危险得多。它动摇的是训练范式的合法性,而不是某个输出样本。
对每个内容创作者,这是面镜子
把镜头拉回做内容的人身上。无论你是独立博主、媒体编辑,还是运营一个原创资讯站,这个案子戳中的是同一个焦虑:当读者越来越习惯在 AI 对话框里得到"已揉碎的答案",原站点的流量、广告、订阅这些变现根基会被持续抽空;而 AI 公司靠这些原创内容训练、靠这些答案留住用户,却未必把价值回流给生产者。
解封文件里"doom loop"的提法,对这种处境是精准的:创作者因收入下滑减少产出,平台可学的新鲜内容变少,最终用户得到的答案质量也跟着塌。这是一个对所有人都坏的均衡。
冷静的判断
需要明确边界:解封文件是诉讼材料,里面是单方披露的摘录,最终事实要等法庭裁决。微软和 OpenAI 必然有他们的反驳——比如合理使用框架、公开数据训练的行业惯例、以及"答案引擎也导流"的另一面数据。把法庭文件当成既定结论,同样不客观。
但方向性的信号已经足够清晰:AI 与内容版权这场拉锯,正在从"能不能用"升级到"怎么用、付不付费、标不标来源"。对依赖原创内容生存的人来说,这不再是旁观的科技新闻,而是直接关系饭碗的规则成形过程。
无论案子怎么判,一个会更常被问到的问题已经摆上桌面:当 AI 吞下全网内容、再把答案留在自己怀里,当初产出那些内容的人,该站在价值链的哪一端?