摘要:美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入纽约时报诉 OpenAI 版权案,支持 OpenAI 主张的大模型训练属"合理使用"。
这起案件走到今天,已经不只是一个媒体和一个实验室的私怨,而是整个生成式 AI 版权框架的风向标。而司法部选择亲自下场,分量就完全不同了。据 IT之家等媒体报道,美国司法部(DOJ)在 9 月 1 日向纽约南区联邦法院提交了一份"利益声明"(statement of interest),正式介入《纽约时报》诉 OpenAI 一案,明确支持 OpenAI 的核心论点:大语言模型的训练使用受版权保护的作品,属于美国版权法下的"合理使用"(fair use)。DOJ 在论述里把理由拉到了国家安全和 AI 产业领导力的高度——言下之意,如果训练本身被判定侵权,受损的不只是某家公司,而是美国在整个 AI 竞赛里的位置。

从程序上说,DOJ 介入并不等于替 OpenAI 背书所有行为。利益声明通常是就"法律如何适用"表达政府立场,不处理具体赔偿,也不对 NYT 的具体指控下结论。但把"训练是否合理使用"这个最根本的争点摆到国家竞争力语境里,对原告方的论证压力是实打实的——当被告方背后站着"这关乎美国 AI 领导地位"的政府表态,陪审团和法官在权衡时很难完全无视这层分量。这也是为什么这一动作在版权圈和法律媒体里引起的震动,远大于它本身的法律效力。
这桩案子的判决逻辑,会直接影响两件事。一是训练数据的合规成本:如果"合理使用"成立,现有以公开文本训练的模式大体无忧;如果被否,整个行业可能要走向授权付费或合成数据路线,训练经济学要重写。二是产品形态:即使训练过关,"模型输出是否构成对原作的替代/衍生"是另一场仗,NYT 主张的恰恰是 ChatGPT 在回答时大面积复现其文章内容。换句话说,DOJ 帮 OpenAI 守的是"输入端",但"输出端"的侵权风险并不因此消失——这恰好解释了为什么过去一年里,各家公司一边在训练端高调辩护,一边在输出端悄悄加了一堆"别复现受版权保护内容"的护栏和过滤器。
值得注意,这不是美国政府在 AI 版权问题上的孤立动作。过去一年里,围绕"AI 训练数据要不要强制披露""TDM(文本与数据挖掘)例外条款怎么定",行政与立法层面都有拉扯。DOJ 这次的站位,至少为"训练端宽松、输出端从严"的折中路线加了一块砝码。对内容机构和做 AI 产品的团队,建议把"数据合规"从法务的边缘议题,提级为产品与融资的核心尽调项。无论本案结果如何,"训练依据"和"输出防侵权"这两条线,未来都会越来越硬。
把视野放到美国之外,这起案件的外溢效应同样值得跟踪。欧盟的《AI 法案》和日本的版权缓冲期,对"文本与数据挖掘例外"有着各自不同的界定,美国的判例一旦清晰,会成为全球立法者绕不开的参照。换言之,纽约南区法院这一家的判决,影响的不只是 OpenAI 一家,而是所有在海外用公开语料训练、又想做全球生意的 AI 公司。对国内做大模型的企业,这同样是个观察窗口:当训练数据的合法性在最大单一市场被重新厘定,出海产品的数据合规架构必须提前预案。最稳妥的姿势,是把"训练依据可追溯、输出防侵权"做成产品默认能力,而不是等诉讼逼到门口才补课。今天省下的合规投入,明天可能变成融资尽调里的一票否决。







