7月24日,印度德里高等法院作出一项具有里程碑意义的裁决:OpenAI使用印度最大通讯社之一ANI的新闻内容训练大语言模型,不构成版权侵权。在全球多国新闻出版机构集体向AI公司施压、要求为训练数据付费的背景下,印度法院的这一裁定为AI行业提供了罕见且有力的法律支撑。
案件背景:ANI为何起诉OpenAI?
2024年11月,ANI向德里高等法院提起诉讼,指控OpenAI未经授权使用其新闻报道训练ChatGPT,并称ChatGPT在回答中生成虚构报道并错误地归咎于ANI。ANI要求法院颁布临时禁令,阻止OpenAI继续使用其内容。多家出版商和行业组织随后加入ANI阵营,包括数字新闻出版商协会(DNPA),其成员涵盖《印度时报》《印度斯坦时报》《今日印度》等几乎所有主流媒体。
OpenAI则辩称,事实本身不应被垄断,如果任何新闻平台不希望被抓取,可以选择将其网站列入屏蔽名单。
法院两项核心认定,动摇ANI诉讼根基
法官Amit Bansal在135页的临时命令中作出了两项核心认定。
认定一:模型训练属于“合理使用”
法官认为,OpenAI存储ANI原始文学作品用于训练ChatGPT底层大语言模型的行为,符合印度《版权法》第52条第(1)(a)款规定的“私人或个人使用(包括研究)”的合理使用例外情形。因此,这不构成第51条意义上的版权侵权。
法官进一步指出,开发大语言模型的经济可行性取决于公共领域数据的可用性——如果训练需要从多个来源获取许可,“经济上将不可行”。法院还强调,禁止ChatGPT使用版权作品将“不利于AI的发展,尤其不利于印度正在开发的大语言模型”。若临时禁令落地,将对公共利益产生不利影响,包括印度大量免费使用ChatGPT的用户。
认定二:ChatGPT输出未构成侵权复制
对于ANI提出的“ChatGPT输出复制了其版权内容”的指控,法院认为ANI未能证明ChatGPT记忆并复制了其受版权保护的新闻报道。法官指出,ANI提交的所谓“被复制”材料,多数是在相关模型训练完成之后才创建的,因此不可能被模型记忆。更合理的解释是,ChatGPT只是根据用户提示进行了新的网站搜索——“从网站检索到的相关数据被生成为基于网站数据的回应,而非仅仅依赖其预训练知识”。
管辖权的确立:服务器在美国不意味着法外之地
OpenAI曾辩称,模型训练发生在美国、训练数据存储在美国服务器上,印度版权法不应适用。但法院驳回了这一主张,认定ANI作品存储在美国服务器上是“从印度访问版权作品并将其传输至海外这一事件链条中的终端步骤”。法院指出,若支持OpenAI的观点,“将导致侵权者通过将终端环节转移至海外服务器来规避印度版权法”。
全球影响:判例会否成为其他国家的参照?
这一裁决的深远意义在于,它首次在印度司法层面为AI模型训练的合法性提供了明确背书。
目前,全球多国类似诉讼仍在进行中。《纽约时报》在美国对OpenAI提起了类似诉讼。印度法院的判决虽无直接约束力,但可能为其他司法管辖区的法官提供重要参考。
值得注意的是,印度版权法采用的是“合理使用”(fair dealing)而非美国更宽泛的“合理使用”(fair use)原则。在更窄的法律框架下仍认定AI训练不侵权,这一裁决的法律分量不容低估。
判决的边界:并非AI训练的“无限通行证”
法院的裁决也有明确边界。这是一项临时命令,而非终审判决,基于ANI未能建立初步证据的案件事实。法官的认定基于训练过程的私人与研究性质、缺乏实质性复制、未证明市场损害以及ANI材料的公共可获取性。这并不意味着AI训练永远不需要许可。
但无论如何,在全球AI版权争议悬而未决的当下,印度法院已经率先亮明了态度:AI发展的公共利益,可以在天平上压过版权所有者的短期利益。



