作者:胡开忠 上海交通大学凯原法学院教授
2026年7月25日,由上海交通大学凯原法学院、知产财经联合主办的“AI时代新型不正当竞争与司法治理研讨会”在上海顺利召开。本次会议汇聚学术、司法和产业代表,围绕人工智能时代新型不正当竞争行为的认定、数据权益保护、平台责任及AI生成物的知识产权等前沿议题展开了深度对话,为构建适应AI产业发展的竞争法治环境贡献了多元智慧。会上,上海交通大学凯原法学院教授胡开忠围绕“人工智能数据训练中的著作权保护问题”进行主题演讲,知产财经对其主讲内容进行了整理,以飨读者。
听取了各位嘉宾的分享,我深受启发。对相关问题的讨论颇具前沿性,其中许多问题涉及人工智能生成物的知识产权保护。下面,我想围绕人工智能数据训练中的著作权利益保护问题,与大家作一分享。
之所以讨论这一问题,是因为人工智能产业发展迅速。在产业发展过程中,人们较多关注模型权利问题,较少关注人工智能企业在数据训练中大量使用人类作品的现象。在这一背景下,不少著作权人发现,人工智能模型生成的部分内容与其作品高度相似,由此产生大量争议。产业界与学界对相关争议的认识并不统一,著作权人的争议也较为突出,因此研究这一问题具有现实意义。
从近年来人工智能领域的版权案件看,类似纠纷并不少见。在美国和欧洲,已有多起著作权人起诉人工智能企业的案件,主张相关企业未经授权使用其作品进行数据训练,损害了著作权人的利益。在我国,也出现了小红书等相关案件。上海还发生过一起类似案件,即LoRA模型在数据训练过程中使用了美杜莎的美术作品,进而引发著作权人提起诉讼。
一、人工智能数据训练中涉及的利益主体
解决上述问题,首先需要厘清人工智能数据训练阶段涉及哪些利益主体。数据训练必须以数据为前提,其中涉及对著作权作品的使用。作品被整合进数据集后,用于人工智能训练,并通过人工智能平台向用户提供服务,这一过程涉及多方主体的利益。
实践中,以前述小红书案为例,画师作品被用于训练后,生成了与之近似的图片。笔者也曾用人工智能模型进行实验,要求模型生成唐老鸭等形象,结果生成了与原作品较为相似的图片。再如奥特曼案,奥特曼形象被用于数据训练后,生成了与奥特曼形象近似的图片。在这些情形下,不少著作权人认为,人工智能企业使用作品进行训练,涉及对原作品的复制、改编甚至翻译,未经许可使用其作品,应当承担侵权责任。
国外也有不少类似案件,例如训练后生成了与原作品近似的音乐。因此,数据训练引发了较大争议:使用作品进行数据训练究竟属于合法行为还是非法行为?著作权人通常认为该行为构成非法使用,因其作品被未经许可使用,故希望人工智能企业付费;人工智能企业则多主张该行为属于合理使用,理由是作品仅用于数据训练过程,并未对外公开,而是在非公开状态下进行训练。也有学者提出,应将数据训练与内容输出分开评价,认为数据训练阶段网民无法看到模型生成内容,故该行为属于合理使用。
二、使用作品进行人工智能数据训练行为的合法性判断
(一)是否构成侵权行为
实际上,上述观点存在认识偏差。在知识产权法中,判断是否构成侵权,通常需要考察四个构成要件:主观过错、客观侵权行为、损害后果以及因果关系。同时,还需判断是否存在免责情形,如合理使用、法定许可等。
(二)是否构成合理使用
在合理使用判断中,若将数据训练与结果输出截然分开,那么并不符合合理使用的判断标准。合理使用既需要考察使用作品的行为,也需要考察使用结果,不能割裂看待,否则难免断章取义。对此,《伯尔尼公约》规定了三步检验法,美国版权法规定了四要素判断法,两者在本质上具有一致性。为便于理解,下面先以美国四要素判断法进行分析。
第一,应考察数据训练中使用作品的目的和性质。一般而言,如果使用作品的目的具有非营利性,例如用于教育、研究等目的,通常可能被认定为合理使用;如果在数据训练中构成转换性使用,即通过对原作品的改变生成了具有创新性的成果,也通常可能被认定为合理使用。例如,企业通过数据训练开发了查重软件,或者人工智能模型经训练后能够识别作品的文体,如区分散文、小说、诗歌,且未对原作品利益产生影响,此类使用即具有转换性。需要特别注意的是,还应考察作品获取方式是否正当、是否具有善意。实践中,大量人工智能企业在数据训练时从网络抓取作品,并未取得著作权授权,因此作品获取的正当性存疑,这也是问题的关键。
第二,应考察被使用作品的性质。通常而言,依据合理使用判断标准,独创性较强的小说等作品应受到更高程度保护,而事实性、历史性等作品则可能允许相对宽泛的使用。
第三,应考察被使用作品的数量及其在原作品中的重要程度。实践中,大量作品被用于数据训练并体现在生成结果中,甚至部分生成内容与原作品完全相同或构成实质性相似,此类行为可能超出合理使用界限。还应看到,数据训练对作品的使用对著作权影响重大。许多作品被用于数据训练后,模型生成的大量内容与原作品实质性相似,或者原作品被拆分后大量出现在生成内容之中。相较传统环境,模型对原作品的利用规模远超以往。例如,鲁迅《呐喊》被用于数据训练后,可能被拆分为数千份、数万份,分别出现在不同生成内容中。传统作品在人工智能时代可能被使用成千上万次甚至数亿次,对著作权人造成的影响超过以往任何时代;如果产生实质性替代,对著作权人的影响更为严重。
由此可见,数据训练对著作权人利益构成较大威胁。从使用目的和转换性使用角度看,部分作品使用行为可能符合合理使用构成要件,可以作为合理使用对待;但也有一些行为,尤其是当前大量存在的数据训练行为,并不符合合理使用构成要件。尽管不少人工智能企业对此持有不同意见,但从美国及欧盟公布的版权报告看,均认为大量人工智能企业的数据训练行为难以完全符合合理使用的构成要件。
三、人工智能数据训练中著作权保护的必要性
因此,对著作权进行保护具有必要性。人工智能企业开展数据训练,本质上需要利用著作权人的作品。尊重著作权,是对创作劳动的尊重,也有利于文化产业发展、社会公平与文化多样性保护。同时,著作权人的作品是人工智能产业发展的前提和来源,如果没有著作权人的作品,人工智能企业将无从开展数据训练。因此,人工智能企业必须充分考虑著作权人的利益。
当然,也有观点认为上述立场过于严格。如果考察欧盟近期出台的报告,其更严格地依据“三步检验法”进行判断,即构成合理使用首先须在法律规定的特定情形下使用作品。欧盟相关报告认为,目前欧盟法律未对使用作品进行数据训练作出规定,因此该行为当然不属于合理使用,立场更为严格。
四、人工智能数据训练中著作权保护的路径
在此情况下,我认为我国在处理相关问题时应当加以区分:如果使用作品行为符合合理使用构成要件,应按合理使用对待;如果不符合,人工智能企业则应支付费用。具体而言,可以从以下方面展开。
在合理使用制度的规范上,可以将转换性使用以及教学、科研性使用纳入合理使用范围,并依据“三步检验法”或四要素法加以判断。对于不符合合理使用规定的行为,可以采取两种路径:一是自愿许可,二是法定许可。目前,OpenAI、谷歌等企业已在美国、欧盟向部分著作权人付费。最近,我国也有一些人工智能企业开始考虑向著作权人付费。若付诸实施,这将是具有里程碑意义的事件。同时,也应注意,近期美国不少版权企业已对中国人工智能企业提起诉讼,原因即在于相关企业未支付费用,所以这一问题值得关注。
从付酬方式看,自愿许可在实践中可能较难全面推行。笔者建议,在特定情形下可以补充适用法定许可,允许人工智能企业依法使用作品进行训练,并在使用后按照法定条件向著作权人支付报酬。这既能够保障数据训练有作品可用,也能使著作权人获得相应经济补偿,实现双赢。当然,部分人工智能企业可能对此有所保留。为促进相关制度发展,还应完善著作权集体管理制度,建立信息披露制度和退出机制等。
解决人工智能数据训练中的著作权保护问题确属难题,任重而道远。但从长远角度看,人工智能企业开展数据训练需要使用他人作品,应当尊重他人著作权。一些人工智能企业对于自己拥有的作品的著作权同样也希望获得法律保护。因此,保护著作权人利益与保护人工智能企业利益之间具有互利性。若能将这一问题妥善处理,可以实现双赢,既促进文化产业发展,也促进人工智能产业发展,这也是我们期望达到的目标。
(本文仅代表作者观点,不代表知产财经立场,平台并不承诺对内容负责,如有相关疑问,请联系文章作者。)





京公网安备 11010502049464号