生成式人工智能训练数据的合理使用限度研究
文章字数:1081
一、合理使用规则的适用困境
生成式人工智能训练高度依赖数据, 开发者未经授权爬取数据是否侵权, 关键在于合理使用规则能否适用。我国《著作权法》对合理使用采取封闭式列举, 可参照的仅科学研究与法定其他情形。生成式人工智能数据训练大多具备商业属性,难以认定为非营利。现有合理使用仅适用于少量引用、局部复制, 而其训练规模大、以提取非表达信息为主,造成司法适用非此即彼的适用困境。
二、合理使用判断标准
判断其是否构成合理使用,需考量三个特性:
其一,非表达性使用。模型对作品的处理在通过统计学习提取结构与语义模式, 而非将作品原样存储供用户调取。当使用目的并非再现作品内容,而是习得抽象规律时,其对权利人利益的实质损害远低于传统复制传播行为。
其二,数据来源的混杂性与过滤的技术可行性。训练数据多来自公开抓取,混杂公有领域信息、受保护作品及个人信息。服务提供者是否负有合法性筛查义务及成本,直接影响过错认定。若开发者故意使用侵权数据源,或在具备过滤能力时怠于履行,则应排除合理使用;反之,若数据清洗在技术上难实现或成本高,则可以宽容。
其三,市场替代的核心判断。合理使用的关键在于是否与原作品形成市场替代。其生成内容是对数据的重组而非复制。只有当模型能够“记忆”并再现训练数据中的特定表达时,才构成对原作品市场的实质性侵蚀。因此,应区分评价训练行为与输出行为, 对前者侧重于是否创造增量价值, 对后者则侧重于是否存在与权利人作品的直接竞争。
三、合理使用限度的制度构造
一是区分商业性与非商业性训练。其服务以营利为目的, 对其训练数据的合理使用应设定得更严格,要求开发者公开数据来源,建立权利人的选择退出机制。二是建立数据来源合法性的分层义务。对于从公开渠道爬取的数据,若开发者采取了行业标准的技术措施避免抓取明显侵权内容, 且未规避权利人设置的技术保护措施,其训练行为可纳入合理使用范畴。反之,若明知或应知数据集包含大量侵权作品仍用于训练,则应排除合理使用,构成侵权。三是引入“输出端过滤”作为合理使用的对价。在承认训练阶段合理使用的同时, 应要求服务提供者在输出端承担防止生成“实质性相似”内容的义务。即开发者须部署技术措施, 确保模型无法在用户提示下生成与训练数据中特定作品构成实质性相似的内容。
综上,生成式人工智能训练数据的合理使用问题,是著作权利益格局的重新分配。合理的限度既非绝对的技术中立豁免,亦非授权必先。较为妥当的方案,是以非表达性使用和转换性目的为基础,以输入端数据来源的合规与输出端防止再现的义务为边界,通过分层设计与分类管理,在激励创新与保护权益之间寻求动态平衡。
贵州财经大学 耿 蕊
生成式人工智能训练高度依赖数据, 开发者未经授权爬取数据是否侵权, 关键在于合理使用规则能否适用。我国《著作权法》对合理使用采取封闭式列举, 可参照的仅科学研究与法定其他情形。生成式人工智能数据训练大多具备商业属性,难以认定为非营利。现有合理使用仅适用于少量引用、局部复制, 而其训练规模大、以提取非表达信息为主,造成司法适用非此即彼的适用困境。
二、合理使用判断标准
判断其是否构成合理使用,需考量三个特性:
其一,非表达性使用。模型对作品的处理在通过统计学习提取结构与语义模式, 而非将作品原样存储供用户调取。当使用目的并非再现作品内容,而是习得抽象规律时,其对权利人利益的实质损害远低于传统复制传播行为。
其二,数据来源的混杂性与过滤的技术可行性。训练数据多来自公开抓取,混杂公有领域信息、受保护作品及个人信息。服务提供者是否负有合法性筛查义务及成本,直接影响过错认定。若开发者故意使用侵权数据源,或在具备过滤能力时怠于履行,则应排除合理使用;反之,若数据清洗在技术上难实现或成本高,则可以宽容。
其三,市场替代的核心判断。合理使用的关键在于是否与原作品形成市场替代。其生成内容是对数据的重组而非复制。只有当模型能够“记忆”并再现训练数据中的特定表达时,才构成对原作品市场的实质性侵蚀。因此,应区分评价训练行为与输出行为, 对前者侧重于是否创造增量价值, 对后者则侧重于是否存在与权利人作品的直接竞争。
三、合理使用限度的制度构造
一是区分商业性与非商业性训练。其服务以营利为目的, 对其训练数据的合理使用应设定得更严格,要求开发者公开数据来源,建立权利人的选择退出机制。二是建立数据来源合法性的分层义务。对于从公开渠道爬取的数据,若开发者采取了行业标准的技术措施避免抓取明显侵权内容, 且未规避权利人设置的技术保护措施,其训练行为可纳入合理使用范畴。反之,若明知或应知数据集包含大量侵权作品仍用于训练,则应排除合理使用,构成侵权。三是引入“输出端过滤”作为合理使用的对价。在承认训练阶段合理使用的同时, 应要求服务提供者在输出端承担防止生成“实质性相似”内容的义务。即开发者须部署技术措施, 确保模型无法在用户提示下生成与训练数据中特定作品构成实质性相似的内容。
综上,生成式人工智能训练数据的合理使用问题,是著作权利益格局的重新分配。合理的限度既非绝对的技术中立豁免,亦非授权必先。较为妥当的方案,是以非表达性使用和转换性目的为基础,以输入端数据来源的合规与输出端防止再现的义务为边界,通过分层设计与分类管理,在激励创新与保护权益之间寻求动态平衡。
贵州财经大学 耿 蕊

