AI训练图书版权之争:看似违法,实则模糊

AI训练图书版权之争:看似违法,实则模糊

当全球最大AI公司用数百万册未授权图书训练模型时,作家群体的愤怒并非没有道理——这些作品正在反哺那些侵蚀其版税收入的系统。美国作家协会调查显示,绝大多数出版作者的作品在本人毫不知情的情况下,进入了AI训练数据集。这看起来“明显违法”,但现实中的法律逻辑远比直觉复杂。

自2023年起,包括Sarah Silverman、John Grisham在内的知名作家先后起诉OpenAI、Meta等企业,指控其利用盗版书库“Books3”训练大模型。这些案件的核心,并非“是否使用了受版权保护的材料”,而是“这种使用能否被纳入合理使用的范畴”。

合理使用:AI公司的核心抗辩

美国版权法的合理使用判定包含四个要素:使用目的与性质、原作品性质、使用比例、以及对原作市场的影响。AI企业主张,模型训练属于“转换性使用”,并不直接输出原文,对原著市场不构成竞争性替代。作者方则反驳,生成式AI能够以风格模仿和观点重述的方式,变相蚕食原作价值。

“公开可得并不意味着可自由使用——数字时代的知识引用边界,正由法庭重新画定。”——编者按

跨国司法实践的分野

欧盟《数字化单一市场版权指令》第4条为文本与数据挖掘提供了例外空间,但权利人可声明退出;日本则相对开放,允许商业性训练利用公开作品;中国在AI生成内容治理上强调“合法来源”与“尊重权利”。美国目前没有统一的联邦立法,各法院判决甚至出现矛盾,使得大企业更倾向于以诉讼拖延换政策窗口。

出路:从零和博弈到共生机制

面对不确定的法律环境,行业开始探索替代方案。有出版巨头与AI公司签订授权协议,按字数或训练轮次付费;也有创业公司为作者提供“退出查询”工具,追踪其作品是否出现在数据集中。但这些机制仍属草创,缺乏统一标准。更重要的是,法律结论若最终倒向“严格禁止”,将不可避免拖慢模型研发,并推动数据竞争转向封闭格局。

从更宏观的视角看,AI训练的合法性问题本质上是“学习权”与“生存权”的冲突。技术进步不应以牺牲创作者为代价,但版权制度也不能固守前数字时代的规则。未来的理想解法,或许是建立介于“合理使用”与“强制授权”之间的新型法定许可机制,让作者获得合理分成,同时不阻塞AI的发展。这场博弈的结果,注定影响数字时代的创作生态与知识生产方式。

本文编译自TechCrunch