Anthropic的“巴拿马项目”涉及购买数百万本二手实体书,经扫描后销毁原书,用于训练Claude模型。法庭记录显示,该项目在2024年内部规划文件中被描述为需保密,文件称“我们不想让外界知道我们在做这件事”。
事实还原
根据华盛顿邮报报道的解封文件,Anthropic在2021年先从LibGen下载数字书籍,后转向实体书。项目使用液压切割机切除书脊,再以高速扫描仪数字化页面,最后由回收公司处理残书。2025年8月,公司与作者集体诉讼达成15亿美元和解,法官认定此举符合转换性使用,属于合理使用范畴。
这些操作依托首次销售原则,允许买家处置所购实体书而不受版权人干预。文件显示,Anthropic视实体书为“必要”数据源,用以避免模型输出“低质量互联网语言”。
机制拆解
商业逻辑上,实体书获取成本低于授权许可,且通过物理销毁可减少额外复制指控。技术层面,切割与高速扫描实现规模化处理,内部文件提到计划扩展至“世界上所有书籍”。此方式既满足训练需求,又试图在法律灰色地带操作。
公司早期依赖盗版数字库,后转向合法购买实体书,显示对数据来源合规性的逐步调整。解封文件揭示领导层将书籍内容视为提升模型写作质量的关键。
产业影响
对竞争对手而言,此事件可能促使其他AI公司重新评估数据采购策略,避免类似法律风险。上下游出版商和作者群体获得和解补偿,但未来授权谈判可能更趋谨慎。
开发者与企业用户面临训练数据获取成本上升的可能性,若类似实践受限,依赖公开或授权数据的模型迭代速度或受影响。
对照与先例
与早期AI公司从网络抓取数据相比,Anthropic转向物理书销毁体现了规模扩大后的策略转变。历史中首次销售原则曾支持二手书市场,此案将其延伸至AI训练领域,法官认定未产生额外物理副本或再分发。
战略判断
基于现有文件,此案可能引发更多AI公司调整数据策略。事件凸显AI训练对高质量文本的依赖与版权边界的冲突,未来数据获取或更多转向授权渠道。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接