据Ars Technica报道,一场围绕稀有书籍的“暗战”正在古书市场悄然展开。多家珍本书商发现,近期有疑似人工智能公司的买家,通过匿名中介批量收购绝版书籍,而这些书籍在被收购后不久便神秘“蒸发”——书商们怀疑,它们被买家刻意销毁了。
AI公司的“数据饥渴”
近年来,随着大语言模型对高质量文本数据的需求急剧膨胀,传统的网络文本资源已逐渐枯竭。AI公司不得不将目光投向书籍,尤其是那些尚未被数字化、具有独特语言风格的稀有书籍。此前,已有科技公司公开表示,计划利用公共领域书籍来填补训练数据缺口。然而,直接购买并销毁物理书籍的做法,却超出了书商们的预期。
匿名买家与“销毁协议”
“他们从不透露真实身份,只通过第三方代理完成交易。付款很爽快,但要求我们承诺不对外泄露书籍去向。更奇怪的是,几天后,我们得知这些书被送进了造纸厂。”一位不愿透露姓名的旧金山书商告诉Ars Technica。
类似的现象在纽约、伦敦、东京等古书交易集中的城市均有发生。一些书商注意到,被收购的书籍通常为19世纪前出版的文学作品、哲学论著和自然历史手稿,这些恰恰是语言模型训练中极为稀缺的“优质语料”。
销毁背后的逻辑
为什么AI公司要销毁已经买下的书?行业分析师提出了几种可能性:其一,为了保持数据独占性——如果实体书仍在市场流通,竞争对手可能通过扫描同一本书获得同等语料;其二,为了避免版权追责——若书籍处于版权保护期,销毁实物可在一定程度上掩盖数字化的使用痕迹;其三,某些公司可能认为,数字化扫描后的纸质书已无保存价值,因而将其当作废纸处理。
然而,无论出于何种动机,书毁难复。这些稀有书籍本身就是文化遗产,部分甚至是孤本。一旦被毁,即便其内容已被扫描保存,物理实体的历史价值、版本信息以及收藏意义也将永远消失。
书商的联合反抗
面对这一趋势,部分书商开始采取行动。纽约一家古籍书店在接待匿名买家时要求对方签署“禁止销毁条款”,若违约将面临高额赔偿。在伦敦,几家书商则建立了信息共享群,标记可疑买家,拒绝向其出售藏书。一位书商在社交媒体上写道:“我们是在转售知识,不是给AI喂饲料。”
监管与伦理的盲区
版权法学教授、AI伦理研究者都对这一行为表示担忧。电子前沿基金会(EFF)的某位分析师指出:“AI公司有权购买书籍,但不应以破坏公共遗产为代价。如果训练数据的获取必须依赖销毁独一无二的史料,那说明这个行业的发展路径存在根本性缺陷。”
与此同时,这一事件也折射出AI数据版权问题的尴尬现状。目前,法律对AI公司使用受版权保护文本尚无明确约束,导致企业在争夺语料时采取极端手段。
编者按:当AI的胃口超出伦理防线
AI训练数据的获取本是一道需要平衡创新与尊重的课题。企业为了模型竞争力而囤积语料,可以理解,但销毁书籍的行为却跨越了商业范畴,触及人类文明保存的底线。我们或许应重新审视那句古老的谚语:知识是无价的。而如今,它正在被明码标价,甚至付之一炬。
本文编译自Ars Technica
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接