微软内部称AI抓取是「人类史上最大劳工盗窃」

微软内部称AI抓取是「人类史上最大劳工盗窃」

编者按:当一家公司公开强调尊重内容创作者,私下却把合作伙伴的数据采集行为称为「盗窃」,这种反差本身就说明,AI训练数据的版权问题已经走到了无法回避的临界点。最新解封的法庭文件,把微软的这种矛盾姿态直接摆到了台面上。

被解封的「内部真话」

据TechCrunch报道,一批此前被涂黑处理、如今正式解封的法庭文件显示,微软一位高管在内部交流中,将AI公司大规模抓取网络内容的行为形容为「人类历史上最大规模的劳动力盗窃」。这段表述之所以引人注目,是因为它所指向的对象并非外人,而是微软最紧密的AI伙伴——OpenAI。

「这是人类历史上最大规模的劳动力盗窃。」——微软高管在内部沟通中对AI抓取行为的评价

文件同时揭示了一个更具讽刺意味的事实:在私下对这类做法表达强烈质疑的同时,微软自身也参与了相关数据的采集工作。两家公司都被指抓取了《纽约时报》置于付费墙之后的内容,并以此为基础构建训练数据集。更关键的是,双方在内部都曾意识到,这种行为对出版商的冲击可能是毁灭性的——有内部警告直言,它会把出版商「掏空」。

付费墙内容如何进入训练数据集

《纽约时报》自2023年底起诉OpenAI与微软以来,一直试图证明其受版权保护的新闻报道被系统性地用于训练大模型。付费墙的存在,使得这一指控的性质比普通的网页抓取更为严重:用户需要付费才能阅读的内容,在被抓取时既不产生订阅收入,也不带来广告曝光,最终却成为支撑商业模型能力的基础素材。

从技术角度看,这类采集通常通过网页爬虫完成。对于爬虫工程师而言,绕过robots.txt协议或利用内容分发网络边缘节点获取全文,并非难以实现的操作;真正难以回答的是法律问题——当一份文本被拆解为token、融入千亿参数之中,它是否还构成「复制」?权利人又该如何主张自己的损失?

行业背景:训练数据的「灰色地带」

这不是孤例。过去三年里,从文字、图片到音频、视频,几乎所有模态的创作者都在追问同一个问题:我的作品是否被用于训练AI,如果是,为什么没有人征求我的同意?

AI公司的普遍立场是「合理使用」:模型学习的是统计规律而非具体表达,因此不构成侵权。但这一抗辩在付费墙内容、盗版电子书库等场景下显得尤为脆弱。与此同时,内容产业的反制手段也在升级——从集体诉讼到授权谈判,从技术层面的反爬虫封锁到立法层面的数据透明度要求。

值得注意的是,行业内部其实早已清楚风险所在。此次解封文件的价值,不在于它披露了某个惊人技术细节,而在于它证明了:相关企业并非「不知情」,而是「知情后仍然选择这么做」。在法律上,这种主观认知(scienter)往往是判断故意侵权与加重赔偿的关键要素。

分析:谁在为「免费数据」买单

如果把视角拉远,这场争议的实质是AI产业的一次成本转嫁。大模型的竞争力高度依赖数据规模与质量,而高质量的专业内容——调查报道、学术论文、代码仓库、专业图库——恰恰是生产成本最高、最容易被无偿拿走的部分。

短期看,免费抓取让AI公司以极低成本获得了巨大优势;长期看,它可能摧毁这些内容的再生产机制。当新闻编辑室因为流量与订阅双重下滑而缩减调查团队,当摄影师因为作品被无偿训练而退出行业,AI模型未来将面对一个日益贫瘠的数据生态。这正是内部警告中「掏空出版商」的真正含义。

对微软而言,处境尤其微妙。它既是OpenAI最大的投资方与云服务提供商,也是全球最主要的内容分发与生产力软件厂商,同时还与多家新闻机构存在授权合作。这种多重身份使其在诉讼中难以维持统一叙事:一边在公开场合承诺支持优质新闻,一边在内部承认抓取行为形同盗窃。

接下来会发生什么

案件的走向可能有三种:法院认定训练行为构成合理使用,AI公司获得事实上的豁免;法院支持权利人主张,推动行业进入强制授权时代;或者双方在压力下达成大规模内容授权协议,把「先抓后谈」变成「先谈后用」。

无论结果如何,这批解封文件已经改变了一件事:关于AI数据来源的讨论,从此不再只是抽象的法律辩论,而有了白纸黑字的内部认知作为证据。对内容产业来说,这或许比任何一场公开声明都更有分量。

本文编译自TechCrunch