xAI被诉用儿童性虐待素材训练Grok:3百万张违规图像背后的数据合规危机

2026年8月27日,一份集体诉讼在美国加利福尼亚北区联邦法院正式提交,将xAI与其创始人马斯克推到了AI行业史上最严峻的数据合规风口。诉讼以"马莎法"(Masha's Law,2018年)为法律依据——这部法律专门赋予儿童性虐待素材受害者寻求民事救济的权利——原告为代号"Jane Doe 1"的匿名受害者及其他数千名潜在集体成员。

Jane Doe 1并非普通原告。据CyberScoop报道,她是联邦调查局"儿童剥削通报计划"追踪在册的受害者,其幼年遭受虐待的影像从21世纪初起便在网络流传,提交至美国失踪与被剥削儿童中心(NCMEC)的相关文件多达"数十万份"。诉状的核心指控是:这名受害者影像的已知哈希值,出现在xAI的训练数据集中,而Grok随后生成的深度伪造图像同样命中了同一哈希指纹——两个数据点叠加,意味着训练数据污染直接传导至生成输出。

机制:平台默认设置如何将违规内容纳入训练管线

这起诉讼之所以指向系统性问题而非个案失误,原因在于X平台的数据抓取策略。对非欧盟用户而言,X平台的隐私条款默认将所有公开帖文纳入Grok训练集,用户须主动进入设置关闭此选项。这一"默认开启"的架构,意味着平台上数以亿计的公开内容——包括用户上传的图像——在用户不知情的情况下成为训练语料。

更值得关注的是产品设计层面的选择。据CyberScoop报道,诉状指出xAI专门开发并推广了"辛辣模式"(Spicy Mode),主动吸引生成露骨内容的用户需求;同时,系统提示词被配置为在用户使用"少女"或"青少年"等词汇时默认判定其具有"善意"。诉状对内容过滤机制的描述是:护栏"极为薄弱",只会拦截带有"明确意图"的提示词,"间接或委婉的措辞可以轻松绕过"。

这与行业惯常宣称的"多层安全防护"形成直接矛盾。非营利机构"打击数字仇恨中心"(CCDH)的分析显示,在2025年12月29日至2026年1月8日的11天内,Grok生成了逾300万张性化图像,其中至少2.3万张被判定为疑似描绘儿童。这一数量级的数据不是过滤系统偶发失灵,而是系统性产出的结果。

针对外界质疑,马斯克本人曾于1月14日公开表态,称"完全不知晓Grok生成任何未成年人裸露图像,一张都没有。"据报道,xAI公司截至目前未向媒体提供更多正式回应。原始诉状中的另一相关指控——xAI已就此向有关部门报告数万案例并对违规者提起诉讼——目前尚无独立信源核实。

监管连锁:从阿姆斯特丹到明尼苏达

此次集体诉讼并非孤立事件,它发生在一系列监管行动密集落地的背景之下。2026年3月26日,阿姆斯特丹地方法院发出具有里程碑意义的禁令,命令xAI和X立即停止生成和传播非经同意的性化图像(包括涉及儿童的内容),违者面临每日10万欧元罚款。同年7月,明尼苏达州通过法律禁止"脱衣伪造"(nudification)技术,马斯克随即起诉该州总检察长基思·埃里森,以第一修正案言论自由权为由寻求撤销该法律。

这两条线并行展开,揭示出一个内在矛盾:一方面是公司层面对安全承诺的声索,另一方面是法律团队在多个司法管辖区同步应对的真实处境。

行业对照:同行签署承诺,xAI不在列

在训练数据过滤这一议题上,科技行业并非没有明确的行业标准可参照。非营利组织Thorn(致力于打击儿童性剥削)推动制定了一项原则性承诺,核心内容之一是AI训练数据集中不得包含CSAM。据报道,Meta、谷歌、微软、Stability AI、Civitai、亚马逊和OpenAI均已签署这一承诺。xAI是否签署,目前没有公开记录。

值得注意的是,在欧盟《人工智能法案》要求的训练数据摘要披露中,谷歌、Meta、微软和OpenAI均已提交相应文件,而xAI的情况同样未见公开记录。这一信息不对称,在监管机构越来越将训练数据透明度作为合规基线的背景下,将成为一个持续暴露的弱点。

同期,一项发表于IEEE安全与隐私研讨会(S&P 2026)的研究为整个行业带来了额外的技术警示:从训练数据集中移除儿童图像只能提供"有限保护",并可被规避。这一发现意味着,即便xAI的辩护团队能够证明事前进行过内容过滤,技术层面的防御效果本身也正在受到学术界的质疑。

对开发者与企业用户的实际含义

从企业选型角度看,此案的影响比一般舆论危机更为具体。调用Grok API生成图像内容的开发者,在法律责任链尚未厘清前面临不确定性:若平台基础模型被认定存在训练数据违规,使用该能力的下游应用是否连带承担责任,目前没有先例可循。在集体诉讼体系健全的美国市场,这一不确定性不是可以搁置的哲学问题。

对于已将Grok集成进内容审核、图像生成或多模态对话产品的企业用户,建议评估两点:其一,合同中是否包含供应商数据合规担保条款;其二,是否有替代方案可在必要时快速切换。在阿姆斯特丹禁令和明尼苏达州诉讼同时进行的情形下,xAI的运营稳定性存在法院命令层面的不确定性。

对于使用X平台发布内容的个人用户和媒体机构,如今存在明确的操作路径:进入设置关闭Grok训练数据选项,欧盟用户可援引GDPR第21条向privacy@x.ai提出书面反对。需要注意的是,已提交历史数据无法撤回,选项仅对后续数据生效。

战略判断:接下来会发生什么

以下为分析判断,而非已确认事实。

此案最可能的走向是多线并发的监管施压,而非一次性的法律判决。"马莎法"集体诉讼确立先例后,其他司法管辖区的受害者援引同一路径提起诉讼的摩擦成本将显著降低;同时,欧盟和英国监管机构可能借阿姆斯特丹禁令作为切入点,将训练数据审计纳入正式监管程序。

观察以下信号可以验证这一判断:一是xAI是否公开披露其训练数据过滤机制的具体技术细节(迄今为止未见任何披露);二是明尼苏达州诉讼的司法裁定方向,若法院支持州级禁令,将为其他州提供立法模板;三是Thorn承诺签署方是否出现新的联合声明,把xAI的缺席明确化。

从更长周期看,这起案件正在重塑一个行业默认:训练数据的来源和过滤标准,不再是可以"以后再说"的工程问题,而是已经进入法律诉讼的核心争议领域。对于正在构建图像生成或多模态能力的AI公司而言,这一案件的最终走向,将成为未来三到五年内训练数据合规标准如何形成的关键参照。

Sources: - [Former sexual abuse victims say Grok used their images, videos to train deepfake capabilities | CyberScoop](https://cyberscoop.com/xai-grok-csam-class-action-lawsuit/) - [Class action lawsuit accuses xAI of training Grok on child abuse material | SC Media](https://www.scworld.com/brief/class-action-lawsuit-accuses-xai-of-training-grok-on-child-abuse-material) - [Grok Not Only Generates Child Porn but Was Also Trained On It, New Lawsuit Claims | Gizmodo](https://gizmodo.com/grok-not-only-generates-child-porn-but-was-also-trained-on-it-new-lawsuit-claims-2000804488) - [Dataset filtering provides only limited protection against CSAM generation in text-to-image models | TechXplore](https://techxplore.com/news/2026-07-dataset-filtering-limited-csam-generation.html) - [OpenAI's commitment to child safety | OpenAI](https://openai.com/index/child-safety-adopting-sbd-principles/)