当大模型竞赛的焦点从参数规模转向数据质量,AI训练数据赛道正迎来属于自己的高光时刻。据TechCrunch报道,总部位于美国的Snorkel AI宣布完成3.5亿美元E轮融资,公司估值较上一轮翻了三倍,达到35亿美元。
七年磨一剑:从斯坦福实验室走向35亿美元
Snorkel AI成立于七年前,脱胎于斯坦福大学AI实验室的研究项目。其核心技术是「程序化标注」(programmatic labeling):开发者不再需要逐条人工打标签,而是通过编写标注函数、调用已有模型等方式生成弱监督信号,再由算法自动融合为训练标签。这套方法大幅削减了构建训练数据集的成本与时间。
在很长一段时间里,这一路线被视为「学术味太重」的偏门方案。但伴随大模型对垂直领域与专有数据的需求激增,Snorkel的价值被市场重新定价——估值短期内翻了三倍,正是资本给出的直接反馈。
数据即服务:AI价值链上最确定的「卖水人」
Snorkel的商业模式是「数据即服务」(data-as-a-service)。企业客户将自有数据接入其平台,借助自动化工具完成清洗、标注、增强与评测,最终得到可直接用于微调或训练的高质量数据集。对于金融、医疗、法律、政府等对数据合规与专业度要求极高的行业,这一模式尤其具有吸引力。
本轮3.5亿美元E轮资金,正是用于扩展这套产品矩阵,并进一步服务企业级客户。用一句话概括Snorkel的定位:它不造模型,它造让模型变好的数据。
在模型架构日益趋同的今天,决定模型上限的往往不是算力,而是数据的质量与独特性。
赛道拥挤,但天花板同样在抬高
Snorkel所处的赛道并不空旷。Scale AI曾以百亿美元级估值成为数据标注领域的标杆,Surge AI、Labelbox、Appen等玩家也在争夺同一批企业客户。与此同时,需求本身也在升级:从早期的图像框选、文本分类,转向RLHF偏好数据、专家级推理数据,以及多模态与智能体轨迹数据。
更值得关注的是,数据需求正从「标注」走向「生成与治理」。合成数据、数据飞轮、自动化评测等新范式,正在重塑这条产业链的价值分配。
挑战:数据红利能持续多久
投资者押注的核心逻辑是:只要模型仍在迭代,数据需求就不会消失。但风险同样存在——模型自我标注与合成数据能力的提升,可能压缩纯人工标注的利润空间;企业客户也可能选择自建数据管线。Snorkel需要用产品化程度和技术壁垒,证明自己不是一轮周期中的过客。
结语
35亿美元估值、3.5亿美元融资,Snorkel AI的这轮跃升是当下AI基础设施投资热度的缩影。当资本从模型层向数据层回撤,真正能拿到长期价值的,或许是那些把「脏活累活」做成标准化产品的公司。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接