YC的Garry Tan:开源AI实验室也应能蒸馏前沿模型

YC的Garry Tan:开源AI实验室也应能蒸馏前沿模型

编者按:当“蒸馏”这个词被美国闭源AI公司当作指控竞争对手的武器之后,硅谷最知名的创业孵化器Y Combinator却给出了几乎相反的立场。其掌门人Garry Tan认为,如果前沿模型的知识本就来自全人类的公开知识,那么让美国本土的开放权重实验室也去“蒸馏”前沿模型,不仅合理,而且必要。

一句话点燃的争论

据TechCrunch记者Julie Bort报道,Y Combinator总裁兼CEO Garry Tan近日公开表示,美国本土的开放权重(open-weight)AI实验室同样应当被允许“蒸馏”(distill)前沿模型,而不应让这项能力成为少数闭源巨头的专属特权。

所谓“蒸馏”,是机器学习中一种常见的技术手段:用一个规模更大、能力更强的“教师模型”生成的输出作为训练数据,去训练一个体量更小、推理成本更低、部署更灵活的“学生模型”。它既能大幅压缩训练成本,也能让能力较弱的团队快速获得接近前沿水平的产品能力。正因如此,“蒸馏”在商业竞争中既是技术问题,也是产权与公平问题。

Tan的核心理由:AI能力是一种公共品

Tan的论述并不复杂,却直指当前AI产业最敏感的神经:前沿模型本身就是在公开的人类知识之上训练出来的,因此获取强大AI的能力,应当“成为一种公共品”(a form of public good)。

前沿模型本身就是建立在公开人类知识之上训练的,因此获取强大的AI能力,应当成为一种公共品。——Garry Tan

这套逻辑链条意味着:如果模型的“原材料”是全人类共同积累的知识,那么把它锁在少数公司的API后面、并用法律或技术手段阻止他人从中学习,就存在正当性上的疑问。在Tan看来,允许美国开放权重实验室蒸馏前沿模型,本质上是在维护一个更开放、竞争更充分的AI生态,而不是在鼓励“抄袭”。

为什么此刻格外敏感

过去一年多,“蒸馏”一词在美国AI圈几乎成了指控中国实验室的专用标签。OpenAI、Anthropic等闭源前沿公司多次声称,部分竞争对手通过大规模调用其模型接口、收集输出数据来训练自家模型,从而以远低于前沿研发的投入快速逼近性能曲线。

在美国政策层面,先进芯片与前沿模型的出口管制持续收紧,围绕“模型权重是否应纳入出口管制”“开源是否等于技术外流”的讨论也从未停止。在这一背景下,Tan的表态相当于从硅谷内部投下一枚反向砝码:他并不否认蒸馏的存在,而是主张美国自己的开放权重阵营也应当拥有同样的权利。

开放权重阵营并非铁板一块

需要指出的是,“开放权重”并不等于“完全开源”。Meta的Llama系列、Mistral的部分模型、阿里的Qwen以及DeepSeek等,虽然权重可下载,但许可证条款差异巨大,不少条款明确禁止用其输出训练其他模型,或对商用规模设限。美国本土的开放权重模型整体上仍落后于最前沿的闭源模型一大截,这使得“允许蒸馏”对它们而言,可能是缩小差距最现实的路径之一。

与此同时,闭源阵营的反驳同样有力:训练一个前沿模型动辄需要数十亿美元算力与数据投入,如果竞争对手可以低成本“收割”这些输出,那么投入前沿研发的长期激励将被侵蚀,最终受损的可能是整个技术进步的节奏。

对创业者和产业意味着什么

Y Combinator的立场与其投资组合高度相关。YC孵化了大量AI应用层创业公司,这些公司的单位经济模型几乎完全取决于推理成本。如果开放权重模型能够通过蒸馏快速获得接近前沿的能力,应用层公司的议价能力将显著增强,推理价格有望继续下探,创新门槛也会随之降低。

对美国AI生态而言,若蒸馏在开放权重场景下被合法化、常态化,可能出现三种连锁反应:一是推理成本进一步下降,AI应用迎来新一轮爆发;二是美国开源生态与中国开源生态之间的性能差距缩小;三是围绕模型许可证、服务条款与“合理使用”的诉讼与监管博弈将更加频繁。

反过来看,如果蒸馏被严格限制,受益最大的将是少数掌握前沿模型的闭源巨头,它们对下游应用层的定价权与话语权会进一步集中。

结语

Tan的表态未必能立刻改变监管走向,但它把一个问题摆到了台面上:当训练数据来自公共知识、模型能力具有准公共品属性时,商业回报与知识开放之间的边界应当划在哪里?在美中AI竞争与开源运动交织的当下,这个问题的答案,可能比任何一次模型发布都更能决定未来五年AI产业的格局。

本文编译自TechCrunch