据Ars Technica援引英国《金融时报》的报道,TikTok母公司字节跳动正在秘密训练一个参数规模高达10万亿的AI大模型,目标直指美国头部AI实验室Anthropic。若消息属实,这将是全球公开已知的最大规模的模型训练项目之一,也标志着中国互联网巨头在全球生成式AI竞赛中迈出了激进的一步。
10万亿参数是什么概念?当前业界普遍认为GPT-4尚未公开参数,但估计在1万亿到2万亿之间。10万亿参数意味着模型容量提升了数倍,对计算资源、数据工程和分布式训练算法的要求呈指数级增长。业内人士估算,训练这样的模型需要至少上万张顶级AI加速卡连续运行数月,仅电力和算力成本就可能达到数亿美元。正因如此,超大规模模型也被视为一家公司AI综合实力的“试金石”。
字节跳动为何押注超大规模模型?
字节跳动在AI领域并非新人。TikTok的推荐算法是其核心竞争力所在,背后依赖的大规模机器学习系统在业界颇受称道。但在大语言模型方向上,字节跳动发力相对较晚。面对OpenAI以及Anthropic推出的Claude系列所建立的技术优势,字节跳动显然不愿只做应用层玩家,而是希望从模型底层建立自主能力。
选择Anthropic作为对标对象也颇具深意。Anthropic以AI安全性和可解释性见长,其Claude模型在企业级市场赢得了大批客户。相比之下,OpenAI在大众消费端声势更盛,但Anthropic在稳健性、合规性和安全对齐方面的口碑更突出。字节跳动可能希望借助“安全可靠”这一标签,在B端市场打开突破口,同时为旗下产品矩阵提供更强的AI基座。
分析认为:“在大模型竞赛的下半场,算力、数据与人才缺一不可。10万亿参数模型是工程极限的挑战,更是一场豪赌——成功了将跻身顶级玩家,失败则可能造成巨额沉没成本。”
芯片管制与算力之困
训练10万亿参数模型的最大障碍之一,就是芯片获取。美国对华出口高端AI芯片实施严格管制,英伟达A100、H100等产品无法直接出口中国,而H800、H20等“特供版”也在不同时期受到限制。字节跳动如何解决算力来源?有供应链消息称,字节跳动早已提前囤积了大量英伟达Hopper架构芯片,同时通过海外数据中心或云服务商的渠道进行部署,试图绕开管制。但这并非长久之计,自主可控的AI芯片能力依然是长期瓶颈。
成本、人才与监管的三重压力
除了算力,人才短缺也是巨大的挑战。10万亿参数模型的训练需要顶尖的系统工程师和算法研究员,而这类人才在全球范围内都非常稀缺,字节跳动不得不以高昂薪酬从Google、OpenAI、Meta等公司“挖角”。与此同时,训练过程中的稳定性和调试复杂度呈几何级增长,一次模型坍塌或训练中断就可能损失数百万美元的成本。
合规层面,欧盟《人工智能法案》已生效,对高风险模型提出严格透明度要求;中国国内也正在推进AI生成内容标识等法规。超大规模模型可能引发的偏见、错误信息以及能耗问题,都将使字节跳动面临监管层面的额外审视。
编者按:大模型“军备竞赛”进入新阶段
字节跳动的这一动作,再次印证了生成式AI正在走向“强者恒强”的极端。当模型规模达到10万亿参数时,能够参与的玩家已经寥寥无几。头部企业通过巨额资本开支构筑壁垒,后来者几乎无法依靠单点突破实现颠覆。
对行业而言,这既是技术进步的信号,也暗藏风险。超大模型是否会带来“规模效应”的边际递减?训练成本的高企是否会拖累AI企业的盈利能力?更重要的是,算力资源的过度集中是否会导致技术主导权进一步失衡?这些问题值得所有人深思。
目前字节跳动尚未公开回应相关传闻,但可以预见的是,全球AI竞争的天平将因这一项目而再度摇摆。未来一两年,我们或许会看到更多关于这个“庞然大物”的消息浮出水面。
本文编译自Ars Technica
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接