阿里开源125B千问新旗舰:训练成本降至前代九分之一,定价仅Claude的3%

2026年8月26日晚,阿里千问团队正式发布并开源Qwen3.8-Flash-Next:一个Transformer参数量125B、每token激活仅6B的多模态混合专家(MoE)模型,训练成本较上代Qwen3.7-Plus降低约90%,API定价每百万token输入1元、输出3元,官方披露这一价格约为Claude Opus4.6的3%。模型完整权重已同步发布至Hugging Face与魔搭社区,供全球开发者直接下载。

千问团队明确指出,Qwen3.8-Flash-Next所采用的"Next"架构,将是下一代旗舰Qwen4的技术雏形。

参数激活率背后的架构逻辑

理解这个模型的关键,在于搞清楚它如何用更少的算力做到更高的性能。传统大模型在每次推理时需要调动全部参数;MoE架构的核心思路是"按需激活"——Qwen3.8-Flash-Next拥有125B Transformer参数,但每处理一个token,实际参与运算的只有6B,其余专家处于休眠状态。这种稀疏激活机制在架构层面已不新鲜,DeepSeek-V4-Flash同样采用MoE设计,但其体量更重:据公开资料,DeepSeek-V4-Flash总参数284B,每token激活13B。相比之下,Qwen3.8-Flash-Next在激活参数量上约为前者的一半,而从官方公布的智能体任务基准来看,两者性能接近甚至有所超越。

千问团队在架构层面做了四处系统性改动,而非局部修补。第一,注意力机制方面引入QSA(千问稀疏注意力)与GDN融合的混合注意力架构,官方数据显示,在高缓存命中的百万token长上下文实际场景中,推理速度可提升8倍以上。第二,信息传递路径方面,自研Gated Residual(门控残差)将传统Transformer的单条信息主通道扩展为4条,让模型根据需要动态决定读写哪条路径,训练稳定性随之提升。第三,参数扩展策略上引入51B的N-gram Embedding,这部分参数相当于一本外挂"索引手册",每次token计算时只做查表寻址,不参与核心运算,以极低的推理代价换来了大幅的参数规模扩展。第四,模型结构与训练优化协同进行,收敛效率和训练吞吐均有提升。

这四项改动共同指向同一个目标:在激活参数不变的前提下,让每一次激活都能调用更大的有效知识库、更高效的信息流转路径。训练成本降至九分之一,是这套设计组合在工程层面的直接兑现。

基准测试:领先在哪,不足在哪

从官方公布及独立媒体DataCamp整理的基准数据来看,Qwen3.8-Flash-Next在智能体编程和专业办公任务上的优势较为明确。SWE-bench Pro编程评测中,该模型得分62.5,Claude Opus4.6得分53.4,差距9.1分;长程专业任务CoWorkBench上为73.9对68.2;JobBench专业工作任务评测中,差距拉大到55.7对36.6,约19分。多模态维度上,移动端智能体AndroidWorld领先Opus4.6达22.5分,视觉数学推理MathVision领先25.1分,具身智能ERQA任务领先31.5分。

但这张成绩单并不是单方面碾压。据DataCamp报道,在Humanity's Last Exam(HLE)这一综合推理难题测试中,Qwen3.8-Flash-Next得分35.9,低于Claude Opus4.6的40.0。HLE的设计初衷是考察模型在知识边界附近的推理能力,得分差距表明,Qwen3.8-Flash-Next在极端推理深度上仍与头部闭源模型存在差距,其优势更多集中于工程化任务和多模态场景,而非通用智识推理。

仅完成预训练的基座版本,在通用能力(SuperGPQA)、数学推理(GSM8K)、编程(SWEBench-Pretrain)三项基础评测中,就已超过参数规模是它3倍的Qwen3.7-Plus基座模型。这说明性能提升主要来自架构效率,而非单纯堆参数。

定价冲击:谁受影响最大

模型能力本身的竞争力,只是故事的一半;API定价才是这次发布对产业格局最直接的冲击。每百万token输入1元、输出3元,按官方对比,这一价格约为Claude Opus4.6的3%,为DeepSeek-V4-Flash忙时价格的1/3、闲时价格的2/3。

对于以Claude为主力API的企业用户而言,如果Qwen3.8-Flash-Next在其核心场景(尤其是智能体编程和办公自动化)的表现能够满足质量门槛,切换带来的成本降幅约为97%。这不是边际优化,而是数量级的落差。实际采购决策中,企业还需考量稳定性、合规要求、服务支持等因素,但价格信号本身已足够强烈,将迫使闭源厂商重新审视高端API的定价策略。

对DeepSeek而言,处境更为微妙。Qwen3.8-Flash-Next在CoWorkBench、Toolathlon Verified等智能体评测中据官方报告优于DeepSeek-V4-Flash,同时在忙时价格上低于后者三分之二。在开源生态内部,两者的直接竞争已经变得清晰——不再是闭源vs开源,而是不同架构路线的开源模型之间抢夺开发者的注意力和部署份额。

开源生态的杠杆效应

千问团队披露,截至目前Qwen系列模型全球下载量已突破30亿次,社区衍生模型超过30万个。这两个数字解释了为何这次把Qwen4架构预览版直接开源,而非留作闭源护城河——当社区衍生模型足够多,开源本身就成为加速架构迭代的机制:全球开发者在真实场景中部署、微调、报告问题,相当于免费获得了大规模真实压测。

Qwen3.8系列目前已完成三档开源:2.4T参数的Qwen3.8-Max、Qwen3.8-27B,以及此次的Qwen3.8-Flash-Next。从超大参数旗舰到高效推理模型,三档覆盖了从科研探索到实际部署的不同需求层级。千问办公"标准模式"已内置Qwen3.8-Flash-Next,官方称可处理95%的日常办公任务,这是从实验室到产品的直接路径验证。

从历史对照来看,2025年初DeepSeek-V3的开源曾在国际社区引发广泛讨论,核心叙事同样是"以极低训练成本实现顶尖性能"。Qwen3.8-Flash-Next延续了这一叙事,但在多模态能力(图像、视频输入)和架构透明度上走得更远——不仅开源权重,还将Next架构定性为Qwen4的前身,给出了更清晰的技术路线预告。

开发者和企业选型的可执行判断

对个人开发者和中小团队而言,Qwen3.8-Flash-Next的核心吸引力在于本地部署门槛的降低:6B激活参数意味着在配备高端消费级显卡的工作站上具备可行性,262K原生上下文支持(YaRN扩展可达百万token)覆盖了绝大多数长文档处理场景。对于以智能体编程、代码审查、复杂文档处理为核心需求的项目,基准数据提供了值得一试的理由。

企业选型则需要更审慎。生产环境关心的不仅是基准分数,还有高并发下的延迟稳定性、大规模部署后的长期维护成本、数据合规的属地化要求。当前阶段,开源模型在服务质量保障(SLA)和商业支持上仍弱于主流闭源API提供商。建议的做法是:在非核心业务线先做平行测试,以自有业务数据集对照评估,而非直接依赖公开基准作为迁移依据。

HLE得分差距是关键指标。如果业务场景涉及复杂多步推理、跨领域知识综合(而非工程化的代码和办公任务),当前版本的能力上限可能不及宣传语气所暗示的全面领先。

Qwen4将在哪些信号上验证自己

将Qwen3.8-Flash-Next定性为"Qwen4架构预览",是一个罕见的公开技术承诺:这意味着社区对Next架构的验证结果,将直接影响Qwen4的完成质量。以下几个信号将在接下来数月内逐步清晰:

首先,社区微调的质量分布。如果衍生模型在特定垂直领域(医疗、法律、金融)通过微调取得显著性能跃升,说明Next架构的表征能力足以支撑专业化迁移。其次,长上下文稳定性的实际口碑。官方宣称的8倍提速发生在高缓存命中条件下;真实生产环境中,文档内容的分布特征千差万别,长期稳定性需要大规模部署数据来说话。第三,HLE类通用推理基准的后续进展。若Qwen4在架构不变的前提下,通过更多训练数据和后训练调优弥合与Claude在深度推理上的差距,则整个Next架构路线的完整性将得到验证。