智谱GLM-5.3-Flash开源:匿名模型Ox Alpha六天夺冠,以Opus 4.8四十分之一价格平齐前沿评分

2026年8月26日,智谱AI正式开源GLM-5.3-Flash(320B-A18B),并确认这就是八月上旬以"Ox Alpha"为名匿名上线OpenRouter和OpenCode、随即登顶双平台调用量排行的模型。该模型采用专家混合(MoE)架构,总参数3200亿,单次推理激活仅180亿,支持1M token上下文窗口,以MIT协议开放全部权重,API定价为0.15美元/百万输入token与0.50美元/百万输出token——限时折扣期内进一步降至GLM-5.3正式版的二十分之一,折算下来约为Claude Opus 4.8定价的四十分之一。

这一组数字构成了这次发布的核心张力:在第三方机构Artificial Analysis的综合智能指数中,GLM-5.3-Flash取得57分,与Anthropic最受欢迎的旗舰模型Claude Opus 4.8持平,位居全球前沿模型能力区间。性能基准平起平坐,价格相差四十倍。

为什么3200亿参数只需激活180亿:架构逻辑

MoE设计的本质是:参数不再同时参与每一次计算。模型在预训练中积累了全量3200亿参数的知识密度,推理时由路由机制决定激活哪些"专家子网络"处理当前请求,本次只调用180亿参数。结果是:用户得到接近超大模型的能力,但计算成本只对应被激活的那一部分。

与前代GLM-4.5相比,GLM-5.3-Flash的变化更能说明问题。两代模型总参数体量相当(GLM-4.5为355B,GLM-5.3-Flash为320B),但层数从92层削减至45层,激活参数从32B降至18B,架构在"变薄"的同时性能反而提升。IT之家援引官方信息指出,这一跃升背后有两项关键创新:其一,GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在不牺牲长上下文精度的前提下,显著降低了长序列的服务成本;其二,引入流形约束超连接(Manifold-Constrained Hyper-Connections,mHC),提升参数规模扩展的效率。此外,30万亿token的多模态预训练语料也是这代性能跃升的重要基础。

GLM-5.3-Flash将视觉能力原生融入编程循环,模型能够主动观察界面渲染结果、读取交互反馈、据此修改代码。这对前端开发、Blender 3D场景构建、以及浏览器与图形界面协同的自动化任务有实际意义,与传统的"语言+视觉拼接"方案在使用场景上存在结构性差异。

六天匿名测试:一场刻意隐去品牌的实战压力测试

Ox Alpha于2026年8月20日以匿名模型身份在OpenRouter和OpenCode上线,免费向全球开发者开放,上线时未披露任何厂商信息。在随后六天内,其在OpenRouter上产生了逾23万亿token的调用量,约为同期第二名的2.3倍,创下该平台单模型上线记录;在OpenCode上同样登顶当周使用量排行。多家报道引用的总调用量(含两平台合计)超过44万亿token。

这种匿名测试策略的含义是:在剥去品牌光环之后,模型仍然能够以纯粹的产品力击败有名有姓的竞争对手。开发者在不知道这是"智谱出品"的情况下选择了它、持续使用它,并推动调用量达到平台历史峰值。

据IT之家报道,整个匿名测试阶段的全部算力,均由国产芯片提供支持。摩尔线程在模型开源当日完成day-0极速适配,基于MTT S5000智算卡和MUSA软件栈投入运行;据摩尔线程官方公告,约10万张国产算力卡在测试期间累计承载了超过62万亿token的调用量。壁仞科技同样于当日完成适配,依托SGLang推理框架与BIRENSUPA软件栈,在壁砺166M芯片上完成推理验证并对外提供部署方案。

这一细节将这次发布的意义从单纯的模型竞争延伸至更大的叙事:一个达到全球前沿水准的超大规模多模态模型,在正式面向公众之前,已在国产硬件上完成了实际规模的压力测试。

两种基准,两种置信度

GLM-5.3-Flash的性能声明涉及两个来源,需要分开对待。第三方机构Artificial Analysis给出的综合智能指数得分为57,与Claude Opus 4.8的得分持平——这是独立评测机构给出的同分,可信度较高。据报道,DeepSeek旗舰模型在同一指数中的得分为53,低于GLM-5.3-Flash。

第二个声明来自智谱自研的Z.ai Code Bench:官方称该基准下GLM-5.3-Flash的编程表现"与Claude Opus 4.8相当"。enterprisedna.co在其报道中专门点出这点:这是厂商自己的基准测试,并非独立对比,"结论方向是清晰的,但需要谨慎对待"。两类证据的性质不同——第三方综合指数得分提供了一个跨模型可比的锚点,而编程场景的具体表现,还需要在更广泛的独立实测中得到验证。

这种区分不是苛求,而是选型的基本原则。对于打算在生产环境使用该模型的开发者和企业,真正有意义的问题是:在自己的实际任务上,GLM-5.3-Flash的输出质量在什么水平?这只能通过真实工作负载的实测来回答。

开发者和企业的选型含义

对开发者而言,GLM-5.3-Flash的直接价值在于三点叠加:MIT协议允许无限制商业部署;1M token上下文可以容纳整个大型代码库;MoE架构使每次调用的实际成本对应18B激活参数,而非3200亿总参数。这意味着在同等预算下可以发起更多请求、支持更高的调用频率。

对企业而言,核心决策框架可以简化为一个问题:哪些任务真正需要旗舰模型的边际能力?常规编程辅助、内部代理工作流、文档处理、代码审查——这些高频任务如果能够在能力基线满足的前提下以四十分之一的价格运行,累计节省的推理成本将极为可观。enterprisedna.co给出的建议是:用实际的编程工作负载对不同价位模型做基准测试,然后按任务类型路由,高风险高精度任务留给旗舰模型,常规任务交给成本更低的选项。

国内部署场景存在额外的现实优势。摩尔线程和壁仞科技的day-0适配意味着,有国产算力合规要求的机构不需要等待漫长的适配周期,可以直接获取经过规模验证的部署方案。而整个匿名测试期间超过44万亿token的国产芯片承载记录,也提供了一定程度的生产稳定性参考。