亮点概述
Muse Glimmer 是一款 30B 参数的多模态密集模型,拥有 128k+ token 上下文窗口,专为本地硬件上的端到端 Agentic 工作流打造。SGLang 提供专属优化,在 NVIDIA GeForce RTX 5090 上借助 NVFP4 与 DFlash 技术,实现最高 1452 tok/s 总输出吞吐和 236 tok/s 单用户解码速度。
Muse Glimmer 模型架构
Muse Glimmer 由 27.9B 密集文本解码器、1.9B ViT 以及 GELU 多模态投影器组成。文本解码器包含 52 层 Transformer,每层采用分组查询注意力(32 个查询头、2 个键值头)与 SwiGLU 前馈网络。解码器使用混合注意力模式,每四步交替三个 2048-token 滑动窗口层与一个全序列层,结合 RoPE 与 NoPE 实现上下文长度扩展。
功能支持
广泛硬件后端兼容
SGLang 支持 Muse Glimmer 部署于 Apple Silicon(Mac mini、M 系列 MacBook Pro)、NVIDIA RTX 5090、RTX PRO 6000 及 DGX Spark 等本地硬件。SM120 平台利用优化 GEMM 与 FlashInfer 后端,Apple Silicon 则通过原生 MLX 后端实现高性能服务。
DFlash 推测解码
用户可通过以下命令启用 DFlash 实现低延迟推理:--speculative-algorithm DFLASH。
原生优化特性
模型兼容 SGLang 的低开销调度器、RadixAttention 前缀缓存及可中断 CUDA 图等优化,MLX 后端也已引入前缀缓存以提升 Apple Silicon 上的 Agentic 工作负载性能。
多格式检查点
提供 BF16、NVFP4(约 19.5GB)、GGUF Q4KM 等格式,适配不同硬件与精度需求。
性能测试结果
测试覆盖七个平台,批大小 1-8。DFlash 可将批大小 1 的交互性提升 1.9-4.3 倍,批大小 8 的总吞吐提升 1.4-4.2 倍。
- RTX 5090 (nvfp4 + DFlash): 236.4 tok/s/user (batch 1), 1452 tok/s (batch 8)
- B300 (nvfp4 + DFlash): 290.01 tok/s/user, 1295 tok/s
- Apple M5 Pro (q4): 17.6 tok/s/user, 56.9 tok/s
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接