HPC-Ops × SGLang:腾讯混元高性能 Attention、Router GEMM 与 MoE 内核
HPC-Ops(https://github.com/Tencent/hpc-ops)是专为 LLM 推理设计的开源算子库,已部署于腾讯混元的大规模生产服务中。其核心算子 Dynamic Attention 和 Fused MoE 在混元在线推理中发挥关键作用,最高可将 Hy3 模型的 TPOT 降低 48.8%。目前,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已集成至 SGLang 主分支,将这些生产验证的优化带给开源服务社区。
本文将介绍 HPC-Ops 三大算子的设计思路及其与 SGLang 的集成方式,并展示 H20 上的算子基准与服务结果,同时包含 H200 验证数据。这些优化针对 NVIDIA Hopper GPU(SM90),已在 Qwen3、Hy3 和 LongCat 工作负载上验证通过。
亮点速览
- Attention:在 H20 上,HPC-Ops 动态调度比静态 split-KV 方案快 2.95 倍,平均比 FlashInfer 和 FlashAttention 中最优方案快 2.25 倍。在 H200 上,集成 Hy3-FP8 路径配合 FP8 KV cache,输出吞吐提升 3.7–5.9%。
- Router GEMM:在 H20 上,HPC-Ops 比 FP32 cuBLAS 快 1.30–3.22 倍,最大绝对误差仅 0.00177,优于 TF32 cuBLAS 的 0.06464。在 H200 LongCat-Flash 验证中,速度提升 4.31 倍。
- MoE:在 H20 上,HPC-Ops 在 TP8/EP1 配置下平均加速 1.08 倍,在 TP1/EP8 配置下加速 1.21 倍。在 Qwen3/H200 测试中,最高比 Triton 快 4.21 倍。
- 端到端服务:8×H20 + Hy3-FP8 配置下,同时启用 HPC-Ops Attention 和 MoE,TPOT 在 batch 4–64 时降低 15.1–48.8%,TTFT 在 batch 4–16 时降低 3.3–6.0%。

MoE 模型服务中的三大热点路径
生产级 MoE 服务通常包含混合长度 Attention、精度敏感的路由以及稀疏专家执行,负载分布不均。HPC-Ops 针对每个阶段提供专用算子:负载感知的 Attention 调度、精度感知的 Router GEMM,以及减少 gather 开销的融合 MoE 流水线。
Attention:混合长度 decode 的负载均衡
在 decode 阶段,每个新 token 需要关注完整 KV cache,工作量随序列长度线性增长。静态 split-KV 调度难以应对混合长度批次,而 HPC-Ops 采用持久化内核,根据实际 KV 长度动态分配任务,实现近乎完美的负载均衡。

Router GEMM:精度与吞吐的平衡
路由器精度直接影响 MoE 模型质量。HPC-Ops 将 FP32 权重分解为两个 BF16 分量,通过两次 BF16 GEMM 恢复低阶尾数精度,同时利用 Tensor Core 加速,误差远低于 TF32 cuBLAS。

MoE:降低小专家 GEMM 周围开销
decode 时每个专家仅处理少量 token,传统 MoE 路径存在大量 gather、kernel launch 和 HBM 往返开销。HPC-Ops 通过融合流水线显著减少这些开销。

端到端性能验证
在 8×H20 上启用 HPC-Ops Attention 和 MoE 后,Hy3-FP8 模型 TPOT 大幅下降;LongCat-Flash-Lite-FP8 模型输入吞吐提升 5.5–6.1%。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接