追逐Batch-1极限:Ling-3.0-flash在Blackwell上的推测解码优化
本文深入分析Ling-3.0-flash混合注意力MoE模型在4张NVIDIA Blackwell GPU上的Batch-1解码优化。通过NEXTN和DSpark两条推测解码路径,单请求吞吐从288 tok/s提升至606 tok/s,均值
本文深入分析Ling-3.0-flash混合注意力MoE模型在4张NVIDIA Blackwell GPU上的Batch-1解码优化。通过NEXTN和DSpark两条推测解码路径,单请求吞吐从288 tok/s提升至606 tok/s,均值
HPC-Ops 是腾讯混元大规模生产推理中使用的开源算子库,其核心的 Dynamic Attention 和 Fused MoE 算子显著提升了模型性能,最高可将 Hy3 模型的 TPOT 降低 48.8%。本文详细介绍 HPC-Ops 中
本文介绍 SGLang 中针对 DeepEP MoE 推理的两种调度时负载均衡方案:Waterfill 和 LPLB。Waterfill 通过将共享专家动态分配给负载较低的 rank,在 DeepSeek-V3/R1 类工作负载下吞吐提升