迈向Blackwell原生8/4位RL:Miles端到端MXFP8与NVFP4实践
本文介绍了Miles团队在Blackwell架构上实现的两种原生低精度RL方案:端到端MXFP8与MoE专家per-token NVFP4。通过从checkpoint转换、Megatron训练、SGLang rollout到实时权重更新的全
本文介绍了Miles团队在Blackwell架构上实现的两种原生低精度RL方案:端到端MXFP8与MoE专家per-token NVFP4。通过从checkpoint转换、Megatron训练、SGLang rollout到实时权重更新的全
GB200 NVL72作为深度学习最强硬件之一,本文分享SGLang团队在上篇博客基础上,对DeepSeek V3/R1推理性能的进一步优化,包括FP8 attention、NVFP4 MoE、大规模专家并行(EP)、预填充-解码分离等技术