迈向Blackwell原生8/4位RL:Miles端到端MXFP8与NVFP4实践

迈向Blackwell原生8/4位RL:Miles端到端MXFP8与NVFP4实践

引言

在低精度RL中,rollout、训练、checkpoint转换和实时权重更新必须遵循统一的精度契约,否则采样器与训练器策略会发散。Miles与SGLang RL生态已集成低精度方案,本文进一步将MXFP8与NVFP4扩展至Blackwell原生格式。

为何需要Blackwell原生方案?

以往低精度方法并非针对MXFP8或NVFP4设计。现有Miles路径采用DeepSeek-V3风格的块缩放FP8方案,在Blackwell上其FP32 scale仍通过软件而非原生微缩放硬件实现。NVFP4则可充分利用B200/B300的FP4 Tensor Core吞吐优势。

格式背景

MXFP8

MXFP8是Blackwell原生微缩放FP8格式,每个32个E4M3值共享一个E8M0局部scale。

NVFP4

NVFP4采用两级缩放:FP32张量级scale与E4M3块级scale。

NVFP4 two-level scaling with FP32 tensor scale and E4M3 block scales

方案一:端到端MXFP8 RL

该方案在rollout、前向传播、权重梯度与数据梯度GEMM中全程使用MXFP8,选定张量可保留BF16。

End-to-end MXFP8 RL recipe

方案二:MoE专家Per-Token NVFP4 RL

NVFP4更激进,仅对MoE专家进行量化,其余部分默认BF16。

Original NVFP4 pretraining recipeNVFP4 with high-precision backwardNVFP4 with dequantized backwardMXFP8 with high-precision backwardMXFP8 with dequantized backward

高精度层保护

保留最终层BF16可显著改善训练稳定性。

Effect of keeping final layers in BF16First-layer BF16 versus last-layer BF16Shared expert high-precision ablation