DeepSeek-V4 Flash强化学习登陆AMD MI355X

DeepSeek-V4 Flash强化学习登陆AMD MI355X

作者:AMD & Miles Team

AMD与Miles团队宣布,DeepSeek-V4 Flash RL现已在搭载ROCm™AMD Instinct™ MI355X GPUs上获得Miles支持。这意味着DeepSeek-V4 Flash可以在Miles框架中完成端到端强化学习训练:由SGLang负责rollout生成与log probabilities记录,由Megatron负责actor训练与策略更新,再由Miles将更新后的权重持续回传给在线rollout引擎。

这项工作并不只是“跑起来”那么简单。强化学习要求rollout端与训练端对同一策略的实现足够一致,否则同一token的概率估计会漂移,进而影响GRPO等训练过程的稳定性。DeepSeek-V4 Flash引入了hybrid compressed attention、mHC residual mixing和MoE routing等结构,使SGLang与Megatron之间的行为对齐更具挑战。

核心结论

  • DeepSeek-V4 Flash RL已可在Miles + AMD Instinct MI355X上运行。团队解决了ROCm环境下端到端执行所需的模型对齐与在线更新问题。
  • 四节点验证完成。在超过100个optimizer steps的运行中,train-rollout log-probability差异保持有界,online reward改善,离线AIME-2024评测分数上升。
  • 下一阶段重点是性能优化。后续工作包括低精度训练、端到端性能调优,以及在更大集群上的扩展。

DeepSeek-V4 Flash架构概览

DeepSeek-V4 Flash是一个2840亿参数的MoE模型,每个token激活约130亿参数。本次使用的配置包含43层decoder256个routed experts并采用top-6 selection,同时具备4条mHC residual streams。在注意力机制上,它结合了128-token sliding window与压缩长上下文注意力。

具体来看,C4 layers会从4:1压缩后的KV序列中选择top 512条目;C128 layers则在128:1压缩序列上进行稠密attention。与mHC和MoE routing一起,这些都是SGLang和Megatron必须保持一致实现的架构关键路径。

Simplified DeepSeek-V4 block showing mHC residual mixing, hybrid compressed attention, and top-6 MoE routing.

图1:DeepSeek-V4结构示意,展示mHC residual mixing、hybrid compressed attention与top-6 MoE routing。

Miles强化学习栈如何运转

Miles负责协调异步训练循环。SGLang生成候选回答与rollout log probabilities;Megatron对同一批序列重新打分,计算policy update并训练actor;随后Miles把更新后的权重传回仍在运行的SGLang workers,供下一轮rollout使用。

当前FP8路径中,rollout使用FP8 Hugging Face checkpoint,actor训练使用BF16 Megatron torch_dist checkpoint。也就是说,两个引擎以不同执行格式表达同一个policy,因此checkpoint转换、重新打分以及在线权重更新都属于正确性边界的一部分。

Prompts flow to SGLang rollout; trajectories and log probabilities flow through Miles to the Megatron actor; updated weights return to SGLang before the next rollout.

图2:Prompts进入SGLang rollout,轨迹与log probabilities经Miles流向Megatron actor,更新后的权重再返回SGLang。

挑战一:缩小train-rollout log-probability差距

RL训练依赖一个前提:SGLang与Megatron必须对同一批生成token给出相近的概率。为此,团队构建了token-identical comparison workflow:先由SGLang生成一次序列,然后让两个引擎对完全相同的tokens进行打分,通过token级差异在昂贵的多节点验证前定位模型实现不一致的问题。

该流程暴露了DeepSeek-V4特有的两处差异:早期hash-routed MoE路径,以及mHC residual mixing。团队将Megatron的hash-routing行为与SGLang对齐,并修正了Megatron侧mHC post-mix逻辑,使两个引擎保留相同的模型语义。这些针对性修改显著提升了rollout与training之间的数值一致性。

挑战二:在线更新中保留量化语义

在RL训练中,rollout server需要在不重启的情况下反复接收更新后的policy weights。对量化模型而言,权重成功传输并不等于更新正确:packed weights、scale tensors以及依赖量化状态的runtime信息,都必须在更新后继续保持正确含义。

针对FP4E8M0张量,AMD让更新路径具备datatype-aware能力,避免更新后张量被错误解释,从而导致无效生成。针对FP8,Miles本身已经定义了更新后的生命周期;AMD则在ROCm栈中补齐了缺失的SGLang接口,使Miles能在rollout恢复前执行必要的量化处理。

这部分工作的核心经验是:在线更新不能只是复制字节,而必须恢复模型的量化状态。

挑战三:在ROCm上建立稳定的多节点并行策略

将DeepSeek-V4 Flash RL扩展到多台AMD Instinct MI355X节点时,团队遇到两个相互关联的问题:一是如何为2840亿参数MoE模型在4K context下选择可行的model-parallel策略;二是如何保证多节点collective communication稳定。

更高的tensor parallelism可以降低单GPU显存压力,但会增加collective traffic。早期部分多节点配置会卡在RCCL collectives中,例如tensor-parallel all-reduce或expert all-to-all无法完成,并被communication watchdog捕获,最终导致运行中断。

团队最终收敛到一个兼顾显存可行性与通信稳定性的布局:在4个八卡节点上采用tensor-parallel 1 / pipeline-parallel 4 / expert-parallel 4,并结合activation recomputation、optimizer-state offload到host memory,以及受控的单GPU token预算。通过减少tensor-parallel all-reduce压力、转向pipeline与expert parallelism,再配合调优后的RCCL transport settings,训练得以端到端稳定运行超过100个optimizer steps。

四节点AMD Instinct MI355X验证结果

团队在4个八卡AMD Instinct MI355X节点上验证了FP8路径:其中2个节点用于SGLang rollout,2个节点用于Megatron actor training。Miles协调了类似GRPO-style training的流程,训练任务为长上下文数学数据集DAPO-Math-17K,上下文长度为4K。模型并行配置为tensor-parallel 1 / pipeline-parallel 4 / expert-parallel 4。每10步,团队会在AIME-2024上进行一次离线评测,每题采样8次。rollout模型使用FP8,actor以BF16训练。

正确性与online reward

关键正确性指标之一,是rollout与training是否会对同一批生成tokens给出相近概率。在记录的训练步骤中,平均绝对log-probability差异约为0.09。从图3可以看到,在超过100步以及多次在线权重更新后,该差异始终保持有界,没有持续上升,也没有在更新后出现突然扩大。团队强调,这是一个令人鼓舞的bring-up结果,而非最终阈值。

Train-versus-rollout absolute log-probability difference over the first 100 training steps.

图3:前100个训练步骤中,train与rollout之间的绝对log-probability差异。

除了log-probability保持一致,online reward也随训练改善。在一次扩展运行中,online raw reward呈现明确上升趋势,而不是维持平坦;从运行前1/3到后1/3,均值有所提升。这表明actor在持续GRPO训练和反复在线权重更新中确实得到改进,而不仅仅是维持原有奖励水平。

Online raw reward over 100 training steps with per-step values, moving average, and linear fit.

图4:100个训练步骤中的online raw reward,包括逐步数值、移动平均与线性拟合,整体斜率为正。

AIME-2024离线评测

在线pass rate是在训练负载上测得的,并会受到动态采样影响,因此团队还引入了独立离线基准:每10步在AIME-2024上评估一次,每题8个samples。这被视为更可靠的模型质量指标。

在前100个训练步骤中,离线AIME的pass@1从0.39提升到0.49pass@8从0.53提升到0.67;同时,受4,096-token上限影响的响应截断比例从60%下降到55%。单次回答准确率与多样本覆盖率同步提升,说明GRPO带来的并非简单的分布“锐化”,而是更真实的能力提升。由于AIME-2024只有30道题,单点评估会有噪声,因此更应关注整体趋势。

Offline AIME-2024 pass@1/2/4/8 over the first 100 RL training steps.

图5:前100个RL训练步骤中的AIME-2024 pass@1/2/4/8,每10步评估一次,每题8个samples。

下一步:从可运行走向高性能

这次验证的重点是把DeepSeek-V4 Flash RL在AMD Instinct MI355X与ROCm生态中端到端打通,并证明关键正确性路径可以稳定工作。接下来,团队将把重心转向性能优化,包括进一步探索低精度训练、端到端吞吐与延迟优化,以及在更大规模集群上的扩展。

总体来看,这项工作展示了Miles、SGLang与Megatron在AMD GPU平台上协同运行大规模MoE强化学习训练的可行性。对于希望在ROCm生态中训练和对齐超大模型的团队而言,DeepSeek-V4 Flash的bring-up经验提供了一个重要参考:模型语义对齐、量化状态恢复与通信并行策略,缺一不可。