DeepSeek-V4 Flash强化学习登陆AMD MI355X
AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通
AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通
SGLang、Miles 与 Thinking Machines Lab 合作,为 975B 参数多模态模型 Inkling 提供 Day-0 支持。新版本围绕 ShortConv、相对位置注意力和 shared-expert sink M
Miles 新增 On-Policy Distillation(OPD),将教师模型指导接入 rollout 与训练流程。Qwen3.5-35B-A3B 自蒸馏实验显示,纯 OPD 无需任务奖励即可把短推理行为迁移给学生模型,并保持甚至提升
在智能体强化学习中,rollout并非单次生成,而是多轮模型调用、工具输出与恢复生成的链式过程。Token-In-Token-Out(TITO)原则旨在消除训练与推理间的关键不匹配,确保训练器评估的token序列与推理引擎实际产生和消费的序
SGLang 与 Miles 宣布对 NVIDIA Nemotron 3 Ultra 实现 Day-0 支持。该模型专为长时程自主代理设计,采用混合 Transformer-Mamba MoE 架构,参数规模达 550B(激活 55B),上
SGLang 团队宣布,DeepSeek-V4 在发布当日即提供全面的推理与强化学习支持。SGLang 和 Miles 组成首个开源技术栈,专为其混合稀疏注意力架构及多样化连接优化而设计。此次发布包括了影子基数前缀缓存、推测解码加速及 Hi
强化学习(RL)已成为现代基础模型开发的核心阶段。通过ROCm对Miles的支持,AMD GPU用户可以在MI300/350级集群上运行现代RL管道,包括分布式rollout和GRPO训练。
千里之行,始于足下。今天,RadixArk团队发布了Miles,一个专为大规模MoE训练和生产环境打造的企业级强化学习框架。Miles基于轻量级RL框架slime构建,后者已悄然驱动众多后训练管道和大模型MoE训练(如GLM-4.6)。sl