Miles v0.1:生产级前沿后训练系统

Miles v0.1:生产级前沿后训练系统

Miles RL循环

Miles v0.1是专为前沿后训练打造的全栈生产级系统,继承slime的简洁设计,遵循“验证、干净、可定制”的核心原则,全面优化RL训练循环的每个环节。系统以准确性、效率、可靠性和可扩展性为首要目标,让前沿规模的RL训练对研究者和开发者触手可及。

The Miles fully async RL loop

一个典型的RL训练任务在Miles中循环执行以下阶段:Rollout阶段由SGLang引擎生成轨迹;Training阶段由NVIDIA Megatron-LM或FSDP trainer消费轨迹组并更新策略;Weight update阶段将新权重同步回Rollout集群。

Rollout

所有Rollout均由SGLang生成。Miles原生集成SGLang,支持多轮会话、工具执行、沙箱环境及token忠实轨迹捕获,尤其适合长上下文和agentic工作负载。

完全异步RL

针对长尾轨迹问题,Miles采用完全异步RL设计,避免同步调度导致的相互阻塞。Rollout引擎持续生成轨迹,trainer则独立消费已完成组并更新模型。

How fully async handles long-tail trajectories

调度以样本粒度进行,已完成轨迹立即释放槽位。数据缓冲区解耦Rollout吞吐与训练节奏,用户可在此自定义保留、重试或丢弃策略。

Evaluation modes on the timeline

Agentic环境与TITO

Miles通过插件点集成Harbor、HUD等环境,支持多种沙箱后端。TITO会话服务器确保模型生成的精确token ID传递给trainer,避免tokenization偏差。

The TITO session server

高效R3与训练优化

Rollout Routing Replay (R3)记录并重放MoE路由结果,保证数值一致性。Miles支持NVFP4、MXFP8等低精度训练及INT4 QAT,确保Blackwell架构的高吞吐。

On-policy distillation in MilesMetrics in the GLM-5.2 agentic RL training example