Miles 引入 OPD:让蒸馏成为后训练原语
Miles 新增 On-Policy Distillation(OPD),将教师模型指导接入 rollout 与训练流程。Qwen3.5-35B-A3B 自蒸馏实验显示,纯 OPD 无需任务奖励即可把短推理行为迁移给学生模型,并保持甚至提升
Miles 新增 On-Policy Distillation(OPD),将教师模型指导接入 rollout 与训练流程。Qwen3.5-35B-A3B 自蒸馏实验显示,纯 OPD 无需任务奖励即可把短推理行为迁移给学生模型,并保持甚至提升
在智能体强化学习中,rollout并非单次生成,而是多轮模型调用、工具输出与恢复生成的链式过程。Token-In-Token-Out(TITO)原则旨在消除训练与推理间的关键不匹配,确保训练器评估的token序列与推理引擎实际产生和消费的序
强化学习(RL)已成为现代基础模型开发的核心阶段。通过ROCm对Miles的支持,AMD GPU用户可以在MI300/350级集群上运行现代RL管道,包括分布式rollout和GRPO训练。