Miles 团队近期将 On-Policy Distillation(OPD)作为一项核心能力接入系统。现在,OPD 已经融入 Miles 的 rollout 与训练流程,用户既可以只依赖教师模型信号训练学生模型,也可以将教师指导与 GRPO/PPO-style 强化学习目标结合使用。
这次更新的重点包括:把 OPD 抽象为 Miles 的可复用训练原语;通过稀疏的 teacher-scoring 流程避免不必要的密集 logprob 负载;并在单个 8×NVIDIA B200 节点上完成 Qwen3.5-35B-A3B 自蒸馏验证。实验显示,在没有任何任务特定 reward 的情况下,OPD 能将教师模型更短的推理行为迁移到基础学生模型,同时保持学生模型的任务表现。

OPD 成为 Miles 的一等训练原语
Miles 现在支持将 OPD 作为一种附加的 reverse-KL 训练信号。这使它可以覆盖两类关键训练模式:
- Pure distillation:学生模型完全依赖教师信号训练。此时任务 reward 可以设为 0,模型更新全部由逐 token 的 student-teacher reverse-KL 信号驱动。
- RL-augmented distillation:将 OPD 信号与任务 reward、GRPO/PPO-style advantage estimator 结合,让学生模型同时从环境反馈与教师指导中学习。
在 rollout 侧,Miles 通过由 SGLang 托管的教师模型支持两种 OPD:sampled-token OPD 与 top-k OPD。在 sampled-token OPD 中,教师模型会为学生模型在每个响应位置实际采样出的 token 打分。由于采样可能具有随机性,这个 token 未必是学生模型概率最高的 token。
top-k OPD 则进一步保留每个位置上的多个候选 token 及其学生模型 logprobs。教师模型对同一批候选 token 打分后,Miles 将对齐后的学生与教师 logprobs 组合成逐 token 的 reverse-KL 训练信号。这样的设计让 OPD 不再是一次性的蒸馏路径,而是 Miles 中可反复复用的训练组件。
Top-k OPD:更丰富的师生分布对齐
相比只看单个采样 token 的估计方式,top-k OPD 能构建更充分的学生—教师对比。在学生 rollout 过程中,Miles 会在每个响应位置记录一组可配置的候选 token ID,以及对应的学生模型 logprobs。
当需要为位置 t 的候选 token 打分时,教师模型会基于原始 prompt 和学生模型在 t 之前已经生成的 token 作为因果前缀,然后返回这些指定候选 token 在该位置上的 teacher logprobs。
该实现还支持可配置的 top-k 蒸馏策略。用户可以自定义候选集合如何构造,以及计算 reverse-KL 信号时如何为候选 token 加权。这样,不同蒸馏配方可以共享同一套 rollout、teacher-scoring 与训练基础设施。
稀疏 Student-to-Teacher Scoring:避免无效负载
这次实现中一个重要系统改进,是引入了稀疏的 student-to-teacher scoring 流程。
在 OPD 中,学生 rollout 会产生逐位置的 top-k 表。对每个生成位置来说,Miles 都清楚知道 KL 计算到底需要哪些候选 token ID 和学生 logprobs。因此,教师模型实际上只需要在对应因果前缀下,为这些候选 token 打分。
在早期 OPD 实现中,scoring 流程需要先构建所有位置 top-k token ID 的全局并集,再要求教师模型在每个响应位置对这个完整并集打分。这样可以保证正确性,但会产生密集的 R × |U| 中间负载,其中 R 是响应长度,U 是全局 token-ID 并集。由于 |U| 可能接近 R × K,旧路径即使最终 OPD 计算只需要 O(RK) 个值,也可能物化并解析 O(R²K) 规模的 JSON 响应。
新的流程改为逐位置稀疏候选 token 打分。Miles 向教师模型发送 per-position token-ID 表,教师模型只返回每个位置自身候选集合所需的 logprobs。这样,教师响应负载与 OPD 实际计算完全对齐:Miles 只携带 OPD 所需的稀疏 R × K 值。
对于长响应推理任务,这一点尤其重要。teacher scoring 不应被无意义的负载构建、传输与解析拖慢。稀疏 scoring 让 OPD pipeline 更直接,也更适合高吞吐 rollout 与训练。
验证实验:在 NVIDIA B200 上进行 Qwen3.5 自蒸馏
为了验证实现效果,团队使用 Qwen3.5-35B-A3B 进行了一个受控自蒸馏实验。
实验中,教师模型先通过 Reinforcement Learning with Verifiable Rewards(RLVR) 训练,在解决 DAPO 数学题时生成明显更短的回答。学生模型则是对应的 pre-RL base checkpoint。团队选择这一设置,是因为直接蒸馏 DAPO 能力并不会带来明显变化:基础 Qwen 学生模型在原任务上已经很强。因此,他们刻意让教师模型具备一种可测量的行为差异——更短但仍有效的推理——再测试 OPD 能否把这种行为迁移给尚未具备该特征的学生模型。
为隔离 OPD 的效果,本实验采用 pure distillation:
- Task reward:0
- Training signal:top-1 student-teacher reverse-KL
- Teacher:经 RLVR 训练的短推理 checkpoint
- Student:pre-RL base checkpoint
- Hardware:单个 8×NVIDIA B200 节点
- Execution mode:student rollout、teacher scoring 与 student training 共置,并在同一 GPU 池上分时运行
实验参考基线如下:
| Model / stage | Held-out DAPO | Mean response length |
|---|---|---|
| RLVR teacher | 0.8870 | 6,248 |
| Initial base student | 0.8457 | 18,675 |
可以看到,教师模型用更短的响应解决同样的 DAPO 问题,而基础学生模型会生成明显更长的解答。该实验要回答的核心问题是:纯 OPD 是否能把教师模型的高效推理行为迁移给学生模型,同时保持 held-out DAPO 性能?
结果:推理显著变短,性能没有下降
实验结果清楚表明,OPD 能够迁移教师模型的高效推理行为。
held-out DAPO 表现从 0.8457 提升到 0.8945。与此同时,sampled rollout length 在第一次更新后迅速下降,从约 18.6k tokens 降至后续多数 rollout 中的 5.5k–6.7k tokens,期间只出现过一次短暂的随机性峰值。逐 token 的 OPD reverse-KL 也从约 0.045 降到 0.010,说明在学生自身 rollout 上,学生分布正在靠近教师分布。
三条学习曲线从不同角度给出了同样结论。首先,held-out DAPO performance 上升,说明 OPD 后学生模型没有在任务性能上退化。

其次,sampled rollout length 快速下降,表明学生模型学到了教师模型的短回答行为。

最后,per-token OPD reverse-KL 持续降低,确认学生分布正逐步向教师分布靠拢。

由于本实验中的原始任务 reward 为 0,行为变化完全由 OPD 教师信号驱动。核心结论是:纯 OPD 能将教师模型的高效推理行为迁移到基础学生模型上,并且 held-out DAPO 表现不但没有下降,反而有所提升。
这对 Miles 意味着什么
OPD 的加入,让 Miles 能覆盖更多单靠可验证任务 reward 难以表达的后训练场景。
很多实际工作流并不只追求任务成功率,还需要优化模型行为,例如推理长度、回答风格、领域特定习惯,以及与参考模型的分布对齐等。OPD 允许 Miles 将这些目标表达为教师引导的训练信号,同时保持原有 rollout 与 RL training pipeline 不变。
OPD 还为 multi-teacher consolidation 提供了路径。不同专家教师可以在不同领域或能力上提供指导,让单个学生模型吸收互补行为,成为更通用的模型。由于 Miles 将 OPD 视为可复用原语,同一套学生训练 pipeline 可以支持不同教师和蒸馏配方,而无需为每个领域单独搭建训练系统。多教师 OPD 的验证仍是后续工作。
此外,OPD 的实现保持了良好的可组合性。用户既可以运行 pure distillation,也可以把 OPD 作为辅助信号与 GRPO/PPO-style 目标结合。这对于需要教师指导与任务 reward 协同工作的后训练流程非常重要。
同样关键的是,该系统针对长响应工作负载做了优化。稀疏逐位置 scoring 与 top-k OPD 避免了不必要的密集 teacher-scoring 负载,使整个 pipeline 更贴近蒸馏真正需要的计算。
下一步
当前实现已经将 OPD 确立为 Miles 的一等能力,并在受控的 Qwen3.5 自蒸馏设置中验证了 pure OPD 的效果。接下来,团队计划继续扩展验证范围,尤其是在更复杂的蒸馏配方、RL 目标组合以及多教师场景中检验 OPD 的泛化能力。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接