SpecForge 团队推出 v0.3.0 版本,实现了目标模型推理与草稿模型训练的完全解耦,支持更广泛的推测解码算法,并统一了在线、离线与解耦工作流。
主要更新亮点
- 在线训练现已完全解耦:补丁版 SGLang 服务器捕获目标特征,Mooncake 传输张量,训练器通过独立控制平面消费轻量引用。
- 推理与训练可独立扩展:在 8×H20 测试平台上,3 个 SGLang 服务器 + 5 个训练器配置使端到端训练吞吐提升约 10%。
- 单一运行时支持多种草稿算法:EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 及可选 D-PACE 目标。
同时发布多款社区贡献的开放 SpecBundle 草稿模型,并内置训练-服务一致性检查门。
从耦合训练器到训练流水线
在线草稿模型训练包含两个截然不同的工作负载:目标侧运行冻结大模型捕获隐藏状态,草稿侧训练小型模型进行前向反向传播。旧版同址设计将两者绑定同一生命周期,导致固定比例、资源干扰和共享故障边界等问题。新架构明确边界,使训练器无需拥有目标模型,仅需 token 序列、掩码与目标特征。
一个边界,三项契约
新在线运行时分为生产者池与消费者池。生产者调度提示至补丁 SGLang 捕获服务器,特征张量写入 Mooncake,仅传递 SampleRef 元数据。
图 1:在线解耦训练架构示意图。
捕获契约
deployment.disaggregated.server_urls 中的每个 URL 对应一个 rollout worker,连接已打补丁的 SGLang 服务器。
投递契约
大张量通过 Mooncake 存储,训练器通过 FeatureDataLoader 解析引用构建批次。
生命周期契约
分布式 rank 同步推进,使用 SQLite 账本记录已训练样本,支持中断恢复。
解耦带来的收益
推理池与训练池可独立扩展。在 8×H20 测试床上,Qwen3-8B Domino 3k 上下文训练中,3 服务器 + 5 训练器配置较旧版同址实现吞吐提升 10%。


图 2-3:同址与解耦训练性能对比曲线。
新运行时已支持 EAGLE3、DFlash、Domino 等算法,性能测试显示显著加速。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接