下一代推测解码:DFlash与Spec V2
Modal、Z Lab与SGLang团队联合发布DFlash推测解码模型,搭配SGLang Spec V2引擎,在Qwen 3.5 397B-A17B模型上实现SOTA推理延迟。HumanEval数据集并发1场景下,吞吐量较基线提升4.3倍
Modal、Z Lab与SGLang团队联合发布DFlash推测解码模型,搭配SGLang Spec V2引擎,在Qwen 3.5 397B-A17B模型上实现SOTA推理延迟。HumanEval数据集并发1场景下,吞吐量较基线提升4.3倍
推测解码(Speculative Decoding)能显著提升LLM推理速度,但传统方法需额外训练低效的草稿模型。Vertex AI采用EAGLE-3创新方案,仅在目标模型内部层添加轻量级草稿头(仅占2-5%模型大小),简化训练并实现2x-