DSpark接入SGLang:用置信度驱动可变长度验证
DSpark 将半自回归 block drafter 与基于置信度的可变验证窗口结合,缓解 Speculative Decoding 在高并发下验证成本膨胀的问题。SGLang 已支持该机制,并通过 ragged CUDA graph、ov
DSpark 将半自回归 block drafter 与基于置信度的可变验证窗口结合,缓解 Speculative Decoding 在高并发下验证成本膨胀的问题。SGLang 已支持该机制,并通过 ragged CUDA graph、ov
SGLang Team 披露了 GLM-5.2-NVFP4 在 Blackwell B300 上的两周优化成果:通过 Spec V2、IndexShare MTP、TopK-V2、Indexer Prologue Fusion 与 BF16
推测解码(Speculative Decoding)能显著提升LLM推理速度,但传统方法需额外训练低效的草稿模型。Vertex AI采用EAGLE-3创新方案,仅在目标模型内部层添加轻量级草稿头(仅占2-5%模型大小),简化训练并实现2x-