追逐Batch-1极限:Ling-3.0-flash在Blackwell上的推测解码优化
本文深入分析Ling-3.0-flash混合注意力MoE模型在4张NVIDIA Blackwell GPU上的Batch-1解码优化。通过NEXTN和DSpark两条推测解码路径,单请求吞吐从288 tok/s提升至606 tok/s,均值
本文深入分析Ling-3.0-flash混合注意力MoE模型在4张NVIDIA Blackwell GPU上的Batch-1解码优化。通过NEXTN和DSpark两条推测解码路径,单请求吞吐从288 tok/s提升至606 tok/s,均值
Qwen团队开源Qwen3.8-Flash-Next,这是一款多模态MoE模型,也是Qwen4架构的早期预览。SGLang与Qwen、NVIDIA及AMD团队合作,提供Day-0支持。该模型采用Gated DeltaNet与Qwen Spa
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供零日支持。该模型采用 30B 参数混合专家架构,仅激活 3B 参数,专为高吞吐量代理任务设计,支持最长 1M 上下文长度。模型支持多令牌预测、DFlash
SpecForge v0.3.0 发布重大更新,将目标模型推理与草稿模型训练完全分离,支持在线、离线及解耦工作流,兼容 EAGLE3、DFlash、Domino 等多种算法。新架构通过 Mooncake 传输特征,SGLang 捕获目标特征
SGLang 与 Miles 携手 Moonshot AI 和 NVIDIA,为 2.8 万亿参数的 Kimi K3 模型提供 Day-0 支持。该混合架构融合 KDA 线性注意力与 MLA,带来全新内存管理、统一内存池及 DSpark 推
Modal、Z Lab与SGLang团队联合发布DFlash推测解码模型,搭配SGLang Spec V2引擎,在Qwen 3.5 397B-A17B模型上实现SOTA推理延迟。HumanEval数据集并发1场景下,吞吐量较基线提升4.3倍
谷歌最新发布的Gemma 4开源AI模型引入了“推测解码”(Speculative Decoding)技术,通过辅助模型预先生成多个令牌再由主模型并行验证,在保持输出质量的同时将推理速度提升最高3倍。这一创新将两个模型合并为一个稀疏专家混合