测评 追逐Batch-1极限:Ling-3.0-flash在Blackwell上的推测解码优化 本文深入分析Ling-3.0-flash混合注意力MoE模型在4张NVIDIA Blackwell GPU上的Batch-1解码优化。通过NEXTN和DSpark两条推测解码路径,单请求吞吐从288 tok/s提升至606 tok/s,均值 LMSYS AI推理优化 推测解码 Blackwell GPU 2026年8月29日 313