Qwen3.8-Flash-Next:SGLang 实现 Day-0 支持
Qwen团队开源Qwen3.8-Flash-Next,这是一款多模态MoE模型,也是Qwen4架构的早期预览。SGLang与Qwen、NVIDIA及AMD团队合作,提供Day-0支持。该模型采用Gated DeltaNet与Qwen Spa
Qwen团队开源Qwen3.8-Flash-Next,这是一款多模态MoE模型,也是Qwen4架构的早期预览。SGLang与Qwen、NVIDIA及AMD团队合作,提供Day-0支持。该模型采用Gated DeltaNet与Qwen Spa
HiSparse通过层次化内存系统解决稀疏注意力的内存瓶颈问题,显著提高了模型的并发吞吐量。其设计利用GPU和主机内存协同工作,能够在高并发情况下实现接近线性的吞吐量扩展。
SGLang 团队宣布即日(Day 0)支持 DeepSeek-V3.2 模型。该模型基于 DeepSeek-V3.1-Terminus,通过持续训练引入 DeepSeek Sparse Attention (DSA),一种由 Lightn