测评 Qwen3.8-Flash-Next:SGLang 实现 Day-0 支持 Qwen团队开源Qwen3.8-Flash-Next,这是一款多模态MoE模型,也是Qwen4架构的早期预览。SGLang与Qwen、NVIDIA及AMD团队合作,提供Day-0支持。该模型采用Gated DeltaNet与Qwen Spa LMSYS Qwen SGLang MoE模型 13小时前 21
测评 HiSparse:层次化内存系统加速稀疏注意力 HiSparse通过层次化内存系统解决稀疏注意力的内存瓶颈问题,显著提高了模型的并发吞吐量。其设计利用GPU和主机内存协同工作,能够在高并发情况下实现接近线性的吞吐量扩展。 LMSYS 稀疏注意力 HiSparse 层次化内存 2026年4月11日 2,125