SGLang 实现 Qwen3.8 模型 Day-0 支持
SGLang 与 Miles 团队携手 Qwen、NVIDIA 等,为 Qwen3.8-2.4T-A95B 提供 Day-0 支持。该模型拥有 2.4T 总参数、95B 激活参数,采用混合注意力架构,对服务栈状态管理提出新挑战。文章详述混合
SGLang 与 Miles 团队携手 Qwen、NVIDIA 等,为 Qwen3.8-2.4T-A95B 提供 Day-0 支持。该模型拥有 2.4T 总参数、95B 激活参数,采用混合注意力架构,对服务栈状态管理提出新挑战。文章详述混合
SGLang RL 团队受 Kimi K2 启发,成功落地 INT4 Quantization-Aware Training (QAT) 端到端方案。通过训练阶段的 fake quantization 与推理阶段 W4A16 真实量化结合,
Intel Neural Compressor 团队宣布 AutoRound 与 SGLang 正式合作,支持低比特量化以实现高效 LLM 推理。AutoRound 通过符号梯度优化技术,实现 INT2-INT8 等低比特量化,在 INT2
SGLang最新功能原生支持NVIDIA Model Optimizer量化!这一集成简化了从全精度模型到高性能量化端点的整个优化与部署流程,无需多步工具切换。通过SGLang中的ModelOpt API,只需三步即可完成量化(支持NVFP