SGLang 亚秒级引擎恢复:权重缓存守护进程实现快速重启
针对SOTA大模型冷启动耗时过长的问题,Ant Ling Infra团队与SGLang团队推出Weight Cache Daemon。该守护进程通过CUDA IPC零拷贝映射,将量化后权重常驻GPU内存,实现从分钟级到亚秒级的权重加载加速。
针对SOTA大模型冷启动耗时过长的问题,Ant Ling Infra团队与SGLang团队推出Weight Cache Daemon。该守护进程通过CUDA IPC零拷贝映射,将量化后权重常驻GPU内存,实现从分钟级到亚秒级的权重加载加速。
本文介绍我们在SGLang中支持全新服务范式PD-Multiplexing的初步成果,该范式旨在提升LLM服务的goodput。通过NVIDIA新功能GreenContext,实现同一进程内GPU资源的轻量级细粒度分区,支持prefill和