RadixArk 联手 Google:SGLang 全面功能落地 TPU

RadixArk 联手 Google:SGLang 全面功能落地 TPU

RadixArk 与 Google Cloud 正式宣布合作,将开源推理框架 SGLang 全面引入 TPU 生态,为开发者提供硬件选择的终极灵活性。

SGLang 技术优势与现状

SGLang 是一款专为高吞吐、低延迟生产环境设计的开源推理框架。目前已在全球数十万 GPU 上运行,日生成数万亿 token,GitHub 星标超过 3 万,贡献者逾 1700 人。RadixArk 作为项目核心维护者,此次合作将让 SGLang 同样运行于 Google TPU。

当前支持与未来路线

开发者现可通过 SGL-JAX 在最新 TPU 上运行 SGLang,支持 Gemma、Qwen、DeepSeek、GLM、Mimo、Kimi 等主流大模型及多模态模型,同时兼容 Wan、Flux 等视频与图像生成扩散模型。

今年晚些时候,RadixArk 将推出 SGL-torchtpu 作为 PyTorch 原生 TPU 后端,支持 eager execution、PyTorch 生态兼容及 MPMD,并提供数据并行、张量并行、专家并行、上下文并行与流水线并行,以及 Radix Cache、HiCache、量化与推测解码等特性,全部由 RadixArk、Google 及社区共同开发的 TPU Pallas 内核驱动。

行业意义与双方表态

未来,SGLang 将实现新开源模型在 TPU 上的 Day 0 支持,让 TPU 成为与 GPU 等效的低成本前沿推理方案。开发者可使用完全相同的 SGLang API,在 GPU 与 TPU 间根据性价比自由切换。

“RadixArk 的使命是让前沿 AI 基础设施对每位开发者开放可及。SGLang 正是这一理念的体现,我们很高兴与 Google Cloud 合作,将其性能与灵活性带入 TPU 生态。”——RadixArk CEO Ying Sheng

“要真正加速前沿 AI 创新,开发者必须能自由选择性能、可靠性、可扩展性和成本更优的训练与推理平台。”——Google 工程副总裁 Bill Jia

SGL-JAX 已开放,项目地址:github.com/sgl-project/sglang-jax。SGL 系列始终欢迎新贡献者共同打造开放、高性能的推理引擎。