NVIDIA Nemotron-TwoTower提出扩散语言模型双塔架构
NVIDIA 研究团队发布 Nemotron-TwoTower 论文,提出将上下文塔和扩散去噪塔解耦,在 30B 混合模型上保留 98.7% 基线质量,同时实现 2.42 倍生成吞吐提升。
NVIDIA 研究团队发布 Nemotron-TwoTower 论文,提出将上下文塔和扩散去噪塔解耦,在 30B 混合模型上保留 98.7% 基线质量,同时实现 2.42 倍生成吞吐提升。
OpenAI近日发布首款定制AI推理芯片“Jalapeño”,由博通设计、台积电3nm工艺制造,专为推理任务优化,预计可将成本降低高达50%。此举标志着OpenAI在AI基础设施领域寻求独立于NVIDIA的战略转变,引发业界对AI供应链和成
OpenAI与Broadcom联合推出首款定制ASIC芯片Jalapeño,专为大语言模型推理设计,仅用9个月完成流片,计划2026年底部署,目标将单次响应成本降低约50%。该芯片将减少对NVIDIA的依赖,但训练环节仍使用NVIDIA G
GB200 NVL72作为深度学习最强硬件之一,本文分享SGLang团队在上篇博客基础上,对DeepSeek V3/R1推理性能的进一步优化,包括FP8 attention、NVFP4 MoE、大规模专家并行(EP)、预填充-解码分离等技术
SGLang最新功能原生支持NVIDIA Model Optimizer量化!这一集成简化了从全精度模型到高性能量化端点的整个优化与部署流程,无需多步工具切换。通过SGLang中的ModelOpt API,只需三步即可完成量化(支持NVFP
小米MiMo-V2-Flash模型总参数达309B,激活参数仅15B,专为最大化解码效率而设计,核心采用滑动窗口注意力(SWA)和多层MTP机制。该模型针对真实服务负载优化,支持不同硬件上吞吐量与延迟的灵活权衡。结合SGLang的Spec
我们兴奋地推出 SGLang 中的 Diffusion Large Language Model (dLLM) 框架设计与实现。通过利用现有的 ChunkedPrefill 机制,该系统实现了无缝集成、无需核心架构变更、继承现有推理优化,并