xFusion推企业AI全栈方案:从边缘工作站到液冷数据中心
在ISC 2026高性能计算展会上,xFusion展示了覆盖边缘工作站到液冷数据中心的四层可扩展企业AI架构。针对企业技术买家对实用生产框架的迫切需求,xFusion提出硬件选型需考虑物理极限、拒绝公共API依赖以保护商业数据安全等关键观点
在ISC 2026高性能计算展会上,xFusion展示了覆盖边缘工作站到液冷数据中心的四层可扩展企业AI架构。针对企业技术买家对实用生产框架的迫切需求,xFusion提出硬件选型需考虑物理极限、拒绝公共API依赖以保护商业数据安全等关键观点
MLCommons指出,AI系统与传统软件不同,其评估发现具有双重用途、无法通过补丁修复,且开放权重模型的危害会永久存在。协调漏洞披露(CVD)模式因此失效。文章分析了三大核心挑战:发现易被滥用、过度反馈会污染测试、无法集中修复模型。MLC
MLCommons Chakra 工作组于 2023 年成立,旨在解决 AI 系统快速发展带来的基准测试与软硬件协同设计难题。通过标准化执行追踪(Execution Trace),Chakra 提供了一个开放、可互操作的生态系统,支持从真实
MLCommons 正式推出 MLPerf Mobile v6.0 版本,新增针对 Android 设备运行大语言模型的生成式 AI 基准测试。该版本引入 Llama 3.2 1B、3B 及 Llama 3.1 8B Instruct 模型
MLCommons 正式发布 MLPerf Training v6.0 基准测试结果。本次更新新增 DeepSeek V3 与 GPT-OSS 20B 两项基准,突出 Mixture-of-Experts(MoE)稀疏计算架构的行业趋势。测
Novita AI 基于 SGLang 为 GLM4-MoE 模型开发了一套经过生产验证的高影响力优化方案。通过端到端性能优化策略,涵盖从内核执行效率到跨节点数据传输调度等全流程瓶颈,集成 Shared Experts Fusion 与 S
SGLang RL 团队受 Kimi K2 启发,成功落地 INT4 Quantization-Aware Training (QAT) 端到端方案。通过训练阶段的 fake quantization 与推理阶段 W4A16 真实量化结合,
在智能体强化学习中,rollout并非单次生成,而是多轮模型调用、工具输出与恢复生成的链式过程。Token-In-Token-Out(TITO)原则旨在消除训练与推理间的关键不匹配,确保训练器评估的token序列与推理引擎实际产生和消费的序
SGLang 与 AMD 团队合作,通过 MoRI 通信库在 AMD Instinct MI355X GPU 上实现大规模 DeepSeek-R1 推理的竞争性 TCO。在 129 tok/s/user 交互性下,MI355X 每百万 to
Intel与SGLang团队合作,通过Dynamo和SGLang实现了异构Encode-Prefill-Decode(EPD)解耦方案,用于视觉语言模型(VLM)服务优化。方案将视觉编码任务卸载至CPU(尤其是头节点CPU),利用Intel
SGLang 与 Miles 宣布对 NVIDIA Nemotron 3 Ultra 实现 Day-0 支持。该模型专为长时程自主代理设计,采用混合 Transformer-Mamba MoE 架构,参数规模达 550B(激活 55B),上
Boson AI 与 SGLang-Omni 团队近日宣布,Higgs Audio v3 TTS 模型已在 SGLang-Omni 框架上实现端到端部署。该模型专为对话式语音代理设计,支持 100 种语言且 WER/CER 保持个位数,同时
LMSYS 正式宣布2026年博士奖学金首位获奖者为加州大学圣地亚哥分校博士生Will Lin。他因在开源AI基础设施领域的杰出贡献获此殊荣,奖学金最高可达5万美元,用于支持学费及相关费用。Will Lin目前领导FastVideo项目,已
Modal、Z Lab与SGLang团队联合发布DFlash推测解码模型,搭配SGLang Spec V2引擎,在Qwen 3.5 397B-A17B模型上实现SOTA推理延迟。HumanEval数据集并发1场景下,吞吐量较基线提升4.3倍
本文介绍 MOSS-TTS-Local-Transformer-v1.5 在 SGLang-Omni 上的端到端部署方案。该模型支持 48kHz 立体声音频、零样本语音克隆、长时合成、多语言生成及原生流式输出。SGLang-Omni 将请求
SGLang-JAX 现已支持 inclusionAI 的 Ling-2.6-1T 在 TPU v7x 上高效部署。通过分析发现 Mixture-of-Experts(MoE)路径是主要瓶颈。全新 Fused MoE V2 内核将 scat
本文介绍 SGLang 中针对 DeepEP MoE 推理的两种调度时负载均衡方案:Waterfill 和 LPLB。Waterfill 通过将共享专家动态分配给负载较低的 rank,在 DeepSeek-V3/R1 类工作负载下吞吐提升
福特汽车公司原以为引入人工智能就能彻底提升生产质量,但现实给了它一记重击。AI在复杂制造流程中频繁出错,导致缺陷率不降反升。为此,福特不得不重新返聘多位退休的资深工程师——他们被内部戏称为“灰胡子”——依靠其数十年的经验来弥补AI的短板。这
华尔街投资者正急切寻找下一个像英伟达那样在人工智能浪潮中暴涨的上市公司,而美国存储芯片制造商美光科技被寄予厚望。随着AI训练和推理对高带宽内存(HBM)需求的激增,美光凭借其在DRAM和HBM领域的技术优势,有望成为继英伟达之后最大的AI硬
软银CEO孙正义公开质疑埃隆·马斯克提出的轨道数据中心计划,认为其技术和经济可行性尚不明确。这一质疑并非孤例,业内专家普遍对太空数据中心的散热、延迟、维护等核心挑战持保留态度。然而,马斯克仍坚持其愿景,试图通过Starlink和SpaceX