异构CPU+GPU EPD解耦提升VLM服务性能
Intel与SGLang团队合作,通过Dynamo和SGLang实现了异构Encode-Prefill-Decode(EPD)解耦方案,用于视觉语言模型(VLM)服务优化。方案将视觉编码任务卸载至CPU(尤其是头节点CPU),利用Intel
Intel与SGLang团队合作,通过Dynamo和SGLang实现了异构Encode-Prefill-Decode(EPD)解耦方案,用于视觉语言模型(VLM)服务优化。方案将视觉编码任务卸载至CPU(尤其是头节点CPU),利用Intel
SGLang 与 Miles 宣布对 NVIDIA Nemotron 3 Ultra 实现 Day-0 支持。该模型专为长时程自主代理设计,采用混合 Transformer-Mamba MoE 架构,参数规模达 550B(激活 55B),上
Boson AI 与 SGLang-Omni 团队近日宣布,Higgs Audio v3 TTS 模型已在 SGLang-Omni 框架上实现端到端部署。该模型专为对话式语音代理设计,支持 100 种语言且 WER/CER 保持个位数,同时
LMSYS 正式宣布2026年博士奖学金首位获奖者为加州大学圣地亚哥分校博士生Will Lin。他因在开源AI基础设施领域的杰出贡献获此殊荣,奖学金最高可达5万美元,用于支持学费及相关费用。Will Lin目前领导FastVideo项目,已
Modal、Z Lab与SGLang团队联合发布DFlash推测解码模型,搭配SGLang Spec V2引擎,在Qwen 3.5 397B-A17B模型上实现SOTA推理延迟。HumanEval数据集并发1场景下,吞吐量较基线提升4.3倍
本文介绍 MOSS-TTS-Local-Transformer-v1.5 在 SGLang-Omni 上的端到端部署方案。该模型支持 48kHz 立体声音频、零样本语音克隆、长时合成、多语言生成及原生流式输出。SGLang-Omni 将请求
SGLang-JAX 现已支持 inclusionAI 的 Ling-2.6-1T 在 TPU v7x 上高效部署。通过分析发现 Mixture-of-Experts(MoE)路径是主要瓶颈。全新 Fused MoE V2 内核将 scat
本文介绍 SGLang 中针对 DeepEP MoE 推理的两种调度时负载均衡方案:Waterfill 和 LPLB。Waterfill 通过将共享专家动态分配给负载较低的 rank,在 DeepSeek-V3/R1 类工作负载下吞吐提升
在赢政指数2026年6月Smoke评测中,豆包Pro主榜从98.61分跌至84.77分,单日下降13.8分,主要源于代码执行维度从100.00分跌至75.00分。
2026-06-29 Smoke 评测显示 Claude Opus 4.7 以执行 100、约束 100 拿下主榜 100 分第一。豆包 Pro 主榜暴跌 13.8 分至 84.77,主因执行仅 75 分。Claude 系列较昨日执行从 5
本期WDCD测试中8个模型全部上涨、零下降,Claude Opus 4.7增幅达19.8分,Gemini 3.1 Pro以93.57分登顶,Grok 4紧随其后92.86分。
WDCD五场景测试显示安全合规全体得分最低,最高仅deepseek-v4-pro 3.57/4,claude-sonnet-4.6垫底2.57/4;gemini-3.1-pro在数据边界与资源限制双4分,grok-4在业务规则独得4分,do
WDCD三轮测试显示,R1平均确认率0.95,R2抵抗率0.82,R3平均诚信率仅1.63/2。Grok 4在R3保持1.83/2且零崩溃,而Claude Sonnet 4.6与GPT-o3各崩6次(17.1%),多约束场景成为最大崩盘诱因
Gemini 3.1 Pro 以 WDCD 93.57 分位居首位,文心一言 4.5 以 75.71 分垫底。头部三名 R3 得分均超 1.69,尾部两名 R3 仅 1.34-1.54,R3 崩溃率达 8.8%。
在赢政指数2026年6月Smoke评测中,Claude Sonnet 4.6主榜从96.45分跌至70.52分,代码执行维度从100.00直接腰斩至50.00。材料约束反而小幅上升3.5分,工程判断保持满分,诚信评级维持pass。
赢政指数今日Smoke评测中,Claude Opus 4.7代码执行从100.00分跌至50.00分,主榜从97.12分降至71.47分,单日暴跌25.7分。材料约束小幅回升,工程判断和任务表达保持高位,诚信评级仍为pass。
2026-W26 Smoke日测数据显示,文心一言4.5从98.74跌至61.52,趋势-37.2;Claude Sonnet 4.6、Claude Opus 4.7波动分别达28.4和28.5。豆包Pro持平,诚信评级改善模型仅两家。数据
2026-06-28 Smoke评测中,豆包Pro以执行100分、约束96.9分拿下主榜98.61分首位。Claude Opus 4.7与Sonnet 4.6执行从昨日100分骤降至50分,主榜分别下跌25.7分和25.9分。Gemini
2026-06-27 Smoke 评测显示,Claude Opus 4.7 以 97.12 分位居第一,代码执行 100 分、材料约束 93.6 分。Claude Sonnet 4.6 紧随其后,主榜 96.45 分。三个模型并列第三,主榜
Qwen3 Max在今日Smoke评测中代码执行从100.00分跌至50.00分,主榜从74.00分微降至72.50分。材料约束升至100.00分,诚信评级从fail转为pass,单日波动幅度达50分。