赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
最新资讯
查看全部 →AMD斥资82亿美元收购李飞飞World Labs,AI人才争夺战升级
AMD宣布以82亿美元收购李飞飞创立的世界实验室,创始人李飞飞将出任AMD执行副总裁兼首席科学家。这桩交易不仅创下AI初创公司收购金额新高,更标志着芯片巨头在AI人才与空间智能赛道上的战略卡位,全球AI竞争格局或将迎来新一轮洗牌。
佛罗里达州起诉OpenAI:称大模型威胁人类文明
美国佛罗里达州向联邦法院提交动议,要求以“公共妨害”为由叫停OpenAI的前沿模型开发,并罕见援引“人类灭绝风险”作为法律依据,称大语言模型是“人类有史以来制造出的最大公害”。此举被视作AI治理从立法监管转向司法诉讼的标志性事件,也引发关于
AI推理新星Modal Labs估值飙至157.5亿美元,四个月翻三倍
据TechCrunch报道,AI推理基础设施初创公司Modal Labs正接近完成7.5亿美元新一轮融资,估值高达157.5亿美元,较四个月前增长超过三倍。这一惊人跃升凸显出AI推理市场需求的爆发式增长,以及资本市场对AI基础设施赛道的持续
英伟达在华芯片销售与政治影响力引专家担忧
据Ars Technica报道,有消息称中国正评估允许字节跳动、阿里巴巴采购此前被美国禁止出口的英伟达AI芯片。这一动向令美国政策专家忧心:一方面可能动摇出口管制的威慑力,另一方面英伟达凭借庞大游说投入与同特朗普政府的密切关系,被质疑握有过
Claude Sonnet 5.5发布:速度提升超30%成本降30%但性能细节未全披露
Anthropic于2026年9月正式上线Claude Sonnet 5.5,官方称其较Sonnet 5速度提升超过30%,多数任务成本降低达30%。市场短期反应积极,相关资产市值先升后回落,但模型具体性能提升细节尚未完全公开。行业关注迭代
MLCommons代理可靠性框架入围全球监管黑客马拉松
MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Buil
MLPerf Inference v6.1 基准测试创参与新纪录
MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较
MLPerf Inference v6.1:行业工程投入新风向
MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基
MLCommons 加入欧盟 AIRIS 项目 推进生物医学 AI 基准测试
MLCommons 近日宣布成为欧盟地平线欧洲计划资助的 AIRIS 项目联合体成员。该项目汇集欧洲、加拿大和美国 21 家合作伙伴,获得 1690 万欧元资助,旨在开发融合生物知识与临床数据的生成式 AI 平台。MLCommons 将主导
MLPerf Training 推出首个 LLM 后训练基准
MLPerf Training 将从 2026 年 10 月 v6.1 提交轮次起新增 LLM 后训练基准,补充现有预训练测试。该基准采用 RLVR 方法,结合蒸馏、强化学习与监督微调,使用 Qwen 3.5 397B 模型和 R2E-Gy
SGLang SSD专家包:消费级硬件运行DeepSeek-V4-Flash与Kimi-K3
SGLang团队推出SSD Expert Pack技术,将MoE模型的专家权重存储于NVMe SSD,仅按需加载路由选中的专家。通过Expert Pack布局、直接I/O、固定暂存和GPU缓存等优化,将海量参数模型部署到消费级硬件成为可能。
NVFP4 KV Cache 加速长上下文与 Agent 推理
SGLang、Qwen 与 NVIDIA 团队联合推出 NVFP4 KV Cache 方案,基于 Blackwell 架构的 NVFP4 格式,通过双级缩放策略将 KV 缓存压缩至约 FP8 的 56%。该方案在 SGLang 中实现初始预
深度横评
查看全部 →MLCommons代理可靠性框架入围全球监管黑客马拉松
MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Buil
MLPerf Inference v6.1 基准测试创参与新纪录
MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较
MLPerf Inference v6.1:行业工程投入新风向
MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基
WDCD 守约排行
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
查看完整守约排行 →
Research Lab
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 454 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。