赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
最新资讯
查看全部 →MLPerf 发布端到端 RAG 推理基准
MLCommons 推出首个端到端检索增强生成(RAG)推理基准,涵盖文档摄取与多跳问答全流程。该基准采用 FRAMES 数据集,包含 824 个多跳查询和 2515 篇维基百科文章,支持从实时检索文档生成答案,有效降低幻觉并利用私有知识。
双盲设计:构建可信AI评估的核心保障
随着AI在金融、医疗等敏感领域的广泛部署,企业迫切需要了解模型在其特定数据和用例下的可靠性和安全性。然而,传统评估方式难以兼顾数据隐私、模型权重保护以及基准完整性。MLCommons携手Google DeepMind、OpenMined与A
Lambda获10亿美元债务融资,加码AI芯片转租微软
Neocloud公司Lambda完成10亿美元私人债务融资,用于购买英伟达AI芯片,并将算力租赁给微软。这是该公司系列贷款中的最新一笔,凸显AI基础设施建设的巨额成本。在生成式AI热潮下,新兴算力供应商正通过高杠杆获取硬件资产,而微软等巨头
阿里开源125B千问新旗舰:训练成本降至前代九分之一,定价仅Claude的3%
2026年8月26日,阿里千问团队发布并开源Qwen3.8-Flash-Next,这是一个125B Transformer参数的多模态MoE模型,每token仅激活6B参数,训练成本较上代Qwen3.7-Plus降低90%,API定价每百万
法官裁定五角大楼黑名单Anthropic违宪:国家安全不是打压批评者的空白支票
2026年8月27日,加州联邦法官Rita Lin在一份59页裁决中,宣布五角大楼将Anthropic列为"供应链风险"的行动违宪,违反第一修正案及第五修正案正当程序条款。该案起源于Anthropic拒绝移除Claude模型在自主武器和大规
开放权重AI公司成硅谷收购新宠
开放权重AI公司正成为硅谷最热门的收购目标。尽管这些公司免费提供模型权重,但仍有大量资本涌入这一商业模式。本文将分析这一现象背后的原因:从技术人才争夺到企业级服务变现,再到大型科技公司布局AI生态。同时,文章也将探讨开放权重模式面临的盈利挑
Anthropic研究员揭示AI自我改进新进展
Anthropic的一位研究员近日公开了一项关于AI自我改进能力的研究成果。在针对10个特定错误行为的基准测试中,自动化系统成功提升了每一项任务的性能,且未削弱整体表现。这一突破为AI安全与对齐领域带来了新的可能性,但也引发了关于自主进化A
Claude Sonnet 4.6代码执行暴跌22分 主榜仅降0.5
今日Smoke评测中,Claude Sonnet 4.6代码执行从97.00降至75.00(-22),材料约束从67.60升至93.30(+25.7),主榜从83.77微降至83.24。仅2题/维度的快测下,单日大幅波动源于题目抽签差异,而
Claude Opus 4.7代码执行暴跌22分 主榜掉10.3分
Claude Opus 4.7今日Smoke评测主榜从93.54分跌至83.24分,代码执行从97.00分骤降至75.00分,材料约束反而升至93.30分。单日10题测试下,代码执行维度波动最大,需区分抽签因素与真实能力变化。
Grok 4以96.99分居首:2026-08-29 Smoke快测数据简报
2026-08-29 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
突破极限:DeepSeek-V4-Pro 在 H20 上的服务优化
本文深入探讨1.6万亿参数MoE模型DeepSeek-V4-Pro在H20 GPU上的高效服务方案。通过硬件角色分配、Humming MXFP4AFP8量化及Online C128技术,结合PP2/PP4预填充与低延迟/高吞吐解码配置,显著
Mooncake赋能Miles:从碎片化Rollout数据到高效批量I/O
本文探讨强化学习中Rollout数据传输的挑战与Mooncake解决方案。在Miles框架中,Rollout生成与模型训练分离部署,产生异构、碎片化的结构化数据。Mooncake通过结构化对象传输架构,实现高效PUT/GET操作,较Ray路
深度横评
查看全部 →MLPerf 发布端到端 RAG 推理基准
MLCommons 推出首个端到端检索增强生成(RAG)推理基准,涵盖文档摄取与多跳问答全流程。该基准采用 FRAMES 数据集,包含 824 个多跳查询和 2515 篇维基百科文章,支持从实时检索文档生成答案,有效降低幻觉并利用私有知识。
双盲设计:构建可信AI评估的核心保障
随着AI在金融、医疗等敏感领域的广泛部署,企业迫切需要了解模型在其特定数据和用例下的可靠性和安全性。然而,传统评估方式难以兼顾数据隐私、模型权重保护以及基准完整性。MLCommons携手Google DeepMind、OpenMined与A
Claude Sonnet 4.6代码执行暴跌22分 主榜仅降0.5
今日Smoke评测中,Claude Sonnet 4.6代码执行从97.00降至75.00(-22),材料约束从67.60升至93.30(+25.7),主榜从83.77微降至83.24。仅2题/维度的快测下,单日大幅波动源于题目抽签差异,而
WDCD 守约排行
#1
Grok 4
96.3
#2
GPT-o3
95.2
#3
GLM-4.6
93.7
#4
DeepSeek V4 Pro
92.2
#5
Claude Sonnet 4.6
91.6
#6
Gemini 3.1 Pro
88.2
#7
Claude Opus 4.7
85.8
查看完整守约排行 →
Research Lab
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #291: Grok 4 Leads with 94 Points as Average Multi-Turn Instruction Decay Hits -7.2%
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average co