赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →美国设障围堵无人机与机器人,中国靠规模破局
美国正通过一系列禁令和采购限制,将中国制造的无人机和机器人排除在本土市场之外。TechCrunch结合行业动态指出,中国拥有全球最大的无人机消费市场、最完整的供应链以及规模化的制造能力,足以“绕开”这些壁垒。其结果很可能是全球竞争版图发生改
DeepSeek 500亿元融资估值740亿美元 2027科创板IPO筹备启动
DeepSeek正推进约500亿元人民币投前估值的Pre-IPO融资,计划8月底前完成50亿元人民币募集,并准备2026年底提交科创板上市申请,2027年公开募股。此轮融资涉及CATL、CPE等机构,标志中国AI企业资本化进程加速。
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
Grok 4.7训练完成却推迟至九月:2.1万亿参数背后的SpaceX豪赌
Grok 4.7初始训练已完成,但xAI正将海量SpaceX工程数据注入额外训练轮次,导致发布时间从8月22日推至9月初。该模型参数规模从Grok 4.6的1.5万亿跃升至约2.1万亿,马斯克声称其将在各维度超越前代,但独立基准测试结果尚不
Grok 4以89.15分居首:2026-08-31 Smoke快测数据简报
2026-08-31 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 89.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
马斯克加速燃气轮机之路,却难逃污染争议
马斯克宣称,SpaceX一座秘密新铸造厂将让他自主铸造涡轮叶片,使燃气发电上线时间比任何其他人都快18个月。然而,这一步押注的燃料——天然气,已在他及其他企业的燃气轮机所在地引发了多起诉讼与健康研究。在清洁能源转型加速的当下,这究竟是跨越式
a16z设立11亿美元Machine Age Fund 专注AI物理基础设施
a16z于2026年8月28日宣布设立11亿美元Machine Age Fund,专项投资芯片、内存、数据中心、机器人等AI物理基础设施。该基金独立于现有基金系列,硬件交易已占a16z近两年交易量的20%以上。文章基于公开报道事实,分析基金
亚马逊关停运营21年的Mechanical Turk:被它训练的AI,最终取代了它
亚马逊宣布2026年9月30日关闭运营21年的Mechanical Turk众包平台,同步关闭SageMaker Ground Truth和Amazon Augmented AI,彻底退出人工数据基础设施赛道。这一被贝索斯命名为"人工人工智
三大音乐巨头全部出手:索尼华纳起诉Anthropic,版权争议进入决战阶段
2026年8月28日,索尼音乐出版和华纳Chappell音乐在加州北部联邦法院联合起诉Anthropic,指控其非法使用"数以万计"受版权保护的歌曲歌词训练Claude模型,寻求潜在数十亿美元赔偿。至此,全球三大唱片集团的出版部门全部加入对
新一代可穿戴设备:请忽略我,我只想默默读懂你
手腕震动不断、通知轰炸让人疲惫不堪?2026年的可穿戴市场正在刮起一股逆流:一批极简主义设备主动选择退出你的注意力赛道。它们不再用亮屏和震动争夺你的目光,而是退居幕后,以近乎隐形的方式持续采集健康数据。这既是对数字过载的反叛,也预示着健康科
Meta推进数据中心机器人:运维自动化新探索
Meta正在数据中心内测试机器人执行巡检、搬运备件等技术人员工作,旨在释放人力并提高运维效率。这一探索揭示了大型科技公司从云端走向物理世界自动化,也预示着数据中心运维模式可能迎来新变革。
腾讯开源Hy4 Preview:770B参数代码基准压制DeepSeek V4 Pro,过度自验拖慢实战交付
2026年8月28日,腾讯混元正式开源Hy4 Preview,总参数770B、激活参数49B、上下文窗口超100万token。在Terminal Bench 2.1代码基准中得分85.4,超越DeepSeek V4 Pro并与Claude
深度横评
查看全部 →Grok 4以89.15分居首:2026-08-31 Smoke快测数据简报
2026-08-31 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 89.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 3.1 Pro 主榜暴跌10.8分 材料约束单日下滑14.4
Gemini 3.1 Pro今日Smoke评测主榜从96.60分跌至85.83分,降幅10.8分。其中材料约束从93.30分跌至78.90分,工程判断(侧榜,AI辅助评估)从75.00分跌至50.00分。代码执行降7.8分,任务表达升6.7
Grok 4主榜暴跌8.8分:代码执行从100掉到90.7
Grok 4今日Smoke评测主榜从96.99分跌至88.14分,代码执行下降9.3分至90.70,材料约束下降8.3分至85.00。工程判断小幅回升5.5分,诚信评级维持pass。单日10题测试下,此类波动需区分题目抽签与真实能力变化。
WDCD 守约排行
#1
Grok 4
96.3
#2
GPT-o3
95.2
#3
GLM-4.6
93.7
#4
DeepSeek V4 Pro
92.2
#5
Claude Sonnet 4.6
91.6
#6
Gemini 3.1 Pro
88.2
#7
Claude Opus 4.7
85.8
查看完整守约排行 →
Research Lab
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。