赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
&triangleup; Gemini 2.5 Pro +15 · ▿ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
&triangleup; Gemini 2.5 Pro +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →Grok 4以98.35分居首:2026-07-22 Smoke快测数据简报
2026-07-22 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
谷歌发布Gemini 3.6 Flash及安全AI,预告3.5 Pro与Gemini 4
谷歌今日宣布推出Gemini 3.6 Flash轻量级模型及针对网络安全的AI工具,同时预告了即将到来的Gemini 3.5 Pro版本,并确认已经开始训练下一代旗舰模型Gemini 4。新模型在推理速度、代码生成和安全防护方面均有显著提升
谷歌发三款新Gemini模型,3.5 Pro缺席引AI战略猜测
谷歌今日发布Gemini 3.6 Flash、3.5 Flash-Lite及Flash Cyber三款新型AI模型,分别侧重性能、轻量化和网络安全。然而,备受期待的Gemini 3.5 Pro仍未亮相,引发外界对其AI战略方向的诸多猜测。分
Anthropic 15亿美元版权和解获批,仅350名作者选择退出
美国联邦法院批准了Anthropic与作者之间的15亿美元版权和解协议,但最后时刻Anthropic采取法律手段阻止作者退出,最终只有350名作者成功退出该和解。此案凸显了AI公司使用受版权保护内容训练模型的法律边界问题,以及和解程序中作者
数据中心2035年耗电量将达当前4倍
根据最新研究,到2035年全球数据中心的电力消耗预计将增长至当前水平的四倍。更令人震惊的是,仅2024年至2033年间新建的数据中心,其总用电量就可能与印度目前的全国用电量相当。这一趋势主要由人工智能、云计算和数字经济的爆发式增长驱动,对全
英伟达野心:将AI数据中心芯片尽收囊中
英伟达推出全新Vera Rubin平台,将CPU与GPU集成于单一系统,标志着其向AI基础设施全栈芯片领导者的战略升级。该平台整合了自研的Grace CPU与下一代Blackwell GPU,旨在简化数据中心部署并锁定开发者生态。行业分析指
美方威胁制裁中国AI模型,指称知识产权盗窃
美国财政部长斯科特·贝森特表示,美国可能因涉嫌知识产权盗窃对中国开源AI模型实施制裁,这进一步扩大了特朗普政府减缓中国AI发展的行动。此举引发业界对全球AI技术合作与供应链的担忧,也凸显出中美科技竞争的白热化。
谷歌推Gemini 3.6 Flash:降低企业AI代理token成本
谷歌发布Gemini 3.6 Flash和3.5 Flash Lite两款新模型,旨在降低企业AI代理的延迟与token成本。新模型在多步任务推理效率与成本控制间取得平衡,为生产环境中的自主软件代理提供更经济可行的方案。分析认为,此举将加速
潜伏AI盲区:新型恶意工具暗藏‘死亡开关’
一种名为‘ShadowRAT’的新型恶意软件,专门针对AI基础设施发起隐蔽攻击。它能深度潜入AI编码系统,窃取训练数据、模型权重和云端凭证,并在被发现时触发‘死亡开关’——销毁文件、锁死系统,导致无法挽回的损失。安全专家指出,此类攻击利用了
斯坦福学生离场抗议谷歌军事合同
上月,斯坦福大学毕业典礼上,超过一百名学生集体离场,以抗议谷歌与军方及ICE的军事合同。活动组织者阿曼达·坎波斯和伊娃·琼斯解释了他们为何选择在桑达尔·皮查伊的演讲中表达愤怒——这不仅是针对一家公司,更是对科技伦理沦丧的集体呐喊。
中国AI撕裂白宫,版权赔偿创纪录
本周,多位特朗普AI顾问公开抨击中国AI模型,引发白宫内部激烈争论。与此同时,一桩AI版权案判赔金额创下历史新高,为行业数据使用划定新边界。本文深度解析两起事件背后的技术、政治与法律博弈。
AI老虎机效应:生成式信息流如何毁掉专注力
生成式AI工具本应提升效率,却让知识工作者陷入“提示词循环”——反复调整、越走越偏。这种现象被称为“AI老虎机效应”,它利用多巴胺奖励机制劫持注意力,破坏深度工作状态。本文剖析其运作原理,并提供重构工作流的实用策略,帮助你在2026年重新夺
深度横评
查看全部 →Grok 4以98.35分居首:2026-07-22 Smoke快测数据简报
2026-07-22 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7 Smoke评测主榜暴跌26.1分,代码执行与材料约束双双失守
今日Smoke评测中,Claude Opus 4.7主榜得分从100.00分跌至73.92分,降幅26.1分。代码执行从100.00降至75.00,材料约束从100.00降至72.60,工程判断与任务表达降幅较小,诚信评级维持pass。
Gemini 3.1 Pro材料约束暴跌17.8分 主榜下滑6分
Gemini 3.1 Pro今日Smoke评测材料约束从90.40分跌至72.60分,降幅17.8分,主榜从81.93分降至75.90分。代码执行小升3.6分,工程判断升至100分,任务表达跌25分。单日10题测试中,此幅度变化需重点观察。
WDCD 守约排行
#1
GPT-o3
94
#2
Grok 4
87.9
#3
Claude Opus 4.7
87.6
#4
Gemini 3.1 Pro
87.3
#5
DeepSeek V4 Pro
84.3
#6
Claude Sonnet 4.6
79.1
#7
GLM-4.6
78.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑
本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #233: GPT-o3 Leads with Zero Instruction Decay, Gemini 3.1 Pro Collapses Completely
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recordin
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。