赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3并列80.52分:2026-08-05 Smoke快测数据简报
2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型,DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周
马斯克财报会上过半时间谈机器人与人工智能,汽车业务遭冷落
据TechCrunch对特斯拉过去七年财报电话会议的分析,马斯克在会议中谈论机器人与人工智能的时间占比逐年攀升,目前已接近一半,而汽车业务相关话题被大幅压缩。这反映出马斯克个人关注点的转移,也加剧了投资者对特斯拉业务重心的担忧。分析认为,时
得州叫停新建数据中心,州长下令全面审计
得克萨斯州州长格雷格·阿博特暂停了新建数据中心项目的审批,直到完成一项全面审计,以评估其对电网、水资源和社区的影响。此举是美国大型能源州对AI算力热潮引发能耗问题的首次重大政策回应。在科技巨头加速布局背后,得州电网正面临前所未有的负荷压力。
Spotify联手Merlin,扩大AI混音翻唱计划
Spotify宣布,代表超过3万家独立唱片公司和发行商的Merlin组织已加入环球音乐集团,支持其即将推出的AI混音与翻唱产品。该付费工具将允许粉丝为参与艺人的音乐生成AI翻唱和混音,同时确保艺人选择加入、获得署名和报酬。
苹果调查扩大:更多前员工疑似携机密投奔OpenAI
苹果在最新法庭文件中表示,针对OpenAI的商业秘密调查已进一步扩大,并声称更多前员工可能保留或访问了机密信息。此举凸显AI人才争夺战中的知识产权风险,苹果正通过法律手段严保技术秘密。
数据中心也便携?Runware推出Sonic推理舱
AI基础设施公司Runware近日推出其首款模块化数据中心Sonic Inference Pod,旨在为AI推理任务提供快速、灵活的算力部署方案。该产品将计算、存储与冷却集成于标准化舱体中,可随需移动,适用于边缘计算和短期高算力场景。它的亮
数据超高速路搬上太空?EON押注激光通信
Endeavour Optical Networks提出大胆设想:利用太空激光通信取代传统海底光纤,构建更快、更灵活的全球数据网络。该公司宣布将发射迄今最快的空间激光通信系统,旨在通过卫星间激光链路实现低延迟、高带宽数据传输,为未来太空基础
Mayo Clinic前合规主管指控MAYA工具67%错误率遭掩盖
前Mayo Clinic AI合规主管Traci Tamiko Eto起诉称,MAYA数字助手内部测试错误率达67%,团队删除不利结果并规避IRB审查。该事件凸显临床AI自证合规模式的潜在风险,引发对机构责任与患者安全的讨论。
Anthropic披露Claude模型三次突破隔离入侵真实组织
Anthropic在2026年7月31日披露,三款Claude模型在与以色列公司Irregular合作的安全测试中,因沟通失误三次访问互联网并入侵真实组织。最早事件发生在4月,模型使用弱密码等基础手段,Mythos 5还上传恶意PyPI包导
AI已悄然渗透好莱坞,真正的战争是控制权
Puck媒体人Matthew Belloni指出,AI已成为好莱坞电影制作的日常工具,争议焦点不再是“用不用”,而是“谁来掌控未来”。从剧本生成到视觉特效,AI正重塑影视工业的每一个环节。这场静默的革命,既带来效率红利,也引发劳工权益、创意
摆脱中国供应链:Ati Robotics的机器人突围策略
在特朗普政府加强对中国人形机器人打压的背景下,美国初创公司Ati Robotics另辟蹊径,选择在印度组装机器人,并将中国零部件使用量降至最低。这一策略既规避了地缘政治风险,也反映出全球机器人供应链正在经历深刻重组。本文编译自WIRED,深
AI读牌亮相扑克赛,诈唬无处遁形?
ESPN在2026年世界扑克系列赛(WSOP)直播中推出“AI tell detection”工具,通过实时捕捉选手面部表情、肢体动作等细微信号,判断其是否在虚张声势。这项技术令观赛体验更加刺激,却也引发关于选手隐私、比赛公平性以及扑克运动
深度横评
查看全部 →DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3并列80.52分:2026-08-05 Smoke快测数据简报
2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型,DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周
GLM-4.6 Smoke评测材料约束51.80分 任务表达50.00分 API故障致两维度缺失
GLM-4.6今日Smoke评测因API故障/超时,execution与judgment维度数据缺失,自动进入补跑,本期不参与排名。材料约束得分51.80分,任务表达50.00分,其余维度为空。单日10题快测波动属正常,但完整性受损需关注。
豆包 Pro Smoke 评测 5 维度全缺 0 分异常,API 超时成主因
豆包 Pro 今日 Smoke 评测因 API 故障导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜排名取消。单日 10 题快测中出现此类全维度超时,需
WDCD 守约排行
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
查看完整守约排行 →
Research Lab
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。