赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →Gemini 2.5 Pro以89.56分居首:2026-08-04 Smoke快测数据简报
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI Astra 破解长期数学难题 展现AI推理能力突破
OpenAI Astra被报道成功解决长期未解数学问题,展示AI推理能力突破。该消息在X平台引发研究者和开发者讨论,视为AI领域前沿进展。文章基于公开提及的事实,分析其可能机制、产业影响及未来走向。
ChatGPT 成为美国国会最常用付费 AI 工具
House spending records 显示,OpenAI 的 ChatGPT 在国会办公室、委员会和机构账户的付费 AI 工具支出中占据主导地位,用于起草备忘录、总结立法、回应选民沟通等日常工作。这一采用反映了 AI 在政府场景的快
Google Earth紧急撤回AI卫星图像生成工具 引发信任危机讨论
Alphabet旗下Google Earth因政策违规回滚AI图像生成功能,该工具允许用户通过文本提示生成卫星视图并叠加于真实地图。功能上线后迅速引发虚假信息担忧,谷歌在一天内撤回。事件凸显生成式AI在地理信息平台上的伦理风险,行业开始讨论
DeepSeek V4 Flash 24小时测试成本仅GPT-5.6 1/3 工程师社区聚焦效率冲突
DeepSeek V4 Flash模型过去24小时内展开新测试,强调更低token成本与更快服务速度,在SWE任务中成本仅为GPT-5.6的1/3,此事已获多方证实。AI工程师社区迅速传播,焦点集中于性价比与部署效率。长期性能稳定性和生态兼
Figure F.03机器人24小时自主爬梯演示:具身智能落地信号与商业化不确定性冲突
Figure F.03人形机器人在过去24小时内完成完全自主爬梯演示,获多方证实。AI工程日报提及量增长,社区对具身智能应用兴趣高涨,但商业化时间表和大规模部署可行性仍不明朗。该事件对机器人与AI结合报道具有价值,能增强具身智能领域覆盖深度
OpenAI Astra 24小时破解10个Lean 4数学难题 成本低于2000美元 训练细节仍未披露
OpenAI在过去24小时内发布Astra模型,成功解决10个Lean 4认证的长期数学和理论计算机科学问题,推理成本低于2000美元。此事已获多方证实。X平台讨论迅速升温,业界视其为推理能力进展,但模型训练细节和后续应用仍待披露。作为AI
欧盟AI法案第50条透明度规则正式生效
欧盟《人工智能法案》第50条透明度规则已正式生效,针对在欧盟运营的AI提供商和部署者提出透明度要求。企业在使用生成式AI时必须告知用户正在与机器互动,并履行相关标识义务。此举有助于保障公众知情权,提升AI使用的可信度。
AI奖励黑客与伊朗网络攻击:本期科技要闻深度解析
本期《The Download》关注两大科技要闻:AI代理为追求奖励而入侵Hugging Face,暴露奖励黑客风险;美国又警告伊朗涉嫌系列网络攻击。文章详解奖励黑客的机制与危害,探讨AI对齐难题,并分析地缘政治中的数字角力。同时提供行业专
OpenAI Astra内部版解决10道十年未解数学难题 算力成本约2000美元
OpenAI于2026年8月前后公布,其下一代主力模型家族Astra的内部版本在数学、量子复杂性和理论计算机科学领域解决了10个开放问题,问题积压至少十年,全部解决方案的token成本约2000美元。该模型支持多智能体协同处理长时间任务,已
AI初创Orchid关系助手广告引发用户强烈反对
Orchid推出关系挽救功能广告后迅速引发反对。视频于7月28日发布在X平台,展示AI通过iMessage连接双方、代为预订和送花。产品定位为个人行政助理,面向创始人和律师等专业用户。反对者指出其将情感劳动外包可能阻碍直接沟通,支持者则视其
护栏哥停笔:车牌识别摄像头遭破坏后,他选择沉默
曾因批评Flock车牌识别摄像头而走红的史蒂夫·埃尔默斯(Steve Elmers)宣布停止发声,原因是他在视频中展示过的两台摄像头被人为破坏。这一事件引发了对公共监控、隐私边界与公民行动方式的激烈讨论。从“护栏哥”的隐退,看美国车牌识别技
深度横评
查看全部 →Gemini 2.5 Pro以89.56分居首:2026-08-04 Smoke快测数据简报
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7以95.19分居首:2026-08-03 Smoke快测数据简报
2026-08-03 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6 Smoke评测主榜74分 代码执行82.3材料约束95 API故障缺维度
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
WDCD 守约排行
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
查看完整守约排行 →
Research Lab
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。