赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →特朗普AI保护主义来袭,人形机器人首当其冲
人形机器人总让人既尴尬又失望:它们跌跌撞撞、误伤儿童,双手笨拙得还不如幼儿。这个新兴行业本该在开放合作中成长,但特朗普政府的AI保护主义已从芯片蔓延至机器人。关税、出口限制正威胁着全球供应链,给尚在摇篮中的产业蒙上新的阴影。
苹果终于升级Siri,为何却让人提不起劲?
经过多年等待,苹果终于为Siri带来AI大改造,使其成为本该成为的助手。然而,此时AI赛道上的聊天机器人早已进化为能编程、推理、创作和完成复杂任务的智能体。Siri AI确实实用,但在这个时代,仅仅做一个好用的AI助手已不再震撼人心。
AI监考远程考试失控,5.8万学生被迫重考
一场由AI监督的远程考试发生严重事故,高分人数骤增至往年5倍,引发大规模作弊嫌疑。高校调查后发现,AI监考系统存在漏洞,无法有效识别借助AI工具作弊的行为,最终被迫取消成绩,安排5.8万名学生重考。这一事件折射出技术监考的局限,也引发了对远
AI争议下,OpenAI首办网红豪华之旅引众怒
OpenAI首次举办网红品牌之旅,邀请多位知名内容创作者参加豪华旅行,却在社交媒体上引发强烈 backlash。在AI技术引发广泛担忧的背景下,人们质疑此举是转移视线还是营销失策。本文分析事件细节、行业背景及潜在影响。
AI也要有品味?DesignArena融资790万美元
AI评估平台DesignArena完成790万美元融资,其创始人旨在将人类审美带入模型训练。该平台已吸引全球530万用户,为前沿AI实验室提供关键的人类反馈,帮助改进模型输出质量。这一轮融资将用于扩展团队、提升平台能力,并深化与实验室的合作
AWS助力氛围编程进入私有云,应用与模型解耦加速
AWS允许“氛围编程”工具Superblocks嵌入到企业客户的私有云之中,为敏感数据和合规环境中的AI应用开发铺平道路。这不仅是云厂商对新兴开发范式的背书,更被业界视为“应用与模型解耦”的又一重要里程碑。企业有望在保留数据主权的同时,灵活
Gemini 2.5 Pro以89.56分居首:2026-08-04 Smoke快测数据简报
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI Astra 破解长期数学难题 展现AI推理能力突破
OpenAI Astra被报道成功解决长期未解数学问题,展示AI推理能力突破。该消息在X平台引发研究者和开发者讨论,视为AI领域前沿进展。文章基于公开提及的事实,分析其可能机制、产业影响及未来走向。
ChatGPT 成为美国国会最常用付费 AI 工具
House spending records 显示,OpenAI 的 ChatGPT 在国会办公室、委员会和机构账户的付费 AI 工具支出中占据主导地位,用于起草备忘录、总结立法、回应选民沟通等日常工作。这一采用反映了 AI 在政府场景的快
Google Earth紧急撤回AI卫星图像生成工具 引发信任危机讨论
Alphabet旗下Google Earth因政策违规回滚AI图像生成功能,该工具允许用户通过文本提示生成卫星视图并叠加于真实地图。功能上线后迅速引发虚假信息担忧,谷歌在一天内撤回。事件凸显生成式AI在地理信息平台上的伦理风险,行业开始讨论
DeepSeek V4 Flash 24小时测试成本仅GPT-5.6 1/3 工程师社区聚焦效率冲突
DeepSeek V4 Flash模型过去24小时内展开新测试,强调更低token成本与更快服务速度,在SWE任务中成本仅为GPT-5.6的1/3,此事已获多方证实。AI工程师社区迅速传播,焦点集中于性价比与部署效率。长期性能稳定性和生态兼
Figure F.03机器人24小时自主爬梯演示:具身智能落地信号与商业化不确定性冲突
Figure F.03人形机器人在过去24小时内完成完全自主爬梯演示,获多方证实。AI工程日报提及量增长,社区对具身智能应用兴趣高涨,但商业化时间表和大规模部署可行性仍不明朗。该事件对机器人与AI结合报道具有价值,能增强具身智能领域覆盖深度
深度横评
查看全部 →Gemini 2.5 Pro以89.56分居首:2026-08-04 Smoke快测数据简报
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7以95.19分居首:2026-08-03 Smoke快测数据简报
2026-08-03 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6 Smoke评测主榜74分 代码执行82.3材料约束95 API故障缺维度
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
WDCD 守约排行
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
查看完整守约排行 →
Research Lab
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。