赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →Claude Sonnet 4.6 与 DeepSeek V4 Pro并列92.17分:2026-08-06 Smoke快测数据简报
2026-08-06 赢政指数 Smoke 快测覆盖 9 个模型,Claude Sonnet 4.6 与 DeepSeek V4 Pro 以 92.17 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full
Meta广告现AI生成儿童性虐待图像,超50条已投放
据WIRED报道,Meta广告库数据显示,超过50个包含AI生成儿童性虐待图像的广告曾在Facebook、Instagram、Messenger或Threads上投放,部分直至本周仍在运行。这一事件不仅暴露了Meta内容审核机制的严重漏洞,
MIT科技评论谜题专栏:新季挑战与上期揭晓
MIT Technology Review推出2026年9/10月号谜题专栏,由Michael S. Branicky领衔的PC2团队精心策划。本期不仅带来全新智力挑战,更公布5/6月号谜题答案。无论你是数学爱好者还是逻辑谜题迷,都能在此找
AI走进现实:Disrupt 2026机器人、工厂与灭绝动物
TechCrunch Disrupt 2026将推出全新的Real World AI舞台,聚焦人工智能与物理世界的深度融合。从具身智能机器人到自动化工厂,再到利用AI技术复活灭绝动物,大会将展示AI走出数字屏幕后的无限可能。本文带你提前解读
谷歌9月4日关闭手机Assistant,Gemini接管
谷歌宣布将从9月4日起在手机上彻底移除Assistant,所有语音控制功能由Gemini完全接管。未来数周内,用户将无法再调用旧版助手,需迁移至Gemini生态。这一举动标志着谷歌AI战略的全面转向,也意味着生成式AI助手成为主流。然而,A
Hark预览浏览器代理:宣称更快更便宜
AI初创公司Hark近日预览了其浏览器使用代理,该工具能够自动完成网页浏览、表单填写、信息提取等复杂任务。Hark宣称,同一任务下,其代理比现有竞品运行速度更快、成本更低,但尚未公布具体基准数据。随着各大科技巨头纷纷布局AI代理,浏览器已成
Shopify:AI搜索带来三倍流量,但未取代谷歌
Shopify最新数据显示,2026年第二季度通过AI搜索进入其平台的流量和订单量同比增长了三倍。与出版商遭遇的AI搜索“流量吞噬”不同,Shopify的AI搜索正在成为新的增长引擎。本文分析AI搜索对电商的深远影响,以及为何谷歌尚未被取代
谷歌AI大将集体出走,联手创办Discovery Loop
据《WIRED》报道,谷歌顶尖AI科学家杰夫·迪恩与多位高管离职,共同创办Discovery Loop,探索用AI驱动药物研发、芯片设计等领域的科学突破。这位谷歌大脑联合创始人的出走,被视为AI人才向创业公司迁徙的重要信号。本文将梳理事件来
Anthropic组建AI芯片团队,自研硬件加速Claude迭代
Anthropic宣布组建自研AI芯片团队,计划通过软硬件协同设计提升Claude模型运行效率。此举标志着AI实验室从依赖外部芯片转向自主定制,将加剧与OpenAI、谷歌等巨头在算力领域的竞争。本文编译自TechCrunch,分析其战略意图
NASA暗能量望远镜将发射,还能追踪危险小行星
NASA计划于8月底发射南希·格雷斯·罗曼太空望远镜,这款新一代望远镜将以前所未有的视野探索暗能量和宇宙膨胀,同时具备探测近地小行星的能力。此外,本期还关注中国最新技术进口限制对全球芯片供应链的深远影响。
MacPaw联手Liquid AI,为开发者提供本地推理能力
MacPaw宣布与Liquid AI达成合作,将在其应用商店生态中为开发者提供基于Liquid AI模型的设备端(on-device)推理能力。这意味着开发者无需依赖云端服务器,即可在Mac设备上运行高性能AI助手Eney的本地版本。此次合
AI网红的无人区:欧盟AI法案下的新战场
欧盟AI法案的监管铁幕落下,AI网红们面临前所未有的挑战。有人担忧严苛的透明度要求将摧毁利润丰厚的生意,也有人主动拥抱规则,将AI透明化融入创作,视为赢得受众信任的新机遇。这场监管风暴正在重塑AI内容创作的未来。
深度横评
查看全部 →Claude Sonnet 4.6 与 DeepSeek V4 Pro并列92.17分:2026-08-06 Smoke快测数据简报
2026-08-06 赢政指数 Smoke 快测覆盖 9 个模型,Claude Sonnet 4.6 与 DeepSeek V4 Pro 以 92.17 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full
GPT-o3涨9.5分逆袭,GLM-4.6暴跌14.9,WDCD守约榜5模型洗牌
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
WDCD横评:安全合规场景最低1.8分,工程规范集体4分满分
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
WDCD 守约排行
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
查看完整守约排行 →
Research Lab
WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average co
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi