赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
最新资讯
查看全部 →美国电池储能再创纪录:二季度新增20.2GWh
最新行业报告显示,美国电池储能装机在2026年第二季度创下20.2吉瓦时的单季新纪录,足以保障约70万美国家庭一天用电。上半年高速增长态势也将推动全年新增装机量有望达到71吉瓦时。储能系统正由电网辅助角色向主力灵活性资源转变,但并网与供应链
三星联手Mistral AI,本地大模型进入芯片制造
三星电子与法国AI企业Mistral AI达成合作,将在其半导体制造与工程业务中部署本地化大模型。根据AI News报道,该协议于韩法巴黎双边峰会期间宣布。三星将集成Mistral软件套件与旗舰模型Mistral Large至内部工厂,以构
诺贝尔奖得主力挺:英国提案禁止开发超级人工智能,获逾百名议员声援
英国工党议员Alex Sobel于2026年9月8日在下议院提出《人工超级智能安全法案》,该法案由倡导组织ControlAI起草,旨在禁止在英国开发和部署超级AI,并推动国际协议。诺贝尔奖得主Geoffrey Hinton公开发声支持,称失
Anthropic内部人士公开承认:AI十年内灭绝人类概率超10%
Anthropic预训练研究员Jacob Coxon公开辞职,称两家顶级AI实验室正不负责任地冲向自我改进超级智能。Anthropic对齐科学主管Evan Hubinger随即公开确认:公司评估AI在十年内杀死全人类的概率超过10%,且目前
AI攻克千禧年难题却陷争议,OpenAI揭示数学未来之变
OpenAI近日宣称其智能体已解决千禧年大奖难题之一,这本应是数学与AI领域的里程碑事件。然而,消息迅速被质疑声淹没:解题过程不透明、评审机制受挑战、商业化与数学开放精神之间的张力被再次暴露。这场争议折射出的,不只是一个公司的公关危机,更是
Meta个人AI智能体Muse:想替你办事,更需要你信任
Meta发布个人AI智能体Muse,可将卖车、订机票等复杂事务委托给AI代理完成,目标直指OpenClaw和Instinct。WIRED评论认为,能力越强、授权越深,风险也越大。用户必须把邮件、支付与通讯记录交给Meta,而Meta历史隐私
AI编程远非赢家通吃:Cognition估值达480亿美元
AI编程工具公司Cognition达到480亿美元估值,其估值倍数甚至超过此前Cursor被SpaceX收购前的水平。这标志着资本正在放弃“赢家通吃”的假设,转而用更分散的视角押注人工智能编程市场。从GitHub Copilot到Devin
黑客窃取Claude订阅令牌,Anthropic发布警告
上个月,一名Claude用户发现自己的账户在闲时仍在消耗Token;Anthropic调查后确认有黑客正在盗用订阅账户。黑客利用窃取的API凭据调用并输出模型内容,让受害者承受费用与数据泄露风险。Anthropic已发布警告,建议用户立即检
微软本月补丁紧急发布:AI攻击浪潮将至
随着AI辅助攻击的预期激增,微软本月发布了大量安全补丁。安全专家警告,AI正在降低网络攻击门槛,企业必须加快修补速度。本文编译Ars Technica报道,深入分析本次补丁的严峻性及行业应对策略。
同日宣告:OpenAI称AGI到来,美国国会提案将开发超级AI列为刑事罪
2026年9月3日,OpenAI发布GPT-6 Astra,总裁格雷格·布罗克曼宣告"欢迎来到AGI时代";同日,美国参议员桑德斯与众议员卡萨提出《禁止人工超级智能法案》,个人违规最高面临20年监禁。但支撑AGI宣言的核心测试,在统一评测环
万代理88小时破解纳维-斯托克斯,但解的是错版本,争议比突破更触目惊心
2026年9月8日,OpenAI宣布用约1万个AI代理在88小时内证明了纳维-斯托克斯方程的有限时间爆破。然而,其证明针对的是"外力驱动"版本,而非克莱千禧大奖所要求的无外力方程。更大的风波来自事前:OpenAI据称在成果公布前向纽约大学数
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with Grok 4 taking the to
深度横评
查看全部 →豆包 Pro以89.91分居首:2026-09-09 Smoke快测数据简报
2026-09-09 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 89.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6 与 Grok 4并列86.25分:2026-09-08 Smoke快测数据简报
2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3材料约束暴跌20分 主榜反升4.8分
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,
WDCD 守约排行
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4