赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
&triangleup; Gemini 2.5 Pro +15 · ▿ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
&triangleup; Gemini 2.5 Pro +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →Kimi K3发布48小时算力告急 月之暗面暂停C端新订阅
月之暗面7月16日发布2.8万亿参数Kimi K3模型,48小时内请求量远超预期并逼近算力极限。7月19日公司宣布暂停C端新用户订阅,优先保障已订阅用户,同时拆分主权益与Kimi Code权益以优化资源分配。该事件凸显高端算力供需矛盾,也引
4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑
本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
OpenAI战略主管称Kimi开源权重或致AI共产主义
OpenAI战略未来主管Dean Ball评论Moonshot AI发布的Kimi K3模型,认可其与2026年Q1最佳公开模型相当的性能,同时警告开源权重策略可能减少前沿投资并导向“full AI communism”。该言论与Kimi
Anthropic恢复Fable 5全球服务 安全分类器拦截率超99%
2026年6月30日Anthropic宣布Claude Fable 5自7月1日起恢复全球服务,同时更新安全分类器拦截逾99%越狱手法,并与亚马逊、谷歌、微软及美国政府合作制定AI越狱评估框架。该举措源于此前出口管制及模型被发现可绕过限制,
Claude“ADHD技能”提示技巧走红 开发者借简单指令优化回复结构
用户jacky分享“i have adhd”提示后,Claude回复质量显著提升,避免答案被冗长内容掩埋。该技巧源于GitHub项目ayghri/i-have-adhd,已在开发者社区引发广泛讨论,成为提示工程的新实践案例。
中国AI模型表现引发“领先竞赛”辩论
Kimi K3与DeepSeek等中国低成本大模型表现引发国际关注,一则声称“中国领先AI竞赛”的帖文被嘲讽,凸显高端硬件必要性争议。辩论涉及多方参与,焦点在于成本与性能平衡如何重塑竞争格局。
AI算力瓶颈加剧:数据中心扩张受限与资本支出争议
AI行业正面临显著的算力容量危机。来源指出,全球算力供应已接近极限,尽管当前使用AI的用户仍属少数,土地、电力、芯片等多重瓶颈已然显现。Kimi等模型需求激增导致暂停新订阅,凸显需求增速远超供给。拥有非AI业务稳定收入的企业在资本支出上更具
Grok 4.5在VulcanBench编码基准中取得领先
Grok 4.5在VulcanBench新编码基准中以91.3%得分领先,解决21项真实多语言软件任务,超越Claude Fable 5与GPT-5.6 Sol,同时占据成本效率优势。Elon Musk转发相关讨论并回复肯定建议,引发行业关
Kimi K3订阅暂停:Moonshot AI算力接近上限,现有用户体验优先
Moonshot AI官方声明显示,Kimi K3因需求激增使GPU容量接近上限,过去48小时已暂停新订阅以保护现有用户。现有订阅者不受影响,公司正快速扩容并计划分批恢复订阅,同时拆分会员计划为Kimi Membership与Kimi Co
苹果诉讼会扼杀OpenAI的硬件雄心吗?
在最新一期播客《Equity》中,主持人深入探讨了苹果对OpenAI提起的诉讼可能如何冲击其备受瞩目的硬件计划及上市进程。本文将从法律、商业和行业竞争的视角剖析这一事件,并加入编者观点,分析这场科技巨头间的冲突将如何重塑AI硬件格局。
Qwen3 Max主榜暴跌14.9分 代码执行从96.9骤降至65.6
Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。
Gemini 2.5 Pro代码执行单日跌24.6分 主榜下滑6.5分
Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。
深度横评
查看全部 →Qwen3 Max主榜暴跌14.9分 代码执行从96.9骤降至65.6
Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。
Gemini 2.5 Pro代码执行单日跌24.6分 主榜下滑6.5分
Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。
Claude Opus 4.7以100分居首:2026-07-20 Smoke快测数据简报
2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
GPT-o3
94
#2
Grok 4
87.9
#3
Claude Opus 4.7
87.6
#4
Gemini 3.1 Pro
87.3
#5
DeepSeek V4 Pro
84.3
#6
Claude Sonnet 4.6
79.1
#7
GLM-4.6
78.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑
本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #233: GPT-o3 Leads with Zero Instruction Decay, Gemini 3.1 Pro Collapses Completely
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recordin
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。