赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
最新资讯
查看全部 →Anthropic 11个月锁定5170亿美元算力合约,IPO前军备竞赛进入白热化
据《The Information》对公开披露信息的汇总分析,Anthropic在过去11个月内签署的算力容量合约总额高达5170亿美元,新增锁定至少14.8吉瓦算力,合作方涵盖亚马逊、谷歌、微软、SpaceX等巨头。这一数字远超其2025
OpenAI首席科学家对着自家公司喊刹车:CoT监控失效与递归自改进的双重警报
2026年9月6日,OpenAI首席科学家雅库布·帕霍茨基在官方博客发表长文《异类思维》,以内部数据为依据,指出AI进步速度将延伸至递归自我改进阶段,同时明确警告:没有任何实验室具备足够的对齐与监控能力来负责任地全速扩展。与此同时,Open
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
作者抗议人工智能版权和解金分配,出版商与代理拿走了大头
在与人工智能公司Anthropic达成的版权和解中,作者们公开抗议出版商和文学代理商分走过多赔偿金。他们认为,这些中介机构按旧有合同索取侵权和解款的分成,明显超出合理份额,将稀释作者的合法补偿。该争端折射出传统出版利益分配机制在生成式AI时
Gemini 3.8 Flash发布:性价比逼近Claude Opus 5,谷歌用Flash系列打一场速度战
北京时间9月3日,谷歌发布Gemini 3.8 Flash及Gemini 3.8 Flash Cyber两款新模型。前者在DeepSWE v1.1长周期软件工程测试中得分73.7%,以远低于Claude Opus 5的价格实现接近的编程性能
英伟达129亿美元收购Hugging Face:AI基础设施帝国的最后一块拼图
2026年9月3日,英伟达宣布以129.3亿美元收购Hugging Face,交易预计2027年上半年完成。这是英伟达有史以来第二大收购,规模仅次于年初200亿美元的Groq资产并购。Hugging Face坐拥1800万开发者、300万模
GPT-o3材料约束暴跌20分 主榜反升4.8分
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,
豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50
DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6并列83.49分:2026-09-07 Smoke快测数据简报
2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不
GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破
2026年9月3日,OpenAI发布GPT-6 Astra,官方测试显示对已知越狱攻击的拒绝率达91.5%,是前代GPT-5.6 Sol的59%的大幅提升。然而发布不到24小时,一名研究者即通过Task-in-Prompt扩展攻击组合多种方
11天、1300万行:Claude完成费马大定理首个计算机可验证证明,但自主二字值得细究
2026年9月4日,Anthropic宣布其内部研究模型在11天内完成费马大定理的完整形式化证明:1300万行Lean代码、29500个中间定理、约60亿输出token。这是历史上首个经计算机完整核验的费马大定理证明,标志AI自动形式化数学
我与Siri AI的夏日短暂热恋
苹果新版Siri AI测试版一度让作者着迷不已,仿佛看到了智能助手的未来。然而随着正式版发布临近,这股热情却迅速消退,作者甚至忘记了它的存在。本文回顾了这段短暂的技术迷恋,并探讨了AI助手在炫目演示与日常实用之间的尴尬落差。
深度横评
查看全部 →GPT-o3材料约束暴跌20分 主榜反升4.8分
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,
豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50
DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6并列83.49分:2026-09-07 Smoke快测数据简报
2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不
WDCD 守约排行
#1
Grok 4
93.2
#2
GLM-4.6
91.4
#3
DeepSeek V4 Pro
88
#4
GPT-o3
86.9
#5
Gemini 3.1 Pro
85.7
#6
Claude Opus 4.7
84.2
#7
Claude Sonnet 4.6
81.7
查看完整守约排行 →
Research Lab
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co