赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
优步创始人卡兰尼克要杀回自动驾驶?新公司或涉足机器人出租车
据TechCrunch报道,优步创始人特拉维斯·卡兰尼克创办的Atoms公司可能入局自动驾驶出租车(Robotaxi)。这位曾因激进的自动驾驶计划离开优步的创业者,此前表示Atoms将让他完成“未竟的事业”。若消息属实,他将在多年前跌倒的赛
作者抗议人工智能版权和解金分配,出版商与代理拿走了大头
在与人工智能公司Anthropic达成的版权和解中,作者们公开抗议出版商和文学代理商分走过多赔偿金。他们认为,这些中介机构按旧有合同索取侵权和解款的分成,明显超出合理份额,将稀释作者的合法补偿。该争端折射出传统出版利益分配机制在生成式AI时
Gemini 3.8 Flash发布:性价比逼近Claude Opus 5,谷歌用Flash系列打一场速度战
北京时间9月3日,谷歌发布Gemini 3.8 Flash及Gemini 3.8 Flash Cyber两款新模型。前者在DeepSWE v1.1长周期软件工程测试中得分73.7%,以远低于Claude Opus 5的价格实现接近的编程性能
英伟达129亿美元收购Hugging Face:AI基础设施帝国的最后一块拼图
2026年9月3日,英伟达宣布以129.3亿美元收购Hugging Face,交易预计2027年上半年完成。这是英伟达有史以来第二大收购,规模仅次于年初200亿美元的Groq资产并购。Hugging Face坐拥1800万开发者、300万模
豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50
DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6并列83.49分:2026-09-07 Smoke快测数据简报
2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不
GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破
2026年9月3日,OpenAI发布GPT-6 Astra,官方测试显示对已知越狱攻击的拒绝率达91.5%,是前代GPT-5.6 Sol的59%的大幅提升。然而发布不到24小时,一名研究者即通过Task-in-Prompt扩展攻击组合多种方
11天、1300万行:Claude完成费马大定理首个计算机可验证证明,但自主二字值得细究
2026年9月4日,Anthropic宣布其内部研究模型在11天内完成费马大定理的完整形式化证明:1300万行Lean代码、29500个中间定理、约60亿输出token。这是历史上首个经计算机完整核验的费马大定理证明,标志AI自动形式化数学
我与Siri AI的夏日短暂热恋
苹果新版Siri AI测试版一度让作者着迷不已,仿佛看到了智能助手的未来。然而随着正式版发布临近,这股热情却迅速消退,作者甚至忘记了它的存在。本文回顾了这段短暂的技术迷恋,并探讨了AI助手在炫目演示与日常实用之间的尴尬落差。
中国为何是数据中心“发烧友”戒不掉的假想敌?
美媒报道称,美国民调显示绝大多数受访者反感数据中心,能耗、噪音和社区矛盾令其成为“过街老鼠”。然而,不少科技领袖与盟友将矛头对准中国,渲染“若不抓紧建设就会输给北京”,试图借“中国威胁”为数据中心的扩张背书。问题是,几乎没有任何可靠证据将二
GPT-6 Astra全面开放:$10/$50定价、百万token上下文与一场分阶段的算力卡位战
2026年9月3日,OpenAI发布GPT-6 Astra,并于9月5日将访问权全面推送至Plus和Business订阅用户,同步重置用户额度。API标准定价为每百万输入token $10、输出$50,是前代旗舰GPT-5.6 Sol促销价
深度横评
查看全部 →GPT-o3材料约束暴跌20分 主榜反升4.8分
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,
豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50
DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6并列83.49分:2026-09-07 Smoke快测数据简报
2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不
WDCD 守约排行
#1
Grok 4
93.2
#2
GLM-4.6
91.4
#3
DeepSeek V4 Pro
88
#4
GPT-o3
86.9
#5
Gemini 3.1 Pro
85.7
#6
Claude Opus 4.7
84.2
#7
Claude Sonnet 4.6
81.7
查看完整守约排行 →
Research Lab
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co