赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
最新资讯
查看全部 →阿里Qwen3.8-Omni-Flash三天反制谷歌Gemini 3.8 Live 音频定价降逾98%
2026年9月18日阿里巴巴发布Qwen3.8-Omni-Flash,以音频定价较谷歌Gemini 3.8 Live下降逾98%的策略,在谷歌9月15日发布后仅三天内展开反制。该模型支持100万token上下文,视频任务token消耗减少4
谷歌Gemini 3.8 Live发布:质量评测登顶,用户偏好仍被老款压制
2026年9月15日,谷歌发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时语音模型,并于9月17日向开发者推送API访问。Extended Thinking版在Artificia
AI高管集体喊刹车:真相是安全恐慌、竞争博弈,还是两者皆是?
2026年9月,Anthropic CEO Dario Amodei发布长文《我们必须放缓前沿》,主张AI能力提升应主动降速一至两年;Sam Altman随即附议并宣布推迟IPO;Elon Musk表态支持。触发这一罕见共识的,是AI智能体
小型AI模型让无人机自主识别并攻击战场目标
据Ars Technica报道,Scaleout公司正将去中心化AI学习部署到军事基地与无人机上。借助小型AI模型,无人机无需云端连接即可在本地完成目标识别与攻击决策,实现“断网可用”的自主作战能力。这一进展在提升战场效率的同时,也再度引发
FAA豪掷8.75亿美元,用AI重构美国空管系统
美国联邦航空管理局(FAA)宣布投入8.75亿美元,推出基于AI的新一代空管软件,帮助空中交通管制员更高效地管理美国空域。此举被视为FAA近年来最重大的技术升级之一,旨在缓解管制员短缺、系统老化与航班量激增的三重压力。
AI末日会是什么样?三种情景推演
在最新一期《Uncanny Valley》播客中,主持人Brian Barrett、Zoë Schiffer与Leah Feiger深入探讨了三种可能的人工智能末日情景,从恶意使用到失控风险再到社会崩溃。与此同时,一股意想不到的两党联盟正在
PrismML押注微型大模型:小模型将如何改变我们用AI的方式
在参数规模军备竞赛愈演愈烈之际,AI实验室PrismML却选择了一条反向路径——把大模型做小。这家鲜为人知的初创公司认为,真正推动AI普及的关键不是更大的模型,而是更快、更便宜、能跑在本地设备上的微型语言模型。本文解析其技术思路与行业背景。
谷歌DeepMind成立新机构,推动AGI公开大讨论
谷歌DeepMind宣布成立一家新研究所,旨在把通用人工智能(AGI)的宏大问题从实验室内部搬到公共讨论场。该机构将邀请哲学家、经济学家、社会学家与政策制定者共同参与,围绕AGI的定义、风险边界与治理路径展开长期对话。此举被视为DeepMi
Crusoe狂揽39亿美元,要建小型模块化“AI工厂”
AI数据中心运营商Crusoe宣布完成39亿美元新一轮融资,公司估值随之升至309亿美元。这家以“废弃能源变算力”起家的公司,正同时押注超大规模数据中心园区与小型模块化“AI工厂”两条路线。在AI算力需求爆炸、电力与土地成为稀缺资源的背景下
微软高管:AI抓取是“人类史上最大规模的劳动窃取”
最新曝光的微软与OpenAI内部邮件显示,微软一位高管将AI对互联网内容的大规模抓取称为“人类历史上最大规模的劳动窃取”。邮件还揭示两家公司对“末日循环”的恐惧:AI摘要与聊天机器人夺走新闻网站流量,媒体收入崩塌、原创内容萎缩,最终连AI赖
AI安全之争:是安全,还是控制?
Anthropic首席执行官达里奥·阿莫迪呼吁各国就AI安全建立全球协调机制,但这一主张并未赢得普遍认同。批评者质疑:当行业头部公司主动要求监管,它是在守护公共利益,还是在为竞争对手筑墙?这场辩论的真正分歧,或许不在技术本身,而在谁有权决定
谷歌推实验性家庭AI代理“CC”:全家共享数据协同办事
谷歌公布代号“CC”的实验性AI代理,主打家庭场景:多位家庭成员可共享数据,让代理帮忙制定计划、协调日程并完成具体任务。这标志着AI助手正从“个人管家”向“家庭中枢”演进,同时也把多用户数据共享带来的隐私与信任问题推到了台前。本文梳理其产品
深度横评
查看全部 →GLM-4.6 Smoke评测5维度全缺失 API故障致今日排名缺席
GLM-4.6今日Smoke评测因API故障/超时导致execution、grounding、judgment、integrity、communication五维度数据完全缺失,已进入自动补跑,本期不参与主榜排名。单日10题快测中此类技术中
Qwen3 Max材料约束暴跌16.9分 代码执行却暴涨64.3分
Qwen3 Max今日Smoke评测材料约束从90.90分跌至74.00分,代码执行从25.00分升至89.30分,主榜升至82.42分。核心发现显示两个主榜维度出现反向剧烈波动。
Claude Opus 4.7以100分居首:2026-09-18 Smoke快测数据简报
2026-09-18 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
DeepSeek V4 Pro
97.7
#2
Gemini 3.1 Pro
96.7
#3
Grok 4
96
#4
Gemini 2.5 Pro
94.5
#5
GPT-o3
94.2
#6
Claude Opus 4.7
92.6
#7
GPT-5.5
90.1
查看完整守约排行 →
Research Lab
WDCD Run #326: DeepSeek V4 Pro and Gemini 3.1 Pro Achieve Perfect Decay Resistance as Fleet Average Drops 72.7%
WDCD Run #326 (2026-09-16) tested 11 models on multi-turn commitment integrity, recording an average
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with