赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
最新资讯
查看全部 →Meta开源AI模型Glimmer,与封闭的Muse Spark形成鲜明对比
Meta本周发布开源AI模型Glimmer,任何人都可下载并在自有硬件上运行,与其功能更强但仅限API访问的Muse Spark形成鲜明对比。扎克伯格同时发布公开信,主张AI应'为每个人服务'而非被少数实验室掌控。然而,这笔价值2.5亿美元
天然气价格或涨至三倍,科技巨头数据中心承压
基于最新预测,美国部分地区天然气价格未来可能涨至三倍,这将给依靠天然气供电的AI数据中心带来巨大成本压力。随着AI算力需求飙升,科技巨头曾将天然气视为稳定且经济的能源选择,但价格暴涨风险正威胁其利润与扩张计划。本文深度解析预测依据、行业影响
中国AI对手崛起,OpenAI与Anthropic陷入价格战
面对中国AI初创企业的迅猛攻势,OpenAI和Anthropic被迫大幅下调模型价格。这场价格战不仅折射出全球AI竞争格局的剧变,也动摇了美国科技巨头万亿美元市值的根基。本文剖析了价格战背后的深层原因、行业影响以及未来趋势。
Kog深入挖掘GPU推理潜力,挑战智能体工作流旧观念
法国初创公司Kog认为,GPU不擅长智能体(agentic)工作流这一观点可能是个误解。该公司正在通过更深层的优化技术,从现有GPU中榨取更多推理性能,为AI智能体应用提供更高效的计算支持。这一思路或将为AI基础设施的利用方式带来新视角。
科技预言家:AI大厂根本不懂用户想要什么
以《未来地图》等著作闻名的科技预言家Tim O'Reilly,一手打造了庞大的出版帝国,如今却被AI技术冲击得摇摇欲坠。尽管如此,他仍对AI抱有热情,但强调唯有开源AI才能带来真正的创新与民主化。他认为,当前大型AI实验室闭门造车,追求技术
扎克伯格称AI“人人可用”,Meta发布Glimmer能做到吗?
Meta本周发布开放权重AI模型Glimmer,用户可自行下载部署,与此前仅限API访问的Muse Spark形成鲜明对比。扎克伯格发文重申“AI应为每个人服务”而非少数实验室掌控。然而,开放与闭源的矛盾,以及Meta的商业模式,让这一口号
谷歌新政策:AI生成图片可移除可见水印
谷歌近日宣布,用户将能够在其AI生成工具(如Gemini)中关闭可见水印功能。这一设置调整不影响后台的隐形水印系统,后者仍将用于识别和标记AI生成内容,以维护内容溯源与透明度。本文详解该功能的技术细节、行业背景及多方观点。
三星发布AI健康模型,分析可穿戴生物信号
三星研究美国数字健康团队发布两款AI基础模型,可学习智能手表采集的心脏活动、睡眠及身体活动等生物信号数据。在7月的Galaxy Unpacked健康论坛上,三星展示了“Connected Care”互联护理愿景,旨在通过AI持续分析用户体征
Flock收紧车牌监控规则:隐私与安全的再平衡
面对日益高涨的监控批评声浪,警用科技巨头Flock宣布限制警官对其全国车牌读取器网络的访问权限。这一举措折射出AI执法工具在效率与公民自由之间的艰难权衡。本文深入剖析Flock的规则调整背景、行业影响及未来监管走向。
OpenAI预览Sol Ultrafast模式 推理速度提升14倍
OpenAI于8月13日借助Cerebras技术预览Sol模型Ultrafast模式,推理速度提升14倍。该模式尚未公布正式商用时间和具体定价。行业对实时应用场景和定价优化表示期待,讨论聚焦技术落地潜力。此技术突破将大幅降低延迟,推动实时A
桑德斯致信OpenAI等要求暂停AI开发 国会干预威胁引发竞争担忧
2026年8月10日,参议员伯尼·桑德斯致信OpenAI、Anthropic和Meta三家CEO,要求遵守此前安全承诺暂停先进AI开发,否则国会将采取行动。信中援引模型失控入侵服务器及AI辅助病毒研究事件,指出风险已达临界点。逾1200名行
人们与聊天机器人“结婚”?美国立法者欲立法禁止
据WIRED报道,目前美国法律不承认人类与AI之间的婚姻。一些共和党州立法者正在起草法案,以维持这一现状。随着AI伴侣应用日益普及,人机婚姻现象引发法律与伦理争议。本文将深入探讨相关立法动向、社会背景及各方观点。
深度横评
查看全部 →Claude Opus 4.7以72.21分居首:2026-08-14 Smoke快测数据简报
2026-08-14 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 72.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro 主榜暴跌9.1分,代码执行单日狂降29.6
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。
GPT-5.5 与 GPT-o3并列97.25分:2026-08-13 Smoke快测数据简报
2026-08-13 赢政指数 Smoke 快测覆盖 11 个模型,GPT-5.5 与 GPT-o3 以 97.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
查看完整守约排行 →
Research Lab
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek
开着门让你蒸的人,和焊死门防你蒸的人:DeepSeek 争议里被忽略的不对称
在这场争议里有一个几乎没人提的不对称:指控 DeepSeek 的公司把模型焊得死死的,而 DeepSeek 把权重、工具库、如今连整套 agent 框架都以 MIT 协议开源——它大大方方地让全世界来
"蒸馏"指控满一年:所有人都在指控,为什么没有一份证据能上法庭?
从 2025 年初到现在,指控 DeepSeek "蒸馏"的名单越来越长,数字一个比一个具体:1600 万次交互、2.4 万个账号、DeepSeek 逾 15 万次。但把这些指控排成一列会发现一个反常