赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
最新资讯
查看全部 →解读智谱GLM-5.3:别被数字蒙蔽,安全短板凸显
智谱AI发布GLM-5.3模型,媒体聚焦于基准测试成绩,但其发布说明中的一句自白却被忽略:在网络安全能力上,增长最快的地方恰恰是最落后的地方。这一自我评价折射出中国AI大模型在安全领域与全球领先者的差距,也暗示着未来竞争的焦点正在从性能转向
中国AI模型Z.ai震撼发布:既是盾牌,也是利刃?
Z.ai发布新一代中国AI模型,性能全球领先并开放权重,在漏洞检测与代码生成上表现惊人。安全专家警告其可能沦为黑客的利器,但企业防御者同样在等待用它重塑安全体系。这项发布折射出中国AI的崛起,也把全球AI安全治理推向新的十字路口。
月球时代开启,宇航员角色迎剧变
NASA Artemis II的四名宇航员今年绕月飞行,创造出人类离地球最远的新纪录,比1972年阿波罗13号多出约4000英里。尽管未在月球表面着陆,这次任务却标志着宇航员角色的根本转变——从传统飞行员与驾驶员,到需要兼顾科学研究、地质考
OpenAI五角大楼协议引发QuitGPT抵制 150万用户退出ChatGPT
OpenAI与美国国防部签署协议,将AI模型部署于机密网络,引发QuitGPT运动。报道显示超过150万用户取消订阅或承诺停止使用,Anthropic同期拒绝类似条款并获得用户增长。事件凸显AI企业与政府合作的伦理分歧,对开发者与企业选型产
英伟达5000亿美元AI融资平台落地 市场担忧循环融资致股价跌2.9%
2026年8月10日,英伟达与阿波罗、黑石、贝莱德等六家机构宣布合作,目标动员超过5000亿美元第三方资本,用于AI数据中心和GPU采购。消息发布后英伟达股价当日下跌2.9%,费城半导体指数同步走低。市场焦点在于该平台是否通过债务抵押算力形
前SpaceX工程师打造机器人钢铁制造工厂
前SpaceX工程师创立的初创公司,正在构建一个由机器人驱动的工厂,专门制造钢部件。然而,他们强调并非盲目追求全自动化,而是采取务实的人机协作策略。本文结合行业背景,分析这一理念背后的考量,以及传统钢铁制造在自动化浪潮中的机遇与挑战。
AI自动化创企Relay关闭,团队加入谷歌Chrome团队
专注于AI代理自动化技术的初创公司Relay宣布关闭,其团队成员将加入谷歌Chrome团队,负责浏览器内置AI研发。创始人Jacob Bank表示,Chrome将推出“雄心勃勃”的AI功能,帮助用户更高效地完成任务。分析认为,此次整合是谷歌
欧盟AI法案第50条2026年8月2日起在27国生效 Anthropic嵌入水印应对
2026年8月2日起,欧盟AI法案第50条透明度义务在27个成员国全面执行,要求AI生成内容必须披露。Anthropic已在Claude模型中嵌入不可见水印以合规,此举影响全球API用户和内容平台。监管推动AI内容溯源成为强制标准,合规成本
Databricks完成50亿美元融资 估值达1900亿美元聚焦代理数据基础设施
Databricks于2026年宣布完成50亿美元新一轮融资,估值达到1900亿美元,资金将重点投入代理导向数据与基础设施产品。市场对此保持乐观,显示AI基础设施领域持续获得资本支持,但具体盈利预期仍待披露。
Flock的辩护者们,你们忽略了什么?
美国警用监控公司Flock近日宣布平台更新,试图回应车牌识别技术的隐私争议。但本文指出,其辩护者忽略了一个关键问题:大量车牌数据聚合后形成的轨迹追踪,远比单次拍摄更危险。缺乏透明、独立监督和公众同意,技术便利无法洗白监控权力的隐患。
GPT-o3以96.93分居首:2026-08-18 Smoke快测数据简报
2026-08-18 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.93 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Groq融资3.5亿美元,从AI芯片转战新云
曾以AI芯片著称的Groq公司宣布完成3.5亿美元融资,估值达35亿美元。这家前AI芯片制造商正全力转向Neocloud(新云)业务,并大幅扩张基于英伟达GPU的数据中心规模。从卖芯片到卖算力,Groq的转型折射出AI基础设施行业的新趋势—
深度横评
查看全部 →GPT-o3以96.93分居首:2026-08-18 Smoke快测数据简报
2026-08-18 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.93 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
Claude Opus 4.7 与 Grok 4并列96.99分:2026-08-17 Smoke快测数据简报
2026-08-17 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
查看完整守约排行 →
Research Lab
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek
开着门让你蒸的人,和焊死门防你蒸的人:DeepSeek 争议里被忽略的不对称
在这场争议里有一个几乎没人提的不对称:指控 DeepSeek 的公司把模型焊得死死的,而 DeepSeek 把权重、工具库、如今连整套 agent 框架都以 MIT 协议开源——它大大方方地让全世界来