赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →Cursor AI Agent被勒索团伙武器化 10家跨国企业遭真实入侵
2026年4月至5月,Aurora勒索软件团伙将Cursor IDE内置AI Agent直接用于10家企业的真实攻击,涵盖环境侦察、凭据窃取和VPN渗透等环节。这是主流AI编程助手首次被证实用于实战入侵,暴露AI agent授权链条失控风险
苹果曝猛料:前员工为OpenAI窃取数据并销毁证据
苹果公司近日公布惊人发现:一名前员工涉嫌窃取公司大量机密数据,并将其提供给OpenAI。苹果声称,该员工在得知自己受到调查后试图销毁相关证据,但苹果已掌握确凿证据。这一事件再次引发科技行业关于商业机密保护与AI竞争激烈程度的讨论。
英伟达拟以300亿美元估值投资Perplexity:一场芯片帝国的应用层卡位战
据《信息报》报道,英伟达正就参与Perplexity新一轮融资进行谈判,拟投资估值超过300亿美元,较一年前涨逾50%。Perplexity年化营收已从年初不足2.5亿美元跃升至7.5亿美元,八个月内翻了三倍。这笔投资的本质,是一家芯片公司
封锁芯片却开放模型:NVIDIA为中国AI提供免费API背后的战略悖论
NVIDIA通过Build平台为DeepSeek、Qwen、Kimi、MiniMax、GLM等五家中国AI模型提供免费OpenAI兼容API,开发者无需信用卡即可一键调用。此举与美国政府封锁芯片出口的政策方向形成鲜明反差,折射出AI时代硬件
索尼诉Anthropic:员工聊天记录曝光盗版行为
索尼公司对AI企业Anthropic提起诉讼,指控其通过torrenting下载受版权保护的歌曲和歌词用于AI训练。法庭证据显示,Anthropic员工在内部聊天中盛赞盗版网站Z-Library,甚至写道“Zlibrary my belov
哈佛辍学生为警员打造AI助手Blue Voice,融资600万美元
哈佛法学院辍学生Alexandra Grant创立Blue Voice,为美国警员提供专门训练的AI助手,涵盖部门法规、地方法令和执法协议。该工具被称为"警察版Harvey",已完成600万美元种子轮融资。与通用AI不同,Blue Voic
Instagram限制未披露AI账号流量,AI网红面临新规
随着AI网红引发用户不满情绪日益高涨,Instagram宣布对未明确披露AI身份的账号实施流量限制。这一举措标志着社交媒体平台开始正视AI生成内容的透明度问题。本文将剖析Instagram新政策的具体内容、背后的行业压力,以及AI内容治理对
五角大楼AI平台迎来ChatGPT与Grok
据TechCrunch报道,美国五角大楼的中央AI工具门户即将迎来两款重量级新成员——OpenAI的ChatGPT和SpaceXAI的Grok,它们将加入已在线运营的Google Gemini,为军方人员提供生成式AI服务。这意味着美国国防
GPT-5.5代码执行暴跌25分 主榜仅降3分 材料约束反升24分
今日Smoke评测中GPT-5.5代码执行从94.50跌至69.50,材料约束从76.00升至100.00,主榜从86.18降至83.23。单日10题快测下,执行维度暴跌与约束维度暴涨形成对冲,需区分抽签波动与真实退化。
Grok 4代码执行暴跌21.8分 主榜从89.15降至84.99
Grok 4今日Smoke评测代码执行从94.50分跌至72.70分,材料约束升至100.00分,主榜下滑4.2分至84.99分。工程判断与任务表达均有提升,诚信评级维持pass。分析显示小样本题目抽签是主要波动来源。
GPT-o3以96.98分居首:2026-09-01 Smoke快测数据简报
2026-09-01 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI视频搜索公司Clipto新获融资,估值达2.5亿美元
Clipto是一家成立仅三年的AI视频搜索初创公司,其技术可实现对TB级视频库的秒级语义搜索。据TechCrunch报道,该公司在完成新一轮1500万美元融资之前,年度经常性收入已达1500万美元,并实现盈利,估值升至2.5亿美元。在AI公
深度横评
查看全部 →GPT-5.5代码执行暴跌25分 主榜仅降3分 材料约束反升24分
今日Smoke评测中GPT-5.5代码执行从94.50跌至69.50,材料约束从76.00升至100.00,主榜从86.18降至83.23。单日10题快测下,执行维度暴跌与约束维度暴涨形成对冲,需区分抽签波动与真实退化。
Grok 4代码执行暴跌21.8分 主榜从89.15降至84.99
Grok 4今日Smoke评测代码执行从94.50分跌至72.70分,材料约束升至100.00分,主榜下滑4.2分至84.99分。工程判断与任务表达均有提升,诚信评级维持pass。分析显示小样本题目抽签是主要波动来源。
GPT-o3以96.98分居首:2026-09-01 Smoke快测数据简报
2026-09-01 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
96.3
#2
GPT-o3
95.2
#3
GLM-4.6
93.7
#4
DeepSeek V4 Pro
92.2
#5
Claude Sonnet 4.6
91.6
#6
Gemini 3.1 Pro
88.2
#7
Claude Opus 4.7
85.8
查看完整守约排行 →
Research Lab
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。