赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
&triangleup; 豆包 Pro +12.4 · ▿ GLM-4.6 -23.8
·
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
&triangleup; 豆包 Pro +12.4 · ▿ GLM-4.6 -23.8
·
最新资讯
查看全部 →英特尔向爱尔兰工厂追加50亿欧元投资 扩建AI芯片产能
英特尔于2026年7月13日宣布向爱尔兰莱克斯利普校区追加50亿欧元投资,升级现有晶圆厂设施,安装先进制造设备,扩建自动化生产系统,提升Intel 3制程节点下Intel Xeon 6及下一代Xeon服务器处理器产能,以应对人工智能和高性能
Meta撤回Instagram Muse Image功能 凸显AI图像生成与隐私同意冲突
Meta于2026年7月10日宣布停止Instagram上Muse Image工具的公开账号引用功能。该功能允许用户通过@公开Instagram账号生成AI图像,默认开启引发SAG-AFTRA、CAA及隐私组织反对。Meta称听取反馈后认定
AI代理爬虫需获许可:Cloudflare新规与授权指南
Cloudflare宣布从2026年9月15日起,默认阻止AI代理爬虫(代表用户实时抓取网页的机器人),除非网站所有者主动授权。这一政策意味着AI爬虫不再被默认允许,网站需通过Cloudflare的“爬虫管理器”或API给予明确许可。本文解
Meta撤回Muse Image提及功能 隐私默认开启引SAG-AFTRA反对
Meta于2026年7月上旬推出Muse Image后,因默认开启公共Instagram账号引用功能遭强烈反对,数日内撤回该特性。SAG-AFTRA等团体要求明确opt-in机制,Meta随后调整但保留其他AI效果扩展。
苹果起诉OpenAI窃取商业机密 前合作伙伴转向硬件竞争
苹果于周五向加州北区联邦法院起诉OpenAI,指控其通过前员工窃取商业机密以推进消费硬件业务。诉讼涉及唐坦和刘畅两名前苹果员工,OpenAI否认兴趣并强调专注自身技术。双方2024年曾达成ChatGPT集成合作,现Siri改用Gemini模
Meta三天撤回Muse Image AI功能 隐私默认设置引发全球争议
Meta于2026年7月7日推出Muse Image功能,允许用户通过@-提及公开Instagram账号生成AI图像,默认自动纳入18岁以上公开账号且不通知本人。三天后因隐私倡导者、SAG-AFTRA工会及演员反对而终止。该功能由Meta
SK海力士纳斯达克上市筹资265亿美元 聚焦AI内存产能扩张
SK海力士通过纳斯达克上市筹集265亿美元,成为美国资本市场外国公司最大规模IPO。募集资金将用于高带宽内存HBM生产线扩建,以满足AI芯片需求。美国政界人士同时敦促其在美国建设存储芯片工厂,目前公司已在印第安纳州推进先进封装项目。
Meta AI图像生成器因隐私默认设置引发争议
Meta推出AI图像生成器Muse后,因默认使用Instagram公开照片训练模型的设置引发隐私争议。用户需手动选择退出,历史数据处理方式尚未明确。该事件凸显AI产品在数据采集透明度与监管合规之间的张力,反映快速迭代中的风险控制挑战。
DeepSeek V4 Pro Smoke评测主榜暴跌16.9分 代码执行单日掉28分
DeepSeek V4 Pro今日Smoke评测主榜从96.99分跌至80.10分,降幅16.9分,主要源于代码执行从100.00分跌至72.00分。材料约束小降3.3分,工程判断反升25分。单日10题抽签下,此类波动需区分题目难度与模型真
Claude Opus 4.7主榜跌14分 代码执行从100降至69
Claude Opus 4.7今日Smoke评测主榜从96.99分跌至82.95分,代码执行维度从100.00分降至69.00分,材料约束升至100.00分。单日2题抽签导致的波动是主因。
Gemini 2.5 Pro以100分居首:2026-07-13 Smoke快测数据简报
2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Meta发布Muse Spark 1.1 API定价1.25美元 开发者获20美元额度
Meta Platforms于2026年7月发布Muse Spark 1.1模型,向美国开发者开放公共预览。模型支持100万token上下文,定价为输入每百万token 1.25美元、输出4.25美元,注册用户获20美元免费额度。该模型在工
深度横评
查看全部 →DeepSeek V4 Pro Smoke评测主榜暴跌16.9分 代码执行单日掉28分
DeepSeek V4 Pro今日Smoke评测主榜从96.99分跌至80.10分,降幅16.9分,主要源于代码执行从100.00分跌至72.00分。材料约束小降3.3分,工程判断反升25分。单日10题抽签下,此类波动需区分题目难度与模型真
Claude Opus 4.7主榜跌14分 代码执行从100降至69
Claude Opus 4.7今日Smoke评测主榜从96.99分跌至82.95分,代码执行维度从100.00分降至69.00分,材料约束升至100.00分。单日2题抽签导致的波动是主因。
Gemini 2.5 Pro以100分居首:2026-07-13 Smoke快测数据简报
2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
91.4
#2
DeepSeek V4 Pro
91.4
#3
Claude Opus 4.7
89.4
#4
Gemini 3.1 Pro
88.9
#5
GLM-4.6
81.9
#6
GPT-o3
81.5
#7
Claude Sonnet 4.6
78.8
查看完整守约排行 →
Research Lab
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #227: Grok 4 and DeepSeek V4 Pro Tie at 91.4 as Instruction Decay Averages -2.8% Across 11 Models
WDCD Run #227 (2026-07-12) evaluated 11 frontier models on multi-turn commitment integrity, with Gro
WDCD Run #221: Average Instruction Decay Hits -36.4% as Grok 4 Leads 11-Model Field
WDCD Run #221 (2026-07-08) measured instruction decay across 11 frontier models over three dialogue