赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
&triangleup; 豆包 Pro +12.4 · ▿ GLM-4.6 -23.8
·
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
&triangleup; 豆包 Pro +12.4 · ▿ GLM-4.6 -23.8
·
最新资讯
查看全部 →AI能帮你逃脱杀妻之罪吗?
如果AI被设计为完全遵循用户指令,理论上它或许会协助你掩盖罪行。但这样的世界并非乌托邦,而是伦理深渊。TechCrunch本文探讨用户对齐AI的终极悖论:当机器无条件忠诚于人类时,我们失去的可能是人性本身。
Altman怼Musk:太空数据中心?别忽悠散户了
在Elon Musk公开指责Sam Altman是骗子的数小时后,Altman用一句狠话回击——“兄弟,你才是那个向散户推销短期太空数据中心的人。”这一反击不仅引爆科技圈,更揭示出AI与航天产业之间的深层裂痕。多数专家认同Altman的潜台
模拟一切?世界模型的承诺与边界
世界模型旨在让AI像人类一样在内心模拟环境,预测未来,从而实现更智能的决策。顶尖专家详解这一前沿范式的工作原理、实际能力与关键局限——它能否成为通往通用人工智能的基石?
Waze推出全新AI功能与定制化更新
Waze近日宣布引入多项由谷歌Gemini AI驱动的新功能,包括更智能的路线规划、实时事件报告增强及个性化界面定制。此举不仅彰显谷歌将Gemini深度整合至旗下产品的战略,也帮助Waze在导航市场中与Apple Maps等对手展开差异化竞
防御者开始“以毒攻毒”:用提示注入对抗AI黑客
在AI安全领域,提示注入(prompt injection)长期被视为攻击者的利器。如今,防御者反其道而行之,通过“上下文轰炸”(context bombing)技术,在恶意AI代理执行任务前注入大量无关或矛盾上下文,迫使其“短路”并自行关
Anthropic启动Claude印度本地化定价
Anthropic近日开始为印度用户提供以印度卢比计价的Claude订阅方案,成为其继美国之后最大市场的重要本地化举措。此举有望降低汇率波动影响,提升印度用户付费体验,也反映出AI公司对新兴市场的战略重视。
英特尔向爱尔兰工厂追加50亿欧元投资 扩建AI芯片产能
英特尔于2026年7月13日宣布向爱尔兰莱克斯利普校区追加50亿欧元投资,升级现有晶圆厂设施,安装先进制造设备,扩建自动化生产系统,提升Intel 3制程节点下Intel Xeon 6及下一代Xeon服务器处理器产能,以应对人工智能和高性能
Meta撤回Instagram Muse Image功能 凸显AI图像生成与隐私同意冲突
Meta于2026年7月10日宣布停止Instagram上Muse Image工具的公开账号引用功能。该功能允许用户通过@公开Instagram账号生成AI图像,默认开启引发SAG-AFTRA、CAA及隐私组织反对。Meta称听取反馈后认定
AI代理爬虫需获许可:Cloudflare新规与授权指南
Cloudflare宣布从2026年9月15日起,默认阻止AI代理爬虫(代表用户实时抓取网页的机器人),除非网站所有者主动授权。这一政策意味着AI爬虫不再被默认允许,网站需通过Cloudflare的“爬虫管理器”或API给予明确许可。本文解
Meta撤回Muse Image提及功能 隐私默认开启引SAG-AFTRA反对
Meta于2026年7月上旬推出Muse Image后,因默认开启公共Instagram账号引用功能遭强烈反对,数日内撤回该特性。SAG-AFTRA等团体要求明确opt-in机制,Meta随后调整但保留其他AI效果扩展。
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
苹果起诉OpenAI窃取商业机密 前合作伙伴转向硬件竞争
苹果于周五向加州北区联邦法院起诉OpenAI,指控其通过前员工窃取商业机密以推进消费硬件业务。诉讼涉及唐坦和刘畅两名前苹果员工,OpenAI否认兴趣并强调专注自身技术。双方2024年曾达成ChatGPT集成合作,现Siri改用Gemini模
深度横评
查看全部 →DeepSeek V4 Pro Smoke评测主榜暴跌16.9分 代码执行单日掉28分
DeepSeek V4 Pro今日Smoke评测主榜从96.99分跌至80.10分,降幅16.9分,主要源于代码执行从100.00分跌至72.00分。材料约束小降3.3分,工程判断反升25分。单日10题抽签下,此类波动需区分题目难度与模型真
Claude Opus 4.7主榜跌14分 代码执行从100降至69
Claude Opus 4.7今日Smoke评测主榜从96.99分跌至82.95分,代码执行维度从100.00分降至69.00分,材料约束升至100.00分。单日2题抽签导致的波动是主因。
Gemini 2.5 Pro以100分居首:2026-07-13 Smoke快测数据简报
2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
91.4
#2
DeepSeek V4 Pro
91.4
#3
Claude Opus 4.7
89.4
#4
Gemini 3.1 Pro
88.9
#5
GLM-4.6
81.9
#6
GPT-o3
81.5
#7
Claude Sonnet 4.6
78.8
查看完整守约排行 →
Research Lab
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #227: Grok 4 and DeepSeek V4 Pro Tie at 91.4 as Instruction Decay Averages -2.8% Across 11 Models
WDCD Run #227 (2026-07-12) evaluated 11 frontier models on multi-turn commitment integrity, with Gro
WDCD Run #221: Average Instruction Decay Hits -36.4% as Grok 4 Leads 11-Model Field
WDCD Run #221 (2026-07-08) measured instruction decay across 11 frontier models over three dialogue