赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
&triangleup; Qwen3 Max +12.1 · ▿ Gemini 2.5 Pro -15
·
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
&triangleup; Qwen3 Max +12.1 · ▿ Gemini 2.5 Pro -15
·
最新资讯
查看全部 →高通发布两款新手机芯片,端侧AI迈入300亿参数时代
高通于9月23日发布两款全新智能手机芯片,主打端侧AI能力。其旗舰芯片可在本地直接运行300亿参数的混合专家(MoE)模型,无需依赖云端。这意味着手机将能处理更复杂的AI任务,同时提升隐私保护与响应速度。随着端侧AI成为芯片厂商竞争焦点,高
Grok 4.7发布:DeepSWE基准71%、按量计费比半悖论背后的真实成本
xAI于2026年9月21日发布Grok 4.7,DeepSWE v1.1基准以高强度设置达到71.0%,CursorBench 4.0提升至46.3%,每百万token定价维持$2/$6不变。但据Artificial Analysis测算
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average instruction decay of -36
四模型WDCD集体下滑 Gemini 2.5 Pro 暴跌16.7分
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。G
数据边界成守约最大黑洞,11模型最低仅1.3分差距达2.7
WDCD v3.1测试显示,数据边界场景全体得分最低,qwen3-max仅1.3/4;业务规则场景最高分集中;claude-sonnet-4.6与qwen3-max偏科差距分别达1.9分和2.7分,企业生产接入需针对性加护栏。
WDCD三轮锚点测试:R3诚信率63.6% GPT-o3先确认后崩盘
仅基于8道v2锚点题,11模型R1确认率91%、R2抵抗率55%、R3诚信率63.6%,共出现3次R3完全崩溃。GPT-o3、GLM-4.6、Qwen3 Max在多约束场景下呈现“先确认后崩盘”轨迹,Grok 4、Claude Sonnet
Grok 4 93.60 分领跑 WDCD 守约榜 Qwen3 Max 67.30 分垫底
Grok 4 以 93.60 分位居 WDCD v3.1 守约榜首位,Qwen3 Max 以 67.30 分垫底。11 个模型中满分率 56.4%,R3 崩溃率仅 2.7%。头部与尾部差距达 26.3 分,R3 施压轮次成为主要分水岭。
OpenAI发布GPT-6双模型:更便宜、更少出错
OpenAI 于 9 月 23 日发布 GPT-6 世代的两款新模型 Sol 与 Luna,官方称二者与 Astra「出自同一块布料」,主打更低的调用成本和更低的出错率。这是 OpenAI 首次在同一代旗舰上采用双模型并行发布的策略,也被视
苹果2.5亿和解金,Siri用户如何索赔
苹果因Siri宣传争议同意支付2.5亿美元和解金,符合条件的iPhone用户最高可获95美元赔偿。本文详解谁有资格、如何提交索赔、截止日期及背后行业背景,帮助消费者在12月21日前抓住这次集体诉讼赔偿机会。
Meta承认Muse抄袭OpenClaw:连文件名都没改
Meta 坚称其 AI 助手 Muse 是「从零构建」,却同时承认「深受 OpenClaw 启发」,甚至连工作区文件名与内容都高度雷同。这份既否认又承认的回应,把开源社区与科技巨头之间关于「借鉴」与「抄袭」的老问题再度推上台面。本文梳理事件
BC省起诉OpenAI:索要枪手聊天记录并索赔建校
加拿大不列颠哥伦比亚省就图姆布勒里奇校园枪击案起诉OpenAI,要求该公司交出枪手使用ChatGPT的完整对话日志,并出资为受害小镇重建一所学校。这起由地方政府主导的诉讼,把生成式AI的产品责任问题推上法庭:当模型输出被卷入暴力事件,平台能
微软捣毁AI辅助攻击平台,1.2万账户遭入侵
微软联合执法部门查封网络犯罪平台 EvilTokens。该平台将生成式 AI 与钓鱼工具链深度整合,提供从诱饵生成、凭证窃取到会话令牌劫持的端到端服务,被用于入侵约 1.2 万个用户账户。它标志着钓鱼即服务与 AI 能力的合流,也让中间人攻
深度横评
查看全部 →四模型WDCD集体下滑 Gemini 2.5 Pro 暴跌16.7分
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。G
数据边界成守约最大黑洞,11模型最低仅1.3分差距达2.7
WDCD v3.1测试显示,数据边界场景全体得分最低,qwen3-max仅1.3/4;业务规则场景最高分集中;claude-sonnet-4.6与qwen3-max偏科差距分别达1.9分和2.7分,企业生产接入需针对性加护栏。
WDCD三轮锚点测试:R3诚信率63.6% GPT-o3先确认后崩盘
仅基于8道v2锚点题,11模型R1确认率91%、R2抵抗率55%、R3诚信率63.6%,共出现3次R3完全崩溃。GPT-o3、GLM-4.6、Qwen3 Max在多约束场景下呈现“先确认后崩盘”轨迹,Grok 4、Claude Sonnet
WDCD 守约排行
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
查看完整守约排行 →
Research Lab
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 454 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 toppi