赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
&triangleup; Qwen3 Max +12.1 · ▿ Gemini 2.5 Pro -15
·
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
&triangleup; Qwen3 Max +12.1 · ▿ Gemini 2.5 Pro -15
·
最新资讯
查看全部 →WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average instruction decay of -36
OpenAI发布GPT-6双模型:更便宜、更少出错
OpenAI 于 9 月 23 日发布 GPT-6 世代的两款新模型 Sol 与 Luna,官方称二者与 Astra「出自同一块布料」,主打更低的调用成本和更低的出错率。这是 OpenAI 首次在同一代旗舰上采用双模型并行发布的策略,也被视
苹果2.5亿和解金,Siri用户如何索赔
苹果因Siri宣传争议同意支付2.5亿美元和解金,符合条件的iPhone用户最高可获95美元赔偿。本文详解谁有资格、如何提交索赔、截止日期及背后行业背景,帮助消费者在12月21日前抓住这次集体诉讼赔偿机会。
Meta承认Muse抄袭OpenClaw:连文件名都没改
Meta 坚称其 AI 助手 Muse 是「从零构建」,却同时承认「深受 OpenClaw 启发」,甚至连工作区文件名与内容都高度雷同。这份既否认又承认的回应,把开源社区与科技巨头之间关于「借鉴」与「抄袭」的老问题再度推上台面。本文梳理事件
BC省起诉OpenAI:索要枪手聊天记录并索赔建校
加拿大不列颠哥伦比亚省就图姆布勒里奇校园枪击案起诉OpenAI,要求该公司交出枪手使用ChatGPT的完整对话日志,并出资为受害小镇重建一所学校。这起由地方政府主导的诉讼,把生成式AI的产品责任问题推上法庭:当模型输出被卷入暴力事件,平台能
微软捣毁AI辅助攻击平台,1.2万账户遭入侵
微软联合执法部门查封网络犯罪平台 EvilTokens。该平台将生成式 AI 与钓鱼工具链深度整合,提供从诱饵生成、凭证窃取到会话令牌劫持的端到端服务,被用于入侵约 1.2 万个用户账户。它标志着钓鱼即服务与 AI 能力的合流,也让中间人攻
Claude Sonnet 4.6以96.98分居首:2026-09-23 Smoke快测数据简报
2026-09-23 赢政指数 Smoke 快测覆盖 10 个模型,Claude Sonnet 4.6 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Anthropic发布Opus 5.5:性能更强,价格更低
Anthropic 正式发布新一代旗舰模型 Opus 5.5,官方称其为"迄今为止测试过的最强性能模型",并首次在旗舰系列上大幅下调价格。TechCrunch 记者 Russell Brandom 指出,Opus 5.5 在综合能力上已对标
丰田让工人训练人形机器人,强调人类不会被取代
据Ars Technica报道,丰田汽车要求工厂一线工人参与人形机器人的训练,用人类示范为机器人提供学习数据,同时对外强调这并不意味着取代人类员工。此举发生在全球车企竞相研发和部署人形机器人的背景之下,折射出人形机器人当前仍高度依赖人类示范
TechCrunch Disrupt 2026展位重开,最后一周抢占创投C位
TechCrunch Disrupt 2026 参展商计划限时重开一周,初创公司可在太平洋时间9月30日23:59前预订展位。活动将于10月13日至15日在旧金山Moscone West举行,预计超10,000名创始人、投资人与科技领袖到场
Hello Robot CEO将现场演示Stretch 4
TechCrunch Disrupt 2026 宣布,Hello Robot 联合创始人兼 CEO Aaron Edsinger 将把新一代移动操作机器人 Stretch 4 带上 Real World AI Stage,进行现场实机演示。
AstroForge 将让 AI 指挥下一艘航天器
TechCrunch 报道,AstroForge 计划让下一艘航天器 Autonomy-1 由小型 Transformer AI 模型在轨指挥。这意味着太空探测器将不再完全依赖地面遥控,而能在通信延迟、带宽受限和突发故障中自主导航、识别目标
深度横评
查看全部 →Claude Sonnet 4.6以96.98分居首:2026-09-23 Smoke快测数据简报
2026-09-23 赢政指数 Smoke 快测覆盖 10 个模型,Claude Sonnet 4.6 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3以96.01分居首:2026-09-22 Smoke快测数据简报
2026-09-22 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.01 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报
2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
查看完整守约排行 →
Research Lab
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 454 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 toppi