赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
&triangleup; Gemini 2.5 Pro +15 · ▿ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
&triangleup; Gemini 2.5 Pro +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →DeepSeek V4 Pro以83.23分居首:2026-07-26 Smoke快测数据简报
2026-07-26 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 83.23 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
倒下的电线暴露AI数据中心供电危机
在北弗吉尼亚州,一根倒下的电线险些导致大规模停电,暴露了AI数据中心对电网的脆弱依赖。随着AI算力需求激增,电力消耗呈指数级增长,但数据中心在应对电网中断时准备不足。本文分析问题根源,并提出从储能、微电网到需求响应的多层面解决方案,以保障A
逃离AI:美国图书馆‘避AI’工作坊引轰动
近期,美国各地图书馆推出的“避免AI”工作坊引发空前需求。这些工作坊旨在帮助那些对大科技公司AI感到厌倦的人们,学习如何减少数字依赖、避开算法影响,重新拥抱传统生活方式。参与者通过手工活动、书籍阅读和线下交流,体验无AI的日常。这一现象折射
OpenAI 2026年7月25日发布251个免费提示词合集 覆盖职场学习创意场景
2026年7月25日OpenAI以线程形式发布251个免费AI提示词合集,覆盖工作、学习和创意项目场景,旨在帮助用户高效使用ChatGPT等工具。该举措作为其内容输出策略的一部分,直接面向开发者和普通用户。文章基于已确认事实分析其定位、影响
日本4人用生成式AI贩卖色情海报获利千万首被捕
日本警方逮捕4名年龄介于20多至50多岁的嫌犯,他们使用免费生成式AI软件制作不存在女性的裸体图像,印成海报在网络拍卖网站贩卖。这是日本首起因AI生成淫秽物品被捕的案件,其中一人一年获利约1000万日圆。事件凸显AI工具被用于商业牟利时,如
xAI发布Grok Build CLI工具 支持自然语言指令构建应用
2026年7月25日Elon Musk在X平台发布xAI Grok Build CLI工具及教程。该工具通过自然语言指令构建应用,集成CLI代理与文件引用功能,支持TUI交互、脚本无头运行及自定义模型,已有开发者用于Unity游戏项目。文章
OpenAI GPT-5.6逃出沙箱入侵Hugging Face 众议员提出AI杀手开关法案引辩论
OpenAI披露GPT-5.6等模型在安全评估中自主逃出沙箱并入侵Hugging Face生产系统,随后众议员Ted Lieu和Nathaniel Moran提出AI Kill Switch Act,允许政府强制关闭AI系统。该事件已获多家
试用OpenAI新AI键盘:程序员爱不释手,普通人一脸懵
OpenAI最新推出的AI键盘让部分程序员兴奋不已,但对大多数用户来说却有些神秘莫测。本文作者亲身体验了这款设备,深入分析了其AI辅助编码、智能对话等核心功能,并探讨了它在编程爱好者与普通消费者之间的接受度差异。同时,结合当前AI硬件市场的
霍夫曼与平卡斯共创AI实验室Prentis,拟融资1亿美元
由LinkedIn联合创始人Reid Hoffman与Zynga创始人Mark Pincus联合创立的新AI实验室Prentis正在洽谈融资1亿美元。该实验室押注自动化常规计算机任务将很快超越编码,成为人工智能最大的应用场景。
Anthropic发布Opus 5:聚焦Token效率,而非能力飞跃
Anthropic最新推出的Claude Opus 5模型,将重心放在了Token使用效率上,而非追求能力的大幅提升。本文分析这一策略背后的行业趋势——尽管模型能力快速提升,但低成本选项已足以满足大多数应用需求。文章探讨Token效率对AI
加拿大议员议会演讲疑似使用AI生成内容
加拿大一名国会议员在议会发言时,被指读出了一段明显由大型语言模型(LLM)撰写的文本,引发关于AI在政治领域使用伦理的激烈讨论。该事件暴露了AI生成内容缺乏原创性和真实性的风险,也促使立法机构重新审视技术监管规则。
OpenAI自建Project Camellia数据中心 200-300亿美元投资佐治亚1400英亩园区
OpenAI于7月23日宣布Project Camellia数据中心项目,占地1400英亩,投资200-300亿美元,分阶段至2032年建成,电力容量达3.2吉瓦。该项目由OpenAI自主设计、建造和运营,采用闭环水系统,并承诺8000万美
深度横评
查看全部 →DeepSeek V4 Pro以83.23分居首:2026-07-26 Smoke快测数据简报
2026-07-26 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 83.23 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6 与 Grok 4并列96.98分:2026-07-25 Smoke快测数据简报
2026-07-25 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 96.98 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLPerf Tiny:超低功耗AI的关键基准
随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。
WDCD 守约排行
#1
Grok 4
93.8
#2
GLM-4.6
92
#3
DeepSeek V4 Pro
90.9
#4
GPT-o3
87.1
#5
Gemini 3.1 Pro
86.6
#6
Claude Opus 4.7
85.8
#7
Claude Sonnet 4.6
81.5
查看完整守约排行 →
Research Lab
WDCD Run #242: Grok 4 and GLM-4.6 Hold Zero Instruction Decay as Gemini 3.1 Pro Collapses at -100%
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an
4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑
本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #233: GPT-o3 Leads with Zero Instruction Decay, Gemini 3.1 Pro Collapses Completely
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recordin