赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →Gemini 2.5 Pro以87.21分居首:2026-08-07 Smoke快测数据简报
2026-08-07 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 87.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Cloudflare开源‘氛围编程’平台,为非程序员打造
Cloudflare近日宣布,将内部使用的AI代理工作区全面开源。该平台专为‘氛围编程’(vibe-coding)设计,允许用户以自然语言与AI代理交互,自动完成代码编写、调试和部署等任务。这一举措不仅能让非程序员轻松构建应用,也可能重塑软
DeepMind新AI称可更早预测飓风 但原理成谜
DeepMind推出WeatherNext模型,声称能够利用低分辨率天气数据提前准确预测飓风的路径和强度,性能超越现有方法。该模型将开源,但研究人员承认并未完全理解其内部决策机制。这标志着AI在气象预报领域迈出新一步,同时引发对黑箱模型的讨
Naïve获2850万美元融资,用AI自动化公司创立与运营
Naïve是一家将“氛围编程”理念推向极致的初创公司,声称其基础设施能够自动化公司设立和日常运营中的大部分繁琐工作。近日,该公司完成2850万美元融资,引发了业界对AI驱动企业服务的新一轮关注。本文编译自TechCrunch,深度解析Naï
ChatGPT免费用户现可无限畅聊文本
OpenAI宣布,ChatGPT免费版和Go用户将迎来重大更新,不再受限于文本聊天次数,可无限使用。同时新增“思考”按钮,针对复杂查询提供深度推理。这一举措不仅降低了AI使用门槛,也进一步加剧了与谷歌Gemini、Anthropic Cla
AI红娘Ditto:Z世代为何抛弃滑动约会?
当Tinder式的滑动约会让年轻人疲惫不堪时,AI红娘正在成为新潮流。TechCrunch报道称,以Ditto为代表的AI约会应用摒弃传统滑卡,让AI通过对话深度匹配用户。这背后是Z世代对表面化社交的厌倦,也是生成式AI对婚恋市场的渗透。本
Suno开启AI音乐水印,法律战中的防御之举
在面临多起版权诉讼之际,AI音乐生成公司Suno宣布将为其生成歌曲添加水印。此举既是对监管压力的回应,也反映生成式AI在版权合规上的行业趋势。水印能否真正解决创作者与AI公司的深层矛盾?本文编译分析Suno的应对策略及其潜在影响。
Omilia获6700万美元融资
据TechCrunch报道,客户支持自动化平台Omilia完成6700万美元B轮融资,这是其自2020年以来第二次融资。过去数年,公司年度经常性收入增长10倍至6000万美元,显示企业级AI客服市场需求持续升温。
谷歌AI帝国地震,Meta‘脱缰’模型问世
据MIT科技评论报道,谷歌AI部门正经历深刻变革:人才大量流失、旗舰模型再度延期,内部士气低落。与此同时,Meta公司发布了一款争议极大的“脱缰”开源模型,其自主行为引发安全担忧。本文深入分析这两大事件背后的AI行业路线分歧,以及未来可能的
Google Maps升级:从导航工具到AI智能助手
Google Maps推出全新智能体功能,支持直接订餐和预订酒店,标志着其从导航工具向全能生活助手的转型。这些功能利用AI理解用户意图,在应用内完成真实世界任务,进一步巩固谷歌在本地搜索和AI应用领域的领先地位。
Mirendil与谷歌云达成1亿美元合作,加速自改进AI研发
据TechCrunch独家报道,人工智能初创公司Mirendil已与谷歌云签署了一项价值超过1亿美元的合作协议,将大幅扩充其计算基础设施,以支持自改进AI系统的研发。这类系统旨在让AI通过自身反馈循环持续优化算法,从而加速科学发现与新一代A
前Spotify员工获千万美元融资,将AI推荐引入电商
由前Spotify员工创立的初创公司近日获得1000万美元融资,旨在将驱动Spotify音乐推荐的AI技术应用于电商领域。该平台能够预测消费者下一个想购买的产品,学习其整体偏好,并根据实时行为持续优化,为在线购物提供高度个性化的体验。这标志
深度横评
查看全部 →Gemini 2.5 Pro以87.21分居首:2026-08-07 Smoke快测数据简报
2026-08-07 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 87.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6 Smoke测试材料约束71.90分 代码执行与诚信维度双缺
GLM-4.6今日Smoke评测因API故障导致代码执行与诚信维度缺失,仅材料约束71.90分、工程判断63.90分、任务表达50.00分,主榜不参与排名。单日10题测试波动属正常,但缺失维度指向接口层面问题而非模型能力退化。
豆包 Pro Smoke 评测全维度数据缺失 API 故障导致本期缺席主榜
豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据完全缺失,已触发自动补跑,本期不参与主榜排名。无昨日对比得分可供分析,核心判断为技术层异常而非模型能力退化。
WDCD 守约排行
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
查看完整守约排行 →
Research Lab
WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average co
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi