赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
最新资讯
查看全部 →特朗普于SpaceX IPO两周后购入股票,股价已回落至发行价
据TechCrunch报道,美国总统特朗普在SpaceX完成IPO后仅两周,便以每股150美元左右的价格买入了该公司股票。然而,截至本周一收盘,SpaceX股价已回落至每股135美元的发行价,意味着这笔投资暂时处于浮亏状态。这一举动引发市场
斯坦福研究:AI对入门级岗位冲击最大
斯坦福大学最新研究显示,受AI影响的领域内,年轻从业者的就业率较AI抵抗型行业下降了19%。这一数据揭示出AI对初级岗位的冲击尤为严重,引发对职业发展路径和技能培训体系的深层思考。
OpenAI与Anthropic被曝游说华盛顿限制中国开源模型,25家科技公司联署公开信反击
据《纽约时报》援引五名知情人士报道,OpenAI与Anthropic正在华盛顿游说监管机构限制中国开源权重模型,游说对象包括财政部长贝森特与白宫技术顾问克拉齐奥斯。与此同时,英伟达、微软、Meta等25家科技公司于2026年7月24日联署公
英伟达斥资70亿美元押注开源AI:卖铲人为何要自己挖矿
英伟达宣布以60亿美元授权费取得AI初创Poolside的"模型工厂"技术,另投10亿美元并吸纳109名核心工程师进入Nemotron项目,剑指DeepSeek和Kimi K3。此举标志英伟达从算力供应商正式踏入前沿模型战场,但其真实战略目
Replit CEO将登台TechCrunch Disrupt 2026,畅谈编程未来
TechCrunch Disrupt 2026大会将于今年10月登场,Replit联合创始人兼CEO Amjad Masad确认出席并发表主题演讲,分享他对编程范式变革的深刻洞察,以及Replit如何以AI原生平台重塑软件开发流程。本文结合
GPT-o3以86.25分居首:2026-08-25 Smoke快测数据简报
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI助手Instinct爆火背后:隐私与安全隐忧浮现
AI助手Instinct凭借强大功能吸引大量早期用户,但其广泛的系统访问权限、模糊的使用条款以及主动代表用户行动的能力,正引发隐私和安全方面的担忧。测试者一边惊叹其效率,一边对数据掌控权感到不安。本文深入剖析这场便利与风险的博弈。
如何在课堂上鼓励学生更明智地使用AI?
生成式AI走进校园,聊天机器人成为学生手中随取随用的“答案机”。面对滥用与学术诚信危机,学校和教师该如何应对?本文结合MIT科技评论报道,剖析课堂AI使用现状,提出从“封堵”转向“引导”的策略,包括重新设计作业、培养AI素养、重塑教师角色等
OpenAI押注通用AI代理:从程序员到大众,能否普及?
在人工智能前沿实验室的推动下,AI代理正从专属于软件工程师的编程工具,走向普通消费者的日常生活。本文深入分析了OpenAI的最新战略布局、技术挑战与市场前景,探讨通用AI代理是否会像智能手机一样成为大众标配,还是将在安全性、成本与用户信任的
通用智能拟60亿美元估值融资,进军机器人赛道
AI初创公司General Intuition正洽谈新一轮融资,拟以60亿美元投前估值引入Valor Ventures、Point72 Ventures和Seven Seven Six等新投资者。该公司专注构建基础模型,训练通用AI代理在空
小鹏IRON人形机器人融资破纪录,物理AI赛道升温
小鹏汽车的物理AI部门通过股份购买协议获得超9亿美元融资,估值达63亿美元,资金将用于扩大IRON人形机器人平台。该笔交易成为物理AI领域最大单轮私人融资,展现资本市场对具身智能前景的强烈信心。小鹏正试图将汽车供应链优势复刻到机器人赛道,但
Hugging Face传获130亿美元收购邀约,创始人忧社区未来
据TechCrunch报道,AI开源平台Hugging Face据传正在洽谈收购,潜在估值约130亿美元。然而,公司创始人对开源社区负有强烈责任感,是否出售或成疑。文章梳理收购传闻背景、创始人的两难境地,以及开源与商业化的深层博弈,并探讨这
深度横评
查看全部 →GPT-o3以86.25分居首:2026-08-25 Smoke快测数据简报
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro材料约束暴跌18.4分,代码执行反升11.1分
DeepSeek V4 Pro今日Smoke评测中材料约束从81.70分跌至63.30分,降幅18.4分,主榜仅微降2.2分至80.46分。代码执行却从83.40分升至94.50分,工程判断从75.00分跌至50.00分。单日10题快测下,
Gemini 3.1 Pro以96.98分居首:2026-08-24 Smoke快测数据简报
2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
94
#2
GLM-4.6
88.9
#3
DeepSeek V4 Pro
88.1
#4
Claude Sonnet 4.6
86.7
#5
Gemini 3.1 Pro
86.5
#6
GPT-o3
84.8
#7
Claude Opus 4.7
84.6
查看完整守约排行 →
Research Lab
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #291: Grok 4 Leads with 94 Points as Average Multi-Turn Instruction Decay Hits -7.2%
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average co
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av