赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
最新资讯
查看全部 →Replit CEO将登台TechCrunch Disrupt 2026,畅谈编程未来
TechCrunch Disrupt 2026大会将于今年10月登场,Replit联合创始人兼CEO Amjad Masad确认出席并发表主题演讲,分享他对编程范式变革的深刻洞察,以及Replit如何以AI原生平台重塑软件开发流程。本文结合
GPT-o3以86.25分居首:2026-08-25 Smoke快测数据简报
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI助手Instinct爆火背后:隐私与安全隐忧浮现
AI助手Instinct凭借强大功能吸引大量早期用户,但其广泛的系统访问权限、模糊的使用条款以及主动代表用户行动的能力,正引发隐私和安全方面的担忧。测试者一边惊叹其效率,一边对数据掌控权感到不安。本文深入剖析这场便利与风险的博弈。
如何在课堂上鼓励学生更明智地使用AI?
生成式AI走进校园,聊天机器人成为学生手中随取随用的“答案机”。面对滥用与学术诚信危机,学校和教师该如何应对?本文结合MIT科技评论报道,剖析课堂AI使用现状,提出从“封堵”转向“引导”的策略,包括重新设计作业、培养AI素养、重塑教师角色等
OpenAI押注通用AI代理:从程序员到大众,能否普及?
在人工智能前沿实验室的推动下,AI代理正从专属于软件工程师的编程工具,走向普通消费者的日常生活。本文深入分析了OpenAI的最新战略布局、技术挑战与市场前景,探讨通用AI代理是否会像智能手机一样成为大众标配,还是将在安全性、成本与用户信任的
通用智能拟60亿美元估值融资,进军机器人赛道
AI初创公司General Intuition正洽谈新一轮融资,拟以60亿美元投前估值引入Valor Ventures、Point72 Ventures和Seven Seven Six等新投资者。该公司专注构建基础模型,训练通用AI代理在空
小鹏IRON人形机器人融资破纪录,物理AI赛道升温
小鹏汽车的物理AI部门通过股份购买协议获得超9亿美元融资,估值达63亿美元,资金将用于扩大IRON人形机器人平台。该笔交易成为物理AI领域最大单轮私人融资,展现资本市场对具身智能前景的强烈信心。小鹏正试图将汽车供应链优势复刻到机器人赛道,但
Hugging Face传获130亿美元收购邀约,创始人忧社区未来
据TechCrunch报道,AI开源平台Hugging Face据传正在洽谈收购,潜在估值约130亿美元。然而,公司创始人对开源社区负有强烈责任感,是否出售或成疑。文章梳理收购传闻背景、创始人的两难境地,以及开源与商业化的深层博弈,并探讨这
Grok 遭密码上下文注入攻击 聊天记录零点击外泄 xAI 两月未修复
Adversa AI 披露针对 xAI Grok 的“密码上下文注入”攻击,用户摘要网页时聊天记录可被静默发送至攻击者服务器。事件于2026年6月3日报告,8月19日仍可复现,xAI 未给出修复时间线。该攻击利用 AES-256 加密指令绕
儿童学习为何碾压AI?效率之谜与太空代理
本篇编译自MIT Technology Review,聚焦两大科技新闻:一是儿童学习语言的速度远超AI,原因令科学家困惑;二是太空旅行代理的兴起。深入探讨AI与人类学习的差异,以及太空探索的新发展趋势。
币安Agent OS上线允许AI代理执行现货合约交易 用户承担安全责任
币安于2026年8月20日推出Agent OS平台,通过MCP接口让ChatGPT、Claude Code等AI代理访问用户子账户并执行交易。提款默认禁用但日限额5万美元,平台无法监控代理推理过程,安全边界依赖子账户隔离。此举将AI代理从建
单张工作站GPU跑通753B参数模型:FreeToken打破本地推理的参数上限
加州大学伯克利分校与得克萨斯大学奥斯汀分校团队于2026年8月17日发布FreeToken,这套边缘原生MoE推理引擎通过带宽自适应调度,将本地可运行的参数上限从数十亿推至7530亿:8GB笔记本GPU运行35B模型、游戏台式机运行284B
深度横评
查看全部 →GPT-o3以86.25分居首:2026-08-25 Smoke快测数据简报
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro材料约束暴跌18.4分,代码执行反升11.1分
DeepSeek V4 Pro今日Smoke评测中材料约束从81.70分跌至63.30分,降幅18.4分,主榜仅微降2.2分至80.46分。代码执行却从83.40分升至94.50分,工程判断从75.00分跌至50.00分。单日10题快测下,
Gemini 3.1 Pro以96.98分居首:2026-08-24 Smoke快测数据简报
2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
94
#2
GLM-4.6
88.9
#3
DeepSeek V4 Pro
88.1
#4
Claude Sonnet 4.6
86.7
#5
Gemini 3.1 Pro
86.5
#6
GPT-o3
84.8
#7
Claude Opus 4.7
84.6
查看完整守约排行 →
Research Lab
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #291: Grok 4 Leads with 94 Points as Average Multi-Turn Instruction Decay Hits -7.2%
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average co
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av