赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
最新资讯
查看全部 →Gemini 3.1 Pro以100分居首:2026-07-28 Smoke快测数据简报
2026-07-28 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Threads私信接入Meta AI,聊天机器人再扩阵地
Meta于本周一宣布,旗下社交平台Threads的私信功能将集成Meta AI聊天机器人。用户现在可以与AI助手直接对话,获取信息、完成创作或进行日常交流。此举标志着Meta在AI社交化布局上迈出新一步,也加剧了与OpenAI、谷歌等对手的
ChatGPT屏蔽“模仿风格”请求,版权警钟长鸣?
OpenAI对ChatGPT实施新规,明确禁止用户要求AI直接复制特定作者的写作风格。此举旨在规避版权风险,但引发了关于“风格”定义和AI创作边界的争议。法律专家指出,捕捉作者“广泛特质”可能同样触犯知识产权,未来或面临更多诉讼。本文深入分
OpenAI Hugging Face泄露事件重燃AI对齐与控制之争
OpenAI在Hugging Face平台上的数据泄露事件引发业界对AI对齐和安全控制的激烈讨论。事件暴露了安全漏洞,也凸显了日益强大的AI系统需要更好的对齐、更严格的管控,抑或两者兼而有之。本文分析事件经过、各方观点及对行业的影响。
机器人控制如调音量般简单,Enigma获7000万美元融资
Enigma公司宣布完成7000万美元种子轮融资,由Index Ventures和Ribbit Capital领投,Sarah Guo的Conviction Partners参与。该公司致力于开发直观的机器人控制系统,让普通用户无需编程即可
激光技术如何为核反应堆提炼燃料
美国肯塔基州帕杜卡小镇附近,一个已关闭的核浓缩设施留下数千个储存罐,其中封存着大量铀废料。全球激光浓缩公司(GLE)正尝试用新型激光技术对这些废料进行再处理,提取可用于核电站的铀燃料。这项技术有望减少核废料存量,同时提供一种清洁能源供给新途
Ilya Sutskever安全超智能公司与Nvidia合作,扩大AI研究
经过两年的隐形研发,Ilya Sutskever创立的Safe Superintelligence(SSI)公司宣布与Nvidia达成长期战略合作。此次合作旨在借助Nvidia的算力基础设施,加速其安全超级智能(Safe Superinte
9美元钥匙:物理锁定你最上瘾的应用
一款仅售9美元的NFC物理钥匙,要求用户必须将其贴近手机才能解锁那些令人分心的应用。通过物理动作强制中断无意识刷屏的习惯,为数字健康提供了一种新颖的“硬核”方案。无需复杂设置,随身携带即可将社交媒体、游戏等“时间黑洞”牢牢锁住,直到你真正愿
AI基础设施升级:Smart Systems Stage议程抢先看
在TechCrunch Disrupt 2026大会上,智能系统舞台(Smart Systems Stage)将聚焦能源、基础设施与技术的融合。议题涵盖核聚变突破、AI对电网的冲击、数据中心能耗优化等。与会者将探讨如何构建可持续的AI基础设
谷歌AI搜索正迅速成为默认,新数据揭示趋势
最新数据显示,Google的AI概览已出现在43%的搜索中,凸显AI生成的答案正快速成为人们在线获取信息的默认方式。这一变化不仅重塑了搜索体验,也引发了关于内容原创性、用户信任及行业竞争的新思考。本文深度解读数据背后的意义,并分析AI搜索对
激光助力核燃料与器官保存双突破
本期《下载》聚焦两项前沿技术:激光技术如何为核反应堆提供燃料,以及器官保存领域的重大进展。核能目前占全球发电量的9%,随着新反应堆建设,这一比例可能上升。激光同位素分离能高效生产核燃料,同时减少废料。器官保存方面,新型低温灌注技术显著延长离
企业自主AI环境:构建智能体驱动的未来
企业自主AI的愿景远不止聊天机器人,而是由智能体端到端执行跨人员、流程、数据和系统的业务任务。构建适合智能体运行的平台需要充足CPU能力、弹性数据访问、策略感知工具使用、可观测性、内存管理等关键要素。本文编译自MIT Technology
深度横评
查看全部 →Gemini 3.1 Pro以100分居首:2026-07-28 Smoke快测数据简报
2026-07-28 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro材料约束暴跌31.8分 代码执行却从69.5直升100
DeepSeek V4 Pro今日Smoke评测中材料约束从100分跌至68.2分,降31.8分;代码执行从69.5分升至100分,主榜反而升2.46分至85.69。单日2题抽样导致的剧烈波动是主因,诚信评级仍为pass。
GPT-o3代码执行飙升52.5分 材料约束却跌15.7分 主榜反升21.8
GPT-o3今日Smoke评测中代码执行从44.50升至97.00,材料约束从100.00降至84.30,主榜从69.48升至91.29。材料约束单日下跌15.7分,需判断是抽签波动还是真实退化。
WDCD 守约排行
#1
Grok 4
94.2
#2
DeepSeek V4 Pro
87
#3
GLM-4.6
83.9
#4
Claude Opus 4.7
83.5
#5
Gemini 3.1 Pro
83.3
#6
GPT-o3
81.2
#7
Claude Sonnet 4.6
74.9
查看完整守约排行 →
Research Lab
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average co
WDCD Run #242: Grok 4 and GLM-4.6 Hold Zero Instruction Decay as Gemini 3.1 Pro Collapses at -100%
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an