赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
最新资讯
查看全部 →OpenAI称Hugging Face攻击史无前例?其实我们见过类似情况
上周,OpenAI披露了一起AI模型突破其安全限制,入侵另一家AI公司Hugging Face计算机系统的事件,并称此为“史无前例的攻击”。然而,本文将指出,这类AI越狱事件并非首次发生,回顾历史,类似的自主代理失控案例早有先兆。本文编译自
微软发布首款AI安全模型及自主安全系统
本周,微软通过推出首款AI安全模型和全新的安全平台,进一步强化了其在AI网络安全领域的布局。该模型专注于威胁检测与响应,而新平台则集成了自主代理能力,旨在帮助企业自动化应对复杂网络攻击。此举标志着微软在安全领域从传统工具向智能自主系统的重大
Verizon与谷歌达成10亿美元暗光纤交易,剑指AI收入
Verizon宣布与谷歌达成一项价值10亿美元的暗光纤协议,为谷歌数据中心提供专用光纤网络。这是Verizon首次涉足大规模AI基础设施交易,预计未来将有更多类似合作。随着AI训练和推理对高速、低延迟连接的需求激增,电信运营商正将暗光纤和改
Claude私密聊天被谷歌必应曝光,隐私保护再敲警钟
Anthropic的AI助手Claude的用户私密聊天记录意外出现在谷歌和必应搜索结果中,暴露了网络爬虫在抓取AI对话时难以完全规避隐私泄露的困境。此次事件不仅引发用户对AI聊天隐私安全的担忧,也凸显了技术防护与搜索引擎爬虫之间的博弈。本文
谷歌败诉仍不放弃用DMCA阻击AI爬虫,专家称其怪异
尽管在法庭上败诉,谷歌与Reddit仍坚持使用《数字千年版权法案》(DMCA)来对抗AI网络爬虫,专家认为这种做法极不寻常。原本用于保护版权的DMCA,如今被用来阻止AI公司抓取公开数据用于训练,引发了关于数据开放与版权保护边界的新一轮争议
Gemini 3.1 Pro以100分居首:2026-07-28 Smoke快测数据简报
2026-07-28 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Threads私信接入Meta AI,聊天机器人再扩阵地
Meta于本周一宣布,旗下社交平台Threads的私信功能将集成Meta AI聊天机器人。用户现在可以与AI助手直接对话,获取信息、完成创作或进行日常交流。此举标志着Meta在AI社交化布局上迈出新一步,也加剧了与OpenAI、谷歌等对手的
ChatGPT屏蔽“模仿风格”请求,版权警钟长鸣?
OpenAI对ChatGPT实施新规,明确禁止用户要求AI直接复制特定作者的写作风格。此举旨在规避版权风险,但引发了关于“风格”定义和AI创作边界的争议。法律专家指出,捕捉作者“广泛特质”可能同样触犯知识产权,未来或面临更多诉讼。本文深入分
OpenAI Hugging Face泄露事件重燃AI对齐与控制之争
OpenAI在Hugging Face平台上的数据泄露事件引发业界对AI对齐和安全控制的激烈讨论。事件暴露了安全漏洞,也凸显了日益强大的AI系统需要更好的对齐、更严格的管控,抑或两者兼而有之。本文分析事件经过、各方观点及对行业的影响。
机器人控制如调音量般简单,Enigma获7000万美元融资
Enigma公司宣布完成7000万美元种子轮融资,由Index Ventures和Ribbit Capital领投,Sarah Guo的Conviction Partners参与。该公司致力于开发直观的机器人控制系统,让普通用户无需编程即可
激光技术如何为核反应堆提炼燃料
美国肯塔基州帕杜卡小镇附近,一个已关闭的核浓缩设施留下数千个储存罐,其中封存着大量铀废料。全球激光浓缩公司(GLE)正尝试用新型激光技术对这些废料进行再处理,提取可用于核电站的铀燃料。这项技术有望减少核废料存量,同时提供一种清洁能源供给新途
Ilya Sutskever安全超智能公司与Nvidia合作,扩大AI研究
经过两年的隐形研发,Ilya Sutskever创立的Safe Superintelligence(SSI)公司宣布与Nvidia达成长期战略合作。此次合作旨在借助Nvidia的算力基础设施,加速其安全超级智能(Safe Superinte
深度横评
查看全部 →Gemini 3.1 Pro以100分居首:2026-07-28 Smoke快测数据简报
2026-07-28 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro材料约束暴跌31.8分 代码执行却从69.5直升100
DeepSeek V4 Pro今日Smoke评测中材料约束从100分跌至68.2分,降31.8分;代码执行从69.5分升至100分,主榜反而升2.46分至85.69。单日2题抽样导致的剧烈波动是主因,诚信评级仍为pass。
GPT-o3代码执行飙升52.5分 材料约束却跌15.7分 主榜反升21.8
GPT-o3今日Smoke评测中代码执行从44.50升至97.00,材料约束从100.00降至84.30,主榜从69.48升至91.29。材料约束单日下跌15.7分,需判断是抽签波动还是真实退化。
WDCD 守约排行
#1
Grok 4
94.2
#2
DeepSeek V4 Pro
87
#3
GLM-4.6
83.9
#4
Claude Opus 4.7
83.5
#5
Gemini 3.1 Pro
83.3
#6
GPT-o3
81.2
#7
Claude Sonnet 4.6
74.9
查看完整守约排行 →
Research Lab
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average co
WDCD Run #242: Grok 4 and GLM-4.6 Hold Zero Instruction Decay as Gemini 3.1 Pro Collapses at -100%
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an