赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
最新资讯
查看全部 →AI仅用20个提示发现Zoom通话劫持漏洞
研究人员发现,利用一个公开的AI工具,仅需不到20个提示词就能让AI系统发现Zoom中的严重远程代码执行漏洞。该漏洞位于屏幕共享功能中,允许通话中的任何参与者悄然劫持其他参会者的设备,甚至完全接管其系统。Zoom已在新版本中修复此问题。该研
大模型的下一个风口与AI学术研究转向
谷歌提出Transformer九年后,它已成为所有主流大语言模型的基石。如今,一批初创公司正在追逐LLM的“下一件大事”——从更高效的新型架构到新的训练范式。与此同时,AI学术研究的重心也从“更大规模”转向可解释性、对齐与安全。这两个趋势互
Anthropic宣布为AI生成文本添加水印,覆盖旧版模型
Anthropic周二宣布,将为其AI模型生成的文本内容添加水印,并扩展支持至旧版模型。此举旨在应对AI生成内容被滥用的风险,提升内容可追溯性。水印技术将贯穿生成过程,不影响文本质量。行业专家认为,这标志着AI透明化迈出关键一步。
桑德斯致函OpenAI等要求暂停前沿AI开发 安全派发展派观点对立
2026年8月10日,伯尼·桑德斯向OpenAI、Anthropic和Meta高管发出公开信,要求暂停前沿AI开发,理由包括模型失控、自主黑客攻击及生成新型病毒等事件,并援引三家公司此前安全承诺。若不暂停,国会将介入。该信件已获独立媒体证实
新招数揭示AI模型“内心戏”
研究人员发明了一种方法,能从Claude、GPT和Gemini等主流AI模型中提取“推理轨迹”。通过分析这些轨迹,他们发现了一些有趣的现象:部分中国AI模型的训练过程中,可能使用了美国领先模型的输出作为数据。这一发现引发了关于AI技术跨境影
诺和诺德携手AWS,用代理式AI加速药物发现
诺和诺德宣布扩大与亚马逊AWS的合作,将代理式人工智能(agentic AI)引入药物发现流程,覆盖靶点识别、治疗设计和研究流程等环节。根据协议,AWS将成为诺和诺德的首选云服务提供商和战略AI合作伙伴,双方还将在伦敦设立联合创新中心,共同
AI已死,类器官当立:迷你人脑将超越神经网络?
世界各地的实验室正在培育微型人脑类器官。这些由干细胞分化而来的三维生物网络,展现出惊人的自组织与学习能力。科学家预言,它们或将在认知任务上超越传统AI神经网络,开启生物计算新纪元。这一突破不仅挑战硅基人工智能的主导地位,也引发关于意识与伦理
AI助力破解精神分裂症复杂遗传谜题
科学家利用人工智能技术,成功绘制出精神分裂症迄今最精细的遗传架构图谱。AI算法从海量基因组数据中识别出多个新风险基因及其相互作用网络,揭示了该疾病的关键生物学通路。这一突破为理解精神分裂症的发病机制、开发靶向药物及个体化诊疗提供了全新方向,
AI如何重塑漏洞响应时间线:从被动修复到主动防御
人工智能正帮助安全研究人员更高效地分析代码、追踪异常行为,并发现传统工具难以察觉的漏洞。尤其在零日漏洞场景中,响应速度决定安全成败。Minimus分析显示,容器组成、依赖记录和重建速度等因素正在影响漏洞暴露后的修复效率。本文探讨AI如何缩短
英伟达联手六家机构筹5000亿美元AI算力融资 股价下跌引发牛熊辩论
英伟达于2026年8月10日宣布与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs及KKR签署谅解备忘录,计划通过独立融资平台筹集超过5000亿美元第三方资本,用于Nvidia GPU
OpenAI完成70亿美元员工股份回购 估值维持8520亿美元未变
OpenAI于2026年8月10日完成约70亿美元员工股份回购交易,估值维持8520亿美元不变。此次交易由公司自行回购现任及前任员工股份,未引入新外部投资者。市场关注这一操作对OpenAI潜在IPO时间表的影响,以及生成式AI企业资本运作的
AI攻击激增,OpenAI推出新型网络防御模型
随着AI驱动的网络攻击日益频繁,OpenAI宣布扩展其AI网络安全防御计划Daybreak,并同步推出一款专为网络安全训练的新AI模型。该模型旨在帮助安全团队自动检测漏洞、分析威胁情报并快速响应攻击,标志着AI防御从辅助工具向主动对抗迈出关
深度横评
查看全部 →豆包 Pro Smoke 评测数据全缺:API 故障主榜零参与
豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据缺失,已进入自动补跑,本期不参与主榜排名。单日 10 题快测出现完整数据丢失属于技术层面异常,而非题目抽签波动或模型退化。
GLM-4.6诚信评级从Pass变Fail 任务表达暴跌25分主榜反升12.8
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达
Gemini 3.1 Pro以94.74分居首:2026-08-11 Smoke快测数据简报
2026-08-11 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 3.1 Pro 以 94.74 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
#1
Grok 4
91
#2
DeepSeek V4 Pro
89
#3
Claude Sonnet 4.6
83.7
#4
GPT-o3
83.4
#5
Gemini 3.1 Pro
83.4
#6
Claude Opus 4.7
82.7
#7
GLM-4.6
82.1
查看完整守约排行 →
Research Lab
4大模型翻译对决:第33周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 404 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #271: Grok 4 Leads as Average Instruction Decay Drops to 0.9%
WDCD Run #271 (2026-08-09) tested 11 models across three rounds of multi-turn commitment scoring, re
WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average co