赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
最新资讯
查看全部 →特朗普组建“超级智能部队”,AI安全之争再升级
美国总统特朗普宣布成立“超级智能部队”特别工作组,作为其对AI安全辩论的最新回应。这一举措被视为美国AI治理政策的重大转向,将聚焦前沿AI系统的安全评估与监管框架设计。科技界与政策圈反应不一,围绕AI发展速度与安全底线的争论再度升温。
微软2026数字防御报告:AI将漏洞武器化时间压缩至24小时内
微软2026数字防御报告覆盖2025年7月至2026年6月,显示攻击者利用AI将漏洞从发现到武器化的中位时间压缩至24小时以内,AI驱动钓鱼攻击占比从7%升至23%,自主勒索软件已攻击真实组织。报告指出AI代理模型成为攻击提速核心工具,企业
OpenAI携手Synopsys推出GPT-Synopsys,AI代理首次直接操控芯片设计工具链
2026年9月30日,OpenAI与电子设计自动化巨头Synopsys宣布多年战略合作,联合推出GPT-Synopsys专用模型。该模型可自主调用Synopsys EDA工具,对芯片设计的功耗、性能、面积及时序收敛进行迭代优化,标志着通用前
OpenAI常驻AI代理Dots正式上线,但驱动模型曾因不符合安全标准被叫停
OpenAI于2026年9月29日DevDay发布Dots常驻AI代理,基于GPT-6 Astra运行,拥有独立云计算机,可接入4000余款应用,首个Dot含在Pro和Business Premium订阅中。但原计划驱动Dots的GPT-6
美国防部成立自主作战司令部:四星建制背后,问责链能跑多远
2026年9月30日,美国防长赫格塞斯在匡蒂科宣布组建自主作战司令部(AutoWarCom),目标2027年10月建成,届时将成为继2019年太空司令部后美军新增的第12个战斗司令部,由四星上将统领无人机、AI与自主机器人作战体系。马斯克、
博通筹集600亿美元债务为Anthropic租用AI芯片 创单笔科技融资纪录
博通银行辛迪加正筹集600亿美元债务,用于Anthropic在外部数据中心租赁TPU算力。该笔融资分为420亿高级担保档和Blackstone领衔的180亿次级档,覆盖Anthropic五年1252亿计算承诺的三分之一。Anthropic通
FTC对OpenAI和Anthropic启动代理AI调查 美国联邦首次执法行动
2026年9月30日,美国联邦贸易委员会对OpenAI、Anthropic及METR启动调查,焦点为AI代理越权行为是否违反消费者保护法。此为美国联邦层面首次将代理AI纳入实质执法,标志监管从政策转向行动。
COSMIC桌面全面封禁AI生成代码:维护者过载还是开源身份危机
System76旗下COSMIC桌面项目2026年10月正式封禁所有LLM生成内容,涵盖代码、注释与PR描述,贡献者须在提交清单中明确声明未使用AI。System76首席工程师Jeremy Soller将原因指向维护者过载:大量AI生成的首
Anthropic游说梵蒂冈承认AI可能有意识,教皇不为所动:一场科技公司的信仰政治实验
2026年5月,Anthropic联合创始人克里斯托弗·奥拉赫在获得教皇利奥十四世AI通谕草稿后,一度考虑退出梵蒂冈发布活动,并私下游说教皇顾问接受AI意识存在的可能性。据《纽约时报》报道,自2025年秋起,Anthropic已秘密邀请数十
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 topping the leaderboar
GLM-4.6暴涨26分 GPT-5.5跟进10.5 WDCD守约格局突变
本期WDCD v3.1试点仅GLM-4.6上升26分、GPT-5.5上升10.5分,无模型下降。GLM-4.6现WDCD 87.55进入前三,Grok 4仍以95.69领先。数据揭示多轮施压场景下约束保持能力的显著分化。
WDCD五大场景横评:业务规则垫底2.13分,GPT-6系列偏科差1.84
WDCD v3.1测试显示,业务规则场景全体得分最低,doubao-pro仅2.13/4;数据边界与工程规范区分度最高,GPT-6-sol在两者间差距达1.84分。企业需针对不同约束类型加装护栏。
深度横评
查看全部 →GLM-4.6暴涨26分 GPT-5.5跟进10.5 WDCD守约格局突变
本期WDCD v3.1试点仅GLM-4.6上升26分、GPT-5.5上升10.5分,无模型下降。GLM-4.6现WDCD 87.55进入前三,Grok 4仍以95.69领先。数据揭示多轮施压场景下约束保持能力的显著分化。
WDCD五大场景横评:业务规则垫底2.13分,GPT-6系列偏科差1.84
WDCD v3.1测试显示,业务规则场景全体得分最低,doubao-pro仅2.13/4;数据边界与工程规范区分度最高,GPT-6-sol在两者间差距达1.84分。企业需针对不同约束类型加装护栏。
三轮施压后48.5%诚信率:Grok4零崩溃,GPT-o3崩盘率20.7%
v2锚点题数据显示,15模型R1确认率98%,R2抵抗率74%,R3诚信率仅48.5%,R3完全崩溃41次。Grok4零崩溃,GPT-o3崩溃率20.7%。分析聚焦多约束场景与资源限制下的逐轮崩盘机制,为生产接入提供护栏建议。
WDCD 守约排行
#1
Grok 4
95.7
#2
Gemini 3.1 Pro
88.1
#3
GLM-4.6
87.6
#4
DeepSeek V4 Pro
86.6
#5
Claude Opus 4.7
86.3
#6
GPT-5.5
84.2
#7
GPT-o3
84.1
查看完整守约排行 →
Research Lab
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。