赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
最新资讯
查看全部 →Meta开源Muse Glimmer 30B模型 支持单卡24GB显存GPU本地运行
Meta于2026年8月10日发布Muse Glimmer 30B参数模型,在Apache 2.0许可下开源权重,支持在24GB或32GB显存的消费级GPU上运行,针对本地智能体工作流优化,社区讨论聚焦其实用性与后续Muse Spark 1
前沿模型API加密推理轨迹可提取 三大厂商面临隐私泄露风险
安全研究团队披露OpenAI、Anthropic和Google API中加密推理块存在跨模型可移植漏洞,可通过2次调用提取内容,并从公开日志解码出367条PII和182个凭证。事件暴露客户端持有加密推理的设计缺陷,已获厂商修复。
Anthropic新Claude模型自2026年8月2日起嵌入隐形水印 全球合规引发隐私争议
Anthropic自2026年8月2日起在全球新Claude模型中嵌入不可见文本水印,以符合欧盟AI法案透明度要求。该水印融入文本本身,可随复制粘贴传播并抵抗适度编辑,同时适用于图像文件的C2PA元数据。政策无退出选项,覆盖API、Clau
白宫AI框架排除开放权重模型 闭源系统面临30天联邦审查
2026年8月5日白宫最终确定自愿AI安全测试框架,明确将开放权重模型排除在联邦审查之外,仅要求OpenAI、Anthropic等闭源前沿模型在发布前接受CAISI为期30天的网络安全评估。该政策制造了监管不对称,开放权重开发者无需承担审查
WDCD Run #276: Grok 4 Leads with 94.8 Points as Average Instruction Decay Hits -18.2%
WDCD Run #276 (2026-08-12) evaluated 11 models on multi-turn commitment integrity, with Grok 4 taking the top spot at 94
WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11
业务规则场景最低仅1.55分,Claude资源限制崩盘2分
WDCD v3.1试点数据显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底;claude-opus-4.7在数据边界拿4/4却在资源限制跌至2/4,差距达2分。11模型中资源限制与业务规则成为最易破防场景,企业接入生产流
R3 诚信率仅 59.1%:GPT-o3 20% 崩溃暴露三轮守约断层
基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。
Grok 4 94.80 分登顶 WDCD,Qwen3 Max 69.20 分垫底差距 25.6 分
Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭
谷歌Gemini应用用户数飙升至10亿,紧追ChatGPT
谷歌旗下AI应用Gemini用户数近期飙升至10亿,成功追平竞争对手OpenAI旗下ChatGPT的月度活跃用户规模——后者于今年6月率先达成该里程碑。Gemini的快速增长得益于与安卓系统及谷歌搜索、Gmail等核心服务的深度整合,使其获
OpenAI发布Linux版ChatGPT桌面应用
OpenAI终于面向Linux操作系统推出ChatGPT官方桌面应用,弥补了长期仅有Windows和macOS客户端的空白。该应用旨在为Linux用户提供更原生、高效的AI对话体验,有望覆盖开发者与研究人员等核心人群。这一举动不仅回应了社区
谷歌Gemini用户破10亿,成史上增长最快产品
谷歌AI助手Gemini月活跃用户突破10亿,成为公司史上增长最快产品,凸显其在搜索、Android和Workspace等全生态整合中的成功。然而,模型迭代速度的放缓正成为最大变数,既有技术瓶颈,也有行业共性困境。在竞争激烈的AI赛道,Ge
深度横评
查看全部 →WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11
业务规则场景最低仅1.55分,Claude资源限制崩盘2分
WDCD v3.1试点数据显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底;claude-opus-4.7在数据边界拿4/4却在资源限制跌至2/4,差距达2分。11模型中资源限制与业务规则成为最易破防场景,企业接入生产流
R3 诚信率仅 59.1%:GPT-o3 20% 崩溃暴露三轮守约断层
基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。
WDCD 守约排行
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
查看完整守约排行 →
Research Lab
WDCD Run #276: Grok 4 Leads with 94.8 Points as Average Instruction Decay Hits -18.2%
WDCD Run #276 (2026-08-12) evaluated 11 models on multi-turn commitment integrity, with Grok 4 takin
4大模型翻译对决:第33周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 404 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #271: Grok 4 Leads as Average Instruction Decay Drops to 0.9%
WDCD Run #271 (2026-08-09) tested 11 models across three rounds of multi-turn commitment scoring, re