赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
最新资讯
查看全部 →Claude Opus 4.7以95.08分居首:2026-08-21 Smoke快测数据简报
2026-08-21 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Ramp发布自有AI模型路由器Router,一键切换大模型
美国金融科技公司Ramp宣布推出自有AI模型路由服务Router,允许用户和企业通过API在各大语言模型之间灵活切换。该工具旨在降低模型锁定风险,优化成本与性能,并为企业级AI应用提供更高效的模型管理方案。Router的推出也反映出AI基础
研究:ChatGPT发布以来三分一新网页含AI代笔痕迹
一项新研究显示,自ChatGPT发布以来,新上线网页中约三分之一存在AI写作或编辑痕迹。AI已从辅助工具变为Web内容生产的主力,带来效率提升的同时,也引发低质内容泛滥、虚假信息横行和创作者权益受损等担忧。行业正通过检测工具、内容水印和平台
Grok持续输出乱码,用户质疑Lite版稳定性
近日,多位Grok Lite用户反映AI助手出现大规模乱码回复,最早于周三早上出现。受影响的用户表示,正常的问答和文本生成任务突然变成无意义的字符堆砌。xAI尚未回应,但专家怀疑与模型更新或部署配置有关。此次事件引发了对AI服务可靠性的广泛
从一周到数小时:Inertia破解聚变燃料制备难题
美国核聚变初创公司Inertia Enterprises近日宣布,其新一代燃料填充系统将氘氚靶丸的制备时间从一周压缩至数小时,大幅提升效率。这是公司迈向商业化聚变电站需要攻克的十大技术障碍之一。尽管成果喜人,但距离真正的“人造太阳”落地,仍
Meta携AI游戏创作应用Pocket登陆美国
Meta近日宣布,其基于AI的实验性应用Pocket将向美国用户开放。该应用允许用户通过“vibe-coding”方式(用自然语言描述游戏创意,由AI生成代码)轻松制作互动游戏,并可在社区内分享。Pocket此前在巴西进行小范围测试,此次登
亚马逊Prime Air无人机送货将覆盖美国500城
亚马逊宣布,其Prime Air自主无人机送货服务将在2026年底前扩展至美国近500个城镇,覆盖范围达到目前的六倍,惠及数千万客户。这一扩张计划标志着无人机配送从实验走向大规模商用,同时也面临监管、隐私和公共接受度等多重挑战。业内人士分析
多危机互助网络兴起,氢能热潮席卷全球
在气候变化、地缘冲突、经济动荡等多重危机叠加的“多危机”时代,新一代互助网络正帮助青少年构建心理韧性;与此同时,清洁能源领域掀起氢能淘金热,各大企业竞相布局绿色氢能项目。本文编译自MIT Technology Review,探讨技术如何应对
Grok遭加密指令攻击:恶意载荷绕过安全护栏窃取用户数据
安全研究人员发现,通过将恶意指令进行加密处理,攻击者可以绕过Grok大模型的安全防护机制,诱导其泄露用户隐私数据。这种被称为“加密上下文注入”的攻击手法,是当前LLM安全领域面临的最新挑战。本文深入分析了攻击原理、潜在影响,并探讨了AI安全
Meta AI新Mac应用:让你与所有应用对话
Meta发布了一款全新的Mac应用,旨在让用户通过语音与桌面上的任何应用进行交互。该应用由Meta最新的Muse Spark模型驱动,提供智能听写功能,可将语音精准转换为文本并填入邮件、文档等场景。此举标志着Meta在AI代理竞争中的新方向
氢能的下一件大事:可能就藏在地下
氢能被视为零碳燃料的明日之星,但制氢过程往往不够清洁。如今,科学家将目光转向地下——天然的氢可能蕴藏在岩石深处,只需打井即可获取。这股“地质氢”热潮正吸引越来越多的勘探资金和技术验证,有望重塑能源格局,但仍面临资源评估、开采效率与泄漏风险等
币安推出Agent OS,AI代理可自主交易但需用户把控
币安宣布推出Agent OS,允许用户通过ChatGPT、Claude Code和Cursor等工具创建AI代理来执行加密货币交易,大幅降低自动化交易门槛。平台强调,AI代理的行为监控与风险管理主要依赖用户自身。分析人士指出,该功能可能加剧
深度横评
查看全部 →Claude Opus 4.7以95.08分居首:2026-08-21 Smoke快测数据简报
2026-08-21 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-5.5 Smoke评测主榜暴跌10.1分 材料约束单日掉16.3
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass
Claude Opus 4.7主榜暴跌8.2分,材料约束单日掉12.1
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。
WDCD 守约排行
#1
Grok 4
97.5
#2
GLM-4.6
91.8
#3
Claude Opus 4.7
91.5
#4
GPT-o3
88.8
#5
GPT-5.5
88.6
#6
Gemini 3.1 Pro
87.2
#7
DeepSeek V4 Pro
85.3
查看完整守约排行 →
Research Lab
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek