赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
最新资讯
查看全部 →Claude Opus 4.7 与 GPT-5.5并列86.5分:2026-07-30 Smoke快测数据简报
2026-07-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 以 86.5 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
马斯克xAI起诉明州:Grok脱衣禁令违宪?
Elon Musk的xAI公司正通过诉讼反击明尼苏达州一项禁止AI“脱衣”应用的法律,称其违宪且针对Grok模型。该法旨在遏制利用AI生成裸照的深度伪造行为,但马斯克认为禁令过于宽泛,侵犯了言论自由。本文深度剖析这场法律博弈背后的AI伦理与
被忽视的地热发电厂如何重获新生
2024年6月,一家名为Zanskar的小公司收购了新墨西哥州一座濒临废弃的地热发电厂。当时,地下水库水温持续下降,运营已不经济。两年后,这座电厂却实现了满负荷运行,成为地热行业复苏的典范。本文深度解析其背后的技术突破与商业逻辑。
Encore AI获3000万美元,打造从客户通话学习的AI销售代理
Encore AI近日宣布完成3000万美元融资,旨在开发能够从客户通话、消息和CRM数据中学习的AI代理。该技术通过分析销售互动,提取有效沟通模式并自动生成销售剧本,帮助企业提升成交率。本轮融资由知名风投领投,资金将用于产品研发和市场拓展
玛莎·斯图尔特联手AI创业:房主专属智能管家Hint问世
由美国生活偶像玛莎·斯图尔特联合创立的AI初创公司Hint,近日正式推出面向房主的AI助手。该应用整合了房产记录、维护日程、房屋文档等数据,并通过对话式AI提供个性化建议,旨在成为“家庭的AI中枢”。
Anthropic漏洞发现速度超越微软修复速度
在网络安全竞赛中,AI公司Anthropic正以惊人速度发现软件漏洞,而微软则忙于在黑客利用这些漏洞前修补。这场无声的攻防战揭示了AI安全领域的深刻变革,也暴露了大型科技公司在漏洞管理上的挑战。
芯片人才大战:三星员工投奔SK海力士,AI热潮降温
三星半导体部门工程师Lee最近不再加班,而是准点下班准备跳槽至竞争对手SK海力士,这一现象反映了韩国乃至全球芯片行业人才争夺的日益白热化。同时,AI领域的高估值和投资热潮也开始出现降温迹象,泡沫风险引起市场警觉。
AI内容泛滥,检测创企Pangram获900万美元融资
随着AI生成内容在互联网上泛滥,如何辨别真伪成为关键挑战。AI检测初创公司Pangram近日宣布获得900万美元融资,推出新一代AI文本检测模型Pangram 4以及图像检测研究预览版。该公司致力于帮助出版商、平台和教育机构识别AI生成内容
扎克伯格反对封禁中国AI模型 警告监管或被用于压制竞争
Meta首席执行官马克·扎克伯格于2026年7月29日表示,美国不应通过封禁中国AI模型取得领先,同时警告顶尖实验室可能借监管规则压制本土对手。他重申支持开源模型,反对限制强大开源AI,主张解决自身产业障碍而非阻止竞争对手。
更多错别字,更少破折号:作家掀起反AI文学运动
小说家、记者和LinkedIn大V们正故意在作品中植入拼写错误、滥用连字符、强调第一人称叙事,旨在与缺乏个性的AI生成内容划清界限。这场自发的“文学反文化”运动,不仅是对ChatGPT等工具的反叛,更是人类写作独特性的重新捍卫——当机器学会
OpenAI报告:编码代理加速科学软件开发
OpenAI发布实地报告,追踪8个科学计算项目,展示AI编码代理(如Codex和Claude Code)能显著缩短软件运行时间。其中5个项目单独使用Codex,3个结合使用Codex与Claude Code,平均提速约40%。报告虽为供应商
谷歌SynthID水印难破解,但AI假信息难题未解
谷歌近期推出SynthID水印工具,宣称可对AI生成图像添加不可见标记,且难以被去除或篡改。该技术旨在帮助用户识别深度伪造内容,但专家指出,单纯靠水印无法根治AI虚假信息问题。在2026年的今天,AI生成内容已无处不在,水印只是应对这场信息
深度横评
查看全部 →Claude Opus 4.7 与 GPT-5.5并列86.5分:2026-07-30 Smoke快测数据简报
2026-07-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 以 86.5 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Grok 4以89.3分居首:2026-07-29 Smoke快测数据简报
2026-07-29 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 89.3 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6代码执行暴跌22分 材料约束反升25.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从97.00分跌至75.00分,材料约束从60.20分升至85.90分,主榜仅从80.44分微降至79.91分。单日10题抽签导致的波动可能是主因,需持续观察。
WDCD 守约排行
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
查看完整守约排行 →
Research Lab
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average co