赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →OpenAI新推理模式引安全专家警惕:跳出顺序思考
OpenAI即将推出的Astra模型将采用“循环深度”技术,不再依赖现有推理模型典型的分步式思维链,而是在神经网络内部反复迭代,直接输出答案。AI安全专家担心,这种“看不见的思考”让推理无法被审计和约束,可能绕过安全护栏,成为新一轮对齐难题
联邦法院裁定五角大楼违宪:Anthropic黑名单认定属报复性执法
2026年8月27日,加州联邦地区法院法官丽塔·林发布59页裁决书,撤销五角大楼对Anthropic作出的"国家安全供应链风险"认定,判定政府因Claude安全护栏争议而实施的系列打压措施违反宪法第一修正案和第五修正案正当程序条款。法院同日
美国G20推行卡罗来纳原则:AI监管松绑的战略赌注与三轨裂变
2026年9月1日,美国在北卡罗来纳州教堂山主办G20创新部长级会议,白宫科技政策局局长克拉齐奥斯推行"卡罗来纳原则",核心是各国不新设AI监管机构、只对"新型情况"立法。中国当场签署,欧盟方向相左,全球AI监管格局正式进入三轨并行阶段。
美政府表态支持OpenAI:纽约时报版权案迎来关键转折
美国政府在纽约时报诉OpenAI版权案中提交法庭之友意见书,明确支持OpenAI关于AI训练使用他人作品构成合理使用的论点。此举可能深刻影响AI版权法律走向。本文编译自WIRED,剖析案件背景、法律争议及行业影响。
GPT-o3以83.94分居首:2026-09-03 Smoke快测数据简报
2026-09-03 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
ChatGPT广告业务200天突破10亿美元年化收入
OpenAI旗下广告平台ChatGPT Ads上线仅200天,年化收入运行率即突破10亿美元,成为公司商业化新引擎。目前已有数万广告主入驻,OpenAI并将自助广告服务扩展至印度、欧洲、中东及北非,进一步争夺传统搜索广告市场。透过AI对话场
自动驾驶告别黑匣子:Motional与MIT让AI实时解释决策
自动驾驶汽车在做出变道或刹车等决策时,能否向乘客解释原因?Motional与MIT CSAIL联合团队在《自然》杂志发表研究,提出一套可实时解释决策的AI系统,将场景编码为自然语言与可视化证据,显著提升信任度。研究涵盖CEO Laura M
美国政府在AI版权纠纷中为OpenAI站台
美国政府在OpenAI因使用受版权保护材料训练大语言模型而面临的法律诉讼中,明确选择支持OpenAI。在一份法庭之友意见书中,政府强调美国有浓厚利益维持AI产业繁荣与竞争力,并使AI的实践与程序成为全球标准。支持者认为这有利于创新,反对者则
我们正“危险地接近”死互联网理论
Pangram CEO警告,AI生成内容正大规模进入社交动态、求职简历、商品评论和保险理赔,网络真实与机器内容的边界迅速消融,平台和用户已陷入真伪甄别危机。过去两年,一批内容溯源与数字身份验证初创公司应运而生,试图以可验证的来源机制修复网络
Pangram CEO:AI检测比“真假”难在哪里?
互联网正被AI生成内容淹没,求职简历、商品评论和保险理赔中也开始出现AI合成的文本与图像。Pangram联合创始人Max Spero认为,AI检测的真正难点在于内容并非简单的“真/假”二分类,而是一段人机协作的连续光谱;同时,生成模型与对抗
特朗普政府AI安全测试秘密规则被指藏腐败,或被令公开
一场新诉讼称,美国联邦政府在前沿AI模型安全测试中使用了高度保密的“秘密规则”。原告指控这些规则可能掩盖腐败,使行政分支能够借“国家安全”之名,对不同企业采取不同标准。在法院命令之下,特朗普政府可能被迫公开完整的测试框架与豁免记录。分析认为
谷歌发布Gemini 3.8 Flash:六周内第三款Flash模型
据Ars Technica报道,谷歌在美国时间9月3日发布Gemini 3.8 Flash,这也是近六周内第三款Flash系列模型。与此同时,Pro系列的更新显得几乎停滞。从快速迭代的节奏看,谷歌正在将Flash作为市场竞争的前锋,试图用高
深度横评
查看全部 →GPT-o3以83.94分居首:2026-09-03 Smoke快测数据简报
2026-09-03 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro以95.91分居首:2026-09-02 Smoke快测数据简报
2026-09-02 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 以 95.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-5.5代码执行暴跌25分 主榜仅降3分 材料约束反升24分
今日Smoke评测中GPT-5.5代码执行从94.50跌至69.50,材料约束从76.00升至100.00,主榜从86.18降至83.23。单日10题快测下,执行维度暴跌与约束维度暴涨形成对冲,需区分抽签波动与真实退化。
WDCD 守约排行
#1
Gemini 3.1 Pro
97.7
#2
Grok 4
96.3
#3
GLM-4.6
95
#4
GPT-o3
94.8
#5
Claude Opus 4.7
94.7
#6
Gemini 2.5 Pro
93.2
#7
GPT-5.5
92.6
查看完整守约排行 →
Research Lab
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4