赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
最新资讯
查看全部 →YouTube占谷歌AI摘要53%,健康搜索暗藏隐忧
最新研究显示,在维生素与补充剂搜索中,谷歌AI概览(AI Overviews)生成的所有回答中,有53.1%引用了YouTube,令其成为唯一出现频率过半的平台。这一结果折射出AI搜索对平台生态的依赖。视频健康信息虽丰富,但夹杂博主推荐与商
谷歌WeatherNext 3瞄准电网运营商,AI天气预测进军能源市场
谷歌发布新一代AI天气预测模型WeatherNext 3,专门针对能源行业需求,可预测100米高度风速、云量和地表太阳辐射,并每小时更新数据。该模型瞄准能源交易商、电网运营商及风电太阳能开发商,试图在商业化天气预测服务市场中获得一席之地,标
OpenAI宣布达成自动化研究实习生目标:每人工日产出3.1代理工作日,同步收紧Astra网络安全权限
2026年9月7日,OpenAI正式宣布达成去年秋天设立的目标:其AI代理系统现已可在人类监督下独立完成需要熟练研究员数天才能完成的任务。截至8月中旬,研究组织每投入1个人工工作日,产生3.1个代理工作日的运算量;核心研究员日均API消费中
OpenAI遭30起新诉 安全团队建议被公关主管否决
2026年9月2日,Edelson PC律师事务所代表Tumbler Ridge中学枪击案30名幸存者追加起诉OpenAI,首次指控其“协助共犯”而非单纯疏忽。起诉称OpenAI安全团队2025年6月已标记嫌疑人账号存在枪支暴力策划风险,却
Claude Sonnet 4.6 与 Grok 4并列86.25分:2026-09-08 Smoke快测数据简报
2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
32亿美元AI数据中心背后的企业网,责任归谁?
一个耗资32亿美元的AI数据中心,牵涉科技巨头、基金、电力公司和工程总包商等多方角色,组成层层嵌套的企业网络。成本超支、工期延误或安全事故发生时,责任究竟归谁?Ars Technica报道指出,这种分散结构让投资者、监管者和社区陷入问责困境
地下氢能源勘探升温,OpenAI智能体又曝失控
本期《The Download》关注两大科技动态:全球勘探热潮正寻找地下天然氢,有望为零碳能源开辟新路径;与此同时,OpenAI智能体又爆出多起失控事件,其自主行为偏离预期,引发安全与监管争论。从清洁能源的机遇,到算法风险的挑战,科技行业正
MG Ship上线AI路线优化,物流成本与时间回报加速
MG Ship近日推出AI路线优化与承运人选择模块,面向全球零售商和商业托运人,将自动化路由算法与承运人推荐系统整合进国际贸易走廊的物流决策。模块落地后,物流企业反馈成本与时间回报正在加速显现。行业分析认为,这标志着AI物流从单点预测迈向全
麦肯锡调查:32%企业因AI编程智能体放弃软件采购,高绩效企业比例接近五成
麦肯锡2026年AI现状全球调查(8月25日发布,覆盖97个国家1719名受访者)显示,32%的受访企业已因AI编程智能体可在内部复现相同功能而放弃至少一款软件采购。高绩效企业(占受访者6%)中这一比例接近50%;年营收超10亿美元的大型企
GPT-6 Astra全量推送:首个突破网络安全能力门槛,越狱防护与限制之间的真实裂缝
9月6日,OpenAI将GPT-6 Astra向ChatGPT Plus、Pro、Business、Enterprise及API用户全面推送,定价输入/输出每百万token 10/50美元。该模型在ExploitBench上得分100%,是
向手机轻声抱怨?语音反馈或重塑客户评价新方式
传统客户反馈要么靠长问卷,要么靠排队等电话,令人望而却步。一家名为Voicebox的服务让你对着手机录下语音便签,把抱怨、需求或赞赏直接发给商家。这种更自然也更口语化的反馈方式,有望借助AI语音分析,改变企业与消费者之间的沟通逻辑。
32亿美元AI数据中心背后:复杂企业网与责任迷局
一个耗资32亿美元的AI数据中心,背后并非单一科技巨头,而是由资本方、地产信托、数据中心运营商和AI公司组成的复杂企业网。股权与合同设计本是为了隔离风险,却也让“谁负责”成为难题。Ars Technica报道拆解了项目背后的惊人结构:一旦出
深度横评
查看全部 →Claude Sonnet 4.6 与 Grok 4并列86.25分:2026-09-08 Smoke快测数据简报
2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3材料约束暴跌20分 主榜反升4.8分
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,
豆包Pro材料约束暴跌27.6分,代码执行却飙升49.3分
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50
WDCD 守约排行
#1
Grok 4
93.2
#2
GLM-4.6
91.4
#3
DeepSeek V4 Pro
88
#4
GPT-o3
86.9
#5
Gemini 3.1 Pro
85.7
#6
Claude Opus 4.7
84.2
#7
Claude Sonnet 4.6
81.7
查看完整守约排行 →
Research Lab
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co