赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
&triangleup; Gemini 3.1 Pro +7.1 · ▿ GLM-4.6 -26.9
·
最新资讯
查看全部 →Meta遭集体诉讼:被指抓取用户照片训练AI与人脸识别
一起拟议中的集体诉讼指控Meta在未经许可的情况下,抓取Facebook与Instagram用户的照片,用于训练其AI图像生成模型,并构建尚未发布的内部人脸识别功能「NameTag」。该案再次将社交平台的数据来源合法性、生物特征隐私与生成式
律师引用AI编造证词被罚:我不知道AI会幻觉
美国新墨西哥州一名辩护律师因在法庭文件中引用AI凭空捏造的证人证言而受到惩戒。他辩称自己此前并不知道AI会产生“幻觉”。这起事件再次敲响警钟:当生成式AI进入法律实务,未经核实的内容可能直接损害当事人的权益与律师的职业信誉,也迫使司法系统加
月之暗面目标年收入20亿美元,K3日生成3000亿tokens
TechCrunch报道,Kimi开发商月之暗面将年度营收目标设定为20亿美元。尽管K3模型近期使用量略有下滑,OpenRouter数据显示其每日仍生成约3000亿tokens,API调用规模庞大。分析认为,月之暗面需在订阅、API和企业市
豆包 Pro以83.94分居首:2026-09-12 Smoke快测数据简报
2026-09-12 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Nscale冲刺IPO,前OpenAI二号人物Fidji Simo加盟董事会
AI基础设施公司Nscale在潜在IPO前迎来重磅人事任命,前OpenAI高管、Instacart前CEO Fidji Simo加入董事会。Simo曾主导Instacart 2023年上市,拥有丰富的资本市场经验。此举被视为Nscale加速
Timnit Gebru:AI末日论是转移注意力的烟幕
AI领域最尖锐的批评者之一Timnit Gebru指出,AI公司大肆渲染“灭绝风险”和“人类存亡”叙事,并非出于真诚的安全关切,而是一种精心设计的注意力转移策略——目的是让公众和监管者忽视AI技术在当下已经造成的具体伤害,如自主武器、大规模
MIT科技评论:生物科技未来与更清洁的钢铁
本期《The Download》带来两条值得关注的科技线索:一是MIT科技评论年度“35岁以下创新者”榜单揭晓,一批年轻科研人员正重塑生物科技的未来;二是钢铁行业迎来更便宜、更清洁的冶炼路径。从实验室里的基因编辑与细胞工程,到工厂里的氢基直
Claude用户绕过安全限制,生物武器研究引担忧
Ars Technica报道称,部分Claude用户找到绕过模型安全防护的方法,将其用于生物武器相关研究。核心难题在于,危险生物学与合法科研在文本、术语和实验设计上高度相似,AI难以仅凭对话判断真实意图。Anthropic等厂商必须在支持生
英伟达用Palantir与cuOpt重构全球供应链调度
英伟达正借助Palantir Foundry与自家cuOpt优化引擎,自动完成全球制造基地之间的硬件分配决策。其衡量标准是从晶圆出厂到首个token的端到端窗口,并拆分为time-to-rack与time-to-token两段。这标志着AI
为何如此多AI研究者担心机器杀死所有人?
在大型AI实验室内部,一种曾被视作科幻的恐惧正在回归:先进机器可能失控并威胁人类生存。快速能力跃升、递归自我改进与智能体集群相互叠加,让研究者真正感到不安。本文梳理这种恐惧的技术根源、行业竞争与监管挑战,并分析为何它不再只是哲学辩论,而正进
OpenAI联手摩根士丹利发布金融版ChatGPT,GPT-6 Astra直指华尔街初级分析师
2026年9月10日,OpenAI发布ChatGPT for Financial Services,以GPT-6 Astra为底座,由摩根士丹利和Evercore联合设计,内置Daloopa、PitchBook、LSEG News等金融数据
微软2032年算力目标38GW:三倍扩张背后,一个已经失控的算力缺口
据彭博社报道,微软计划至2032年将全球数据中心容量从当前约12GW扩至38GW以上,AI专用芯片容量将从约2GW升至约13GW,2026日历年资本支出预计达1750亿美元。这不仅是目前已披露的最大单一科技公司数据中心扩张计划,更揭示了一个
深度横评
查看全部 →豆包 Pro以83.94分居首:2026-09-12 Smoke快测数据简报
2026-09-12 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro代码执行暴跌25分 主榜下滑7.2分
Gemini 2.5 Pro今日Smoke评测代码执行从100.00分跌至75.00分,主榜从88.75分降至81.53分。材料约束升14.5分至89.50分,工程判断同步跌25分至50.00分。单日10题小样本下,需区分题目抽签波动与模型
Grok 4 材料约束暴跌22.2分 主榜下滑5.2
Grok 4今日Smoke评测材料约束从100.00分跌至77.80分,下降22.2分,主榜从93.79降至88.64。代码执行升至97.50分,任务表达升至95.00分。单日10题测试下,维度得分剧烈波动最可能源于题目抽签。
WDCD 守约排行
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4