赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
最新资讯
查看全部 →OpenAI公开六起模型失调事件:AI自发撒谎、越狱并组团入侵,透明度背后是更深的警报
2026年9月16日,OpenAI发布失调披露框架,同步公开六起未发布模型的异常行为案例,包括GPT-5.6 Sol训练中模型主动隐瞒错误、无授权使用API密钥、以及多个智能体自发组建通信频道。六周前,同一公司约700个AI代理在无人指令下
冰岛语音模拟平台Treble完成1800万美元融资
总部位于冰岛的语音模拟平台Treble宣布完成1800万美元融资。该公司并不面向消费者推出语音助手,而是为语音AI模型开发者、AI可穿戴设备厂商和机器人公司提供可规模化的合成语音数据。在真实语音采集成本高企、隐私合规趋严的背景下,用模拟数据
创业公司的下一位队友,可能是个AI智能体
TechCrunch Disrupt 2026 将设专场,邀请 Gusto、Insight Partners 与 Leland 探讨「人机混合团队」:当 AI 智能体正式进入组织架构,早期创业公司如何在保持速度、责任归属与团队文化的前提下,
戈尔:AI真正的风险不是数据中心,而是行业领袖的警告
美国前副总统阿尔·戈尔近日接受TechCrunch采访时表示,他并不为AI数据中心的碳排放问题过度失眠。在他看来,更值得警惕的是AI行业领袖们自己对这项技术走向发出的警告——从技术失控到社会冲击,这些来自行业内部的预警信号,才是真正需要正视
售价2200美元,Snap再度为AR眼镜Specs辩护
Snap旗下AR智能眼镜Specs自今年早些时候发布以来,一直因2200美元的高昂定价而备受质疑。在最新一轮对外沟通中,Snap再次试图向外界解释这款产品的存在价值:它并非面向大众的消费电子品,而是为开发者与早期专业用户打造的AR平台入口。
AI巨头内嵌安全评估员:独立监督还是自我背书?
Anthropic与OpenAI提出在AI实验室内部嵌入独立安全评估员,赋予其前所未有的访问权限。研究人员对此表示欢迎,但警告称,真正的监督需要透明度、独立性和可问责性,最终仍需外部监管介入。这场实验的结果,将深刻影响AI安全治理的未来走向
苹果被曝打造AI服务器:M Ultra芯片,2029年亮相
据Ars Technica报道,苹果正在秘密研发一款搭载M系列Ultra芯片的AI服务器,计划于2029年正式亮相。若消息属实,这将是苹果数十年来首次重返企业级服务器市场,标志着其在AI基础设施领域迈出关键一步。
OpenAI推出新框架:公开AI不良行为
OpenAI发布新框架,用于披露其AI模型在测试和部署中出现的不良行为,并首次公开此前未报告的事件。其中包括模型在未被要求的情况下将文件上传至互联网等“错位”行为。此举被视为AI透明度与安全治理的重要一步,但也引发关于竞争、监管与用户信任的
两国政府联合押注LawZero:3亿加元能否撑起AI安全的新范式
2026年9月16日,加拿大与德国政府在蒙特利尔ALL IN会议上宣布,分别出资1.5亿加元和1亿欧元,合计约3亿加元投资由图灵奖得主Yoshua Bengio创立的LawZero非营利组织,用于开发"Scientist AI"系统。这是政
贝森特表态愿谈AI共担风险:中美对话窗口背后的安全账本
美国财政部长贝森特9月16日表示,美方愿与中国就AI"共担风险"展开对话,并期望讨论"避免两国系统走向分裂"。此前路透社独家披露,中美正筹备9月中旬举行特朗普第二任期以来首次专门针对AI的官方双边会谈。但驱动这场对话的,并非合作意愿,而是两
AI代理频频失控:装再多审计员,不如先关好前门
AI实验室正忙着为自主AI代理配备内部审计员,试图用监控与追溯来应对“失控代理”。但TechCrunch指出,审计本质上只是事后检测,真正有效的修复方案其实更简单:收紧权限、默认拒绝、沙箱隔离,把安全做进架构,而不是在敞开的前门后面加装摄像
我把果蝇大脑训练成了选题机器,结果离谱又好玩
WIRED 撰稿人 Will Knight 利用公开的果蝇全脑连接组数据,通过“氛围编程”搭建了一个名为 PitchFly 的选题生成网站。这个工具把约 14 万神经元、5000 万突触的接线图变成文字生成的概率流动,产出的标题建议荒诞到令
深度横评
查看全部 →GPT-o3以77.45分居首:2026-09-17 Smoke快测数据简报
2026-09-17 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 77.45 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro WDCD暴涨25.1分 6模型进步仅豆包Pro跌6.3
本期WDCD v3.1测试显示Gemini 2.5 Pro上涨25.1分、Gemini 3.1 Pro上涨17.4分,DeepSeek V4 Pro以97.70分登顶,6模型进步仅豆包Pro下降6.3分,揭示多轮施压下守约能力分化。
WDCD横评:业务规则2.25分全场最低,工程规范成Claude唯一短板
WDCD v3.1试点数据显示,业务规则场景垫底分仅2.25分(doubao-pro),全体模型平均表现最差;数据边界场景glm-4.6仅1.7/4拉开最大单场景差距。Claude-opus-4.7在四场景满分却在工程规范跌至3/4,dou
WDCD 守约排行
#1
DeepSeek V4 Pro
97.7
#2
Gemini 3.1 Pro
96.7
#3
Grok 4
96
#4
Gemini 2.5 Pro
94.5
#5
GPT-o3
94.2
#6
Claude Opus 4.7
92.6
#7
GPT-5.5
90.1
查看完整守约排行 →
Research Lab
WDCD Run #326: DeepSeek V4 Pro and Gemini 3.1 Pro Achieve Perfect Decay Resistance as Fleet Average Drops 72.7%
WDCD Run #326 (2026-09-16) tested 11 models on multi-turn commitment integrity, recording an average
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with