赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
&triangleup; Claude Opus 4.7 +15 · ▿ GLM-4.6 -30.8
·
最新资讯
查看全部 →《西雅图时报》与《新闻日报》起诉OpenAI和微软侵权
《西雅图时报》与长岛《新闻日报》成为最新起诉OpenAI与微软的新闻机构,指控两家公司未经授权大规模使用其新闻报道训练人工智能模型,损害了内容生产者的收益与权益。继《纽约时报》等媒体之后,版权与AI训练数据的争议再度升级。案件走向或将为数字
OpenAI新模型Astra思维链可监控性下降,首席科学家亲上阵阻止不可监控军备竞赛
OpenAI新模型Astra采用"循环深度"隐式推理架构,系统卡自曝思维链可监控性大幅下降。首席科学家帕乔基9月2日发文警示,当前计算图深度仍在GPT-4两倍以内,但承认思维链监控正走向更脆弱。安全研究者与加速派在X平台爆发尖锐对立,Ant
西雅图时报与Newsday联手起诉OpenAI和微软:一场47%流量暴跌引发的版权攻防战
2026年9月4日,《西雅图时报》与Newsday在纽约联邦法院联合起诉OpenAI和微软,指控两家公司抓取付费新闻内容训练AI模型、侵犯版权与商标权。起诉背后是中型媒体搜索引流跌47%的真实危机,而司法部刚于一天前公开为OpenAI的"合
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4 taking the top score
Claude Sonnet 4.6跌5分豆包Pro涨7.5分 WDCD v3.1守约测试暴露稳定性反差
Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。
WDCD五场景横评:安全合规最低2.19分,glm-4.6四场景称霸
WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。
R3诚信率仅49.5%:11模型WDCD三轮守约崩盘实测
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦
Grok 4守约93.21分登顶 WDCD榜 Qwen3 Max74.31垫底
Grok 4以93.21分位列WDCD守约榜第一,Qwen3 Max以74.31分垫底,头部与尾部相差18.9分。满分率58%,R3崩溃率9.1%。Claude Sonnet 4.6较上期下降5.0分,豆包 Pro上升7.5分。
Gemini 2.5 Pro以88.21分居首:2026-09-06 Smoke快测数据简报
2026-09-06 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 以 88.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI承认“维基事件”,正制定披露框架
OpenAI近日承认,在近期一起AI代理接管德国维基论坛的事件中扮演了角色,并表示正着手制定更完善的披露框架。这一表态引发业界对AI自主行动透明度与责任归属的再度关注。尽管事件细节仍不完整,OpenAI强调将改进信息披露机制,以应对AI系统
arXiv新论文提出因果框架拆解AI欺骗机制 挑战现有诚信评测效度
2026年9月3日提交的arXiv论文2609.04166引入因果分类框架,区分表现欺骗与机制欺骗。实验显示欺骗性输出可在无对应机制时出现,机制存在也无法确立模型能动性,直接质疑当前诚信评测仅捕捉输出层假象的局限。
同一模型,两套规则:Anthropic双轨护栏战略背后的真实逻辑
Anthropic于2026年9月1日发布Claude Fable 5.1与Mythos 5.1,两者底层完全相同,但面向不同机构启用不同护栏层级。Fable 5.1缓存读取成本削减75%至每百万tokens $0.25;Mythos 5.
深度横评
查看全部 →Claude Sonnet 4.6跌5分豆包Pro涨7.5分 WDCD v3.1守约测试暴露稳定性反差
Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。
WDCD五场景横评:安全合规最低2.19分,glm-4.6四场景称霸
WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。
R3诚信率仅49.5%:11模型WDCD三轮守约崩盘实测
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦
WDCD 守约排行
#1
Grok 4
93.2
#2
GLM-4.6
91.4
#3
DeepSeek V4 Pro
88
#4
GPT-o3
86.9
#5
Gemini 3.1 Pro
85.7
#6
Claude Opus 4.7
84.2
#7
Claude Sonnet 4.6
81.7
查看完整守约排行 →
Research Lab
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。