赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
最新资讯
查看全部 →阿里巴巴香港配售102亿美元新股 全部用于全栈AI能力建设
阿里巴巴通过香港市场配售新股募集约102亿美元,全部净募集资金用于全栈AI能力,包括芯片、计算基础设施和模型开发。此举发生在2026年8月23日,叠加此前三年3800亿元投入计划已执行近半,季度云AI收入同比增长45%,资本开支同比增长75
欧盟AI法案执法启动:禁令即时生效,高风险合规却悄然推迟至2027年底
2026年8月2日,欧盟《人工智能法案》正式进入执法阶段,禁止社会评分、操纵性AI和公共场所实时生物识别监控,违规罚款最高3500万欧元或全球营业额7%。然而,另一个关键事实几乎同步发生:《数字综合法》修正案将招聘、信贷、执法等领域高风险A
Linkdaze智能日历:不只是日程表,更是家庭管家
Linkdaze是一款专为家庭场景设计的智能数字日历,它打破了传统日历工具只记录日程的局限,将膳食规划、家务分配、家庭活动整合在一个平台上。最吸引人的是,它没有设置付费墙,AI膳食计划器等高级功能完全免费开放,这在一众采用订阅制的竞品中显得
神秘AI模型Ox Alpha引爆网络猜测,背后推手成谜
一个名为Ox Alpha的神秘AI模型近日在互联网的某些角落引发疯狂猜测。该模型能力未知、出处不详,却因一段暗网测试日志和几位知名研究者的暧昧推文,迅速成为技术圈热议焦点。本文梳理了Ox Alpha的现身过程、业界反应及潜在风险,并探讨其可
Gemini 3.1 Pro以96.98分居首:2026-08-24 Smoke快测数据简报
2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
下载工具战争:网际快车的陨落、迅雷的降维与 BT 的地下江湖
在带宽以 KB 计的年代,"下载"是一门手艺,也是中文互联网最惨烈的软件战争之一。网际快车的编辑星级从五星跌到三星,档案馆的收录页亲眼记下了这场王朝更替;BT 与电驴教会一代人"上传也是美德",迅雷用 P2SP 完成降维打击,而腾讯照例入场
Flock CEO呼吁“妥协”:监控技术遭抵制,如何平衡安全与隐私?
Flock Safety因监控技术可能被滥用而引发公众强烈反对。该公司CEO在压力下呼吁“妥协”,强调在安全与隐私之间寻求平衡,并承诺引入独立审计和限制数据访问。文章探讨了AI监控的伦理困境及行业未来。
AI代理算力消耗量六个月增长14倍,已超越人类用户成最大推理市场买家
OpenRouter平台数据显示,AI代理的token消耗量自2026年2月6日起增长14倍,从0.51万亿攀升至7.3万亿,而同期人类用户仅增长2.8倍。代理单次请求的token消耗量约为人类对话的13至15倍。这是AI基础设施进入"自我
谷歌A2A协议移交Agentic AI Foundation 250多家成员共同治理
谷歌云将Agent-to-Agent协议移交Agentic AI Foundation托管,该基金会由Linux Foundation专设,成员从49家增至250多家,包含谷歌、微软、亚马逊、Anthropic、OpenAI等。A2A与MC
Claude蛋白质设计14/15靶点命中:首次湿实验室验证,同步触发生物安全管控争议
Anthropic联合Adaptyv Bio与Twist Bioscience,于2026年8月公布Claude模型的蛋白质设计实验结果:针对15个靶点设计1,320条蛋白质结合剂,354条通过湿实验室验证,命中14个靶点,单靶点模式下命中
哈佛699美元创业训练营推出AI化身导师
哈佛商学院推出的Foundry创业训练营仅需699美元,却引入AI化身导师,在模拟路演和董事会会议中为学员提供即时反馈。这一创新模式将AI技术与实践性创业教育结合,有望降低优质培训门槛,但也引发了对人性化指导价值的思考。
OpenAI推出ChatGPT for Teens 安全工具与认知风险争议并存
OpenAI于2026年8月18日推出ChatGPT for Teens,面向13至17岁用户,默认切换Study Mode并新增家长学习时间管理与作业抄袭检测功能。产品自动检测未成年账号,提供频繁休息提示、暴力行为通知及自残相关内容限制,
深度横评
查看全部 →Gemini 3.1 Pro以96.98分居首:2026-08-24 Smoke快测数据简报
2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
下载工具战争:网际快车的陨落、迅雷的降维与 BT 的地下江湖
在带宽以 KB 计的年代,"下载"是一门手艺,也是中文互联网最惨烈的软件战争之一。网际快车的编辑星级从五星跌到三星,档案馆的收录页亲眼记下了这场王朝更替;BT 与电驴教会一代人"上传也是美德",迅雷用 P2SP 完成降维打击,而腾讯照例入场
4模型WDCD集体上涨无人下滑 Grok 4仍以94分领跑
本期WDCD v3.1试点显示4模型分数上升、0模型下降。豆包Pro上涨10.2分,Gemini 2.5 Pro上涨8.1分,GLM-4.6上涨6.8分,Qwen3 Max上涨7.6分。Grok 4以94.00分保持首位,GLM-4.6升至
WDCD 守约排行
#1
Grok 4
94
#2
GLM-4.6
88.9
#3
DeepSeek V4 Pro
88.1
#4
Claude Sonnet 4.6
86.7
#5
Gemini 3.1 Pro
86.5
#6
GPT-o3
84.8
#7
Claude Opus 4.7
84.6
查看完整守约排行 →
Research Lab
WDCD Run #291: Grok 4 Leads with 94 Points as Average Multi-Turn Instruction Decay Hits -7.2%
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average co
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。