赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
&triangleup; Qwen3 Max +12.1 · ▿ Gemini 2.5 Pro -15
·
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
&triangleup; Qwen3 Max +12.1 · ▿ Gemini 2.5 Pro -15
·
最新资讯
查看全部 →灵感来自《独领风骚》:谷歌相册AI虚拟衣橱全平台上线
谷歌相册的AI虚拟衣橱功能正式登陆Android与iOS。该功能可自动从用户照片中识别衣物,去除背景并生成可自由搭配的数字衣柜,灵感来自1995年电影《独领风骚》中的经典换装场景。功能今年6月率先面向Android用户开放,如今完成全平台覆
Meta Muse Charm:像电子宠物,实为Z世代新宠
Meta 推出的 AI 挂饰 Muse Charm 外形酷似风靡上世纪的电子宠物塔麻可吉,但它真正的野心不在怀旧,而在于切入 Z 世代把数码产品当作时尚配饰的潮流。从包挂饰到复古科技回潮,Meta 正试图让 AI 硬件摆脱“工具”标签,变成
无人机曝光62台燃气发电机,新泽西数据中心被罚110万美元
新泽西州一座数据中心因被无人机拍到违规运行62台燃气发电机,遭监管机构处以110万美元罚款。然而,周边居民担忧,对于财力雄厚的亿万富翁投资者而言,百万美元级别的罚款不过是九牛一毛,无法真正遏制数据中心带来的空气污染与健康风险。
PrismML将微型大模型带入高通智能眼镜
PrismML宣布将其微型大语言模型部署到搭载高通芯片的智能眼镜上,让设备端AI无需云端即可运行。此举瞄准智能眼镜算力与续航瓶颈,也契合高通推动终端侧AI的战略。PrismML的更大目标,是打造能在设备本地运行、更高效利用既有算力的开放权重
带上你的合伙人,Disrupt 2026 第二张门票半价
TechCrunch Disrupt 2026 推出限时双人优惠:购买一张同类型门票,第二张立享五折。活动将于 10 月 13 日上午 8 点(太平洋时间)开幕,注册需在此前完成。对于正在寻找投资人、联合创始人或技术伙伴的创业者而言,这是把
我可能找到了一款值得冒险的AI智能体
《连线》记者Zoë Schiffer亲测AI智能体Instinct:它帮她省下550美元、预订餐厅、拦截钓鱼诈骗,却也白白浪费了64美元,并可能是一场安全噩梦。在AI智能体加速落地的2026年,这究竟是一次解放劳动力的革命,还是把家门钥匙交
GPT-5.5以86.25分居首:2026-09-25 Smoke快测数据简报
2026-09-25 赢政指数 Smoke 快测覆盖 10 个模型,GPT-5.5 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
谷歌轨道数据中心10月1日首飞,仅搭载4颗TPU
谷歌Suncatcher项目的首颗实验性轨道数据中心卫星将于10月1日发射,搭载四颗自研TPU。受限于真空散热与供电预算,它每次只能连续运行约15分钟。该项目试图把AI算力送上太空,用近乎无限的太阳能替代地面数据中心的电力与水资源消耗,但在
ElevenLabs CEO访谈:AI语音估值220亿,用户该被告知吗?
AI语音独角兽ElevenLabs估值已达220亿美元,其CEO在专访中表示,企业使用AI语音客服时应告知用户,直到机器对话成为社会常态。本文深度解析ElevenLabs的技术崛起、商业版图扩张,以及AI语音伦理与透明度的行业争议。
TechCrunch创始人峰会2026全攻略:11月4日波士顿见
TechCrunch创始人峰会将于2026年11月4日在波士顿举行为期一整天的线下大会,面向处于各个发展阶段的创业者,帮助他们与顶级风险投资人和资深企业家建立连接,获取关于公司搭建与规模化增长的实战经验。本文梳理了峰会的时间、地点、核心价值
甲骨文对新墨西哥州Stargate数据中心发出不可抗力通知
甲骨文就其位于新墨西哥州的Stargate数据中心发出不可抗力通知,若该设施未能按计划在2028年上线,公司将可据此推迟付款。此举凸显AI基建狂飙背后的工期与电力风险,也让外界重新审视这场由OpenAI、甲骨文与软银共同推动的千亿美元级算力
Ando获2000万美元融资,打造人机协作团队通讯应用挑战Slack
初创公司Ando宣布获得2000万美元pre-seed和种子轮融资,投资方包括Accel、Index Ventures和Emergence。Ando正在开发一款团队通讯应用,允许人类与AI代理在同一平台协作办公,直接挑战Slack在团队协作
深度横评
查看全部 →GPT-5.5以86.25分居首:2026-09-25 Smoke快测数据简报
2026-09-25 赢政指数 Smoke 快测覆盖 10 个模型,GPT-5.5 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7 与 Gemini 3.1 Pro并列84.61分:2026-09-24 Smoke快测数据简报
2026-09-24 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 3.1 Pro 以 84.61 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜
四模型WDCD集体下滑 Gemini 2.5 Pro 暴跌16.7分
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。G
WDCD 守约排行
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
查看完整守约排行 →
Research Lab
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 454 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 toppi