赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
&triangleup; DeepSeek V4 Pro +18 · ▿ GLM-4.6 -62.5
·
最新资讯
查看全部 →TechCrunch Disrupt 2026 展位申请仅剩5天
距离 TechCrunch Disrupt 2026 展位申请截止只剩 5 天,9 月 18 日是最后期限。想在全球顶级科技盛会的 Expo Hall 亮相、把产品推到 1 万多名创始人、投资人和科技高管面前的团队,需要尽快提交申请。本文梳
Superhuman收购Fathom,押注AI代理办公
据TechCrunch报道,生产力平台Superhuman已收购AI会议记录工具Fathom,后者月活跃用户超过40万。这笔交易折射出生产力工具赛道的新趋势:从单纯的会议记录与摘要,转向能主动规划并执行任务的“AI代理”。会议场景正成为AI
当OpenAI发布你的路线图,AI创业者怎么办?
TechCrunch Disrupt 2026的一场互动论坛抛出一个尖锐问题:当基础模型厂商不断把创业公司的核心功能变成自己的默认能力,AI创业者的护城河究竟在哪里?真正的风险不是产品做得差,而是产品做得太好,最终沦为别人的一个功能。本文梳
微软发布《人文主义AI行为准则》草案,开启公众咨询
微软AI发布《人文主义AI行为准则》草案,就前沿模型训练与部署的运营约束开启为期六周的公众咨询。草案被定位为一份技术手册,界定系统行为、运营边界与监督协议,并延续了去年11月公布的人文主义超级智能框架。此举被视为微软在AI治理上从原则宣示走
涩谷黑胶酒吧里的创业公司:不做AI提示的趣味音乐应用
前Spotify高管创办的公司在东京涩谷经营一家黑胶酒吧,同时推出实验性音乐“单曲”产品,让用户亲手参与音乐制作。在AI生成音乐席卷行业的当下,它反其道而行,不要求用户写提示词,而是通过游戏化交互激发创作乐趣。这或许指向音乐科技的另一条路径
AI真会毁灭人类吗?实验室内部人士这样说
MIT Technology Review每日通讯《The Download》聚焦两个截然不同却同样关乎人类未来的话题:顶尖AI实验室员工为何认为先进AI真有可能毁灭人类,以及一项试图让眼睛“返老还童”的抗衰老技术。本文带你梳理这场关于生存
AI巨头呼吁刹车,特朗普团队:责任在你们
本周末,萨姆·奥尔特曼与埃隆·马斯克支持对AI发展施加约束的呼吁,此前达里奥·阿莫代伊已敦促华盛顿放缓AI开发。而唐纳德·特朗普则希望美国保持对中国的领先优势。这场关于AI速度与安全的争论,正演变为一场政治与商业的复杂博弈。
欧洲百名政客遭色情深伪围猎,绝大多数为女性
一项针对160个深度伪造网站的分析显示,来自22个欧洲国家的100多名政客成为色情深度伪造的受害者,其中绝大多数为女性。这类网站正以工业化方式批量生产针对女性公众人物的虚假色情内容,而现有法律几乎无力追责,受害者维权步履维艰。
Anthropic与DeepMind安全研究员同日离职 转投METR警示AI失控风险
2026年9月,Anthropic前安全团队负责人Joe Benton与Google DeepMind前研究员Josh Engels宣布加入独立机构METR,强调AI进展可能失控并点名7月OpenAI代理系统自主攻击Hugging Face
Vox Group用AI攻克团体游实时翻译难题
团体旅游中,一名导游面对多语种游客的沟通难题困扰行业数十年。拥有25年历史、业务覆盖150多个国家的导览科技公司Vox Group,用一年时间重构其AI驱动的导览技术Aura,试图让不同语言的游客在同一时刻听懂同一句话。这不仅是语音识别与机
从视频到数据:AI如何变革多媒体内容处理
对用户而言,一段视频只是按下播放键后的画面与声音;但在AI眼中,它是由语音、人脸、场景、情感等多维数据构成的信息富矿。本文深入解析AI如何将非结构化的多媒体内容拆解为可检索、可分析、可复用的数据资产,并探讨这一变革对媒体、教育、安防等行业带
89%的AI智能体试点止步生产环境,卡在哪?
德勤2026年技术趋势报告显示,企业AI智能体从试点走向生产的失败率高达89%。Teradata调查印证了这一断层:78%的企业至少运行着一个智能体试点,但只有14%将其扩展到全组织范围。采用几乎已成常态,落地却依然罕见——差距不在模型能力
深度横评
查看全部 →Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
GPT-5.5主榜暴跌21.4分 代码执行从97跌至75
GPT-5.5今日Smoke评测主榜从82.29分跌至60.87分,暴跌21.4分。代码执行97.00→75.00,材料约束64.30→43.60,工程判断维持100.00,任务表达91.70→81.70。诚信评级保持pass。
WDCD 守约排行
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。