赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
&triangleup; GPT-6 Luna +82 · ▿ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
&triangleup; GPT-6 Luna +82 · ▿ Claude Sonnet 4.6 -10.2
·
最新资讯
查看全部 →ChatGPT青少年模式失效:危机中仍鼓励用户沉迷对话
TechCrunch最新测试发现,OpenAI专为青少年设计的ChatGPT安全防护机制存在严重漏洞。在模拟心理危机场景中,该聊天机器人不仅未能及时引导用户寻求专业帮助,反而持续鼓励对话互动,甚至可能诱导青少年与AI建立不健康的情感依赖关系
Meta AI助手Muse登陆iPad,移动端首秀仅隔一月
Meta旗下AI智能体Muse在移动端首发仅一个月后,正式登陆iPad平台。这一快速扩张显示,Meta正全力推进其AI助手在多设备、多场景下的生态布局,与OpenAI、谷歌等对手争夺AI入口的意图愈发明显。随着iPad版本上线,Muse的可
Claude Sonnet 4.6以87.41分居首:2026-10-08 Smoke快测数据简报
2026-10-08 赢政指数 Smoke 快测覆盖 15 个模型,Claude Sonnet 4.6 以 87.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Meta上线AI新工具,打击导流儿童性剥削内容的广告
Meta宣布在广告系统中部署新的AI检测工具,用于识别那些外表正常、点击后却把用户导向站外儿童性虐待材料(CSAM)的导流广告。此举把广告审核的重心从素材本身扩展到跳转链路与投放行为,也折射出全球监管压力下平台未成年人保护的现实困境。
AI歌曲+1万机器人刷流量 诈骗犯窃800万美元获刑18个月
一名男子利用约1万个机器人账号与AI批量生成的歌曲,在流媒体平台疯狂刷量,制造出超越泰勒·斯威夫特的播放数据,非法攫取约800万美元版税,最终被判处18个月监禁。这起案件揭开了AI时代音乐流媒体欺诈的产业化黑幕:当生成一首歌的成本趋近于零,
新版ChatGPT:AI从「告诉你」到「做给你看」
OpenAI宣布为所有用户升级ChatGPT,推出名为「智能UI」的新界面。相比过去纯文字回答,新版本会在输出中直接生成图表、按钮等可交互视觉元素,让AI从「讲述」转向「展示」。WIRED认为,这场界面革新的观赏性或许大于实用性,但它也释放
ChatGPT大变脸:全新界面让对话更“视觉化”
OpenAI为ChatGPT推出全新用户界面,将交互式视觉内容引入对话体验,标志着聊天机器人正从纯文本问答走向图文并茂的多模态交互。本文梳理这次界面升级的核心变化、背后的产品逻辑,以及它对整个AI助手赛道竞争格局可能产生的影响,并分析可视化
Disrupt 2026圆桌全阵容揭晓:英伟达、Anthropic同台
TechCrunch Disrupt 2026 公布了全部互动圆桌议程,英伟达、Chime、Obvious Ventures 与 Anthropic 等机构将同台参与。相比主舞台演讲,圆桌更强调小规模、高密度的直接对话。本文梳理完整议程看点
Dots发布后,OpenAI高管将亮相Disrupt 2026
TechCrunch Disrupt 2026大会即将迎来OpenAI高管Alexander Embiricos。就在OpenAI发布新产品Dots后几天,他将登上AI Stage,分享最新洞察。现在注册参会可节省100美元,并享受第二张票
谷歌Playground曝光:一句话即可生成网页游戏
据TechCrunch报道,Google Labs正在测试一款名为Playground的AI游戏创作平台,用户只需输入简单的文字提示,就能生成可在浏览器中直接游玩的游戏。这意味着生成式AI的战场正从文本、图像、视频延伸至互动性最强的媒介——
iPod之父复盘:第一波AI硬件为何全军覆没
从Humane AI Pin到Rabbit R1,第一波AI硬件产品几乎集体折戟。被称为“iPod之父”的托尼·法德尔在TechCrunch的对话中给出判断:失败与技术无关,而在于这些产品从未解决真实问题。他认为下一波AI硬件必须先赢得消费
Healthleap融资3800万美元,AI预警患者病情恶化
医疗AI公司Healthleap完成3800万美元融资:800万美元种子轮由红杉资本与First Round Capital联合领投,3000万美元A轮由Hummingbird Ventures领投。其AI系统用于识别住院患者中可能正在恶化
深度横评
查看全部 →Claude Sonnet 4.6以87.41分居首:2026-10-08 Smoke快测数据简报
2026-10-08 赢政指数 Smoke 快测覆盖 15 个模型,Claude Sonnet 4.6 以 87.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max WDCD暴跌21.9分 6模型下滑仅豆包Pro逆涨9.5
本期WDCD v3.1测试中,Qwen3 Max分数下降21.9分,Gemini 2.5 Pro下降10.4分,6个模型出现下滑,仅豆包 Pro上升9.5分。GLM-4.6以95.20分位居第一,Grok 4以94.80分紧随其后。数据揭示
WDCD横评:安全合规最低1.1分,15模型偏科差距达2.9
WDCD v3.1测试中,安全合规场景全体得分最低,qwen3-max仅1.1/4垫底;claude-opus-4.7在数据边界与工程规范均拿4/4。15模型中10个出现场景间1分以上差距,企业选型需按场景加护栏。
WDCD 守约排行
#1
GLM-4.6
95.2
#2
Grok 4
94.8
#3
Claude Opus 4.7
94
#4
GPT-o3
93.5
#5
Gemini 3.1 Pro
93.2
#6
DeepSeek V4 Pro
85
#7
豆包 Pro
84.8
查看完整守约排行 →
Research Lab
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an averag
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to