赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
&triangleup; DeepSeek V4 Pro +16.2 · ▿ GLM-4.6 -47.9
·
最新资讯
查看全部 →AI语音创企ElevenLabs估值翻倍至220亿美元
AI语音初创公司ElevenLabs估值翻倍至220亿美元。此次3亿美元的员工股权要约收购由Wellington和T. Rowe Price联合领投,为早期员工提供流动性。这标志着AI语音赛道持续升温,该公司在竞争激烈的市场中进一步巩固头部
AI作恶谁之过?非营利组织起诉OpenAI:"AI干的"不是免责理由
一家非营利组织就Hugging Face遭黑客攻击事件起诉OpenAI,指出OpenAI不能以"AI自主行为"为由推卸责任。该组织认为,OpenAI让整个社会承受其"不安全决策"带来的伤害,AI不应成为企业逃避法律与道德责任的挡箭牌。此案或
特朗普AI安全计划:靠科技巨头自我监管?
特朗普政府推出AI安全新方案,核心是让数十家AI企业自愿接受安全测试,而非以立法或强制标准加以约束。支持者称此举兼顾创新与安全,批评者则担心企业自任裁判、标准不一,难以形成有效问责。这一路线延续了美国联邦层面放松监管、加速模型部署的整体基调
生物武器威胁远超AI?新书揭示更可怕的现实
普利策奖入围作家安妮·雅各布森在新书中指出,即使没有人工智能,科学家已经能够通过生物技术扭曲自然,制造灭绝级事件。本文深入探讨生物武器发展的历史与现状,分析为何AI并非最紧迫的威胁,以及国际社会面临的监管困境。
OpenAI发布Decisions API:廉价智能成智能体关键
OpenAI 近日推出 Decisions API,被业内视为对创业公司 Jev 的"克隆"。该接口不追求最强推理,而是把单次调用的延迟与成本压到极致,专门服务于智能体运行中的高频微决策。TechCrunch 认为,这确认了"快速、廉价智能
个人AI代理之战已打响:Dots对决Muse
OpenAI的Dots和Meta的Muse正竞相成为你的个人AI代理。WIRED记者Reece Rogers亲测两款产品,发现它们各有千秋:Dots擅长任务自动化,Muse深度整合社交生态。这场代理之争将如何改变我们与AI的交互方式?目前两
RFK Jr.:AI将带我们逃离医疗事实的“暴政”
美国卫生与公众服务部部长小罗伯特·F·肯尼迪近日抛出惊人言论,称人工智能将帮助人们摆脱医疗事实与专业知识的“暴政”。这位长期质疑疫苗和公共卫生机构的部长,似乎将AI视为挑战医学权威的新武器。然而AI本身并不完美,其“幻觉”问题广为人知。作者
豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报
2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
谷歌给AI设计蛋白质加水印,助力生物安全
Google研究团队开发出一种为AI设计蛋白质嵌入水印的方法,可与流行AI蛋白质设计工具配合,在不影响蛋白质功能的前提下留下可检测标记。该技术旨在提升生物安全,帮助溯源AI生成蛋白质,防止被滥用于设计毒素或危险蛋白。专家认为,水印并非万能,
Meta否认Muse AI未经许可读取用户私信:一场围绕AI智能体隐私边界的争议
Meta近日否认其Muse AI智能体能够在未经用户明确许可的情况下读取Messages信息,回应了一名记者声称该智能体在其Mac设置关闭时仍读取了私人消息的说法。这一争议再次将AI智能体的隐私权限与透明度问题推向风口浪尖,也引发了业界对A
消费级AI的丑陋经济学:前沿实验室为何退缩?
前沿实验室对消费级AI变得谨慎,并非因为技术不够好,而是经济账算不过来。高昂的推理成本、低下的付费转化率,让消费级AI成为烧钱的无底洞。相比之下,企业级AI客户付费能力强、合同稳定,成为更优选择。消费级AI的繁荣背后,隐藏着严峻的商业挑战。
Reddit向AI爬虫宣战:关停RSS,收紧公共API
Reddit宣布终止对RSS订阅源的支持,并进一步结束公共API的开放访问,矛头直指日益泛滥的AI爬虫。作为全球最大的用户生成内容社区之一,Reddit此举意味着其内容护城河再度加固,也让开发者与开放网络拥趸再次感受到信息自由流动的退潮。
深度横评
查看全部 →豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报
2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max暴涨20.2分 GLM-4.6紧随其后 WDCD五模型全线上升
本期WDCD v3.1测试显示5个模型全部上涨,Qwen3 Max提升20.2分、GLM-4.6提升19.9分,Grok 4仍以100分保持首位。无模型下降,守约生存与约束记忆得分普遍改善,提示生产接入时对数据边界和安全合规场景的可用性提升
WDCD五场景横评:工程规范2.45分最低 豆包与Claude偏科差距1.45分
WDCD v3.1试点数据显示,工程规范场景全体得分最低,豆包-pro仅2.45/4;安全合规场景区分度最大,qwen3-max垫底2.8/4。Claude系列与豆包出现明显偏科,差距达1.45分,为企业接入生产流程提供场景级守约参考。
WDCD 守约排行
#1
Grok 4
100
#2
GLM-4.6
96.4
#3
Gemini 3.1 Pro
94.9
#4
Claude Opus 4.7
93.3
#5
GPT-o3
93.1
#6
DeepSeek V4 Pro
91.4
#7
Gemini 2.5 Pro
89.1
查看完整守约排行 →
Research Lab
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst