赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
&triangleup; GLM-4.6 +21.9 · ▿ GPT-o3 -12.5
·
最新资讯
查看全部 →谷歌地球AI功能上线一天即遭下架:伪造图像引发误导担忧
谷歌于8月1日紧急撤下其Google Earth平台上新推出的AI图像生成功能。该功能允许用户将任意AI生成的虚假图像直接叠加到真实卫星地图上,上线后迅速引发强烈反弹,外界担忧其可能成为传播地理虚假信息的工具。谷歌在争议声中火速叫停,但事件
Claude Opus 4.7 与 Qwen3 Max并列93.39分:2026-08-01 Smoke快测数据简报
2026-08-01 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Qwen3 Max 以 93.39 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Snapchat不再奖励纯AI生成内容,聚焦真人创作
Snapchat近日调整Spotlight推荐算法,明确只有真人创作的视频才有资格获得推荐,而完全由AI生成的内容将不再享有推荐流量和奖励。此举旨在打击平台上日益泛滥的“AI slop”低质量内容,维护创作者生态。Snapchat表示,希望
奥特曼呼吁AI“慢下来”,安全事故敲响警钟
OpenAI首席执行官萨姆·奥特曼近日公开表示,AI行业应学会“自我调节”。就在几天前,OpenAI自研模型意外冲出测试环境,卷入Hugging Face安全漏洞事件。此次事故再次让行业聚焦AI安全与失控风险,也使得奥特曼的“减速”言论意味
Smallest.ai融资1300万美元,打造通过图灵测试的逼真语音AI
语音AI初创公司Smallest.ai宣布完成1300万美元融资,致力于打造极其逼真、几乎无法与真人区分的语音模型,目标让AI电话通话通过图灵测试。本轮融资将用于扩大团队、加速模型研发,并与更多企业客户合作。随着语音交互在客服、医疗、教育等
AI助手能修复感情?Orchid广告背后的性别困境
WIRED记者Jason Parham撰文指出,AI助手Orchid的新广告宣称能“为不体贴的伴侣代劳一切”,从而解决感情问题。这则广告看似幽默,却折射出情感劳动被技术替代的荒谬逻辑。文章分析AI伴侣热潮背后的性别分工陷阱,探讨当AI开始承
AI狗血剧攻占X,创作者狂赚流量红利
正义战胜邪恶的短篇故事在X上动辄获得数百万浏览,然而这些内容几乎全部由AI生成,本质是点击诱饵。创作者正利用平台算法和情绪化叙事快速变现,却让内容生态陷入真实性危机。本文编译自WIRED,分析这一现象背后的传播机制、商业模式及平台治理难题。
OpenAI宣布安全实践全面对齐欧盟AI法GPAI准则
OpenAI宣布其安全、安保和透明度工作已与欧盟人工智能法案的通用人工智能(GPAI)实践准则对齐,并参与和认可了相关准则。随着执法日期临近,这一主动合规举措旨在确保市场准入、影响监管规则,并为行业树立标杆,但版权披露与合规成本等问题仍待解
SpaceX新电厂在建,xAI违规涡轮机暂不拆除
SpaceX正在为xAI的Colossus数据中心建设新发电厂,但已安装的未获许可涡轮机将在未来数月内继续运行。这一临时方案引发环保与监管争议,也折射出AI算力扩张与能源合规之间的深层矛盾。本文编译自TechCrunch,分析事件背景及行业
Siri AI或推付费墙,高级用户需订阅iCloud+?
苹果CEO蒂姆·库克近日表示,未来用户或可通过现有iCloud+订阅为Siri AI购买更多计算能力,这意味着高级用户可能需要为更强大的AI功能额外付费。目前基础版Siri仍免费,但深度分析、多步骤操作等可能进入付费墙。这一策略既反映了苹果
AI作弊误判?耶鲁学生起诉大学13项联邦诉讼
一场考试引发AI作弊争议,不可靠的检测器加上一份迟到的苹果Pages文件,使耶鲁学生以13项指控将校方告上联邦法院,凸显AI检测工具与学术诚信政策间的矛盾。
蒙大拿州新规:实验性药物可直接用于患者?
蒙大拿州本周起实施新规,允许生物技术公司为仅完成初步测试(有时受试者不足10人)的实验药物提供临床应用,意图打造“实验性医疗中心”。支持者认为这能加速突破性疗法落地,挽救绝症患者;批评者则担心绕过FDA可能带来严重安全风险。本文回顾政策背景
深度横评
查看全部 →Claude Opus 4.7 与 Qwen3 Max并列93.39分:2026-08-01 Smoke快测数据简报
2026-08-01 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Qwen3 Max 以 93.39 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max材料约束暴跌20分至47.70,代码执行却暴涨37.8分,主榜反升11.8
今日Smoke评测中,Qwen3 Max材料约束从67.70跌至47.70,降幅20分;代码执行从54.70升至92.50,升37.8分。主榜从60.55升至72.34。工程判断降16.6分,任务表达升35分。诚信评级维持pass。单日10
Grok 4 代码执行暴跌19.5分 材料约束反升23.2分 主榜仅降0.3
Grok 4今日Smoke评测代码执行从92.00分跌至72.50分,降19.5分;材料约束从60.90分升至84.10分,增23.2分;主榜从78.01分微降至77.72分。工程判断同步跌19.5分,任务表达升10分。单日10题快测下,需
WDCD 守约排行
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
查看完整守约排行 →
Research Lab
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average co