赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
#1
Claude Opus 4.7 82.6
▲3.6
·
#2
DeepSeek V4 Pro 79.3
·
#3
GPT-o3 76.7
▼4.2
·
#4
Grok 4 76.4
▼1.4
·
#5
GPT-5.5 75.9
▼1.2
·
#6
Claude Sonnet 4.6 72.9
▼4.4
·
#7
Qwen3 Max 71.5
·
#8
Gemini 3.1 Pro 70.8
▲1.4
·
#9
Gemini 2.5 Pro 70
▼4
·
#10
GLM-4.6 53.1
▼10.4
·
#11
豆包 Pro 52.2
▼20.1
·
&triangleup; GLM-4.6 +26.4 · ▿ 豆包 Pro -41.7
·
最新资讯
查看全部 →AI攻击已可怕,AI蠕虫病毒更致命
据WIRED报道,中国研究人员展示AI模型能像攻击性、适应性计算机病毒般运作。这一发现意味着未来网络攻击可能由自我复制、不断变异的AI实体发起,给网络安全带来前所未有的挑战。专家警告,需要全新的防御思维来应对这场即将来临的“智能病毒”威胁。
谷歌AI教父杰夫·迪恩离职创业,用AI加速科学发现
据TechCrunch报道,谷歌传奇高管杰夫·迪恩(Jeff Dean)与其他数位顶级AI研究员已正式离开谷歌,联合创办新公司,目标是用人工智能加速科学发现。此举在业界引发巨大关注,也标志着顶尖AI人才从科技巨头向创业领域流动的新高潮。
最危险的AI黑客攻击,仍需人类主导
安全研究员James Kettle通过实验挑战AI的黑客能力,发现尽管AI能高效执行漏洞扫描和攻击生成,但真正致命的攻击仍然需要人类专家在关键环节介入,利用专业知识进行决策和调整。这种“人机协同”模式可能成为未来最危险的网络威胁,也为防御方
Hank Green揭秘:YouTube标签捉不到的AI问题
知名科普创作者Hank Green指出,YouTube的AI内容标签系统只能识别明显的“垃圾内容”,却无法捕捉高保真的AI虚假信息。当AI能生成比真人更可信的说辞,标签反而可能成为误导的掩护。本文分析标签系统的结构性缺陷,并提出平台与观众应
Reddit暗示旧版界面将迎“不祥”变化
Reddit官方近日暗示,将对备受用户喜爱的旧版界面old.reddit.com进行“不祥”的调整,理由是这一简洁高效的平台被用于某些“不良行为”。这一表态引发老用户强烈不安。本文回顾旧版网站的历史价值,剖析官方说辞背后的商业逻辑,并探讨经
Klaviyo迎回Elias Torres,收购Agency强化AI代理
Klaviyo宣布收购Elias Torres创办的AI代理公司Agency,这位连续创业者将出任首席产品官,领导公司AI代理业务。此次收购被视为科技创始人之间的“圆满闭环”,也标志着Klaviyo加速布局电商领域的人工智能应用。业内认为,
Claude Sonnet 4.6 与 DeepSeek V4 Pro并列92.17分:2026-08-06 Smoke快测数据简报
2026-08-06 赢政指数 Smoke 快测覆盖 9 个模型,Claude Sonnet 4.6 与 DeepSeek V4 Pro 以 92.17 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full
Meta广告现AI生成儿童性虐待图像,超50条已投放
据WIRED报道,Meta广告库数据显示,超过50个包含AI生成儿童性虐待图像的广告曾在Facebook、Instagram、Messenger或Threads上投放,部分直至本周仍在运行。这一事件不仅暴露了Meta内容审核机制的严重漏洞,
MIT科技评论谜题专栏:新季挑战与上期揭晓
MIT Technology Review推出2026年9/10月号谜题专栏,由Michael S. Branicky领衔的PC2团队精心策划。本期不仅带来全新智力挑战,更公布5/6月号谜题答案。无论你是数学爱好者还是逻辑谜题迷,都能在此找
AI走进现实:Disrupt 2026机器人、工厂与灭绝动物
TechCrunch Disrupt 2026将推出全新的Real World AI舞台,聚焦人工智能与物理世界的深度融合。从具身智能机器人到自动化工厂,再到利用AI技术复活灭绝动物,大会将展示AI走出数字屏幕后的无限可能。本文带你提前解读
谷歌9月4日关闭手机Assistant,Gemini接管
谷歌宣布将从9月4日起在手机上彻底移除Assistant,所有语音控制功能由Gemini完全接管。未来数周内,用户将无法再调用旧版助手,需迁移至Gemini生态。这一举动标志着谷歌AI战略的全面转向,也意味着生成式AI助手成为主流。然而,A
Hark预览浏览器代理:宣称更快更便宜
AI初创公司Hark近日预览了其浏览器使用代理,该工具能够自动完成网页浏览、表单填写、信息提取等复杂任务。Hark宣称,同一任务下,其代理比现有竞品运行速度更快、成本更低,但尚未公布具体基准数据。随着各大科技巨头纷纷布局AI代理,浏览器已成
深度横评
查看全部 →Claude Sonnet 4.6 与 DeepSeek V4 Pro并列92.17分:2026-08-06 Smoke快测数据简报
2026-08-06 赢政指数 Smoke 快测覆盖 9 个模型,Claude Sonnet 4.6 与 DeepSeek V4 Pro 以 92.17 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full
GPT-o3涨9.5分逆袭,GLM-4.6暴跌14.9,WDCD守约榜5模型洗牌
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
WDCD横评:安全合规场景最低1.8分,工程规范集体4分满分
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
WDCD 守约排行
#1
Grok 4
97.5
#2
GPT-o3
95.2
#3
DeepSeek V4 Pro
91.1
#4
Claude Opus 4.7
86.7
#5
Gemini 3.1 Pro
84.5
#6
GLM-4.6
78.6
#7
Claude Sonnet 4.6
77.4
查看完整守约排行 →
Research Lab
WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average co
3大模型翻译对决:第32周质量评测,deepseek-v4-pro 以 9 分领跑
本周共翻译 423 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi