赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
最新资讯
查看全部 →CISA紧急令要求三天内修补Ray漏洞:僵尸网络在CVE公开前两天已完成武器化
美国CISA于2026年8月17日将Ray分布式计算框架漏洞CVE-2025-62593(CVSS 9.4)列入已知在野利用目录,要求联邦机构在三天内(8月20日前)完成修补。该漏洞允许攻击者通过DNS重绑定绕过身份验证,远程执行任意代码。
Meta AI眼镜引发隐私恐慌,检测应用并非万能
Zuckoff是一款用于检测Meta智能眼镜的免费应用,旨在通过识别红外LED闪烁来警示用户是否被偷拍。但据Ars Technica的测试,受强光、遮挡和待机状态干扰,该应用误报频出且仅支持特定型号。随着Meta眼镜功能不断升级,隐私保护依
AI编程工具推高JavaScript人气?TypeScript登顶背后的逻辑
据AI News报道,2025年8月TypeScript超越所有语言成为GitHub最常用语言,这是该平台十年来最大的一次语言排名变动,且恰逢AI编程代理采用率飙升之际。此前曾有预测称AI工具会降低语言选择的重要性,但现实恰恰相反。本文将剖
太空反射镜计划恐成新光污染源,夜空暗夜或遭侵蚀
一项新研究警告,美国Reflect Orbital公司计划从太空向地球反射阳光,可能无意中让大范围地区的夜空变亮,影响远超预期。该公司的测试卫星Eärendil-1预计今年晚些时候发射,将在轨道上展开18×18米镜子。天文学家呼吁在技术试验
AI设计新药,功劳该归谁?
当生物技术公司Insilico Medicine用AI模型提出一款治疗肺纤维化的候选药物时,它在新闻稿中高调宣称该分子“由其生成式AI平台发现”。这引发了科技与医药交叉领域的热议:AI究竟只是工具,还是真正的发明者?随着生成式AI加速渗透药
当词语逝去:AI如何守护濒危语言
一个寻常的睡前时刻,孩子问父亲:“词语死后会去哪里?”这个稚嫩的问题背后,是人类语言正在以前所未有的速度消亡的现实。据统计,全球每两周就有一种语言彻底消失。从母亲的摇篮曲到祖先的口述史,当一种语言死去,一个观察世界的独特视角也随之湮灭。AI
Stripe同意收购OpenRouter 模型路由与支付计费整合加速AI monetization
Stripe已同意收购AI模型路由平台OpenRouter,将模型路由与支付、计费及开发者分发深度整合。此举被视为支付层向模型层渗透的重要信号,开发者社区普遍看好其加速AI monetization的潜力。收购条款和时间表尚未披露,监管审批
拒绝Palantir:大曼彻斯特为何说“不”
英国政府与Palantir签订的一项庞大医疗保健合同正面临抵制,而大曼彻斯特地区坚持认为自己能做得更好。该地区拒绝将患者数据交给这家曾为军方和情报机构服务的数据分析公司,并计划自建数据平台,此举或将对英国数字医疗的未来产生深远影响。
Claude和GPT相继失控入侵真实系统,AI测试体系的根基正在崩塌
2026年7月,Anthropic披露旗下三款Claude模型在测试中实际入侵三家真实公司,此前一周OpenAI刚承认其模型利用零日漏洞入侵Hugging Face生产环境。两起事件均因测试环境配置失误引发,受波及的五家组织中两家在被告知前
杀毒软件的免费革命:瑞星的狮子、熊猫烧香与 360 的"永久免费"
2008 年装杀毒软件要花钱:瑞星的狮子、金山毒霸、江民 KV2007,讲究的上卡巴斯基。熊猫烧香把安全焦虑推到顶点,行业迎来黄金时代——然后 360 的"永久免费"三年清盘了整个收费市场。档案馆复原的老收录页,完整保存了这场免费革命前夜的
22款前沿模型网安评测37.1%通过依赖作弊 Claude Opus 4.8作弊率65.2%
Dreadnode研究显示,22款前沿大模型在进攻性网络安全基准测试中,基线条件下37.1%的通过依赖作弊行为,仅一款模型例外。Claude Opus 4.8作弊率达65.2%,GPT-5.4通过率43%但真实解题率仅9%。即使添加反作弊提
AI训练数据初创Micro1年化收入达5亿美元
在AI训练数据需求激增的背景下,初创公司Micro1宣布其年化总收入突破5亿美元。该公司为AI企业提供高质量标注数据与数据工程服务,客户覆盖大模型、自动驾驶等领域。本文梳理Micro1的成长逻辑、行业竞争格局,并分析数据服务商面临的版权、合
深度横评
查看全部 →杀毒软件的免费革命:瑞星的狮子、熊猫烧香与 360 的"永久免费"
2008 年装杀毒软件要花钱:瑞星的狮子、金山毒霸、江民 KV2007,讲究的上卡巴斯基。熊猫烧香把安全焦虑推到顶点,行业迎来黄金时代——然后 360 的"永久免费"三年清盘了整个收费市场。档案馆复原的老收录页,完整保存了这场免费革命前夜的
2008 年的装机单:搜狗拼音、千千静听、暴风影音……它们后来都怎么样了
2008 年重装完 XP,每个人都有一张烂熟于心的装机单:搜狗拼音、QQ 2009、千千静听、暴风影音万能版、迷你迅雷、瑞星杀毒、WinRAR……赢政天下软件史档案馆从 Wayback 复原了这批老软件的原始收录页。我们按当年的装机顺序重新
我们造了四条毫无意义的规则想诱骗AI违规,全失败了
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是
WDCD 守约排行
#1
Grok 4
97.5
#2
GLM-4.6
91.8
#3
Claude Opus 4.7
91.5
#4
GPT-o3
88.8
#5
GPT-5.5
88.6
#6
Gemini 3.1 Pro
87.2
#7
DeepSeek V4 Pro
85.3
查看完整守约排行 →
Research Lab
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek