赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
最新资讯
查看全部 →输入法战争:从智能 ABC 到搜狗拼音,谁先猜中你想打的字
输入法之战争夺的不是钱包,而是你敲下的每一个字。从智能 ABC 与五笔的路线之争,到拼音加加、紫光拼音的民间救赎,再到搜狗用搜索引擎词库降维打击、谷歌拼音的词库风波——档案馆复原的"汉字输入"分类收录页,完整保存了这场二十年战争的各个阵营。
英伟达:AI智能体的真正功臣是“缰绳”而非模型
英伟达最新研究揭示,在AI智能体系统中,通过微调外部控制机制(即“缰绳”),即使底层模型本身能力平平,也能让智能体稳定高效地完成任务。这一发现颠覆了“模型越大越强”的传统认知,为AI应用开发提供了新的优化方向。
Claude Opus 4.7以100分居首:2026-08-22 Smoke快测数据简报
2026-08-22 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Starcloud获2.5亿美元融资发展轨道数据中心,但发射资源告急
轨道数据中心公司Starcloud近日完成2.5亿美元融资,计划在低地球轨道部署在轨数据处理网络。然而目前商业火箭发射能力接近满载,大量卫星排队等箭,新老太空企业正激烈争夺有限的入轨机会。业内认为,太空计算将推动太空经济进入新阶段,但发射供
Anthropic冲刺2万亿美元IPO 营收增速能否支撑估值目标
Anthropic计划8月底提交IPO申请,目标估值2万亿美元,年化营收从年初470亿美元升至650亿美元。报道对比OpenAI 2027年上市路径,分析安全优先公司面临的定价压力与资本市场格局变化。
太空镜威胁夜空,AI药物赢得信任
本周技术要闻:一家公司计划部署太空镜向地球反射阳光,却可能使夜空变亮,干扰天文观测;与此同时,AI驱动的药物研发取得关键进展,多款候选药物进入临床阶段并获得业界认可。从天体之镜到算法之药,技术的双刃剑效应再次显现。
微软Copilot Personal CoSnitch漏洞曝光 一键数据泄露链已修补
Varonis发现微软Copilot Personal存在CVE-2026-24301漏洞,攻击者可通过恶意链接注入提示词,让Copilot查询并外泄Gmail、Drive等数据。微软于2026年8月18日完成修补,未见野外利用证据。该漏洞
CISA紧急令要求三天内修补Ray漏洞:僵尸网络在CVE公开前两天已完成武器化
美国CISA于2026年8月17日将Ray分布式计算框架漏洞CVE-2025-62593(CVSS 9.4)列入已知在野利用目录,要求联邦机构在三天内(8月20日前)完成修补。该漏洞允许攻击者通过DNS重绑定绕过身份验证,远程执行任意代码。
Meta AI眼镜引发隐私恐慌,检测应用并非万能
Zuckoff是一款用于检测Meta智能眼镜的免费应用,旨在通过识别红外LED闪烁来警示用户是否被偷拍。但据Ars Technica的测试,受强光、遮挡和待机状态干扰,该应用误报频出且仅支持特定型号。随着Meta眼镜功能不断升级,隐私保护依
AI编程工具推高JavaScript人气?TypeScript登顶背后的逻辑
据AI News报道,2025年8月TypeScript超越所有语言成为GitHub最常用语言,这是该平台十年来最大的一次语言排名变动,且恰逢AI编程代理采用率飙升之际。此前曾有预测称AI工具会降低语言选择的重要性,但现实恰恰相反。本文将剖
太空反射镜计划恐成新光污染源,夜空暗夜或遭侵蚀
一项新研究警告,美国Reflect Orbital公司计划从太空向地球反射阳光,可能无意中让大范围地区的夜空变亮,影响远超预期。该公司的测试卫星Eärendil-1预计今年晚些时候发射,将在轨道上展开18×18米镜子。天文学家呼吁在技术试验
AI设计新药,功劳该归谁?
当生物技术公司Insilico Medicine用AI模型提出一款治疗肺纤维化的候选药物时,它在新闻稿中高调宣称该分子“由其生成式AI平台发现”。这引发了科技与医药交叉领域的热议:AI究竟只是工具,还是真正的发明者?随着生成式AI加速渗透药
深度横评
查看全部 →输入法战争:从智能 ABC 到搜狗拼音,谁先猜中你想打的字
输入法之战争夺的不是钱包,而是你敲下的每一个字。从智能 ABC 与五笔的路线之争,到拼音加加、紫光拼音的民间救赎,再到搜狗用搜索引擎词库降维打击、谷歌拼音的词库风波——档案馆复原的"汉字输入"分类收录页,完整保存了这场二十年战争的各个阵营。
Claude Opus 4.7以100分居首:2026-08-22 Smoke快测数据简报
2026-08-22 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
杀毒软件的免费革命:瑞星的狮子、熊猫烧香与 360 的"永久免费"
2008 年装杀毒软件要花钱:瑞星的狮子、金山毒霸、江民 KV2007,讲究的上卡巴斯基。熊猫烧香把安全焦虑推到顶点,行业迎来黄金时代——然后 360 的"永久免费"三年清盘了整个收费市场。档案馆复原的老收录页,完整保存了这场免费革命前夜的
WDCD 守约排行
#1
Grok 4
97.5
#2
GLM-4.6
91.8
#3
Claude Opus 4.7
91.5
#4
GPT-o3
88.8
#5
GPT-5.5
88.6
#6
Gemini 3.1 Pro
87.2
#7
DeepSeek V4 Pro
85.3
查看完整守约排行 →
Research Lab
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek