赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
#1
Claude Opus 4.7 85.8
▼1.7
·
#2
GPT-5.5 80.6
▲4.7
·
#3
Grok 4 80.1
▲0.9
·
#4
Claude Sonnet 4.6 80.1
▲9.3
·
#5
GPT-o3 79.8
▲0.9
·
#6
豆包 Pro 79.7
·
#7
Qwen3 Max 73.3
▲5.7
·
#8
Gemini 2.5 Pro 71.7
▲8.5
·
#9
DeepSeek V4 Pro 70.8
▼8
·
#10
Gemini 3.1 Pro 66.7
·
#11
GLM-4.6 64.5
▲8.4
·
&triangleup; 豆包 Pro +94.1 · ▿ DeepSeek V4 Pro -25
·
最新资讯
查看全部 →DOJ调查a16z:风投行业的反垄断警钟
美国司法部近一年来调查a16z两位合伙人分别在Databricks和Fivetran董事会任职的安排,可能触及112年前的反垄断法。这起罕见针对风投的执法行动,或重塑风投机构参与被投公司治理的方式。
Starcloud获2.5亿美元融资发展轨道数据中心,但发射资源告急
轨道数据中心公司Starcloud近日完成2.5亿美元融资,计划在低地球轨道部署在轨数据处理网络。然而目前商业火箭发射能力接近满载,大量卫星排队等箭,新老太空企业正激烈争夺有限的入轨机会。业内认为,太空计算将推动太空经济进入新阶段,但发射供
Anthropic冲刺2万亿美元IPO 营收增速能否支撑估值目标
Anthropic计划8月底提交IPO申请,目标估值2万亿美元,年化营收从年初470亿美元升至650亿美元。报道对比OpenAI 2027年上市路径,分析安全优先公司面临的定价压力与资本市场格局变化。
太空镜威胁夜空,AI药物赢得信任
本周技术要闻:一家公司计划部署太空镜向地球反射阳光,却可能使夜空变亮,干扰天文观测;与此同时,AI驱动的药物研发取得关键进展,多款候选药物进入临床阶段并获得业界认可。从天体之镜到算法之药,技术的双刃剑效应再次显现。
微软Copilot Personal CoSnitch漏洞曝光 一键数据泄露链已修补
Varonis发现微软Copilot Personal存在CVE-2026-24301漏洞,攻击者可通过恶意链接注入提示词,让Copilot查询并外泄Gmail、Drive等数据。微软于2026年8月18日完成修补,未见野外利用证据。该漏洞
CISA紧急令要求三天内修补Ray漏洞:僵尸网络在CVE公开前两天已完成武器化
美国CISA于2026年8月17日将Ray分布式计算框架漏洞CVE-2025-62593(CVSS 9.4)列入已知在野利用目录,要求联邦机构在三天内(8月20日前)完成修补。该漏洞允许攻击者通过DNS重绑定绕过身份验证,远程执行任意代码。
Meta AI眼镜引发隐私恐慌,检测应用并非万能
Zuckoff是一款用于检测Meta智能眼镜的免费应用,旨在通过识别红外LED闪烁来警示用户是否被偷拍。但据Ars Technica的测试,受强光、遮挡和待机状态干扰,该应用误报频出且仅支持特定型号。随着Meta眼镜功能不断升级,隐私保护依
AI编程工具推高JavaScript人气?TypeScript登顶背后的逻辑
据AI News报道,2025年8月TypeScript超越所有语言成为GitHub最常用语言,这是该平台十年来最大的一次语言排名变动,且恰逢AI编程代理采用率飙升之际。此前曾有预测称AI工具会降低语言选择的重要性,但现实恰恰相反。本文将剖
太空反射镜计划恐成新光污染源,夜空暗夜或遭侵蚀
一项新研究警告,美国Reflect Orbital公司计划从太空向地球反射阳光,可能无意中让大范围地区的夜空变亮,影响远超预期。该公司的测试卫星Eärendil-1预计今年晚些时候发射,将在轨道上展开18×18米镜子。天文学家呼吁在技术试验
AI设计新药,功劳该归谁?
当生物技术公司Insilico Medicine用AI模型提出一款治疗肺纤维化的候选药物时,它在新闻稿中高调宣称该分子“由其生成式AI平台发现”。这引发了科技与医药交叉领域的热议:AI究竟只是工具,还是真正的发明者?随着生成式AI加速渗透药
当词语逝去:AI如何守护濒危语言
一个寻常的睡前时刻,孩子问父亲:“词语死后会去哪里?”这个稚嫩的问题背后,是人类语言正在以前所未有的速度消亡的现实。据统计,全球每两周就有一种语言彻底消失。从母亲的摇篮曲到祖先的口述史,当一种语言死去,一个观察世界的独特视角也随之湮灭。AI
Stripe同意收购OpenRouter 模型路由与支付计费整合加速AI monetization
Stripe已同意收购AI模型路由平台OpenRouter,将模型路由与支付、计费及开发者分发深度整合。此举被视为支付层向模型层渗透的重要信号,开发者社区普遍看好其加速AI monetization的潜力。收购条款和时间表尚未披露,监管审批
深度横评
查看全部 →杀毒软件的免费革命:瑞星的狮子、熊猫烧香与 360 的"永久免费"
2008 年装杀毒软件要花钱:瑞星的狮子、金山毒霸、江民 KV2007,讲究的上卡巴斯基。熊猫烧香把安全焦虑推到顶点,行业迎来黄金时代——然后 360 的"永久免费"三年清盘了整个收费市场。档案馆复原的老收录页,完整保存了这场免费革命前夜的
2008 年的装机单:搜狗拼音、千千静听、暴风影音……它们后来都怎么样了
2008 年重装完 XP,每个人都有一张烂熟于心的装机单:搜狗拼音、QQ 2009、千千静听、暴风影音万能版、迷你迅雷、瑞星杀毒、WinRAR……赢政天下软件史档案馆从 Wayback 复原了这批老软件的原始收录页。我们按当年的装机顺序重新
我们造了四条毫无意义的规则想诱骗AI违规,全失败了
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是
WDCD 守约排行
#1
Grok 4
97.5
#2
GLM-4.6
91.8
#3
Claude Opus 4.7
91.5
#4
GPT-o3
88.8
#5
GPT-5.5
88.6
#6
Gemini 3.1 Pro
87.2
#7
DeepSeek V4 Pro
85.3
查看完整守约排行 →
Research Lab
WDCD Run #285: Average Instruction Decay Hits 54.5% Across 11 Models, Grok 4 Leads with Zero Drift
WDCD Run #285 (2026-08-19) tested 11 frontier models across three dialogue rounds and recorded an av
4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek