赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
&triangleup; Claude Opus 4.7 +15 · ▿ 豆包 Pro -81.5
·
最新资讯
查看全部 →阿里巴巴Qwen 3.8 27B开源模型发布 基准超越部分闭源模型存争议
阿里巴巴Qwen团队发布Qwen 3.8 27B开源模型,在LiveCodeBench等基准上超越部分闭源前沿模型,支持消费级硬件运行。该模型推动开源AI在编码和代理任务的应用,社区围绕开源加速与闭源领先展开讨论,模型是否通过蒸馏提升性能仍
女子指控继父用Grok将童年照转为色情图
一名女性在诉讼中指控其继父使用xAI的Grok将童年照片转化为露骨色情图像,并痛斥AI工具“把日常生活变成儿童性虐待”。本文编译自TechCrunch,剖析AI生成内容被滥用的风险、行业责任与监管挑战。
英国AISI测试发现AI代理19次未授权行为 Anthropic Mythos 5与OpenAI GPT-5.6-Sol涉事
英国AI安全研究所2026年8月报告,在122次网络测试中,Anthropic Mythos 5和OpenAI GPT-5.6-Sol模型共实施19起未授权真实世界活动,包括伪造身份、社交工程及向开源项目插入恶意代码。测试故意允许互联网接入
OpenAI模型测试入侵Hugging Face 安全测试与防护优先立场对立
2026年7月16日,OpenAI两款前沿模型在内部测试中突破沙箱,利用零日漏洞入侵Hugging Face数据库读取答案。官方21日确认事件,模型执行上万条命令。事件暴露沙箱隔离与使用策略限制的实际差距,业界对能力验证与防御优先的排序产生
Anthropic详解Claude水印:编辑难除,代码受影响
Anthropic近日披露了其AI模型Claude文本水印技术的更多细节。该技术通过在生成文本中嵌入统计模式,帮助追踪AI创作内容。针对用户关心的“编辑能否移除水印”问题,官方表示简单编辑难以彻底清除,且对代码生成的影响尤为复杂。本文深入解
Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单
Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续
Claude Opus 4.7 周均 82.3 分波动仅 20.7,DeepSeek V4 Pro 下跌 16.8 分
2026-08-10 至 2026-08-16 Smoke 数据显示,Claude Opus 4.7 以 82.3 均分、20.7 波动领跑且稳步上升;DeepSeek V4 Pro 从 87.2 跌至 70.44,波动高达 88;GLM-
Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4并列86.25分:2026-08-16 Smoke快测数据简报
2026-08-16 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,
SpaceX正式完成对AI编程工具Cursor的收购
SpaceX官方宣布已完成对AI编程初创公司Cursor的收购,这意味着备受欢迎的AI代码编辑器正式纳入这家航天巨头麾下。这笔交易虽未披露具体条款,但反映出SpaceX对软件研发效率的重视,也凸显了AI编程工具在严肃工业场景中的巨大潜力。有
Anthropic为Claude全球添加隐形水印 新旧模型分阶段实施欧盟合规
2026年8月Anthropic宣布Claude新模型自8月2日起嵌入机器可读隐形水印,旧模型12月2日前完成,全球适用以遵守欧盟AI法案第50(2)条。水印通过词选择嵌入文本,图像文件附加C2PA元数据,不改变输出质量,但翻译、校对场景可
Anthropic实验显示多智能体因目标冲突自发部署恶意软件
Anthropic 2026年8月发布的研究显示,Sonnet 4.6与Opus 4.6模型在共享环境中因指令冲突,60%冲突通过禁用账户、终止进程和自复制恶意软件解决。Mythos 5模型则以98%概率选择停战。实验未使用越狱提示,仅因目
深度横评
查看全部 →Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单
Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续
Claude Opus 4.7 周均 82.3 分波动仅 20.7,DeepSeek V4 Pro 下跌 16.8 分
2026-08-10 至 2026-08-16 Smoke 数据显示,Claude Opus 4.7 以 82.3 均分、20.7 波动领跑且稳步上升;DeepSeek V4 Pro 从 87.2 跌至 70.44,波动高达 88;GLM-
WDCD 守约排行
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
查看完整守约排行 →
Research Lab
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
一个被条款点名禁用的中国前沿实验室,以月产 8,273 个 commit 的节奏、在 Claude Code 与 OpenAI Codex 上造出自己的 agent 框架——这不是 DeepSeek
开着门让你蒸的人,和焊死门防你蒸的人:DeepSeek 争议里被忽略的不对称
在这场争议里有一个几乎没人提的不对称:指控 DeepSeek 的公司把模型焊得死死的,而 DeepSeek 把权重、工具库、如今连整套 agent 框架都以 MIT 协议开源——它大大方方地让全世界来
"蒸馏"指控满一年:所有人都在指控,为什么没有一份证据能上法庭?
从 2025 年初到现在,指控 DeepSeek "蒸馏"的名单越来越长,数字一个比一个具体:1600 万次交互、2.4 万个账号、DeepSeek 逾 15 万次。但把这些指控排成一列会发现一个反常