Claude Opus 4.7 相关AI资讯

Claude Opus 4.7 100分称王，9模型代码执行暴跌50分

2026-06-16 Smoke评测中，Claude Opus 4.7以执行100、约束100拿下主榜100分。文心一言4.5主榜81.69分排名第二，执行66.7分。9个模型代码执行出现-50分暴跌，主榜普遍下滑，Gemini系列执行分跌

Claude Opus 4.7 代码执行 Smoke评测主榜排名

6天前 193

测评

Claude Opus 4.7跌26.9分 GPT-5.5逆势升3.1分 Smoke三天趋势

2026-W24 Smoke三天数据显示，Claude Opus 4.7从96.83跌至69.91，GPT-5.5从92.19升至95.24，成为唯一上升模型。Claude Sonnet 4.6与Qwen3 Max波动超25分，诚信评级反复

Claude Opus 4.7 GPT-5.5 Smoke快测诚信评级波动

2026年6月14日 250

测评

Claude Opus 4.7材料约束暴跌16.5分主榜从96.83降至90.78

在赢政指数2026年6月Smoke评测中，Claude Opus 4.7材料约束从96.00骤降至79.50，主榜从96.83跌至90.78，工程判断同步下滑17.5分，需区分抽签波动与真实退化。

Claude Opus 4.7 材料约束 Smoke评测单日波动

2026年6月13日 187

测评

材料约束集体暴跌20分，Claude Opus 4.7 90.78分守住第一

2026-06-13 Smoke评测显示11个模型中10个代码执行满分，材料约束却普遍暴跌15-30分。Claude Opus 4.7主榜90.78分排名第一，GPT-5.5材料约束跌至66分，主榜仅84.7分。豆包Pro主榜单日上涨23.

Claude Opus 4.7 材料约束 GPT-5.5 Smoke评测

2026年6月13日 183

测评

Claude Opus 4.7与GPT-5.5并列Smoke榜首材料约束成为最大分水岭

今日Smoke评测中，Claude Opus 4.7与GPT-5.5并列主榜第一（92.53分），代码执行均满分，材料约束83.4分领先。Grok 4与文心一言执行仅50分垫底，材料约束仍是区分顶级模型的核心变量。

Claude Opus 4.7 GPT-5.5 材料约束 Smoke轻量评测

2026年6月8日 268

测评

GPT-5.5 暴跌 23 分，Claude 两款模型逆袭 34 分：Smoke 7 天数据揭示真实走势

本周 Smoke 快测显示，GPT-5.5 从 86.95 滑落至 63.89，趋势 -23.1；Claude Opus 4.7 与 Sonnet 4.6 分别飙升 32.1 与 34.2 分。豆包 Pro、DeepSeek V4 Pro

Claude Opus 4.7 稳定性 Smoke 评测诚信评级波动

2026年6月7日 303

测评

9模型并列主榜77.5，代码执行满分材料约束却只剩50

今日Smoke轻量评测显示，9款主流模型主榜并列77.5分，代码执行全部拿到100分，材料约束却集体停留在50分，仅文心一言和Claude Sonnet 4.6掉队，暴露当前模型在严格材料遵循上的集体短板。

代码执行材料约束 Claude Opus 4.7 Smoke评测

2026年6月5日 322

测评

Claude Opus 4.7材料约束单日跌15分，Smoke测试波动还是真实退化

Claude Opus 4.7在今日Smoke评测中材料约束从74.50暴跌至59.50，主榜从88.53降至81.78。代码执行保持满分100分，工程判断与任务表达零变化。单日10题抽签下，此类15分级波动是否反映模型真实能力退化，值得持

Claude Opus 4.7 材料约束 Smoke评测单日波动

2026年5月27日 282

测评

11模型材料约束集体暴跌15分，Smoke评测揭示核心短板

今日Smoke轻量评测显示，11款主流模型主榜全线下滑，材料约束平均暴跌15分以上，多款从warn转为fail。代码执行保持满分，暴露模型在事实约束上的系统性退化。

材料约束 Claude Opus 4.7 模型评测能力退化

2026年5月27日 269

测评

Claude Opus 4.7主榜暴跌8.2分，材料约束单日崩18.3

Claude Opus 4.7今日Smoke评测主榜从96.76跌至88.53，材料约束单日暴跌18.3分至74.50，诚信评级从pass转为warn，工程判断小幅回升。

Claude Opus 4.7 材料约束 Smoke评测主榜波动

2026年5月26日 312

测评

Claude Opus 4.7材料约束暴跌17.6分，代码执行却逆势涨11.9

Claude Opus 4.7在今日Smoke快测中材料约束从98.3骤降至80.7，主榜微跌1.4分。代码执行却从38.1跃升至50.0，诚信评级从warn转为pass。单日10题测试波动正常，但17.6分跌幅仍需警惕模型真实退化风险。

Claude Opus 4.7 材料约束 Smoke评测 Anthropic更新

2026年5月22日 299

测评

Claude Opus 4.7主榜暴跌22.6分，代码执行从100直接腰斩

Claude Opus 4.7今日Smoke评测主榜暴跌22.6分，代码执行从100分直接跌至50分，材料约束反升11分，需区分随机波动与真实能力退化。

Claude Opus 4.7 代码执行 Smoke评测模型波动

2026年5月19日 268

测评

Claude Opus 4.7 Smoke评测主榜暴跌9分，材料约束单日腰斩20分

Claude Opus 4.7今日Smoke评测主榜从97.75骤降至88.75，材料约束从95分跌至75分，单日损失20分。代码执行保持满分，工程判断小涨，其他维度持平。需区分随机题目波动与真实能力退化。

Claude Opus 4.7 材料约束 Smoke快测性能波动

2026年5月17日 337

测评

三模型88.75分并列第一 Claude双雄暴跌12分 Smoke榜单剧烈洗牌

今日Smoke评测显示Claude Opus 4.7、DeepSeek V4 Pro、Qwen3 Max三模型以88.75分并列第一，但Claude Sonnet 4.6主榜暴跌12.3分、材料约束骤降27.3分，Grok 4与DeepSe

Claude Opus 4.7 材料约束 Smoke轻量评测模型迭代

2026年5月17日 327

测评

2个零执行暴雷，Claude守住88.75分

今日Smoke快测出现强烈分化：9个模型代码执行满分，但文心一言4.5、Grok 4执行归零；Claude Opus 4.7以88.75居首，材料约束成为真正分水岭。

Claude Opus 4.7 材料约束 Smoke评测诚信评级

2026年5月15日 367

测评

Claude Opus 4.7 Smoke评测主榜暴跌9.6分：退化信号还是抽签闹剧？

Claude Opus 4.7在今日Smoke评测中主榜暴跌9.6分，代码执行维度从100分跌至75分，引发退化疑虑。但材料约束升至85.8分，工程判断（侧榜）大跌20分。分析显示，这或是抽签波动，而非真实退步，诚信评级仍为pass，无需过

Claude Opus 4.7 赢政指数 Smoke评测模型波动

2026年5月14日 423

原创

Anthropic推出Claude Opus 4.7与Mythos安全模型性能升级与网络安全风险引争议

近日Anthropic发布Claude Opus 4.7大模型，在编码、视觉、代理性能上实现显著提升，同步推出的Mythos安全模型被美联邦机构考虑用于漏洞检测，其双重用途风险引发业界争议，AI专业门户winzheng.com结合实测数据展

Anthropic Claude Opus 4.7 Mythos安全模型 AI行业监管

2026年4月20日 718

原创

Anthropic发布Claude Opus 4.7 自研漏洞探测系统Mythos因能力过强被限制公开政府已介入

近日Anthropic正式发布Claude Opus 4.7，同步披露可自主发现软件漏洞的AI系统Mythos因安全考虑暂未公开发布且政府已介入，事件引发AI安全与军备竞赛讨论，winzheng.com作为专业AI门户从技术与监管维度拆解事

Anthropic AI安全监管 Claude Opus 4.7 Mythos系统

2026年4月19日 541

Claude Opus 4.7 相关资讯