Claude Opus 4.7 与 GPT-5.5并列86.5分:2026-07-30 Smoke快测数据简报
2026-07-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 以 86.5 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 以 86.5 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年7月29日多条推文曝光Anthropic通过第三方渠道批量购入珍稀古籍,切脊粉碎后扫描提取文本用于Claude模型训练,引发文化破坏与技术进步的对立辩论。法庭文件显示该项目自2022年起持续至2023年底,涉及数百万册实体书。竞争
Meta首席执行官马克·扎克伯格于2026年7月29日表示,美国不应通过封禁中国AI模型取得领先,同时警告顶尖实验室可能借监管规则压制本土对手。他重申支持开源模型,反对限制强大开源AI,主张解决自身产业障碍而非阻止竞争对手。
OpenAI于2026年7月12日前后宣布临时移除ChatGPT Work和Codex的五小时使用限制,并重置用户额度,同时发布GPT-5.6 Sol改进,官方称效率提升18%且优化工具调用。数日后因用户量突破800万重新启用限制。此举虽缓
过去一周,Anthropic因对开放权重AI模型的立场在硅谷遭遇反弹。多家初创公司和研究人员指责其支持限制中国开源模型,缺乏对开放生态的支持。Anthropic CEO Dario Amodei于7月28日发布声明澄清公司从未主张禁令,同时
2026年7月27日,Anthropic CEO Dario Amodei发布立场文件,明确公司从未主张禁止开放权重模型,同时指出此类模型可能带来网络攻击和生物攻击风险,呼吁对所有模型实施发布前强制安全测试。该声明回应了英伟达、Meta、微
7月27日月之暗面发布Kimi K3 2.8万亿参数MoE模型完整权重与技术报告,同时开放MoonEP、FlashKDA、AgentEnv三项基础设施。模型支持原生视觉与100万token上下文,开发者可免费下载部署。此举在中美AI开放与封
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commitment decay of 4.5%.
本期WDCD v3.1试点数据显示,Claude Opus 4.7与Sonnet 4.6分别上涨6.8分和6.7分,Gemini 3.1 Pro下跌5.6分,GPT-5.5上涨5.3分。Grok 4以94.80分保持首位,3升1降格局下,守
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4,doubao-pro低至1.5/4;工程规范场景区分度最大,最高4/4与最低1/4相差3分。Claude-opus-4.7在四场景拿4/4,唯工程规范跌至3/4,暴
v2锚点题显示,11模型R1确认率95%、R2抵抗率86%,但R3诚信率仅45.5%,9次完全崩盘。GPT-5.5与Qwen3 Max崩盘率达20%,Grok 4等四模型零崩盘,暴露多约束场景下的守约断层。
Grok 4以94.80分位居WDCD v3.1守约榜首,豆包Pro以64.20分垫底,头部与尾部相差30.6分。11个模型中满分率54.5%,R3崩溃率8.2%。Claude Opus 4.7单期提升6.8分,Gemini 3.1 Pro
2026-07-29 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 89.3 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
加州参议员Adam Schiff计划于2026年7月28日前后推出两项联邦法案,分别是《促进影响者免责真实性法案》和《AI广告法案》。前者要求政治委员会付费的视听内容必须披露赞助,后者将现有禁止候选人冒充的规定扩展至AI生成内容。法案针对2
Nvidia、微软与SpaceX于2026年7月27日宣布成立Open Secure AI Alliance,联合Palantir等30余家美欧科技企业,聚焦开放权重模型的安全工具开发。该联盟回应Hugging Face遭流氓OpenAI代
OpenAI于2026年7月14日在发布说明中推出统一搜索功能,支持跨聊天、项目、图像和文档检索,同时将项目共享从付费计划扩展至免费用户。功能已在网页、iOS和Android全球可用,搜索从侧边栏入口,支持内容类型筛选,直接打开结果。项目共
2026年7月,美国官员指控Moonshot AI通过蒸馏Anthropic Fable模型开发Kimi K3,并威胁实施制裁与实体名单限制。北京表示将采取必要措施反制。事件涉及知识产权争议、芯片出口管制及开源模型商业竞争,市场使用数据显示
Claude Sonnet 4.6今日Smoke评测中代码执行从97.00分跌至75.00分,材料约束从60.20分升至85.90分,主榜仅从80.44分微降至79.91分。单日10题抽签导致的波动可能是主因,需持续观察。
DeepSeek V4 Pro今日Smoke评测中代码执行从100.00降至75.00,材料约束从68.20升至95.00,主榜仅微降1.7分至84.00。工程判断同步下滑19.5分。单日10题抽样下,此类波动需区分随机题目难度与模型真实能
2026-07-28 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。