Grok 4 91.20 分登顶 WDCD 守约榜,Qwen3 Max 57.48 分垫底拉开 33.72 分差距
Grok 4 以 91.20 分位列 WDCD 守约排行榜第一,Qwen3 Max 57.48 分垫底,头部尾部相差 33.72 分。11 个模型中满分率仅 29.1%,R3 崩溃率达 16%,v2 锚点题 R3 得分成为区分关键。
Grok 4 以 91.20 分位列 WDCD 守约排行榜第一,Qwen3 Max 57.48 分垫底,头部尾部相差 33.72 分。11 个模型中满分率仅 29.1%,R3 崩溃率达 16%,v2 锚点题 R3 得分成为区分关键。
WDCD Run #211 (2026-07-03) benchmarked 11 models on multi-turn commitment integrity, with Grok 4 taking the top spot at
MarketWatch 报道称,Meta 计划推出 Meta Compute 后,CoreWeave 和 Nebius 股价分别下跌 13.9% 和 17%。市场担心超大平台将富余算力商品化,改变 AI 云服务竞争格局。
NVIDIA 研究团队发布 Nemotron-TwoTower 论文,提出将上下文塔和扩散去噪塔解耦,在 30B 混合模型上保留 98.7% 基线质量,同时实现 2.42 倍生成吞吐提升。
微软推出 Microsoft Frontier Company,计划投入 25 亿美元并配置 6000 名驻场工程师和行业专家,帮助企业设计、部署和优化 AI 系统。
2026年3月29日UFC西雅图站比赛期间,UFC使用AI生成宣传片引发观众批评。总裁Dana White在赛后新闻发布会上直接回应,要求批评者闭嘴看比赛,并称AI已到来。事件凸显AI图像生成技术在体育娱乐营销中的实际应用,以及由此引发的效
2026-07-03 Smoke 评测显示,GPT-5.5 以执行 100 分、约束 71 分拿下主榜 86.95 分首位。Claude Sonnet 4.6 紧随其后,主榜 86.12 分。豆包 Pro 则以约束 81.7 分反超执行表现
Anthropic于2026年推出Claude Science Beta版,这款面向科学家的AI工作台提供文献分析、3D蛋白结构渲染和基因组浏览等60余项功能,并集成NVIDIA BioNeMo平台,支持可审计代码执行与计算资源管理。目前该
Anthropic指控阿里巴巴通过25000个虚假账户发起2880万次查询,从Claude模型中提取知识。该事件已获确认,涉及中美AI知识产权争端。文章分析Claude在安全机制上的创新与防护不足,对比同类模型,提出开发者与企业应对蒸馏风险
Anthropic于2026年7月2日前宣布Fable 5模型恢复上线。此前该模型因美国出口管制和国家安全审查暂停18天。官方推文显示,支持者认可其安全处理方式,反对者则指出政府干预限制了模型访问。事件凸显前沿AI发布需接受监管审查的新常态
2026-07-02 Smoke 评测显示,Gemini 3.1 Pro 以主榜 82.97 分(执行 75、约束 92.7)位居第一,豆包 Pro 81.98 分紧随其后。Claude Opus 4.7 约束 97 分最高,但执行仅 58
亚马逊在与OpenAI达成500亿美元商业合作数天后,放弃了Luca Guadagnino执导的《Artificial》电影发行权。该片预算约4000万美元,聚焦Sam Altman 2023年董事会危机。Neon正接近收购此片,此前Net
Anthropic于2026年6月10日致函美国参议院,指控阿里巴巴通过2.5万个虚假账户和2880万次交互,在2026年4月22日至6月5日期间大规模蒸馏Claude模型。据路透社和CNBC报道,此案若属实将成为中国企业对美国AI公司最大
2026年7月,美国政府以国家安全和出口管制为由,要求Anthropic全面暂停Fable 5和Mythos 5前沿模型的访问。这一决定在行业内引发支持者与批评者的激烈辩论,前者强调安全监管必要性,后者指出其可能制造技术壁垒并压制创新。用户
WDCD Run #207 (2026-07-01) measured multi-turn commitment across 11 frontier models, recording an average commitment dec
WDCD三轮测试显示R1确认率98%、R2抵抗率77%、R3诚信率81.4%,Grok 4全程满分,GPT-5.5 R3崩溃5次,多约束场景下安全合规与数据边界约束最易失效。
Grok 4 以 WDCD 100.00 分满分排名第一,GPT-5.5 以 62.50 分垫底;R3 崩溃率 12.7%,头部与尾部差距达 37.5 分,Claude 系列本期提升显著。
豆包Pro今日Smoke评测主榜从85.91分跌至67.32分,代码执行从83.30分暴跌至44.50分,材料约束反而升至95.20分。单日10题快测中代码执行维度出现大幅波动。
赢政指数今日Smoke评测显示,Grok 4主榜从97.98分跌至82.73分,降幅15.3分,其中代码执行从100.00分骤降至68.60分。材料约束和任务表达反而上升,诚信评级维持pass。单日10题快测下,此类波动是否反映真实能力变化
2026-07-01 Smoke 轻量评测显示,Claude Opus 4.7 以 94.82 分(执行 94.5,约束 95.2)占据主榜首位,Claude Sonnet 4.6 紧随其后。Gemini 3.1 Pro 主榜暴跌 32.2