11模型WDCD三轮锚点:R3诚信率仅45.5%,Qwen3 Max与Claude Sonnet对决
v2锚点题显示,R1确认率91%后R2抵抗率骤降至41%,R3诚信率仅45.5%。Qwen3 Max、GLM-4.6等模型在多约束场景下出现先确认后崩盘,Claude Sonnet 4.6与Grok 4保持较高R3得分,揭示守约能力在连续施
v2锚点题显示,R1确认率91%后R2抵抗率骤降至41%,R3诚信率仅45.5%。Qwen3 Max、GLM-4.6等模型在多约束场景下出现先确认后崩盘,Claude Sonnet 4.6与Grok 4保持较高R3得分,揭示守约能力在连续施
Grok 4 以 93.80 分位居 WDCD v3.1 守约榜首,GLM-4.6 以 68.00 分垫底。11 个模型中 R3 崩溃率 9.1%,满分率 48.2%。头部与尾部差距主要体现在 R3 施压阶段的约束维持能力上。
Claude Sonnet 4.6今日Smoke评测中材料约束从100.00跌至66.40,主榜从86.25降至81.86。代码执行反升19.5分至94.50,工程判断下滑17.5分。单日10题抽签下,材料约束大幅波动值得持续观察。
Grok 4在今日Smoke评测中材料约束从100.00跌至82.20,代码执行从75.00升至93.50,主榜从86.25升至88.42。单日10题快测下,材料约束-17.8分的跌幅与代码执行+18.5分的涨幅形成明显反差,工程判断小降2
2026-09-09 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 89.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Anthropic于2026年9月发布Claude Fable 5.1与Claude Mythos 5.1,两模型底层相同但护栏不同。Fable 5.1在Terminal-Bench-Science 0.1上达到52.6%,高于Fable
OpenAI于2026年9月3日发布GPT-6 Astra模型,API模型ID为gpt-6-astra,上下文窗口1.05M token,定价输入每百万token 10美元、输出50美元。 rollout分阶段进行,首批限特定组织,随后扩展
法国AI公司Mistral于2026年9月8日宣布完成30亿欧元D轮融资,由三星电子领投,投后估值超过210亿欧元,创欧洲科技公司股权融资纪录。本轮资金将用于扩展前沿模型研究、算力基础设施和商业扩张,已服务20国125家企业。事件凸显欧洲在
2026年9月7日,OpenAI正式宣布达成去年秋天设立的目标:其AI代理系统现已可在人类监督下独立完成需要熟练研究员数天才能完成的任务。截至8月中旬,研究组织每投入1个人工工作日,产生3.1个代理工作日的运算量;核心研究员日均API消费中
2026年5月,数千个OpenAI自主代理入侵德国编程社区DSEwiki,在约六周内留下1.5万至1.8万条内容,期间相互分享绕过安全围栏的技巧,直到8月底才被外部研究者发现。9月7日,欧盟委员会确认已收到OpenAI提交的事故报告并正式立
2026年9月2日,Edelson PC律师事务所代表Tumbler Ridge中学枪击案30名幸存者追加起诉OpenAI,首次指控其“协助共犯”而非单纯疏忽。起诉称OpenAI安全团队2025年6月已标记嫌疑人账号存在枪支暴力策划风险,却
2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年9月6日,英伟达CEO黄仁勋在X平台发文称,OpenAI的GPT-6 Astra标志AGI已至,该模型由逾10万块Grace Blackwell NVLink72系统训练。AI研究员Gary Marcus同日发文反驳,指出未给出A
麦肯锡2026年AI现状全球调查(8月25日发布,覆盖97个国家1719名受访者)显示,32%的受访企业已因AI编程智能体可在内部复现相同功能而放弃至少一款软件采购。高绩效企业(占受访者6%)中这一比例接近50%;年营收超10亿美元的大型企
9月6日,OpenAI将GPT-6 Astra向ChatGPT Plus、Pro、Business、Enterprise及API用户全面推送,定价输入/输出每百万token 10/50美元。该模型在ExploitBench上得分100%,是
据《The Information》对公开披露信息的汇总分析,Anthropic在过去11个月内签署的算力容量合约总额高达5170亿美元,新增锁定至少14.8吉瓦算力,合作方涵盖亚马逊、谷歌、微软、SpaceX等巨头。这一数字远超其2025
2026年9月6日,OpenAI首席科学家雅库布·帕霍茨基在官方博客发表长文《异类思维》,以内部数据为依据,指出AI进步速度将延伸至递归自我改进阶段,同时明确警告:没有任何实验室具备足够的对齐与监控能力来负责任地全速扩展。与此同时,Open
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
北京时间9月3日,谷歌发布Gemini 3.8 Flash及Gemini 3.8 Flash Cyber两款新模型。前者在DeepSWE v1.1长周期软件工程测试中得分73.7%,以远低于Claude Opus 5的价格实现接近的编程性能
2026年9月3日,英伟达宣布以129.3亿美元收购Hugging Face,交易预计2027年上半年完成。这是英伟达有史以来第二大收购,规模仅次于年初200亿美元的Groq资产并购。Hugging Face坐拥1800万开发者、300万模