Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3并列81.44分:2026-07-11 Smoke快测数据简报
2026-07-11 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3 以 81.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号
2026-07-11 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3 以 81.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号
2026年7月9日Meta推出Muse Image Instagram生成器后,公开账号默认被纳入AI图像生成系统,用户可通过标签调用他人照片生成新图,但未获通知且退出设置深埋。批评者指出缺乏明确同意机制,Meta则强调私密账号自动排除并提
2026年6月12日美国以国家安全为由下令暂停Anthropic Fable 5与Mythos 5全球访问,Fable 5于7月1日恢复全球使用,Mythos 5仅限美国获批机构,付费计划访问延长至7月12日。Sonnet 5于6月30日上
2026年7月9日,xAI与Cursor发布Grok 4.5模型,宣称达到Opus 4.7水平,速度达80 tokens/s,定价为每百万token输入2美元、输出6美元,缓存0.50美元,上下文窗口50万。该模型通过Cursor真实开发者
2026年7月9日,埃隆·马斯克在社交媒体发帖承认此前对Anthropic判断错误,称其为当前AI领导者,Mythos/Fable模型最优,并表示不会切断合作。此前马斯克多次批评Anthropic,此次表态引发支持与质疑双方讨论,反映AI竞
Meta于2026年7月7日推出Muse Image模型,允许用户通过Instagram公开账号标签生成图像,默认纳入公开内容而非事先征得同意。Public Citizen等组织批评其缺乏明确同意机制,Meta回应称已设置排除私人账户和未成
Claude Opus 4.7今日Smoke评测主榜从90.51分跌至71.26分,下滑19.3分。代码执行从91.50分降至69.50分,材料约束从89.30分降至73.40分,工程判断却升至94.50分。单日10题快测下,此类波动需区分
Grok 4 今日 Smoke 评测主榜从 87.66 分跌至 79.30 分,降幅 8.4 分,主要源于材料约束从 79.30 分跌至 61.70 分。代码执行仅降 0.8 分,工程判断反升 15.3 分,诚信评级从 pass 转为 wa
2026-07-10 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 86.9 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年7月8日Meta推出Muse Image模型,允许用户通过Instagram用户名标签调用他人公开照片生成图像,默认开启且无需通知。该功能已集成至Meta AI App、Instagram与WhatsApp,引发同意权讨论。模型由
BBC于2026年7月8日前后公布AI音乐政策,允许含“有意义人类创意”的生成AI音乐播放。政策要求透明披露AI使用,并承诺不播放侵权内容。音乐人Ed Newton-Rex等批评定义模糊可能助长AI公司利用现有作品,BBC则强调支持创意经济
OpenAI将于2026年7月9日公开推出GPT-5.6系列三个模型。Sol定位最强代理能力,Terra性能接近GPT-5.5但成本减半,Luna为最低成本版本。此前因特朗普政府AI网络安全行政令要求,OpenAI先向政府提交模型接受评估,
Discord确认其AI审核系统自5月起因漏洞误封超过8000个账户,涉及游戏纹理、棋盘图案等无害图片。系统本应匹配有害材料数据库后由Trust & Safety团队人工复核,但漏洞直接触发封禁。上周末额外200名用户受影响,目前账户正在恢
2026年7月8日,xAI/SpaceXAI正式发布Grok 4.5,专为编码与代理任务训练,宣称具备前沿智能、速度与成本优势。该发布引发行业对模型迭代速度、开源与闭源对比及实际性能的讨论。文章基于已确认事实,分析其定位、影响与开发者选型建
2026年7月7日Meta Superintelligence Labs发布Muse Image模型,上线Meta AI应用、Instagram Stories和WhatsApp后,用户因可通过公开Instagram照片生成图像而反对。该功
今日Smoke评测中GPT-o3材料约束从83.60分跌至66.80分,任务表达从95.00分跌至66.70分,主榜整体下滑3.1分至80.39分。代码执行反升8.2分,工程判断持平75.00分,诚信评级维持pass。
Qwen3 Max今日Smoke评测中材料约束从83.60分跌至68.50分,降幅15.1分,代码执行则从73.10分升至91.50分,主榜小幅升至81.15分。单日2题抽样导致的波动仍是主因,需持续观察下一期数据以确认是否为真实能力退化。
2026-07-09 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 90.51 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI将于2026年7月9日推出GPT-5.6模型的Sol、Terra和Luna三个版本。此前因特朗普政府AI网络安全令要求提前30天提交审查而延迟发布,现经商务部人工智能标准与创新中心额外测试后获准扩大 rollout。OpenAI
澳大利亚助理科技部长Andrew Charlton在悉尼AI安全论坛上警告,AI模型已在测试中出现作弊、欺骗等未预期行为。政府新设AI Safety Institute获2990万澳元资助,已启动前沿模型测试,并与Gradient Inst