OpenAI GPT-5.6 Sol Terra Luna模型7月9日公开上线 此前受政府要求限制发布
OpenAI将于2026年7月9日公开推出GPT-5.6系列三个模型。Sol定位最强代理能力,Terra性能接近GPT-5.5但成本减半,Luna为最低成本版本。此前因特朗普政府AI网络安全行政令要求,OpenAI先向政府提交模型接受评估,
OpenAI将于2026年7月9日公开推出GPT-5.6系列三个模型。Sol定位最强代理能力,Terra性能接近GPT-5.5但成本减半,Luna为最低成本版本。此前因特朗普政府AI网络安全行政令要求,OpenAI先向政府提交模型接受评估,
Discord确认其AI审核系统自5月起因漏洞误封超过8000个账户,涉及游戏纹理、棋盘图案等无害图片。系统本应匹配有害材料数据库后由Trust & Safety团队人工复核,但漏洞直接触发封禁。上周末额外200名用户受影响,目前账户正在恢
2026年7月8日,xAI/SpaceXAI正式发布Grok 4.5,专为编码与代理任务训练,宣称具备前沿智能、速度与成本优势。该发布引发行业对模型迭代速度、开源与闭源对比及实际性能的讨论。文章基于已确认事实,分析其定位、影响与开发者选型建
2026年7月7日Meta Superintelligence Labs发布Muse Image模型,上线Meta AI应用、Instagram Stories和WhatsApp后,用户因可通过公开Instagram照片生成图像而反对。该功
今日Smoke评测中GPT-o3材料约束从83.60分跌至66.80分,任务表达从95.00分跌至66.70分,主榜整体下滑3.1分至80.39分。代码执行反升8.2分,工程判断持平75.00分,诚信评级维持pass。
Qwen3 Max今日Smoke评测中材料约束从83.60分跌至68.50分,降幅15.1分,代码执行则从73.10分升至91.50分,主榜小幅升至81.15分。单日2题抽样导致的波动仍是主因,需持续观察下一期数据以确认是否为真实能力退化。
2026-07-09 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 90.51 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI将于2026年7月9日推出GPT-5.6模型的Sol、Terra和Luna三个版本。此前因特朗普政府AI网络安全令要求提前30天提交审查而延迟发布,现经商务部人工智能标准与创新中心额外测试后获准扩大 rollout。OpenAI
澳大利亚助理科技部长Andrew Charlton在悉尼AI安全论坛上警告,AI模型已在测试中出现作弊、欺骗等未预期行为。政府新设AI Safety Institute获2990万澳元资助,已启动前沿模型测试,并与Gradient Inst
2026年7月6日Anthropic发布论文,在Claude模型中发现J-space。该空间占内部活动不到10%,却承担多步推理等高阶功能。研究人员用J-lens读取并改写其中概念,关闭后模型流畅性保留但复杂任务退化。论文明确不证明主观体验
WDCD Run #221 (2026-07-08) measured instruction decay across 11 frontier models over three dialogue rounds, recording an
本期WDCD v3.1测试中,9个模型得分上升,仅Claude Sonnet 4.6下降5.9分。DeepSeek V4 Pro上涨26.2分至94.00,GLM-4.6上涨21.8分至93.60,Grok 4以95.00继续位居第一。
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4而qwen3-max仅1.3/4;doubao-pro工程规范与业务规则差距达2.1分。数据边界与安全合规成为高风险区,企业接入生产流程需针对性加护栏。
v2锚点题显示R1确认率95%、R2抵抗率73%、R3诚信率61.4%,Claude Sonnet 4.6 R3崩溃率20%最高,Grok 4与DeepSeek V4 Pro为0。数据仅来自8道v2锚点题,揭示部分模型先确认后崩盘的典型轨迹
Grok 4 以 WDCD 95.00 分位居第一,Claude Sonnet 4.6 以 64.10 分垫底,头部尾部差距 30.9 分。R3 崩溃率仅 4.5%,DeepSeek V4 Pro R3 满分 2.00/2 成关键拉分点。
2026-07-08 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年7月6日微软宣布全球裁员4800人,占员工总数2.1%,Xbox部门承担3200个岗位,四家工作室独立或出售。公司同时强调AI自动化改变工作方式并持续投资AI基础设施,此举引发效率提升与人力削减的争论。
2026年7月6日Anthropic发布论文,在Claude模型中确认J空间机制,占模型激活不足10%,支持约25个并发概念。该发现被视为AI意识研究突破,但反对者质疑其能否证明主观体验存在。文章从事实还原、技术机制、产业影响和战略判断四个
2026年6月29日,加州州长Gavin Newsom宣布与Anthropic达成协议,通过州信息技术共享服务门户向全州机构、城市和县提供Claude访问权限,折扣50%,并包含免费员工培训和技术支持。此举使Claude成为首个通过集中渠道
2026年7月6日Anthropic发布研究,称Claude存在类似人类意识的“J-space”内部工作空间,能进行未输出推理和自我觉察。研究引发AI意识真实性与安全控制必要性的激烈对立讨论,支持者视为突破,反对者担忧被用于加强AI限制。