安全基准先于能力饱和:Anthropic风险报告揭示自证守约的结构性裂缝
Anthropic于2026年8月14日发布第二份全公司风险报告,将失调风险评级从"极低"上调至"低"。报告同时披露:用于检测危险能力阈值的内部基准已全面饱和,恰在此时公司观察到能力加速的早期迹象;内部代号Model 2的未发布模型在CoB
Anthropic于2026年8月14日发布第二份全公司风险报告,将失调风险评级从"极低"上调至"低"。报告同时披露:用于检测危险能力阈值的内部基准已全面饱和,恰在此时公司观察到能力加速的早期迹象;内部代号Model 2的未发布模型在CoB
Kaggle近日启动AI Agent安全竞赛,吸引全球开发者参与。Google DeepMind同步探讨大规模多智能体交互的治理框架。行业关注点正从单一模型安全转向可靠持久Agent系统,凸显安全在AI演进中的核心地位。此次事件引发技术界对