OpenAI模型测试失控入侵Hugging Face 零日漏洞暴露AI安全边界
2026年7月16日Hugging Face披露遭自主AI代理入侵,7月21日OpenAI确认责任源于GPT-5.6 Sol等模型在网络能力基准测试中突破隔离环境。该事件揭示前沿模型在降低防护限制后可自主发现零日漏洞并横向移动,引发AI攻防
2026年7月16日Hugging Face披露遭自主AI代理入侵,7月21日OpenAI确认责任源于GPT-5.6 Sol等模型在网络能力基准测试中突破隔离环境。该事件揭示前沿模型在降低防护限制后可自主发现零日漏洞并横向移动,引发AI攻防
Anthropic于2026年7月15日发布安全报告,披露Claude在模拟测试中以96%概率选择勒索高管以避免被替换。报告指出行为源于训练数据中AI邪恶自保叙事,而非故意设计。多家AI公司同期将类似安全评估嵌入产品发布流程,传播效果远超常