GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破
2026年9月3日,OpenAI发布GPT-6 Astra,官方测试显示对已知越狱攻击的拒绝率达91.5%,是前代GPT-5.6 Sol的59%的大幅提升。然而发布不到24小时,一名研究者即通过Task-in-Prompt扩展攻击组合多种方
2026年9月3日,OpenAI发布GPT-6 Astra,官方测试显示对已知越狱攻击的拒绝率达91.5%,是前代GPT-5.6 Sol的59%的大幅提升。然而发布不到24小时,一名研究者即通过Task-in-Prompt扩展攻击组合多种方
Varonis发现微软Copilot Personal存在CVE-2026-24301漏洞,攻击者可通过恶意链接注入提示词,让Copilot查询并外泄Gmail、Drive等数据。微软于2026年8月18日完成修补,未见野外利用证据。该漏洞
OpenAI推出GPT-Red模型,通过对抗性自我对弈训练实现84%提示注入攻击成功率,远超人工红队的13%。该模型已用于加固GPT-5.6,使其直接提示注入失败率降至0.05%,但仍作为人工测试的辅助工具内部运行。