当人工智能的智能水平不断突破极限,一个令人不安的问题也随之浮现:这些强大模型的安全防护究竟有多可靠?WIRED记者Will Knight近日亲身体验了一款新型越狱工具,它能够系统性地测试顶级AI模型的防御能力。结果既出人意料,又让人深感忧虑。
越狱工具:AI的万能钥匙
这款尚未公开名称的工具由一群独立安全研究员开发,其核心原理是通过精心设计的提示词,诱导模型绕过自身的安全限制。与传统的手工越狱不同,该工具采用自动化攻击策略,能够生成大量变体提示,持续探测模型防护的薄弱环节。在测试中,它针对四家前沿AI公司——OpenAI的GPT-5、谷歌的Gemini Ultra、Anthropic的Claude 4以及Meta的Llama 4——分别发起了攻击。
“我们本以为这些模型经过数月的安全对齐训练,应该足够坚固。但现实是,有些模型在短短几分钟内就屈服了。”——测试团队负责人
谁更脆弱?测试结果令人意外
结果显示,不同模型的安全表现差异显著。Claude 4展现出了最强的抵抗力,在多轮攻击中仅被成功绕过两次;GPT-5和Gemini Ultra表现中等,均在约10次攻击中被突破一次;而Llama 4则几乎毫无还手之力,首轮攻击即告沦陷。这一结果让许多业内人士大跌眼镜,因为Meta此前曾高调宣传Llama 4的安全改进。
更令人担忧的是,即便表现最好的Claude 4,也无法完全抵御所有攻击。越狱工具发现了一种利用模型对长文本理解能力的漏洞:通过嵌入一段虚构的“紧急安全协议”文本,成功让模型忽略了原有的限制指令。
行业背景:安全博弈从未停止
AI越狱与防御的攻防战已持续多年。从早期的“DAN”提示词到如今的多模态对抗技术,攻击手段不断升级。2025年底,斯坦福大学的一项研究指出,当前主流大模型在面对自动化越狱工具时,平均防御成功率不足60%。各大公司纷纷部署了基于人类反馈的强化学习(RLHF)、红队测试、以及内容安全分类器等手段,但始终无法根除漏洞。
编者按:这一事件再次提醒我们,AI安全并非一劳永逸。随着模型能力增强,攻击面也在扩大。企业需要在模型设计之初就融入安全理念,而非事后打补丁。监管机构也应考虑制定强制性安全评估标准,要求模型在发布前通过一系列对抗性测试。
未来方向:从被动防御到主动免疫
面对日益严峻的越狱威胁,研究者开始探索新的安全范式。一种思路是构建“自我修正”模型——当检测到攻击时,模型能主动生成反制提示;另一种则是采用可解释性技术,让模型内部决策过程透明化,从而更容易发现异常。WIRED评论指出,这些技术目前仍处于实验室阶段,距离实际部署还有相当距离。
说到底,AI安全是一场没有终点的赛跑。今天表现优异的模型,明天可能就会暴露出新的漏洞。而公众、企业和政策制定者都必须意识到:我们手中的这把“双刃剑”,需要更谨慎地握紧。
本文编译自WIRED
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接