开源AI模型逼近前沿,安全差距仍然显著

开源AI模型逼近前沿,安全差距仍然显著

开源人工智能模型的进化速度,正以出乎所有人意料的方式突破想象。过去,人们普遍认为前沿AI能力仅掌握在少数闭源巨头手中,但最新发布的一份行业报告显示,这一格局正在被悄然改写。Z.ai推出的开源权重模型GLM-5.2,在多项基准测试中已逼近乃至持平当前最顶尖的闭源模型,然而真正让研究者感到不安的,是它在安全防护方面存在的明显空白。

这份由SaferAI发布的新报告,深入评估了GLM-5.2的能力边界与风险暴露。报告确认,该模型在推理、编码、多任务理解等维度上展现出接近前沿水平的实力,意味着开源社区第一次触及到如此强大的通用智能。然而,与同等能力级别的商业闭源模型相比,GLM-5.2缺少系统性的安全对齐、红队测试记录以及滥用缓解机制。这种能力与防护之间的严重不匹配,可能让强大的模型在脱管状态下被误用或恶意利用。

能力追赶,安全落后

报告的核心结论并不复杂:开源模型的智能水位正在快速抬高,但安全水位却未能同步抬升。对此,SaferAI在评估中具体指出了几个令人担忧的方面。首先,GLM-5.2在有害内容生成、越狱攻击和对抗性提示面前,显得比同等规模闭源模型更加脆弱。其次,模型发布前的安全评估信息不透明,外界无法得知开发团队究竟做了哪些防护尝试,更无法验证这些尝试的有效性。最后,由于模型权重完全开放,任何第三方都可以绕过原始开发者设置的使用防线,进行二次微调或部署,进一步放大潜在风险。

这种能力与安全的“剪刀差”,并非GLM-5.2独有的问题,而是整个开源AI生态面临的系统性挑战。近年来,从Llama系列到Mistral,再到DeepSeek等由华人社群推动的模型,开源模式一直被视作对抗闭源垄断、加速技术民主化的重要路径。但与此同时,研究者也多次警告,开源模型让强大AI技术触手可及,却几乎没有任何现成的治理框架能够约束其下游使用。

“我们正在见证一个危险的窗口期:开源模型的能力提升速度,已经超过了我们理解并管控其风险的速度。”——SaferAI报告的主要作者在媒体简报中表示。

治理框架的紧迫性

GLM-5.2的案例,再次将“开源AI是否有条件地开放”这一命题推至台前。一方面,支持者认为,模型开源性是确保AI技术长期安全的核心机制——透明代码与共享权重让更多研究者能够审阅、检测和修正潜在问题,而不是把一个越来越重要的基础技术锁在黑箱里。另一方面,批评者则指出,这种乐观假设的前提是,社会拥有足够的审查能力和应对工具,而现实显然远未达到。

事实上,监管层面的动作已经在全球多地加速。欧盟的人工智能法案已经将通用AI模型的透明度与风险评估列为强制性义务;美国也多次举行听证会,讨论开源模型的出口与安全约束。但此类政策大多聚焦于训练算力、数据合规或模型卡标注,对于开源权重模型特有的“不可撤回性”以及“下游不可控性”,尚未形成有效共识。

更核心的问题在于,安全评估本身的技术路径仍不成熟。现有的红队测试和对抗性基准,多源于对早期模型的研究经验,很难覆盖新一代接近前沿能力的开源模型所暴露出的全新风险。SaferAI在其报告中同样承认,即便其发布的评估结果,也只能反映某一时间点下的快照,模型真实风险必然随着使用场景的变化而不断漂移。

编者按:创新不能以安全为代价

GLM-5.2让我们看到,开源AI已经从一个“开源社区的玩具”成长为足以挑战闭源巨头的力量。这显然是值得庆祝的技术成就,但它所带来的安全落差,却容不得任何浪漫化的想象。闭源前沿实验室尚且在安全对齐上屡屡翻车,而开源社区在资源投入和审查条件远不及前者的情况下,又将如何承担起与其能力相匹配的责任?

我们认为,答案不在于禁止开源,也不在于给模型开发生硬套上枷锁,而在于为开源AI打造一套“阶梯式安全评估机制”——根据模型能力阈值,强制要求不同强度的外部审计、监测与事故报告义务。能力越接近前沿,安全门槛就应当越严格。唯有让能力进度与安全约束始终保持同步,我们才不会在追逐更聪明模型的过程中,遗失对风险的敬畏。

本文编译自TechCrunch