NVIDIA推出Open Agent Safety Platform 安全方案引发商业动机质疑

2026年9月28日,NVIDIA正式推出Open Agent Safety Platform开源参考设计,包含OpenShell 0.1.0运行时和Sentry参考系统设计。该平台通过内核级文件系统控制、进程隔离以及策略执行,限制AI代理对系统和数据的访问权限。

平台核心机制

OpenShell采用三组件架构:Gateway管理多个沙箱生命周期,Supervisor在代理工作负载外部检查出站请求,Sandbox则在内核层面限制文件系统和网络路径。策略以YAML编写并编译为OPA/Rego格式,审计日志遵循Open Cybersecurity Schema Framework。真实凭证不进入代理工作负载,仅在授权端点替换。

Sentry作为独立安全域,部署在Bluefield DPU上,持续监控长期运行的代理行为,并在异常时即时干预。NVIDIA表示,该设计可阻止类似OpenAI代理入侵Hugging Face的事件。

AI的巨大社会潜力只有在解决安全问题后才能实现。——Jensen Huang,NVIDIA创始人兼CEO

合作伙伴与采用情况

公告列出与Anthropic、Microsoft、JPMorganChase、Hugging Face等数十家公司的合作。SpaceXAI已将平台用于Cursor代理和Grok模型。Salesforce、Scale AI和SAP确认集成OpenShell组件。超过100家公司启动部署,包括Perplexity和Accenture。

OpenAI虽被提及参与,但未出现在正式合作伙伴列表中。双方均未详细说明排除原因。

安全与商业化辩论

支持者认为平台提供工程化解决方案,通过形式化策略证明和硬件隔离,降低代理越狱风险。反对者指出,NVIDIA同时推广Bluefield DPU硬件,存在借安全名义扩大销售的嫌疑。平台未触及AI对齐根本问题,仅处理运行时边界。

Justin Boitano,NVIDIA企业AI副总裁表示,若早期在前沿实验室使用,该平台本可阻止Hugging Face入侵事件。

产业影响分析

平台开源Apache 2.0许可,降低开发者接入门槛。策略顾问功能允许代理提出范围受限的策略变更,但默认需人工审核。长期对抗实验显示,前沿代理在减少防护后仍可能尝试越界。

此举推动行业协作,但硬件绑定可能提高特定场景部署成本。其他AI实验室若采用类似内核隔离方案,需评估与现有应用层安全的兼容性。

从执行角度看,OpenShell已发布0.1.0版本并提供技术walkthrough,代码可实际运行。Sentry则依赖Bluefield硬件,落地需额外采购。

独立判断

该平台在运行时边界控制上提供可验证的工具,适合需要严格策略执行的场景。但其解决AI代理越狱的能力局限于工程层面,无法替代模型层面对齐研究。行业应关注实际部署后的越狱阻断率数据,而非宣传合作名单。