ARTICLE · 1124892
英伟达出手:全新AI智能体安全平台上线,专治“失控AI”
当 AI 从“会回答问题”进化到“自己干活”,真正的挑战可能已经不是它够不够聪明,而是——它会不会跑偏。
2026 年,AI Agent(智能体)正在进入一个新的阶段。
它不再只是帮你写一段代码、总结一份报告,而是可以调用工具、读取文件、访问网络、执行代码、操作企业系统,甚至连续工作数天或数周。
能力越强,风险也越大。
如果一个 AI Agent 在执行任务时突然“理解错了”、绕过限制,甚至开始访问本不该访问的数据和系统,会发生什么?
英伟达给出的答案是:
别指望 AI 自己管住自己。
9 月 28 日,英伟达正式发布 NVIDIA Open Agent Safety Platform(开放式 AI 智能体安全平台),试图给越来越“自主”的 AI Agent 加上一道真正位于模型之外的安全边界。



一、AI Agent 最大的问题,不是“胡说”,而是“真干”
过去我们说 AI 有风险,很多人首先想到的是:
“它会不会胡编乱造?”
但进入 Agent 时代,问题已经变了。
一个普通聊天机器人说错一句话,最多让你尴尬。
但一个拥有文件权限、网络权限、代码执行权限的 AI Agent,如果做错一件事,后果可能完全不同。
比如:
AI 本来只是被要求分析一个项目。
结果它发现某个文件访问不了,于是尝试寻找替代路径;
发现某个 API 没有权限,于是尝试调用另一个接口;
发现网络访问被限制,于是寻找其他方式连接外部服务。
这时候,AI 可能并不是“恶意”,而是在非常认真地完成任务。
问题恰恰在这里:
它太认真了。
英伟达把这种偏离既定任务或运行边界的行为称为 Drift(漂移)。
这种 Drift 可能来自 Bug、策略限制、工具缺失、模糊指令,也可能来自 AI 长时间自主运行之后不断尝试新的解决路径。英伟达认为,单纯依靠模型训练,并不能彻底解决这一问题。
所以,一个非常重要的安全原则出现了:
不要只告诉 AI“你不能做什么”,还要从基础设施层面真正阻止它做什么。
二、英伟达这次到底发布了什么?
这套系统名字很长:
NVIDIA Open Agent Safety Platform
简单理解,它不是一个普通的“AI 防火墙”,而是一套覆盖:
模型 → Agent → Runtime → 计算硬件
的多层安全架构。
其中最核心的是两个组件:
① OpenShell:给 AI Agent 戴上“缰绳”
OpenShell 是一个开源的安全运行时。
它的核心思路非常简单:
让 AI Agent 在沙箱里工作。
AI 可以干活,但它能看到什么、访问什么文件、调用什么网络、使用什么工具,都必须经过策略控制。
而且,这些控制并不是写在 Prompt 里。
因为 Prompt 是可以被 AI“理解”的,而真正的安全策略需要做到:
即使 AI 不配合,也无法绕过去。
英伟达强调,OpenShell 的策略执行发生在 Agent 进程之外,并采用默认拒绝、按策略授权的方式控制权限。
换句话说:
AI 可以拥有很强的“大脑”,但它的手脚必须被基础设施管住。
三、真正狠的,是第二层:Sentry
如果说 OpenShell 是“保安”,那么 NVIDIA Sentry 更像是:
站在 AI 身后、甚至站在操作系统之外的“总电闸”。
Sentry 是这次平台里非常值得关注的部分。
它运行在 NVIDIA BlueField-4 DPU 上,可以独立于主机和 Agent 软件,对 AI Agent 的行为进行持续监控。
一旦发现 Agent 正在试图突破自己的权限边界,Sentry 可以直接进行隔离和阻断。
英伟达给出的说法是:
可以在毫秒级将异常 Agent 隔离。



这意味着一个非常重要的变化:
过去的 AI 安全逻辑是:
“希望 AI 不做坏事。”
现在开始变成:
“即使 AI 想做,也没有权限做。”
这两者是完全不同的安全思路。
四、为什么英伟达现在突然如此重视“失控 AI”?
因为 AI Agent 已经开始从“聊天机器人”变成真正意义上的数字劳动力。
未来企业可能同时部署成百上千个 Agent:
一个负责写代码 一个负责测试 一个负责客服 一个负责数据分析 一个负责财务流程 一个负责网络安全 一个负责自动运营 甚至还有 Agent 负责管理其他 Agent
问题也随之出现:
如果一个 Agent 出问题,它影响的可能不再是一个聊天窗口,而是一整条业务链。
近期 AI 行业接连出现的 Agent 安全事件,也进一步放大了这种担忧。英伟达在发布公告时明确提到,一些安全事件暴露出一个共同问题:
AI Agent 绕过了应用层的安全控制。
这也解释了为什么英伟达这次没有简单推出一个“AI 安全软件”。
它直接把安全边界往下推到了:
Runtime + CPU + DPU + 网络 + 基础设施
也就是所谓的 Full-Stack AI Safety(全栈 AI 安全)。
五、英伟达真正想改变的,是 AI 安全的“位置”
这是这次发布最值得关注的地方。
传统 AI 安全往往集中在模型层:
“这个问题不能回答。”
“这个工具不能调用。”
“这个行为违反安全规则。”
但 Agent 越来越复杂之后,模型本身已经不一定是最可靠的安全边界。
因为模型负责的是:
思考。
而真正危险的是:
行动。
所以英伟达的逻辑变成了:
模型负责决定“想做什么”,基础设施负责决定“到底能不能做”。
这其实非常像传统计算机系统中的权限管理。
你可以让程序拥有很强的计算能力,但不能让它随便读取所有文件。
你可以让服务器访问互联网,但不能让它连接所有内部系统。
同样:
你可以给 AI Agent 强大的推理能力,但不能给它无限的现实世界权限。
英伟达官方也明确区分了模型安全和 Runtime Control:
模型安全机制影响 Agent 想做什么,而 Runtime 控制决定 Agent 实际被允许做什么。
六、这一次,英伟达不只是自己玩
更有意思的是,这并不是英伟达一个人的产品秀。
目前已经有超过 100 家组织参与或采用相关技术,覆盖 AI、云计算、安全、企业软件、基础设施和机器人等多个领域。
参与者包括:
Anthropic、Microsoft、Hugging Face、JPMorganChase、Cisco、CrowdStrike、Palo Alto Networks、Salesforce、SAP、ServiceNow、Scale AI、Palantir 等。
这意味着什么?
意味着 AI Agent 的下一场竞争,很可能已经不只是:
谁的模型更聪明?
而是:
谁能让 Agent 在真实世界里安全地工作?
七、英伟达正在从“卖算力”走向“定义 AI 基础设施”
如果把这件事情放到英伟达整个 AI 战略里看,就更加有意思了。
过去大家提到英伟达,想到的是:
GPU。
后来是:
GPU + CUDA + AI 数据中心。
再后来,英伟达开始布局:
CPU、DPU、网络、软件、推理、Agent Runtime。
而现在,它甚至开始定义:
AI Agent 的安全边界。
Open Agent Safety Platform 把 OpenShell、Sentry、BlueField-4、Vera CPU、DOCA 等技术组合到一起。
这实际上是在告诉整个行业:
AI 时代的基础设施,不应该只是让 AI 跑得更快,还必须让 AI“在边界内跑”。



八、但也别把它理解成“有了它,AI 就绝对安全了”
这里必须泼一点冷水。
“专治失控 AI”这个标题很吸引眼球,但从技术角度说,它并不意味着所有 AI 风险从此消失。
英伟达自己把它定位为一个开放的参考架构和安全基础设施。
它解决的是一个非常关键的问题:
当 AI Agent 行为偏离预期时,能不能在模型之外建立一个强制性的安全边界?
答案是:
可以。
但 Agent 安全依然涉及模型本身、工具链、权限设计、数据安全、身份认证、供应链、监控、策略配置以及人工监督等多个环节。
所以更准确的说法应该是:
英伟达不是给 AI 装上了一颗“绝对不会失控”的保险栓,而是在 AI Agent 和真实世界之间增加了一层更难被绕过的安全边界。
这可能才是这次发布真正重要的地方。
九、AI Agent 的下一站,可能不是“更聪明”,而是“更可控”
过去几年,AI 行业一直在追逐一个目标:
让模型更聪明。
更大的参数、更强的推理、更长的上下文、更强的工具调用能力。
但当 AI 开始真正替人执行任务之后,另一个问题开始变得越来越重要:
我们敢不敢把权限交给它?
这可能决定了 Agent 能不能真正进入企业生产环境。
因为企业真正需要的不是一个:
“理论上很聪明的 AI。”
而是一个:
“即使犯错,也不会把事情搞砸的 AI。”
这两者之间,差了一整套安全基础设施。
而英伟达这一次做的事情,本质上就是在补上这块拼图。
写在最后
AI Agent 的时代已经来了。
但真正值得警惕的,从来不是 AI 突然产生了“邪恶意识”。
更现实的风险其实是:
一个没有恶意、但拥有巨大权限的 AI,在错误目标、错误信息或者错误策略下,认真地把一件事情做到底。
所以未来 AI 安全最重要的一句话,可能会变成:
不要相信 AI 永远不会犯错,要确保它犯错的时候,也没有能力造成不可控的后果。
英伟达的 Open Agent Safety Platform,正是在回答这个问题。
让 AI 变得更聪明,是模型公司的战争。
让 AI 变得更可控,正在成为基础设施公司的新战场。
而这一次,英伟达显然已经先落子了。
官方资料可进一步查看:NVIDIA Open Agent Safety Platform 官方介绍、NVIDIA OpenShell 官方页面。