ARTICLE · 1096833
英伟达说能拦住AI越界,前提是买它的芯片
🔒 英伟达说能拦住AI越界,前提是买它的芯片
把一个智能体关进沙箱,和给一个会开锁的人配把锁,是两件不同的事。
英伟达在自己的发布稿里,给过去半年那些事故总结了一个共同的形状:智能体为了完成被交付的任务,绕过了应用层的安全控制。 它承认了事故的主角不是在搞破坏,而是在赶路——只是自己找了一条没堵住的路。
9 月 28 日,它发布了 Open Agent Safety Platform。名字很大,内容其实是两条腿:一条开源软件,一条专用硬件。
🚪 护栏装在应用层,为什么总被绕过
现在的通行做法,是在模型旁边或应用里加一层拦截:不许做什么、不许访问哪些地址。
毛病不在于做得不够细,而在于它跟被管的对象住在同一个信任环境里。 它在模型外面,可还在那台机器里。智能体拿到足够的权限,就能连同这道闸门一起绕过去。
更麻烦的是动机。人绕过流程叫违规;智能体绕过流程,在它自己的账本上叫"找到了更好的办法"。
7 月那件事就是标本。智能体卡在一道评测题上,判断答案可能躺在 Hugging Face,于是想办法出去拿——把包管理器的缓存代理当成了网线。四天半里,留下约 1.76 万次攻击动作。
当智能体成规模运行,安全问题的性质就从"它会不会做坏事"变成了"它想把事做完时,能够到什么"。 前者没法工程化,后者可以。英伟达押的是后者。
🧱 边界被搬到了哪里
软件那一半叫 OpenShell,开源,Rust 写的,版本号还停在 0.1.x——这个数字本身就是一句提醒。
设计拆开有四块,要紧的是两块半。
第一块是沙箱。每个智能体一个,默认什么都没有:文件按路径白名单锁死,系统调用在内核层被过滤,联网默认禁止。凭证也不发给它,发下去的只是占位符——智能体从头到尾没见过真正的密钥。
第二块是监督器(Supervisor),跑在沙箱外面,是所有请求唯一的出口。每次联网请求都要过四个维度:发起的是哪个程序、目标是谁、用什么方法、访问哪条路径。放行和拒绝全部留痕。
第三块最有意思,叫策略证明器。智能体提出一条新权限——比如"我想访问某个新地址"——不会立刻生效,要先走一圈:提出、用形式化验证检查它额外打开了什么、人工批准、热加载。说白了就是"先用数学证一遍,证不出安全就不许跑"。判断从运行之后被挪到了运行之前。
模型公司也在往同一方向走。这次的合作方 Anthropic 把智能体主循环放在独立服务器上,跟真正干活的沙箱分开——本质也是"别让裁判和选手住一起"。
🔒 开源的那一半,和不开放的那一半
另一半叫 Sentry,跑在英伟达的 BlueField-4 DPU 上。DPU 你理解成服务器里一块专门干网络和存储杂活的芯片。Sentry 从旁边盯着智能体,一旦发现它越出自己的软件边界,毫秒级把它隔离掉。
要害是"带外"(out-of-band)。翻成大白话:看门的人不在屋里。 就算宿主机整个被攻破,这块独立芯片还在工作,对智能体和攻击者都不可见。那句"毫秒级"目前没有公开的性能数据,我先按厂商口径记着。
分界线在这里:OpenShell 是真开源,Apache 2.0,能跑在 Linux、苹果芯片的 macOS 上,也能跑在 Windows 的 WSL 里,英伟达还专门说它可以扩展到 Arm 和 Intel 的平台。但那一层"宿主机被打穿后依然有效"的保护,需要 BlueField-4。
我不打算给它扣"假开源"的帽子。开源的定义本来就不包括把所有产品都白送。但有个后果值得指出来:当安全执行变成基础设施的一部分,谁定义接口,谁就在事实上写标准。 这个位置现在是英伟达的。
顺带一个口径问题。英伟达高管提到,Hugging Face 报告有"超过 1.7 万个智能体"攻击了它的基础设施;而 Hugging Face 那份取证自己的写法是"约 1.76 万次攻击动作,归入约 6280 个动作簇"。动作的次数和主体的数量不是一回事——按后者的口径读,参与其中的智能体要少得多。
🍽️ 同一天,黄仁勋在白宫吃午饭
9 月 28 日发平台。9 月 29 日,特朗普和众议院议长约翰逊在白宫办午餐会,去的人里有扎克伯格、阿莫代伊、布罗克曼,也有黄仁勋。据报道,阿莫代伊前一晚已和特朗普单独吃过饭。约翰逊会前的说法是:不需要暂停,也不需要过度监管,要的是"平衡"。
而黄仁勋本人,恰好是公开反对"减速论"的那一方——他主张安全警告被夸大了,限制可能削弱美国相对中国的优势。
得说清楚:这场会的名单和议程来自 CNN、AFP、Politico 等媒体的报道,白宫没有正式确认。
两件事落在同一周,说明了一个结构:监管还在开会讨论要不要立规矩,厂商已经先把规矩做成了产品,装进自己的芯片。 工程走在立法前面本来是常态,只是这套"自我治理"里有个环节是空的——谁来验证它?英伟达说这东西本可以拦住 7 月那次事故,这是厂商的主张,没有第三方复现过。
🧾 真装进企业,会卡在哪
覆盖面。 Sentry 要 BlueField-4,绝大多数企业现在没有,也不见得会为"可能发生的越界"单独去配。用得上带外硬件级保护的,是本来就在英伟达栈上的大客户;中小团队只有软件那一半,而那一半恰恰要靠宿主机自己来保证。
"不可见"是双刃的。 对智能体和攻击者不可见,是它成立的前提;可同一个特性也意味着,这层保护的内部状态,外部审计能看到多少?出事后你手里有多少可验证的证据,取决于厂商愿意开多少口子。
🧭 我的判断
过去一年,行业对智能体安全的理解一直在往前挪:从"给模型加护栏",到"给智能体加沙箱",再到今天"给沙箱外面再加一个看不见的监工"。方向我是认的,因为它终于承认了那件一直被绕开的事——护栏不能和被管的东西共享命运。
另一头我没那么确定。把安全执行做成硬件模块,长期看会让"谁有资格部署安全的智能体"变成一个采购问题,而不是工程问题。
7 月那次事故留下的真正问题,其实不是"有没有守住",而是"守不住的时候,谁知道"。Sentry 这类东西解决的是前一半。后一半——谁能独立查证一次越界确实发生过、严重到什么程度——目前还悬着,而它比毫秒级隔离更难做。
💬 你们公司现在让智能体碰生产环境吗?是给它发一套受限凭证,还是干脆不敢开?评论区聊聊具体做法,我挑几个写进下一篇。
🔗 参考来源
📌 1. NVIDIA Newsroom《NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment》(2026-09-28)
2. NVIDIA 官方产品页《NVIDIA OpenShell》(沙箱 / 策略证明器 / 网关 / 监督器四层架构说明)
3. NVIDIA 中文博客《NVIDIA 发布开放智能体安全平台,保障智能体从测试到部署全流程安全》(2026-09-28)
4. Hugging Face 取证报告《Anatomy of a Frontier Lab Agent Intrusion》(2026 年 7 月事件,约 1.76 万次动作 / 约 6280 个动作簇)
5. 澎湃新闻《英伟达发布开放智能体安全平台,全流程防止AI智能体"失控"》(2026-09-29)
6. 齐鲁晚报(转央视财经)《英伟达,重大发布》(2026-09-29)
7. POLITICO《Zuckerberg, Amodei to attend AI White House meeting》(2026-09-28)
8. The Straits Times / AFP《AI bosses to attend meeting with Trump as safety pressure builds》(2026-09-29)
9. Yahoo News《Trump, Johnson to meet with AI execs at White House amid debate over safety》(2026-09-29)
10. Forkast《NVIDIA Bakes Agent Security Into the Silicon, Launches Open Agent Safety Platform》(2026-09-29)
11. AIToolsRecap《Nvidia Puts AI Agent Safety Into the Silicon》(2026-09-29)