乐于分享
好东西不私藏

DGX Spark 本地 AI agent 与多机集群:NVIDIA Computex 2026 更新解读

DGX Spark 本地 AI agent 与多机集群:NVIDIA Computex 2026 更新解读
点击蓝字
关注我们

2026 年 Computex 上,NVIDIA 为 DGX Spark 个人 AI 超级计算机发布了两项更新:一是 NemoClaw 简化安装,几分钟即可跑起本地 agent;二是 NVIDIA Sync 中的 cluster assistant,把 2~4 台 DGX Spark 组成 256~512 GB 统一内存池。配合 NVFP4 量化与 MTP 优化,官方公布的推理吞吐提升最高可达 2.6×(up to)。本文基于 NVIDIA 开发者博客原文与官方文档整理,不夸大性能,只谈官方公布的配置与数据。

01|背景:为什么把 agent 跑在本地

自主、长时运行的 AI agent 带来了一类新的算力需求:任务要维持大上下文窗口、会派生并发子 agent、持续迭代,并且不依赖云端。

NVIDIA 给出的路径是:让 agent 跑在开发者自己的硬件上,由 NemoClaw 负责编排执行。这样做有三个直接结果——敏感上下文保留在设备本地开发者直接控制 agent 的访问范围不再有按 token 计费的成本

承载这套方案的硬件是 DGX Spark:GB10 Grace Blackwell 超级芯片,128 GB 统一内存,板载 ConnectX-7(CX-7)网卡,支持 200 Gbps RoCE 网络。单台机器可以本地运行 35B 级别的开放模型;需要更大模型时,则走向多机集群,这是后文的话题。

02|NemoClaw:一条命令装完本地 agent 栈

NemoClaw 是一个开源蓝图(blueprint),把三样东西打包进一次安装:开放模型agent 运行底座(Hermes Agent 或 OpenClaw),以及 NVIDIA OpenShell 运行时。OpenShell 是为自主 agent 设计的安全沙箱执行环境,提供三层机制:agent 的工具调用在沙箱内隔离执行,对外网络访问受访问控制策略约束,高风险操作有操作护栏拦截。

安装只需要一条命令:

curl -fsSL https://www.nvidia.com/nemoclaw.sh | bash

这条命令会自动安装 Node.js(如需要)、安装 OpenShell、克隆 NemoClaw 稳定版、构建 CLI,并运行向导创建沙箱。向导过程中确认许可、执行快速安装后,本地会自动部署 Ollama 并下载 Qwen3.6-35B 模型。OOBE 完成后,系统会自动打开 build.nvidia.com/spark 上的 NemoClaw 引导页。官方称,从开箱到跑起 agent 只需几分钟,不含初始模型下载时间(取决于网速)。

附注:配合 2026 年 6 月版 DGX Spark 系统软件,首次开机默认不再自动安装 OTA 更新,可更快进入 Ubuntu 桌面。

03|跑起来:访问、示例 agent 与定制

安装完成后,先获取 WebUI 的访问令牌:

nemoclaw <sandbox名> gateway-token --quiet

然后在浏览器打开 http://127.0.0.1:18789/#token=<TOKEN>。注意:地址里必须用 127.0.0.1,不能用 localhost——gateway 有 origin 检查。进去之后发一条测试消息,确认全栈已通;本地 Ollama 模型已自动选好,无需手动配置。

NemoClaw 自带四个可直接运行的示例 agent,每个都带策略配置、起始 prompt 和个性化指引:

  • 每日个人新闻摘要:定时抓取订阅主题,把结构化摘要推送到 Telegram。

  • 软件开发 agent:读取本地项目目录、制定计划、写代码并自我审查,全程除本地推理外无外部网络访问。

  • 演示文稿与文档审查:在文件发出前做红队检查,按严重度输出问题清单——前后不一致、无来源的论断、无障碍问题。

  • 日程协调员:把「什么时候能见面」的邮件往返,变成已确认的日历事件。

进一步定制 agent 行为,主要靠三个抓手:

  • system prompt:在仪表盘里编辑 agent 的指令。prompt 越具体,agent 表现越稳定。

  • 工具权限:OpenShell 网络策略控制 agent 能访问哪些外部地址,权限越窄,意外行为越少。

  • 消息渠道集成:如果安装时开了消息渠道,在手机上也能直接和它对话,用的还是同一个本地模型。

命令
作用
nemoclaw <名> status
查看沙箱状态与推理健康度
nemoclaw <名> logs --follow
实时跟踪沙箱日志
nemoclaw list
列出所有已注册的沙箱

官方建议:首次运行先给 agent 一个边界清晰的窄任务,比如「总结一个文件」,确认响应与工具调用正常后,再逐步扩大权限。

想换模型,运行 nemoclaw onboard --fresh --gpu 并在向导中选择新模型。注意 --fresh 会销毁并重建现有沙箱;想保留旧沙箱,用 --name <新名> 另建一个。

04|Qwen3.6-35B:2.6× 吞吐提升的构成

NemoClaw 默认下载的 Qwen3.6-35B,是本次性能更新的重点。官方数据是:在 vLLM 上使用 NVIDIA NVFP4 量化 checkpoint(检查点),配合 MTP(multi-token prediction,多 token 预测)优化,整体推理吞吐提升可达 2.6×。需要说明的是,2.6× 是官方给出的上限(up to),实际提升幅度取决于具体负载与配置。

2.6× 背后是一批内核级优化:FlashInfer 下 MTP 的 CUDA Graph 支持、FlashInfer MoE kernel 的 BF16 自动调优、TinyGEMM 与 cuBLAS 的 BF16 路径。这里不展开细节,普通读者知道它们存在即可;需要复现时可在官方博客中找到对应条目。

05|2~4 台集群:NVIDIA Sync 的 cluster assistant

单台 128 GB 不够用怎么办?NVIDIA Sync 里的 cluster assistant 可以把 2~4 台 DGX Spark 组成高带宽集群:2 台提供 256 GB 统一内存,官方称足以运行约 400B 参数的模型;4 台提供 512 GB,可承载大型 MoE 模型、多并发推理实例,或受益于分布式内存的微调任务。

难点在 ConnectX-7 的网络配置:netplan、节点间 SSH 信任、逐链路带宽验证、IP 规划,手工做每一步都容易出错。cluster assistant 把这些步骤变成 Sync 里的引导式流程:

  1. 环境检查:确认各节点 OTA 版本与 sudo 权限(要求 2026 年 4 月或更新的系统软件)。

  2. 拓扑探测:在各节点并行运行探针,结合 LLDP/BPDU 探测信息与接口、IP 检查。

  3. IP 规划与冲突消解,并下发 netplan 配置。

  4. 带宽与延迟验证:使用 ib_write_bw / ib_write_lat。

  5. 节点间 SSH 配置:密钥经 CX-7 fabric 路由。

支持的物理拓扑有三种:

拓扑
连接方式
交换机
双机直连
单根 QSFP 线连接两台机器的 CX-7 端口
不需要
三机环
三根 QSFP 线组成闭环,每节点两个 CX-7 口都用上
不需要
2~4 台经交换机
每台机器各用一根 QSFP 线接入 QSFP 交换机
需要

若使用交换机,官方列出的硬件门槛如下:

  • 端口数:至少 4 个 QSFP56-DD 端口。

  • 拆分速率:支持 25/50/100/200/400G。

  • 每口带宽:建议 200G~400G。

  • 管理口:1 个 1/10GbE。

  • 协议:支持 RoCE v2。

  • 交换容量:0.8~1.6 Tbps。

还有一点值得注意:cluster assistant 只负责配置网络与节点间 SSH,不负责安装,也不编排 NCCL 或 vLLM 等工作负载;官方文档还特别提到,三机环拓扑下使用 NCCL 需要手动编译。集群网络配好之后,跑什么编排框架由用户自己决定。

06|结语

这次 Computex 更新降低的是两个门槛:本地 agent 的开箱上手门槛,以及多机组网的配置门槛。一台 DGX Spark 加一条命令,可以得到一个带安全沙箱的本地 agent;两到四台机器加一次引导式配置,可以得到 256~512 GB 的统一内存池。

它替代不了数据中心;但对需要在本地验证 agent 工作流、又对数据隐私有要求的开发者与团队,这是一条有官方文档支撑、可以照着做的路径。


数据来源与参考

  • NVIDIA Developer Blog:Run Local AI Agents with Faster Models and Multi-Node Clustering on NVIDIA DGX Spark(Computex 2026)

  • NVIDIA Sync 官方文档:Cluster Assistant for ConnectX-7 Multi-Node Clusters

  • build.nvidia.com/spark:Start with NemoClaw on DGX Spark 引导页

  • DGX Spark 硬件规格:NVIDIA 官方产品资料(GB10、128 GB 统一内存、ConnectX-7 200 Gbps)

如果您希望获取关于NVIDIA GPU、液冷一体机、InfiniBand、NVIDIA网络的更多详细信息,或者有关于产品的任何疑问,欢迎通过文章末尾联系方式与我们的专业销售人员取得联系。我们期待为您提供帮助,并解答您的所有问题。

广州市恒联计算机科技有限公司是一家专注于人工智能和高性能计算领域的技术型企业,作为英伟达精英级合作伙伴,我们致力于为政府、教育、企业以及医疗等各大行业提供先进的信息技术服务和解决方案。

我们的业务覆盖了人工智能的核心领域,包括高性能计算和深度学习等关键技术的研发与应用。凭借在高性能计算集群管理软件的专业知识,我们为客户提供包括英伟达GPU卡的销售、部署、运维在内的全方位服务,同时专注于集群网络的优化,确保客户能够充分利用GPU的强大计算能力。

恒联科技拥有丰富的行业经验,我们的客户群体包括众多知名学术机构和企业,如清华大学、中国科学院、中山大学、暨南大学以及广州中医药大学等。通过与这些顶尖机构的紧密合作,恒联科技不断推动技术创新,提升服务质量,以满足客户在科研、教育和商业应用中的高标准需求。

我们的核心团队由经验丰富的工程师和行业专家组成,他们对人工智能和高性能计算领域有着深刻的理解和热情。恒联科技不仅提供技术解决方案,还致力于为客户提供持续的技术支持和服务,帮助他们在各自的领域中保持领先地位。

如想进一步了解公司或者业务相关详情,赶快扫描以下二维码联系我们的销售人员吧:

销售总监:华先生

联系方式:13711281330

微信号:shwa88