乐于分享
好东西不私藏

Cisco 关于 AI 网络(AI Networking)的理解

Cisco 关于 AI 网络(AI Networking)的理解

整体概要

Cisco 将 AI 网络(AI Networking)定义为"双轨"方案:一是支撑 AI 工作负载的专用高性能基础设施(数据中心内连接 GPU 的"后端"网络 Fabric),二是用 AgenticOps 这种自主推理式运维模式来管理这套基础设施和企业核心网络。文档类型:概念科普 / 产品理念介绍页

核心知识速查表

标记
概念
说明
🔴
AI Networking 定义
专用 AI 基础设施 + AgenticOps 自主推理式运维的结合,服务于数据中心和企业核心网络
🔴
三大核心功能
①数据中心后端(无损 Fabric)②企业前端(园区网/WAN)③AgenticOps 推理层
🔴
数据中心后端
GPU 间通信采用 All-Reduce / All-to-All 等同步集合通信模式,产生"同步微突发"
🔴
RoCEv2
RDMA over Converged Ethernet,绕过 CPU 实现内存到内存直传,超低延迟
🔴
PFC
Priority Flow Control,与 RoCEv2 配合防止训练突发流量丢包
⚠️
丢包代价
训练时哪怕丢 1 个包,整个 GPU 集群都要等待重传,浪费昂贵算力
🔴
企业前端
WAN 用预测式路径选择、园区网用自主保障,应对 AI 应用流量激增
⚠️
AgenticOps 的定位
是 human-in-the-loop:给出引导式建议,IT 团队保留治理权,非完全自主执行
⚠️
AgenticOps vs AIOps
AIOps 侧重模式匹配告警;AgenticOps 能"推理"复杂任务,但仍需人工确认
💡
深度网络模型
基于"数十年"网络遥测数据训练的领域专用模型,比通用 AI 更精准
🔴
可编程芯片
如 Cisco Silicon One ASIC,支持 800G 和 1.6T 高密度连接
💡
四大核心技术
可编程芯片、深度网络模型、预测性基础设施、统一编排(本地/云/边缘)
💡
数据中心用例
智能负载均衡 + 深度数据包缓冲,缩短大模型训练时间
💡
前端用例
自动检测"brownout"(局部性能骤降)并重路由,避免 AI 助手响应变慢
⚠️
安全/性能场景
此场景下系统"自动部署缓解措施"(更接近全自主),与排障场景的人在回路不同
🔴
可持续性
高基数(high-radix)交换机 + 先进光模块,降低功耗,兼顾 ESG 目标和"五个九"可用性
🔴
三大收益
缩短作业完成时间、运维可扩展性(AgenticOps 让小团队管理超大规模环境)、能效提升
⚠️
三大挑战
对网络抖动/拥塞极敏感、新旧基础设施整合复杂、网络+AI 治理复合型技能缺口
🔴
未来趋势
网络将扩展到 1.6T 及更高速率;近 90% CISO 预计 AI 攻击将超越人工防御速度

深度解析 Q&A

Q1:AgenticOps 到底是"自主运维"还是"人在回路"?为什么文档中的表述看起来不完全一致?

A:这是理解本文档的关键细节。在正文"AgenticOps and the reasoning layer"一节,原文明确写道 AgenticOps "facilitates a human-in-the-loop model where the system provides guided recommendations for troubleshooting or configuration, allowing IT teams to maintain governance while significantly increasing the speed of remediation"——也就是说,在故障排查和配置场景下,AgenticOps 只是给出推理后的建议,最终决策权和执行权还在 IT 团队手里,它的价值在于把排障速度大幅提升,而不是完全取代人。

但在"企业应用场景"一节讨论安全漏洞和性能退化时,原文说的是 "organizations utilize these systems to automatically deploy mitigations for security vulnerabilities or performance degradation in real-time"——这里描述的却是系统"自动部署"缓解措施,听起来更接近全自主执行。

所以准确的理解是:AgenticOps 在"排障/配置"这类需要人工判断、影响面大的操作上倾向于人在回路(给建议,人拍板);而在"安全/性能实时响应"这类时间敏感、规则相对明确的场景上,倾向于更自主的自动执行。FAQ 部分把 AgenticOps 笼统称为"autonomous",是一种简化表述,不能脱离正文的这层细分去理解。

Q2:为什么 AI 训练网络必须做到"无损"(lossless),具体靠什么技术实现?

A:原文解释,GPU 集群训练采用 All-Reduce、All-to-All 这类集合通信模式:所有 GPU 必须在同一轮迭代中互相交换梯度,这会产生"同步微突发"(synchronized microbursts)流量。一旦网络丢包,就需要重传,而重传期间整个集群都要等待——FAQ 里说得很直白:"if the network drops even one packet, the entire cluster must wait for it to be re-sent, wasting valuable time and compute power"。

实现无损的具体技术组合是 RoCEv2(RDMA over Converged Ethernet)+ Priority Flow Control (PFC)。RoCEv2 让数据在两台服务器的内存之间直接传输、不经过 CPU,从而拿到 AI 场景需要的超低延迟;PFC 则负责在链路层面防止拥塞导致的丢包。二者配合,才能撑住训练时的突发流量而不丢一个包。

Q3:数据中心"后端"和企业"前端"两套网络,分别解决什么问题,为什么要分开设计?

A:文档把 AI 网络拆成两个环境来讲,是因为二者的流量特征和优化目标完全不同。后端(backend)专注 GPU 到 GPU 的训练通信,目标是"零丢包",因为一丢包就拖慢全体 GPU;这里靠 RoCEv2 + PFC 的无损 Fabric 解决。前端(frontend,即园区网和 WAN)面对的是 AI 应用(比如数字助手、实时分析)给企业网带来的流量激增,目标是低延迟、体验一致,不需要像后端那样极致无损;这里靠 WAN 侧的"预测式路径选择"和园区网的"自主保障"来实时监测用户体验,一旦发现"brownout"(局部性能骤降)就自动重路由,让 AI 助手的响应不被拖慢。原文用一句话概括了这个分工:"While the backend builds the AI, the frontend delivers it to the users."


Sources:

  • • What is AI networking? - Cisco[1]

References

[1]What is AI networking? - Cisco: https://www.cisco.com/site/us/en/learn/topics/artificial-intelligence/what-is-ai-in-networking.html