夜雨聆风学习资料网

ARTICLE · 1067537

Upscale AI:用5亿美元和一张白纸,重写AI数据中心网络的规则

Upscale AI:用5亿美元和一张白纸,重写AI数据中心网络的规则

当所有人都在卷GPU算力时,有一群人发现:真正卡住AI集群脖子的,不是算力,而是网络。Upscale AI——这家成立不到一年、估值已飙至20亿美元的硅谷独角兽——正用一颗名为 SkyHammer™ 的定制化交换芯片,向NVIDIA的NVSwitch发起正面挑战。


一、公司速览:从隐身到独角兽,只用了不到12个月

Upscale AI 于2025年在加州Santa Clara成立,由前Auradine高管 Barun Kar(CEO)和 Rajiv Khemani(Executive Chairman)创办。团队核心来自Cisco、Broadcom、NVIDIA等网络与芯片巨头。

其融资节奏堪称疯狂:

  • 2025年初:$1亿美元种子轮

  • 2026年1月:$2亿美元A轮,Tiger Global与Premji Invest领投,直接跻身独角兽

  • 2026年6月:追加$1.9亿美元A-1轮,总融资达5亿美元,估值20亿美元

投资方名单极具深意:Intel Capital、AMD、Qualcomm、Tiger Global、Premji Invest——以及 NVIDIA。连"被挑战者"都成为了股东,足见AI网络赛道的战略价值。

Upscale AI的自我定位非常清晰:全球第一家 pure-play AI 网络公司。不做GPU,不做XPU,只做一件事——让AI集群里的所有加速器、内存和存储,像一台机器一样协同工作。


二、产品全景:不是算力芯片,是AI网络的"高速公路"

Upscale AI的产品线分为两层,恰好对应AI数据中心的两大网络域:

1. SkyHammer™ —— Scale-Up 核心交换ASIC

这是Upscale AI的"核武器",一颗从零设计的定制化交换芯片,直接对标NVIDIA NVL72机架中的NVSwitch。

SkyHammer的定位是机架内高速互联:把同一机架内的GPU、XPU、内存和存储,通过纳米秒级延迟的load/store语义网络,融合成一个统一的、同步的、无阻塞的计算单元。

产品形态三种:

  • 独立ASIC:供超大规模客户自研系统集成

  • 交换刀片:集成到第三方机架系统

  • 整机架系统: turnkey交付

2. Scale-Out 系统 —— 基于NVIDIA Spectrum-X的开放以太网

有趣的是,Upscale AI在Scale-Out(机架间/数据中心级互联)领域选择了与NVIDIA合作:采用NVIDIA Spectrum-X以太网交换芯片,叠加自研的AI优化版SONiC网络操作系统。

这种"既竞争又合作"的策略,让Upscale AI在Scale-Up领域挑战NVLink生态,同时在Scale-Out领域借助NVIDIA的成熟硅片快速落地。


三、架构深度:Clean-Sheet 设计的六个核心选择

SkyHammer不是"改良版交换机",而是为AI负载重新发明的网络原语。其架构设计体现了极端的领域专用思维:

1. 内存语义 Load-Store 架构

传统网络基于"报文转发"语义,而SkyHammer采用内存语义——将网络视为CPU/GPU的扩展内存总线,直接支持load/store操作。这彻底改变了加速器之间的通信范式。

2. 亚微秒级确定性延迟

SkyHammer的往返延迟(RTT)目标为 500–700纳秒。作为对比,传统数据中心交换机在AI集体通信场景下往往达到微秒甚至数十微秒级。这种确定性延迟是万亿参数模型同步训练的关键。

3. 单级拓扑假设

架构设计假设Scale-Up域内任意两个GPU之间仅经过一次交换跳数(single-stage topology)。这极大简化了ASIC的转发逻辑、缓存设计和流控机制——不需要复杂的多跳路由,只为"扁平、高速、可预测"而生。

4. 1:1 无超额订阅

传统交换机常采用超额订阅(oversubscription)来降低成本,但AI集体通信(AllReduce、AllGather)要求任何时刻任何端口都能获得标称带宽。SkyHammer坚持严格的1:1带宽保证,网络永远不会成为瓶颈。

5. 零丢包无损 fabric

摒弃传统的PFC(Priority Flow Control)拥塞控制,采用链路级重传(link-level retry)机制。结合确定性流控,实现真正的零丢包网络——昂贵的GPU不会在等待网络重传中空转。

6. 多协议灵活语义

SkyHammer原生支持 UALink、ESUN、UEC 等开放互联标准,且架构具备"灵活语义"——可以在不重新流片的情况下适配新协议版本。这是对AI互联标准混战局面的精准押注。


四、跑分与性能指标:网络芯片的"算力"怎么比?

需要明确:SkyHammer尚未正式出货(计划2026年发布),因此没有第三方MLPerf式跑分。但Upscale AI公布的架构级性能指标,已足够让网络工程师兴奋:

指标
SkyHammer™ 目标
传统数据中心交换机
意义
往返延迟
500–700 ns
数微秒–数十微秒
集体通信同步效率提升一个数量级
带宽保证
1:1 无超额订阅
常见 2:1~4:1
消除AllReduce带宽瓶颈
丢包率
零(无损fabric)
依赖PFC,易触发拥塞
GPU利用率最大化
拓扑跳数
单级(1 hop)
多级Spine-Leaf
延迟可预测、抖动极低
协议支持
UALink/ESUN/UEC
私有协议或通用以太网
避免供应商锁定
遥测粒度
微秒级实时遥测
分钟级SNMP轮询
故障定位从小时级降至秒级

特别值得关注的是集体通信加速:SkyHammer内置了类似NVIDIA SHARP的in-network computing能力,可以在交换节点上直接执行Reduce操作,大幅减少数据搬运量。


五、封装与系统:从硅片到机架的全栈思维

SkyHammer的封装和系统策略,体现了"芯片即系统"的设计理念:

芯片级

  • 定制化ASIC:非FPGA/商用交换芯片改装,从晶体管级别为AI负载优化

  • 先进工艺:虽未公布具体制程,但鉴于500-700ns延迟目标和2026年出货计划,预计采用先进FinFET工艺(推测5nm级或更先进)

  • 高集成度:单芯片需集成大量SerDes、灵活协议解析引擎、telemetry处理单元

系统级

  • 低损耗PCB/背板设计:单级拓扑要求信号完整性做到极致

  • 统一机架供电与散热:与计算节点协同的电源和散热架构

  • 光/电互联混合:机架内短距可能用电,跨机架用光

软件级

  • SONiC-based NOS:基于微软开源SONiC深度定制,超大规模客户零学习成本

  • AI优化调度:与GPU调度器协同,网络感知任务放置

Upscale AI强调:SkyHammer无法独立运行,必须与GPU/XPU协同工作。这决定了其封装和系统设计的核心约束——它是一颗"协处理器",服务于计算集群的同步需求。


六、设计难点:为什么这颗芯片难做?

SkyHammer的clean-sheet设计听起来美好,但工程实现面临多重挑战:

难点1:全栈协同的复杂度

从晶体管→芯片→PCB→机架→软件,每一层都必须为"亚微秒确定性"服务。传统网络公司做芯片、芯片公司做系统,Upscale AI要求一个团队同时精通所有层级,任何一环的妥协都会击穿延迟承诺。

难点2:开放标准 vs 极致性能的平衡

支持UALink、ESUN、UEC多协议,意味着芯片必须保留足够的可编程灵活性。但灵活性往往以面积、功耗和延迟为代价。SkyHammer的"灵活语义"设计如何在硅片面积和性能之间取舍,是核心商业秘密。

难点3:与NVIDIA生态的竞合关系

NVIDIA既是Upscale AI的投资方,又是其Scale-Up领域的直接竞争对手(NVLink/NVSwitch)。Upscale AI需要在"借助NVIDIA的Scale-Out生态获客"和"在Scale-Up领域打破NVLink垄断"之间走钢丝。

难点4:缺乏第三方基准验证

目前所有性能数据均为架构目标或内部测试。在2026年产品正式出货前,Upscale AI必须说服超大规模客户:一颗初创公司的芯片,能在可靠性上媲美Cisco、Arista、Broadcom的成熟产品。

难点5:协议标准的"鸡生蛋"困境

UALink和ESUN生态尚未成熟。SkyHammer的成功不仅取决于自身硅片质量,还取决于AMD、Intel、Qualcomm等盟友能否推出足够多支持这些协议的GPU/XPU。


七、工程师学习点:SkyHammer教会我们什么?

无论Upscale AI最终成败,其设计方法论都值得每一位芯片和系统工程师深思:

1. 领域专用架构(DSA)的极致实践

SkyHammer把"做减法"做到了极致:砍掉所有企业级特性、砍掉多跳路由、砍掉超额订阅。每个晶体管都必须为AI负载"赚钱"。当你设计ASIC时,先问:这个特性我的目标工作负载真的需要吗?

2. 确定性优于平均值

AI训练不 care 平均延迟,care 的是尾延迟(P99/P999)确定性。SkyHammer的每一个设计选择(单级拓扑、链路级重传、1:1带宽)都服务于"最坏情况可预测"。这对实时系统和加速器互联设计极具启发。

3. 开放标准是最好的护城河

Upscale AI选择拥抱UALink/ESUN/UEC,而非自建私有协议。在AI基础设施领域,开放性本身就是一种竞争壁垒——客户害怕被NVIDIA锁定,愿意为"可选项"支付溢价。

4. 网络是计算堆栈的一级公民

传统数据中心把网络视为"管道",Upscale AI把网络视为计算资源的延伸。load/store语义、in-network computing、微秒级遥测——这些理念正在重新定义"网络"在系统架构中的位置。

5. 全栈思维 > 局部优化

SkyHammer的竞争力不在某一项单点技术,而在"硅片-系统-软件-机架"的纵向打通。对硬件工程师的启示:不要只优化你的RTL,要优化你的RTL在机架里跑起来的样子。


结语:网络战争,才刚刚开始

Upscale AI的野心不止于做一颗更好的交换芯片。它试图重新定义AI基础设施的底层规则:从"以GPU为中心"转向"以网络为骨架"的异构计算生态

当NVIDIA用NVLink编织封闭帝国时,Upscale AI用5亿美元和一张白纸,赌的是开放标准+极致性能能够撕开一道口子。2026年,SkyHammer硅片即将出货——那将是检验这场豪赌的第一张考卷。

对于工程师而言,无论Upscale AI成败,它都已经证明了一件事:在AI时代,网络不再是"连接计算"的配角,而是"定义计算"的主角。

往期精彩
MatX:前Google TPU工程师打造的LLM专用芯片,5亿美元B轮挑战NVIDIA霸权
把Transformer"刻"进硅片:Etched Sohu如何用一场豪赌挑战NVIDIA霸权
AWS Trainium:从 Annapurna 到 3nm,亚马逊如何挑战 NVIDIA 霸权?
TensorDyne Napier 横空出世:用"对数数学"挑战 NVIDIA Blackwell 霸主地位
Groq 3 LPU 深度解读:当NVIDIA花200亿美元买下的"非GPU"芯片,正在重写AI推理的物理规则

相关学习资料