乐于分享
好东西不私藏

英伟达发力极速推理,软件TileRT专注batch 1优化.

英伟达发力极速推理,软件TileRT专注batch 1优化.

LLM推理的性能坐标轴上,一直存在着吞吐量(Throughput,tok/s/GPU)”交互度/单用户生成速度(Interactivity,tok/s/user)”的权衡。

针对实时语音助手、Agent交互和超高速代码生成等场景,Nvida先手布局Groq(LPU)为代表的专有数据流芯片,AMD奋起追赶,不但与晶圆级芯片设计公司Cerebras合作还拿下了Taalas,准备把大语言模型刻在芯片里。老黄又拿出了软件武器TileRT。

传统NVIDIA GPU架构在小BatchDecode(解码)阶段往往因频繁的内核启动(Kernel Launch)和内存同步开销而遭遇瓶颈。

SemiAnalysisInferenceX测评中针对TileRT的实测数据,给出了一个颠覆性的答案:通过软件架构与编译层面的创新,通用GPU同样能够交付500tokens/s/user的极致交互速率。

一、TileRT的核心技术突破

OperatorExecution Continuity 传统推理引擎(TensorRT-LLMvLLMSGLang)遵循Graph  Operator Kernel的经典执行抽象。在Decode阶段,由于Batch Size较小,GPU极其依赖内存带宽,而模型被拆解成数百个独立的算子后,内核启动(Setup/Teardown)、跨算子同步和显存频繁加载的开销逐渐占据了关键路径,导致GPU计算单元在等待调度的过程中严重空转。 TileRT解决这一痛点的核心思路是:以持续执行(Execution Continuity)替代频繁调度

1. Persistent Engine(持久化执行引擎) TileRT将整个Decode阶段的计算图静态编译为单个持久化Kernel(Single Persistent Kernel)。一旦挂载到GPU上,计算单元无需在每个算子结束后归还控制权,彻底消除了算子间启动与调度的等待时间。

2. Tile级管线重叠(Tile Pipelines & Cross-Kernel Tiling)SRAM / On-chip Cache层面打通数据流,将计算、显存加载/写入以及跨卡/跨节点通信在Tile粒度上实现最大程度的Overlap(掩盖latency)

二、InferenceX关键实测数据解读

8B200节点、针对GLM-5 FP8(744B参数)大模型的InferenceX评测中,TileRT展现出了极其惊人的表现:

关键结论:

1. 跨代际与跨精度降维打击:TileRT仅基于FP8精度,就击败了传统引擎经过FP4量化加上MTP(Token预测/推测解码)加速后的极限表现。

2. 以小博大的节点效率:仅需一台8B200服务器,其单用户交互速度达到了运行传统引擎的GB300 NVL72机柜(72)3倍。

3. 真实场景落地验证:目前小米(Xiaomi)和智谱(ZAI)等头部厂商已在其最快梯队(Fast Tier)的在线API中静默集成了TileRT,验证了其工程可行性。

三、权衡与架构思考

天下没有免费的午餐尽管TileRT在单用户交互速率上达到了巅峰,但为了追求极低的单用户延迟,TileRT采用了更紧凑的资源调度策略,牺牲了一部分大Batch场景下的极限吞吐量(tok/s/GPU)。在8k/1k场景且并发升高的状况下,GB300传统引擎的单卡总吞吐可达240tok/s/GPU,而TileRT160.4tok/s/GPU

四、总结与行业启示

硬件带宽每代提升2-3倍,但内存Latency并没有质的飞跃。过去大家习惯通过更换加速卡(如专用LPU)来解决Latency问题,但TileRT证明了:通过编译优化与持久化算子设计,通用GPU依然有着极深的潜在算力红利等待挖掘。

在考虑采购高昂的专有芯片或大规模机柜前,AI基础设施团队应当重新审查当前的推理软件栈。TileRT证明了仅靠软件层升级,就能在现有的B200 / GPU节点上实现接近500tokens/s的超高交互速率,这对于降低Agent类应用的落地门槛具有深远的战略意义。