在LLM推理的性能坐标轴上,一直存在着“吞吐量(Throughput,tok/s/GPU)”与“交互度/单用户生成速度(Interactivity,tok/s/user)”的权衡。

针对实时语音助手、Agent交互和超高速代码生成等场景,Nvida先手布局Groq(LPU)为代表的专有数据流芯片,AMD奋起追赶,不但与晶圆级芯片设计公司Cerebras合作还拿下了Taalas,准备把大语言模型刻在芯片里。老黄又拿出了软件武器TileRT。
传统NVIDIA GPU架构在小Batch的Decode(解码)阶段往往因频繁的内核启动(Kernel Launch)和内存同步开销而遭遇瓶颈。
SemiAnalysis在InferenceX测评中针对TileRT的实测数据,给出了一个颠覆性的答案:通过软件架构与编译层面的创新,通用GPU同样能够交付500tokens/s/user的极致交互速率。

一、TileRT的核心技术突破
从Operator到Execution Continuity 传统推理引擎(如TensorRT-LLM、vLLM、SGLang)遵循Graph → Operator →Kernel的经典执行抽象。在Decode阶段,由于Batch Size较小,GPU极其依赖内存带宽,而模型被拆解成数百个独立的算子后,内核启动(Setup/Teardown)、跨算子同步和显存频繁加载的开销逐渐占据了关键路径,导致GPU计算单元在等待调度的过程中严重空转。 TileRT解决这一痛点的核心思路是:“以持续执行(Execution Continuity)替代频繁调度”。
1. Persistent Engine(持久化执行引擎): TileRT将整个Decode阶段的计算图静态编译为单个持久化Kernel(Single Persistent Kernel)。一旦挂载到GPU上,计算单元无需在每个算子结束后归还控制权,彻底消除了算子间启动与调度的等待时间。
2. Tile级管线重叠(Tile Pipelines & Cross-Kernel Tiling):在SRAM / On-chip Cache层面打通数据流,将计算、显存加载/写入以及跨卡/跨节点通信在Tile粒度上实现最大程度的Overlap(掩盖latency)。
二、InferenceX关键实测数据解读
在8卡B200节点、针对GLM-5 FP8(744B参数)大模型的InferenceX评测中,TileRT展现出了极其惊人的表现:

关键结论:
1. 跨代际与跨精度降维打击:TileRT仅基于FP8精度,就击败了传统引擎经过FP4量化加上MTP(多Token预测/推测解码)加速后的极限表现。
2. 以小博大的节点效率:仅需一台8卡B200服务器,其单用户交互速度达到了运行传统引擎的GB300 NVL72机柜(72卡)的3倍。
3. 真实场景落地验证:目前小米(Xiaomi)和智谱(ZAI)等头部厂商已在其最快梯队(Fast Tier)的在线API中静默集成了TileRT,验证了其工程可行性。
三、权衡与架构思考
天下没有免费的午餐尽管TileRT在单用户交互速率上达到了巅峰,但为了追求极低的单用户延迟,TileRT采用了更紧凑的资源调度策略,牺牲了一部分大Batch场景下的极限吞吐量(tok/s/GPU)。在8k/1k场景且并发升高的状况下,GB300传统引擎的单卡总吞吐可达240tok/s/GPU,而TileRT为160.4tok/s/GPU。
四、总结与行业启示
硬件带宽每代提升2-3倍,但内存Latency并没有质的飞跃。过去大家习惯通过更换加速卡(如专用LPU)来解决Latency问题,但TileRT证明了:通过编译优化与持久化算子设计,通用GPU依然有着极深的潜在算力红利等待挖掘。
在考虑采购高昂的专有芯片或大规模机柜前,AI基础设施团队应当重新审查当前的推理软件栈。TileRT证明了仅靠软件层升级,就能在现有的B200 / GPU节点上实现接近500tokens/s的超高交互速率,这对于降低Agent类应用的落地门槛具有深远的战略意义。
夜雨聆风