乐于分享
好东西不私藏

TensorRT-LLM 0.5.0 源码之二十二

TensorRT-LLM 0.5.0 源码之二十二

stringUtils

#if ENABLE_BF16#include <cuda_bf16.h>#endif // ENABLE_BF16#include <cuda_fp16.h>
#if ENABLE_BF16static inline std::basic_ostream<char>& operator<<(std::basic_ostream<char>& stream, __nv_bfloat16 const& val){    stream << __bfloat162float(val);    return stream;}#endif // ENABLE_BF16static inline std::basic_ostream<char>& operator<<(std::basic_ostream<char>& stream, __half const& val){    stream << __half2float(val);    return stream;}
std::string fmtstr(char const* format, ...) __attribute__((format(printf, 1, 2)));
template <typename U, typename TStream, typename T>inline TStream& arr2outCasted(TStream& out, T* arr, size_t size){    out << "(";    if (size > 0)    {        for (size_t i = 0; i < size - 1; ++i)        {            out << static_cast<U>(arr[i]) << ", ";        }        out << static_cast<U>(arr[size - 1]);    }    out << ")";    return out;}template <typename TStream, typename T>inline TStream& arr2out(TStream& out, T* arr, size_t size){    return arr2outCasted<T>(out, arr, size);}template <typename T>inline std::string arr2str(T* arr, size_t size){    std::stringstream ss;    return arr2out(ss, arr, size).str();}template <typename T>inline std::string vec2str(std::vector<T> vec){    return arr2str(vec.data(), vec.size());}
inline bool strStartsWith(std::string const& str, std::string const& prefix){    return str.rfind(prefix, 0) == 0;}
std::string vformat(char const* fmt, va_list args){    va_list args0;    va_copy(args0, args);    auto const size = vsnprintf(nullptr, 0, fmt, args0);    if (size <= 0)        return "";    std::string stringBuf(size, char{});    auto const size2 = std::vsnprintf(&stringBuf[0], size + 1, fmt, args);    TLLM_CHECK_WITH_INFO(size2 == size, std::strerror(errno));    return stringBuf;}
std::string vformat(char const* fmt, va_list args){    va_list args0;    va_copy(args0, args);    auto const size = vsnprintf(nullptr, 0, fmt, args0);    if (size <= 0)        return "";    std::string stringBuf(size, char{});    auto const size2 = std::vsnprintf(&stringBuf[0], size + 1, fmt, args);    TLLM_CHECK_WITH_INFO(size2 == size, std::strerror(errno));    return stringBuf;}

stlUtil

template <typename TInputIt, typename TOutputIt, typename TBinOp>constexpr TOutputIt basicInclusiveScan(TInputIt first, TInputIt last, TOutputIt dFirst, TBinOp op){    if (first != last)    {        auto val = *first;        while (true)        {            *dFirst = val;            ++dFirst;            ++first;            if (first == last)            {                break;            }            val = op(std::move(val), *first);        }    }    return dFirst;}template <typename TInputIt, typename TOutputIt>constexpr TOutputIt inclusiveScan(TInputIt first, TInputIt last, TOutputIt dFirst){#if defined(__GNUC__) && __GNUC__ <= 8    return basicInclusiveScan(first, last, dFirst, std::plus<>{});#else    return std::inclusive_scan(first, last, dFirst);#endif}

InclusiveScan:input:   0, 1, 2, 3output: 0, 1, 3, 6

template <typename TInputIt, typename TOutputIt, typename T, typename TBinOp>constexpr TOutputIt basicExclusiveScan(TInputIt first, TInputIt last, TOutputIt dFirst, T init, TBinOp op){    if (first != last)    {        while (true)        {            T tmp{op(init, *first)};            *dFirst = init;            ++dFirst;            ++first;            if (first == last)            {                break;            }            init = std::move(tmp);        }    }    return dFirst;}template <typename TInputIt, typename TOutputIt, typename T>constexpr TOutputIt exclusiveScan(TInputIt first, TInputIt last, TOutputIt dFirst, T init){#if defined(__GNUC__) && __GNUC__ <= 8    return basicExclusiveScan(first, last, dFirst, std::move(init), std::plus<>{});#else    return std::exclusive_scan(first, last, dFirst, std::move(init));#endif}

EclusiveScan:Input: 0, 1, 2, 3, init=5Output: 5, 5, 6, 8

独占前缀和是指,输出序列中的每个元素是输入序列中该位置之前所有元素(不包括当前位置元素)经过累积操作的结果。

用一个简单例子说明。假设二元操作 op是加法 +,初始值 init为 0:输入序列: [a, b, c, d]输出序列: [0, a, a+b, a+b+c](注意输出序列比输入序列多一个元素,但此函数输出序列长度与输入相同)

cublasVersionCheck

#define TLLM_CUBLAS_VERSION_CALC(MAJOR, MINOR, PATCH) (MAJOR * 10000 + MINOR * 100 + PATCH)#define TLLM_CUBLAS_VER_LE(MAJOR, MINOR, PATCH)                                                                        \    TLLM_CUBLAS_VERSION_CALC(CUBLAS_VER_MAJOR, CUBLAS_VER_MINOR, CUBLAS_VER_PATCH)                                     \    <= TLLM_CUBLAS_VERSION_CALC(MAJOR, MINOR, PATCH)#define TLLM_CUBLAS_VER_LT(MAJOR, MINOR, PATCH)                                                                        \    TLLM_CUBLAS_VERSION_CALC(CUBLAS_VER_MAJOR, CUBLAS_VER_MINOR, CUBLAS_VER_PATCH)                                     \        < TLLM_CUBLAS_VERSION_CALC(MAJOR, MINOR, PATCH)#define TLLM_CUBLAS_VER_GE(MAJOR, MINOR, PATCH)                                                                        \    TLLM_CUBLAS_VERSION_CALC(CUBLAS_VER_MAJOR, CUBLAS_VER_MINOR, CUBLAS_VER_PATCH)                                     \    >= TLLM_CUBLAS_VERSION_CALC(MAJOR, MINOR, PATCH)#define TLLM_CUBLAS_VER_GT(MAJOR, MINOR, PATCH)                                                                        \    TLLM_CUBLAS_VERSION_CALC(CUBLAS_VER_MAJOR, CUBLAS_VER_MINOR, CUBLAS_VER_PATCH)                                     \        > TLLM_CUBLAS_VERSION_CALC(MAJOR, MINOR, PATCH)

nvtxUtils

#include <nvtx3/nvtx3.hpp>#include <array>namespace tensorrt_llm::common::nvtx{inline nvtx3::color nextColor(){#if !defined(NVTX_DISABLE)    constexpr std::array kColors{nvtx3::color{0xff00ff00}, nvtx3::color{0xff0000ff}, nvtx3::color{0xffffff00},        nvtx3::color{0xffff00ff}, nvtx3::color{0xff00ffff}, nvtx3::color{0xffff0000}, nvtx3::color{0xffffffff}};    constexpr auto numColors = kColors.size();    static thread_local std::size_t colorId = 0;    auto const color = kColors[colorId];    colorId = colorId + 1 >= numColors ? 0 : colorId + 1;    return color;#else    return nvtx3::color{0};#endif}} // namespace tensorrt_llm::common::nvtx#define NVTX3_SCOPED_RANGE(range) ::nvtx3::scoped_range range##_range(::tensorrt_llm::common::nvtx::nextColor(), #range)

这段代码是用于GPU性能分析的工具,它利用NVIDIA的NVTX(NVIDIA Tools Extension)库来标记代码段,以便在性能分析工具(如Nsight Systems、Nsight Compute)中可视化程序的执行流程和时间分布。

下面逐部分解释代码的功能:

头文件与命名空间

#include <nvtx3/nvtx3.hpp>
  • • nvtx3/nvtx3.hpp:引入了NVTX v3库的功能,用于创建范围标记和颜色定义。

nextColor() 函数:循环分配颜色

inline nvtx3::color nextColor(){#if !defined(NVTX_DISABLE)    constexpr std::array kColors{nvtx3::color{0xff00ff00}, nvtx3::color{0xff0000ff},                                 nvtx3::color{0xffffff00}, nvtx3::color{0xffff00ff},                                 nvtx3::color{0xff00ffff}, nvtx3::color{0xffff0000},                                 nvtx3::color{0xffffffff}};    constexpr auto numColors = kColors.size();    static thread_local std::size_t colorId = 0;    auto const color = kColors[colorId];    colorId = colorId + 1 >= numColors ? 0 : colorId + 1;    return color;#else    return nvtx3::color{0}; // 如果禁用NVTX,返回黑色(无操作)#endif}
  • • 功能:该函数从一个预定义的七种颜色数组中循环返回颜色。颜色以ARGB格式表示(例如0xff00ff00是绿色)。
  • • 线程安全:使用static thread_local确保每个线程有独立的颜色计数器,避免多线程竞争。
  • • 条件编译:如果定义了NVTX_DISABLE宏,则返回黑色(效果上相当于禁用NVTX标记),这提供了灵活的编译时控制。

NVTX3_SCOPED_RANGE 宏:创建作用域标记

#define NVTX3_SCOPED_RANGE(range) ::nvtx3::scoped_range range##_range(::tensorrt_llm::common::nvtx::nextColor(), #range)
  • • 功能:这是一个宏,用于创建一个作用域范围的NVTX标记。当程序执行进入该宏定义的代码块时,性能分析工具的时间线上会开始一个具有指定颜色和名称的区间;离开作用域时,区间自动结束。
  • • 参数说明:
    • • range:用户指定的范围名称(例如NVTX3_SCOPED_RANGE(forward_pass)会生成名为"forward_pass"的区间)。
    • • range##_range:生成一个唯一的变量名,确保在同一作用域内可多次使用该宏。
    • • nextColor():为每个范围分配一个循环颜色,帮助在时间线上直观区分不同代码段。

代码应用场景与示例

这段代码通常用于GPU加速的应用程序(如深度学习框架TensorRT-LLM)中,进行精细化的性能分析。例如:

void run_mlp(){    NVTX3_SCOPED_RANGE(forward_pass); // 标记前向传播范围    // ... 前向传播计算 ...    NVTX3_SCOPED_RANGE(backward_pass); // 标记反向传播范围    // ... 反向传播计算 ...}
  • • 在NVIDIA性能分析工具中,开发者可以清晰看到forward_pass和backward_pass在不同时间段的执行情况及其耗时,从而快速定位性能瓶颈。

总结

这段代码提供了一个易于使用的性能分析工具封装,通过动态分配彩色范围标记,帮助开发者在复杂的GPU工作负载中可视化和分析代码执行效率。其设计兼顾了线程安全、条件编译和用户友好性。


参考文献

  • • https://github.com/NVIDIA/TensorRT-LLM/blob/release/0.5.0/cpp/tensorrt_llm/common/stringUtils.h
点个「赞」+「在看」❤️
让我们知道这份文字有温暖到你,也是我们持续创作的最大动力!
推荐
OpenClaw 架构详解
TensorRT-LLM 0.5.0 源码之二十一
TensorRT-LLM 0.5.0 源码之二十
MPI Send and Receive
nano-vllm-voxcpm 架构
LLM推理优化的核心技术:深入理解KV缓存与分页注意力机制
什么是氛围编程(Vibe Coding)?
BS::thread_pool 一个快速、轻量级、现代且易于使用的线程池库
MiMo-V2-Flash技术报告
AI原生开发中的MCP与CLI对比
Qwen3-TTS 技术报告
Vibe Coding 氛围编程最佳实践
Paged Attention, IFB, and Request Scheduling
VoxCPM 模型结构
理解 VoxCPM 模型
Multi-Head, Multi-Query, and Group-Query Attention
PagedAttention
什么是 Programmatic Dependent Launch
如何让AI听懂你的“话外音”?GOAT-SLM模型实现更懂情感的语言交互
Optimize Prompts
大模型部署必看:LLM 推理(Inference)优化 技术,适配高并发、低延迟场景
LLM Serving Benchmark Metrics
告别语音克隆烦恼:VoxCPM用Token-Free方案,打造真实会“思考”的AI语音
OpenCharacter: 利用大规模合成人物角色训练可定制化角色扮演语言模型
FlashAttention与PagedAttention详解:拯救GPU显存,让大模型飞起来的核心技术
Meta Prompting: A Guide to Automated Prompt Optimization
CUDA 中如何使用虚函数
DeepSpeed的ZeRO技术具体是如何实现显存优化的?
LM-as-a-judge:LLM评估指南
LLM Sequence Packing
深入了解SmoothQuant:大模型高效量化背后的数学原理
ART·E: How We Built an Email Research Agent That Beats o3
中文LLM指令微调动态机制
intro to GRPO an efficient policy optimization method
提升TTS语音合成效果:低质量数据清洗、增强与数据扩增
语音合成(TTS)分句生成拼接时的响度一致性问题:现状、成因与对策
TTS的CFM中的class-free指的是什么?
当扩散模型遇上流匹配:原来是一回事儿
语音合成中的“一对多”问题主流模型解决方案分析
Share Memory 的 Bank Conflict
告别高成本!TensorRT-LLM实战:如何将LLM推理速度提升数倍
使用LoRA对LLM进行微调的实用技巧
强化学习小白必看:PTX Loss 到底是个啥?
GPT-5 Prompt Migration and Improvement Using the New Optimizer
Hugging Face BPE Tokenizer 的资源文件
RULER: Relative Universal LLM-Elicited Rewards
语音合成(TTS)中文自然度:问题、成因、解决方案
SFT 泛化新解读:强化学习 + 奖励修正,一文读懂
Evol-Instruct 竟能精准生成领域专属数据?实操技巧速看!
指令微调数据-少即是多
语音合成(TTS)跳跃与重复问题的解析:成因、机制及解决方案
大模型训练新思路:GEPA 靠 “反思” 赢过 RL,看完秒懂
DPO、PPO、GRPO的原理,区别与联系
OPENCSG 中文语料库:一系列高质量的中文数据集,用于语言模型训练
Conditional Flow Matching : 连续标准流 Continuous Normalizing Flow
CFM 与 OT-CFM:条件流匹配与最优传输的碰撞
DPO损失实现
Conditional Flow Matching : 常微分方程ODE、欧拉方法和Neural ODE
当 Normalizing flow 遇上语音生成:AI 说话变 “真人” 的秘密在这里!
从知识增长的角度提升RAG上下文的质量
手把手教你创建 evol-instruct 数据集!附完整流程~
社交类聊天的 Query 分析与应答策略
SFT 中指令选择和响应选择哪个更重要?
角色扮演大模型技术分享2-超拟人模型的困境
最新!SpeechLLM 综述:架构、能力、挑战与未来全揭秘
如何低成本生成高质量指令微调数据?
从数量到质量:通过自引导数据选择来提升语言模型性能以实现指令调优
Qwen 的训练数据是怎么做的?
如何低成本生成高质量指令微调数据?
RLHF及其变体:进展和实际工程见解
晦涩难懂的 Flow matching!图形化理解
FSQ的原理与VQ-VAE的区别和联系
大模型并行训练的一些知识——极简版
RLHF 入门,高手勿进!

相关学习资料