只说安装和使用。 在rtx5000系列/Blackwell架构显卡降低显存占用、提升推理速度效果比较明显。 非Blackwell架构的提升比较有限。 官方的说法是针对生视频、生图片有所提升 雪狼因为显卡是属于rtx ada系列,目前是无感的。 但是有很多rtx5000系显卡的小伙伴反馈效果提升明显,故就做了本章教程,所以只讲安装和使用。 所以感兴趣的小伙伴,可以自己测下看看效果。 操作之前最好先复制一份实例,防止python环境改动过大跑不了!!!!!!
comfyui实例右上角三个点, 点下去, 有一个管理

python -m pip install triton-windows<3.4

git clone https://github.com/DazzleML/comfyui-triton-and-sageattention-installer.git他会在你实例目录下,新建一个文件夹(你知道下就好) 不用特地去找

cd comfyui-triton-and-sageattention-installer
python comfyui_triton_sageattention.py --install意思是程序找到了一个 ComfyUI 安装位置 我这边是一个[1-1]选项 你直接输入1回车就可以 你要确定你有没有安装成功 输入命令
python comfyui_triton_sageattention.py --show-installed
2.2.0+cu130torch2.10.0andhigher.post6这个版本号,是专门为 PyTorch 2.10 及以上版本 构建的通用安装包 所以不是说安装错了之类。 版本号没有问题
那么来说下怎么设置
他是氛围全局加速和局部加速的
局部是这么用,
你重启comfyui后
比如来到qwen2511的工作流
先连Patch Sage Attention KJ(kjnodes插件的节点)
再去连其他的
这样就是应用上了,你可以没连之前测下,连了之后测下

我列一个sage_attention下拉框的对照表, 你看着来选, 不然默认auto就可以。
sageattn_qk_int8_pv_fp16_cuda | Ampere架构 | |||
sageattn_qk_int8_pv_fp16_triton | 跨架构兼容性 | |||
sageattn_qk_int8_pv_fp8_cuda | Ada/Hopper架构 | |||
sageattn_qk_int8_pv_fp8_cuda++ | fp8_cuda 基础上进一步优化,可能采用更快的累加策略(FP32+FP16) | |||
sageattn3 | Blackwell架构 | |||
sageattn3_per_block_mean | sageattn3 |
然后运行就是了,这个是局部加速
如果是想默认全局加速则是下面这个流程
启动参数空格后,加一个命令如下
--use-sage-attention

SageAttention ✅ | Flash Attention ❌ | Triton ✅

雪狼之夜ps:既然都看到这行了,不如给个3连,亲~~~
☟
夜雨聆风