乐于分享
好东西不私藏

comfyui安装sageattention、Triton(N卡提速、降显存,适用Blackwell架构(如RTX 50系列)显卡)图文

comfyui安装sageattention、Triton(N卡提速、降显存,适用Blackwell架构(如RTX 50系列)显卡)图文
PART 0基础教程合集(前1~20集教程) 其他comfyui相关的教程我放文章底部
    comfyui安装(非整合包,直装)熟悉界面提示词翻译整线下载模型models、工作流、解决报错报红界面整理(固定节点、分组)图生图图片打标图片反推+图生图声音克隆子工作流LoRA下载使用数学表达式、分组开关for循环视频反推wan2.2图生视频全流程局部重绘视频切片/随机种git安装comfyui插件models文件存储优化fp16、bf16转fp8、gguf(运行提速/显存降低)comfyui应用(App mode)comfyui-cyc-email远程通知ComfyUI MCP 
    PART 序
      • 只说安装和使用。
      • rtx5000系列/Blackwell架构显卡降低显存占用提升推理速度效果比较明显。
      • Blackwell架构的提升比较有限。
      • 官方的说法是针对生视频、生图片有所提升
      • 雪狼因为显卡是属于rtx ada系列,目前是无感的。
      • 但是有很多rtx5000系显卡的小伙伴反馈效果提升明显,故就做了本章教程,所以只讲安装和使用。
      • 所以感兴趣的小伙伴,可以自己测下看看效果。
      • 操作之前最好先复制一份实例,防止python环境改动过大跑不了!!!!!!
      PART 正文
      • comfyui实例右上角三个点,
      • 点下去,
      • 有一个管理
      输入命令安装下(全程要开魔法
      python -m pip install triton-windows<3.4
      这个是你实例所在目录。留意下
      直接输入命令
      git clone https://github.com/DazzleML/comfyui-triton-and-sageattention-installer.git
      • 他会在你实例目录下,新建一个文件夹(你知道下就好
      • 不用特地去找
      执行下面命令(意思打开并进入文件夹)
      cd comfyui-triton-and-sageattention-installer
      安装comfyui_triton_sageattention 脚本
      python comfyui_triton_sageattention.py --install
      如果他提示你
      Ps C:\Users\cyc\ComfyUI-Installs\ComfyUI\ComfyUI>cdnd-sageattention-installerC.venv)  C:\Users\cyc\ComfyUI-Installs\ComfyuI\ComfyuI\comfyui-triton-and-sageattention-installer> python comfyui_triton_sageattention.py --install comfyui-triton-a Found ComfyUI installations:[1] F:\aiApp\comfyUIFile(ComfyUI Desktop) Select installation to install to [1-1]
      enter a path, or 'q' to quit:
      • 意思是程序找到了一个 ComfyUI 安装位置
      • 我这边是一个[1-1]选项
      • 你直接输入1回车就可以
      • 你要确定你有没有安装成功
      • 输入命令
      python comfyui_triton_sageattention.py --show-installed
      出来下图提示,就是ok了
      • 2.2.0+cu130torch2.10.0andhigher.post6这个版本号,
      • 是专门为 PyTorch 2.10 及以上版本 构建的通用安装包
      • 所以不是说安装错了之类。
      • 版本号没有问题

      • 那么来说下怎么设置

      • 他是氛围全局加速局部加速

      • 局部是这么用,

      • 你重启comfyui后

      • 比如来到qwen2511的工作流

      • 先连Patch Sage Attention KJkjnodes插件的节点

      • 再去连其他的

      • 这样就是应用上了,你可以没连之前测下,连了之后测下

      • 我列一个sage_attention下拉框的对照表,
      • 你看着来选,
      • 不然默认auto就可以。
      后端选项 (Backend)
      核心实现
      精度策略 (Q/K/V)
      目标硬件/场景
      特点与说明
      sageattn_qk_int8_pv_fp16_cuda
      CUDA
      Q/K: INT8V: FP16
      Ampere架构
       (如RTX 3090)
      速度与精度的良好平衡,在支持的硬件上非常稳定-
      sageattn_qk_int8_pv_fp16_triton
      Triton
      Q/K: INT8V: FP16
      跨架构兼容性
       (如RTX 3060/3070/3080)
      兼容性最好,用Triton实现,在不同N卡上都能获得不错的加速。
      sageattn_qk_int8_pv_fp8_cuda
      CUDA
      Q/K: INT8V: FP8
      Ada/Hopper架构
       (如RTX 4090, H100)
      速度更快,但需要 CUDA 12.4+ 和 SM89+ 的GPU支持
      sageattn_qk_int8_pv_fp8_cuda++
      CUDA++
      Q/K: INT8V: FP8
      Ada/Hopper架构
      在 fp8_cuda 基础上进一步优化,可能采用更快的累加策略(FP32+FP16)
      sageattn3
      自动选择
      自动选择
      Blackwell架构
       (如RTX 50系列)
      为最新 Blackwell 架构GPU优化的 SageAttention 3.x 版本
      sageattn3_per_block_mean
      自动选择
      自动选择
      Blackwell架构
      sageattn3
       的一个变体,可能使用“per-block mean”的量化策略
      • 然后运行就是了,这个是局部加速

      • 如果是想默认全局加速则是下面这个流程

      • 启动参数空格后,加一个命令如下

      --use-sage-attention
      然后小齿轮点进去他在这个位置下图
      这个是全局配置的。
      启动起来后你在启动日记可以找到

      SageAttention ✅ | Flash Attention ❌ | Triton ✅

      嗯,然后可以运行下,我如果可以,底部评论区反馈下显卡型号和场景。
      我想知道下,分别是哪类显卡和哪类场景上提升比较明显。
      卡到关于comfyui方面的问题
      可以底部评论区留言
      雪狼能力虽然有限,都会尽量解答

      雪狼之夜ps:既然都看到这行了,不如给个3连,亲~~~

       ☟

      PART 图片相关
      视频、图片序列-相互转换图片视频改变亮度、对比度图片模糊变高清,图片修复ComfyUI-APISR插件 TinyPNG批量压缩图片图片批量等比例缩放分辨率图片png转jpg、批量(填充白底)批量改图片后缀png改jpg图片批量打标、批量反推qwenVL安装、图片反推、打标姿态控制图生相似图人物多角度comfyui多图合并comfyui_controlnet_aux-线稿图生相似图、单图/多图参考生成(flux1-redux)Qwen-Image-InstantX局部重绘comfyui人物无限角度生成扩图、外绘、竖屏转横屏人物立体感Z-Image-Turbo 图生图(二次元转真人)人物360全角度seedvr2 图片高清修复(老照片修复)sam3万能抠图comfyui矢量图svg
      PART 视频相关
      视频/音频-截取角色图片360度旋转视频wan2.2_s2v 音频驱动-图文教程视频时长截取/改变视频分辨率comfyui视频去水印、去字幕、去动态水印wan2_animate-多角色-动作迁移wan2_animate+uni3c运镜迁移、运镜克隆SCAIL(KJ版)多角色-动作迁移+运镜迁移SCAIL+wan_animate+uni3c补帧骨骼图视频、图片序列-相互转换Bernini-R主动运镜跳舞换衣绿幕抠像、玫瑰花转场Wan-Move轨迹引导运镜wan2_animate+uni3c人物一致性 LTX2.3导演台模拟运镜视频截取图片图片像素化、视频像素化wan2.2无限首尾帧wan2.2图生视频(人声、环境音)sam3 视频分割深度图、合并骨骼图+scailv2动作迁移MiniMax H3图生视频(多图参考)
      PART 音频相关
      视频/音频-截取音频提取文字分离人声MMAudio 视频配音效HunyuanVideo-Foley  视频配音效声音替换,音色转换,音色迁移
      PART 其他comfyui
      下载、读取GGUF格式工作流新建文件夹安装llama-cpp-python看内存、CPU、GPU占用率comfyui-kjnodes安装漫剧教程1AI漫剧教程2看用了哪个扩展插件批量修改文件名comfyui批量读取txt文件换衣教程电商剧情短片音乐版权/字体版权/图片版权MSR透明头像comfyui 下拉框失灵ollama导演模式