用户可在 ComfyUI 中加载 GGUF 格式模型,实现低比特率量化以节省显存,适用于低配置 GPU。项目提供自定义节点,支持 transformer/DiT 模型及 T5 文本编码器量化,LoRA 加载功能实验性可用。【此简介由AI生成】
ComfyUI-GGUF
GGUF 量化支持原生 ComfyUI 模型
目前这还是一个正在进行中的工作(WIP)。这些自定义节点为存储在由 llama.cpp 推广的 GGUF 格式中的模型文件提供支持。
虽然在常规 UNET 模型(conv2d)上进行量化是不可行的,但像 flux 这样的变压器/DiT 模型似乎受量化影响较小。这允许在低端的 GPU 上以每个权重变量比特率较低的量化运行。为了进一步节省 VRAM,还包括了一个用于加载量化版 T5 文本编码器的节点。
注意:**"强制/设置 CLIP 设备"**不是这个节点包的一部分。如果你只有一个 GPU,请不要安装它。如果你不理解它的用途,不要将其设置为 cuda:0,然后抱怨 OOM 错误。无需复制上述工作流,只需使用你自己的工作流,并将标准的“加载扩散模型”替换为“Unet 加载器(GGUF)”节点。
安装
[!重要]
确保你的 ComfyUI 版本足够新,能够支持在加载仅 UNET 时使用自定义操作。
要正常安装自定义节点,请将此仓库克隆到你的自定义节点文件夹(ComfyUI/custom_nodes)中,并安装推理所需的唯一依赖(pip install --upgrade gguf)。
git clone https://github.com/city96/ComfyUI-GGUF
要在独立版本的 ComfyUI 上安装自定义节点,请打开位于 "ComfyUI_windows_portable" 文件夹(即存放您的 run_nvidia_gpu.bat 文件的目录)中的命令提示符(CMD),然后使用以下命令:
git clone https://github.com/city96/ComfyUI-GGUF ComfyUI/custom_nodes/ComfyUI-GGUF
.\python_embeded\python.exe -s -m pip install -r .\ComfyUI\custom_nodes\ComfyUI-GGUF\requirements.txt
在 MacOS Sequoia 系统上,torch 2.4.1 版本似乎为必需,因为 2.6.X 的夜间版本会导致“M1 缓存区不足以容纳”的错误。更多详细信息或解决方法,请参见 这个问题。
使用方法
只需使用位于 bootleg 类别下的 GGUF Unet 加载器。将 .gguf 模型文件放在您的 ComfyUI/models/unet 文件夹中。
LoRA 加载功能尚处于实验阶段,但它应该可以与内置的 LoRA 加载节点配合使用。
预量化模型:
- flux1-dev GGUF
- flux1-schnell GGUF
- stable-diffusion-3.5-large GGUF
- stable-diffusion-3.5-large-turbo GGUF
最近还增加了对量化 T5 的初始支持,这些可以通过使用各种 *CLIPLoader (gguf) 节点来替代常规节点进行使用。对于 CLIP 模型,请使用您之前用于 CLIP 的模型。加载器可以处理两种类型的文件——gguf 和常规的 safetensors/bin。
有关如何创建自己的量化模型的说明,请参见 工具 文件夹。