ComfyUI-QuantFunc 教程:先看二进制和显卡门槛,再谈加速
ComfyUI-QuantFunc 是一组量化扩散模型节点。Python 层把模型、CLIP、VAE、LoRA 和导出流程接到 ComfyUI,真正的推理由 libquantfunc.so 或 quantfunc.dll 完成。它适合官方列入支持表的 NVIDIA 显卡与模型,不是所有 ComfyUI 环境都能直接使用的通用加速器。
1. 它把什么接进 ComfyUI
SVDQ 路径读取离线量化模型;Lighting 路径在加载时把 diffusers 格式的 BF16/FP16 权重量化为 4-bit。v2 loader 分开输出 MODEL、CLIP、VAE,再交给 Build Pipeline 组合。官方还提供运行时量化结果导出、LoRA 永久融合、参考图编辑和 inpainting 节点。
README 当前列出的管线包括 Z-Image、QwenImage、QwenImage-Edit 与 Flux.2 Klein。其他模型即使能被 ComfyUI 读取,也不能据此推断 QuantFunc 引擎必然兼容。
2. 安装前先核对硬件
官方最低条件是 NVIDIA Compute Capability 7.5 或更高、8 GB VRAM、560 以上驱动、cuDNN 9.x、Python 3.9+,操作系统限定 Linux(glibc 2.31+)或 Windows 10/11。README 的要求表写 CUDA Runtime 13.0+,Linux 依赖示例却同时给了 CUDA 12.8 和 13.0;这是文档中的口径差异,不能替部署者替它补结论。
实际安装时,应按显卡、驱动和准备下载的引擎包逐项确认。AMD、Apple Silicon 和纯 CPU 没有列在官方支持范围内。
3. 安装与第一次启动
cd ComfyUI/custom_nodes git clone https://github.com/QuantFunc/ComfyUI-QuantFunc.git
启动 ComfyUI 后,插件默认从 ModelScope 下载匹配的 Linux 或 Windows 原生库。如果装了 modelscope,自动更新会使用它;没有这个包时会跳过自动更新,也可以按官方目录手工放置二进制。
这一步应查看控制台,记录插件版本、引擎版本、下载地址和错误。生产环境最好先在隔离机器取得文件并做哈希、来源和许可审查,再移入目标环境。仓库自身没有放置一份常见的开源 LICENSE,而是把插件许可链接到 ModelScope,不能只凭 GitHub 可见源码推断二进制许可。
4. 从最小工作流开始
先导入 workflow_sample/QuantFunc-Easy-Gen.json,选择一个明确受支持的模型,用小尺寸、固定 seed 生成一张图。确认输出正常后,再分别尝试 runtime quantization、预量化模型、图像编辑或 export 工作流。
量化对照至少记录四项:第一次加载时间、第二次开始的稳定推理时间、峰值显存、相同 seed 下的画面差异。LoRA 融合导出会把适配权重写入新模型,应保留原始权重和工作流,避免把不可逆导出当作唯一副本。
5. 常见故障怎么定位
worker failed to start 先查驱动和 CUDA runtime;找不到 DLL/SO 时检查平台目录并重启 ComfyUI;自动更新失败则补装 modelscope 或改为手工下载。输出噪点明显时,官方建议核对 model backend 与 transformer 权重是否匹配。
不要把 datacenter 卡首次 JIT、消费者显卡 SASS 路径和缓存后的运行时间混成同一个指标。项目方的 2–11 倍数字需要在自己的显卡、模型、分辨率和步数上复测。
6. 商业化与验证边界
官方仓库没有价格、充值、订阅配额或付费转售入口,因此本轮不按严重商业漏斗隔离。它会从 ModelScope 下载项目方原生引擎,而且许可说明也在 ModelScope;这属于供应链和使用条款边界,部署前仍要审查。
7. 与 ComfyUI-GGUF 对比
city96/ComfyUI-GGUF用于加载 GGUF 格式的 ComfyUI 模型,官方仍称 WIP,主要替换 UNet loader,也支持量化 T5。QuantFunc 使用自己的 CUDA 引擎,提供运行时 4-bit、SVDQ、组件式 pipeline 和导出。
手里已经有 GGUF 权重,并希望格式和开源实现更直观时,可先看 ComfyUI-GGUF。目标模型在 QuantFunc 支持范围内,愿意接受 NVIDIA 限定并审查外部二进制时,再评估 QuantFunc。
这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。
先判断这个项目是否适合你
适合谁用
适合在受支持的 NVIDIA GPU 上运行 Z-Image、QwenImage、QwenImage-Edit 或 Flux.2 Klein,减少显存占用或缩短扩散推理。上线前应对相同模型、seed、尺寸和步数记录首轮加载、峰值显存、稳定推理时间与画面偏差,不要直接引用仓库的 2–11 倍数据作为自己的结果。
采用建议
ComfyUI-QuantFunc 的价值在于把特定模型的量化和导出收进节点图。它不是装完即得的通用加速器:先检查 GPU 与系统范围,审查自动下载的二进制和许可,再用自己的模型做显存、速度与画质对照。
原教程未展开的系统信息
核心功能
导出与 LoRA 融合
运行时量化结果可以落盘;叠加的 LoRA 可永久融合进导出的权重,后续加载不再重复量化。
常见问题
ComfyUI-QuantFunc 0.0.02 为什么还会显示引擎 0.0.07?
两者独立编号。0.0.02 是 ComfyUI 插件,0.0.07 是当前匹配的原生引擎。
第一次启动为什么会联网下载文件?
插件默认从 ModelScope 下载匹配的 libquantfunc.so 或 quantfunc.dll;模型自动加载器也可能下载模型。离线环境应提前按官方目录准备文件。
AMD 显卡或 Mac 能运行 ComfyUI-QuantFunc 吗?
官方当前只列出 NVIDIA CC 7.5+、Linux 或 Windows,没有给出 AMD、Apple Silicon 或纯 CPU 支持。
官方的 2–11 倍加速可以直接当作我的结果吗?
不可以。它是项目方说明,应在固定模型、seed、尺寸和步数下记录首轮与稳定推理数据。