本地使用 ComfyUI 运行 Stable Diffusion 3.5
Stable Diffusion 3.5 的发布,尤其是 SD3.5-FP8 高性能量化版本的推出,显著降低了显存占用并提升了生成速度。FP8 将模型权重从 FP16 压缩至 8 位浮点,在保持画质的同时大幅优化资源效率。
实测数据显示,在 RTX 4060 上运行 stable-diffusion-3.5-fp8,1024×1024 分辨率图像平均生成时间仅需 40~50 秒,相比原始 FP16 版本提速约 40%,显存占用控制在 10.5GB 左右。这使得主流消费级显卡也能流畅运行顶级文生图流程。
硬件配置建议
虽然 FP8 降低了门槛,但大模型仍需一定基础配置:
| 组件 | 建议 |
|---|---|
| GPU | NVIDIA 显卡,RTX 30 系及以上 |
| 显存 | ≥10GB(最低可尝试 8GB,需启用低显存模式) |
| 内存 | ≥16GB RAM |
| 存储 | ≥20GB SSD 空间(建议 NVMe) |
| 系统 | Windows 10/11 或 Linux(Ubuntu 20.04+) |
| 驱动 | 支持 CUDA 11.8 及以上 |
笔记本用户如搭载 RTX 4060 Laptop(8GB 显存),可通过添加 --lowvram 参数运行,但速度会稍慢。
软件安装与准备
建议使用 ComfyUI 便携版(Portable Edition),预装 PyTorch、CUDA 和常用插件,解压即用。
下载地址:
https://github.com/comfyanonymous/ComfyUI/releases/latest/download/ComfyUI_windows_portable_nvidia.7z
解压后进入目录,双击 run_nvidia_gpu.bat 即可自动拉起服务。首次运行可能需要几分钟安装缺失组件。
模型文件部署
SD3.5-FP8 由多个组件协同工作,需完整部署以下三类核心文件:
主模型(Checkpoint)
- 文件名:
stable-diffusion-3.5-fp8.safetensors - 推荐来源:魔搭 ModelScope
- 放置路径:
\ComfyUI\models\checkpoints\
CLIP 文本编码器(共三个)
SD3.5 使用三路文本编码架构,必须全部放入 \ComfyUI\models\clip\ 目录:
| 模型文件 | 功能说明 |
|---|---|
clip_g.safetensors | OpenCLIP ViT-bigG/14,擅长捕捉抽象概念和艺术风格 |
clip_l.safetensors | CLIP ViT-L/14,基础语义理解主力 |
t5xxl_fp8_e4m3fn.safetensors | Google T5-XXL 的 FP8 版本,专为长句逻辑解析优化 |
特别注意:务必使用 FP8 精度的 T5 模型!误用普通 FP16 版本会导致精度不匹配甚至崩溃。
工作流配置文件(JSON)
官方提供专为 SD3.5-FP8 调优的工作流模板:
- 文件名:
SD3.5-FP8_example_workflow.json - 下载地址:
https://github.com/Stability-AI/StableDiffusion3-FP8-Examples/raw/main/workflows/SD3.5-FP8_example_workflow.json
该 JSON 文件包含完整的节点连接关系,包括模型加载、文本编码、采样器设置和图像保存等环节。
工作流配置与生成
启动 ComfyUI 服务后,浏览器访问 http://127.0.0.1:8188。将下载的 SD3.5-FP8_example_workflow.json 拖入浏览器窗口,工作流会自动加载。
关键步骤是确认每个 CLIP 节点是否正确绑定了对应的模型文件:
- 第一个 CLIP Text Encode (G) 节点选择
clip_g.safetensors - 第二个选
clip_l.safetensors - 第三个务必选
t5xxl_fp8_e4m3fn.safetensors
若列表未显示,点击刷新按钮强制重新扫描模型目录。
参数设置与性能
在任意一个 CLIP 输入框中输入提示词,例如:
a futuristic city at sunset, cyberpunk style, neon lights, flying cars, ultra detailed, 8K resolution
负向提示词建议填写:
blurry, low quality, distorted face, extra limbs, watermark
其他参数推荐如下:
| 参数 | 推荐值 |
|---|---|
| 分辨率 | 1024 × 1024 |
| 采样器 | DPM++ 2M Karras |
| 步数 | 25–30 |
| CFG Scale | 7.0 |
| 种子 | -1(随机) |
设置完成后,点击右上角的 Queue Prompt 按钮开始推理。底部日志会实时输出加载和采样过程。
不同硬件平台的实测对比结果:
| GPU | 显存占用 | 单图耗时(1024²) |
|---|---|---|
| RTX 4090 24G | 11.2 GB | 22s |
| RTX 4070 Ti 12G | 10.8 GB | 31s |
| RTX 4060 16G | 10.5 GB | 45s |
| RTX 3060 12G | 10.3 GB | 58s |
即使是五年前的 RTX 3060,也能在不到一分钟内完成一张高质量输出。
优化技巧
- 开启模型缓存:保持 ComfyUI 后台常驻,后续重复使用时会从内存缓存读取,速度加快。
- 低显存模式适配:对于 8GB 显存设备,在启动脚本中加入
--lowvram。 - 合并输入节点:可用'Primitive Node'创建共享文本源,连接到所有编码器,实现一处修改全局同步。
- 定期清理输出目录:默认保存路径是
\ComfyUI\output\,建议写批处理脚本每天自动归档。 - 升级 NVMe 固态硬盘:模型加载时间和磁盘 IO 强相关,PCIe 4.0 NVMe 能显著减少等待。
借助 ComfyUI 的模块化设计,用户可以自由调整流程、测试新模型。数据留在本地,生成节奏由你掌控,无需依赖网络或订阅服务。
