AMD 核显笔记本 Windows 11 运行 Stable Diffusion 实战
硬件环境与方案对比
本次测试平台为 AMD Ryzen R7 6800H,16G 内存,核显 Radeon 680M,共享内存 8G。在 Windows 11 环境下,我们主要对比了 DirectML 版与 ZLUDA 版本的性能表现。实测发现,ZLUDA 版本速度约为 DirectML 的 5 倍以上,对于 APU 用户来说,这是目前较为理想的解决方案。
一、环境准备:HIP SDK 与 ROCm
1. 理解 HIP 与 ROCm
HIP(Heterogeneous-Compute Interface for Portability)是 AMD 开发的 GPU 编程模型,旨在实现代码的可移植性。简单来说,它是对 CUDA API 的高度兼容克隆,几乎全盘拷贝了 CUDA 接口,但作为 CUDA 的子集存在。HIP 既可以运行在 ROCm 平台上,也能适配 CUDA 环境,这意味着它既能在 A 卡上跑,理论上也能在 N 卡上跑。
ROCm 则是 AMD 的开源 GPU 计算软件堆栈,提供了与 CUDA 相似的编程模型,让在 AMD GPU 上编写和运行计算应用变得更加容易。
- A 卡:编程模型使用 HIP 或 OpenCL,运行环境为 ROCm。
- N 卡:编程模型与运行环境均为 CUDA。
2. 下载与安装
访问 AMD 开发者资源页面获取 HIP SDK。注意版本选择:
- 版本要求:需下载 HIP 5.7.1 版本(安装界面显示为 5.7)。只有这个版本支持 AMD Radeon 680M 的 ZLUDA 加速。如果是 780M 核显,则可以使用 6.1 版本。
- 安装包:AMD Software PRO Edition
3. 关键库替换(针对 680M)
锐龙 R7 6800H 内置的 Radeon 680M 核显架构为 gfx1035(R5 6600H 同款)。由于官方驱动不支持该架构,我们需要手动替换部分库文件。
从 GitHub 仓库下载以下两个压缩包:
rocblas.for.gfx1035.AMD.680M.rembrandt.V2.7z(专用于 680M)Rocm.rocblas.HIP5.7.0.V2.7z(通用多显卡支持)
操作步骤:
- 找到 HIP 安装目录下的
bin\rocblas文件夹,路径通常为C:\Program Files\AMD\ROCm\5.7\bin。 - 将压缩包内的
rocblas.dll复制并覆盖原目录下的同名文件。 - 将原目录下的
library文件夹重命名为oldlibrary。 - 将压缩包内的
library文件夹复制到同一目录下。 - 建议重启电脑以确保生效。
注意:ZLUDA 不完全支持 PyTorch,运行时可能会出现不稳定现象,请做好心理准备。
二、Stable Diffusion WebUI 部署
1. 基础工具安装
- Git:前往 git-scm.com 下载安装。
- Python:推荐版本 3.10.6 ~ 3.10.11。安装时务必勾选'配置环境变量'。
2. 拉取项目代码
选择一个空间充足的磁盘分区,创建文件夹(例如 git),打开 CMD 窗口执行:
cd git
git clone https://github.com/lshqqytiger/stable-diffusion-webui-amdgpu amdgpu
国内镜像可选:
git clone https://gitee.com/ranxv/stable-diffusion-webui-amdgpu.git amdgpu
进入 amdgpu 文件夹后,继续执行以下命令补充依赖:
git clone https://github.com/lshqqytiger/k-diffusion-directml repositories/k-diffusion
git clone https://github.com/stability-AI/stablediffusion repositories/stablediffusion-stability-ai
3. 安装 PyTorch 依赖
激活虚拟环境后,指定安装 cu118 版本的 Torch,避免使用默认的 CUDA 12 版本以防崩溃:
pip install torch==2.2.1+cu118 torchvision==0.17.1+cu118 --index-url https://download.pytorch.org/whl/cu118
如果后续误装了其他版本,可按上述命令重新覆盖安装。
4. 配置文件修改
找到 stable-diffusion-webui-amdgpu\webui-user.bat 文件,用记事本打开,在文件末尾添加以下属性:
set PYTORCH_CUDA_ALLOC_CONF=garbage_collection_threshold:0.9,max_split_size_mb:512
set COMMANDLINE_ARGS=--precision full --disable-nan-check --upcast-sampling --opt-sub-quad-attention --medvram --use-zluda
三、启动与性能预期
双击 webui-user.bat 即可启动。首次运行需要等待 ZLUDA 自行配置,期间没有进度条,请勿强制关闭。
即使浏览器打开了 http://127.0.0.1:7860/,加载模型的过程依然可能非常漫长(示例中耗时约 614 秒),这属于正常现象,耐心等待即可。只有第一次慢,后续会快很多。
生成图片的速度大约在 13.15 it/s,对于核显而言已经相当不错。
验证成功标志:
最关键的是确认 ROCm 能否识别 GPU。如果在日志中看到类似 ROCm: agents=['gfx1035'] 的输出,说明配置成功。
![图:ROCm 识别 GPU 信息]
至此,你的 AMD 核显笔记本已能满血运行 Stable Diffusion。

