从一句话到一张图：看懂 Stable Diffusion 的“潜空间扩散”生成流程（配图详解）

Ne0inhk

21 Mar 2026 — 5 min read

Stable Diffusion Pipeline

Source: Aayush’s Blog, “Stable Diffusion using Hugging Face – Putting everything together” (2022).Used with attribution.

当你输入一句 “A dog wearing a hat（戴帽子的狗）”，模型最后输出一张高清图片。中间到底发生了什么？
这张图展示的，其实就是 Stable Diffusion 这类潜空间扩散模型（Latent Diffusion Model）最核心的工作流：文本 → 语义向量 → 潜空间噪声 → 逐步去噪 → VAE 解码成图像。
本文将按图逐块拆解，并补充它背后的关键概念与工程细节，让你真正理解扩散模型是如何“画画”的。

1. 这张图在讲什么？

这张图描述了典型的 Stable Diffusion 文生图管线：

Prompt 文本 → CLIP 文本编码得到 text embeddings
从高斯噪声开始初始化潜变量 latents
U-Net 在 text embeddings 条件引导下做多步迭代去噪（由 scheduler 控制）
得到最终的 conditioned latents
VAE 解码成真实像素图输出（如 512×512）

2. 模块一：CLIP Model —— 文本如何变成“可计算的语义”

图左侧是 CLIP Model，主要过程包括：

Tokenizer（分词器）：把文字拆成 token
Token to Embedding：把 token 映射到向量空间
输出 Text Embeddings (1×77×768)

2.1 为什么是 77×768？

以 SD 1.x 为例：

最大 token 长度固定为 77（包含起止符号等）
每个 token 对应一个 768 维语义向量（CLIP Text Encoder 的 hidden size）

因此最终的文本表示是一个矩阵：

\text{text\_embeddings} \in \mathbb{R}^{1 \times 77 \times 768}

这个 embedding 就是后续 U-Net 去噪过程的“条件信号”，相当于让模型知道：它去噪的目标应该朝向“戴帽子的狗”。

3. 模块二：Gaussian Noise → Latents —— 为什么从噪声开始？

图的右上角是 Gaussian Noise（高斯噪声）：

形状：1×4×64×64

这就是 Stable Diffusion 的“起点”。

3.1 为什么不是直接在 512×512 像素上扩散？

这是 Stable Diffusion 的核心创新：不在像素空间扩散，而在潜空间（latent space）扩散。

真实图像：3×512×512
潜空间：4×64×64

这相当于把图像压缩了 8 倍（512 / 64 = 8），计算量大幅下降。

这就是 Latent Diffusion 的意义：更快、更省显存，同时保持画质。

3.2 这 4 个通道是什么？

这是 VAE 编码后的 latent feature map 的通道数（对 SD 1.x 常见配置就是 4）。

4. 模块三：U-Net —— 扩散模型真正“画画”的地方

图中黄色块是 U-Net，它是扩散模型的核心网络，负责：

输入：当前 timestep 的 noisy latents（含噪潜变量）
条件：text embeddings
输出：噪声预测（或直接预测 x0 / v，取决于训练方式）

4.1 U-Net 为什么叫 U-Net？

因为它是“编码器-解码器”的结构，中间通过 skip connection 保留空间细节，适合做图像相关任务。

4.2 文本是怎么“进”U-Net 的？

通常通过 Cross-Attention（交叉注意力）：

Query 来自 latent feature
Key/Value 来自 text embeddings

这意味着：

模型每一步去噪时，都在不断“对齐”文字语义与图像潜空间结构。

4.3 CFG：提示词引导

虽然图里没写，但实际流程几乎都会用 Classifier-Free Guidance（CFG）：

同时跑 有条件（prompt） 与 无条件（空 prompt）
两者结果线性组合，让生成更贴近 prompt

\epsilon = \epsilon_{\text{uncond}} + s \left( \epsilon_{\text{cond}} - \epsilon_{\text{uncond}} \right)

其中 s 是 guidance scale（常见 5~12）。

5. 模块四：Scheduler —— 控制“加噪/去噪”的时间策略

图右侧橙色块是 Scheduler algorithm to add noise，它负责管理扩散过程中的：

时间步（timestep）
噪声强度（noise schedule）
采样算法（DDIM、Euler、DPM++ 等）

5.1 为什么图里写 “Repeat N times”？

因为扩散模型的生成不是“一步到位”，而是 多步迭代：

通常 N = 20~50
每一步根据 scheduler 指定的规则更新 latents

这就是所谓的 采样过程（sampling）。

去噪步数越多，通常细节越丰富，但耗时越长；不同采样器会影响风格与稳定性。

6. 模块五：VAE —— 从潜空间回到像素世界

图中绿色块是 VAE，它是一个：

Encoder：把图像压缩到 latent
Decoder：把 latent 解码回图像

在文生图里我们只用 Decoder：

image = VAE.decode(conditioned_latents)

输出图像尺寸是：3×512×512（RGB）

这也是图右下角 Output Image 的来源。

7. 串起来：Stable Diffusion 的整体流程（对应图）

结合图，我们可以用“工程视角”的伪流程理解：

输入 prompt
用 CLIP 把 prompt 编码成 text embeddings
初始化随机高斯噪声 latents（1×4×64×64）
for t in timesteps:
- U-Net(latents, t, text_embeddings) → 预测噪声
- Scheduler 根据预测噪声更新 latents
VAE 解码 latents → 输出 512×512 图片

8. 为什么这种结构强大？有三个关键优势

8.1 潜空间扩散：速度与质量的折中最佳解

相比像素扩散：更快、更省显存
相比 GAN：更可控、更稳定

8.2 CLIP 语义空间：文本可精细控制图像内容

Cross-attention + CFG 让 prompt 能精准影响形状、颜色、风格、细节。

8.3 Scheduler 可插拔：采样策略决定“生成气质”

不同 scheduler（Euler、DDIM、DPM++）决定：

清晰度
细节锐利程度
风格偏向
收敛速度

9. 读图小结

Stable Diffusion = 文本条件 + 潜空间扩散 + U-Net 去噪 + VAE 解码

Prompt 给方向
CLIP 给语义
U-Net 做生成
Scheduler 控节奏
VAE 把结果搬回像素世界

理解了这条链路，就可以掌握扩散模型最重要的知识骨架。

3大开源修复模型横评：云端镜像快速部署，1天完成全面测试

3大开源修复模型横评：云端镜像快速部署，1天完成全面测试你是不是也遇到过这样的情况：团队要选一个AI图像修复工具，大家各自在本地跑GFPGAN、CodeFormer、GPEN，结果有人用笔记本CPU跑，有人用高端显卡，测试速度、画质效果完全没法比？最后开会讨论时，谁的电脑配置高，谁的结果就“看起来更好”，根本没法做出公正决策。这正是很多技术主管在搭建AI工具链时最头疼的问题——缺乏统一、可复现的测试环境。不同设备、不同依赖版本、不同参数设置，导致评估结果偏差巨大，选型变成“看运气”。别急，今天我就来帮你解决这个痛点。我们不靠本地部署“拼电脑”，而是直接上云端标准化镜像环境，一键部署三大主流开源人脸修复模型：GFPGAN、CodeFormer 和 GPEN，在相同GPU资源下完成公平对比测试，1天内搞定从部署到出报告的全流程。 ZEEKLOG星图平台提供了预置好这三大模型的AI镜像，无需手动安装复杂依赖，不用折腾CUDA、PyTorch版本兼容问题，点击即用，还能对外暴露API服务，方便团队成员远程调用测试。整个过程就像租了一台“AI修复工作站”，谁都能用，结果可比对。

手把手教你在GitHub上运行开源项目（新手必看版）

📦 说在前面 GitHub这个程序员宝藏平台（我愿称之为代码界的金矿），每天都有成千上万的开源项目更新。但是很多新手朋友看到那些酷炫项目时，经常会遇到三大灵魂拷问：这项目怎么跑起来？需要装什么软件？报错了怎么办？今天咱们就用最接地气的方式，手把手教你从0到1运行GitHub项目！ 🔧 准备工具包（装机三件套） 1. 代码编辑器（必装）推荐直接上VS Code这个万金油，装好记得在扩展商店安装这两个插件： * GitLens（代码时光机，能看到每行代码的修改记录） * Code Runner（一键运行脚本的神器）（超级重要）👉 如果项目里有.vscode文件夹，一定要用VS Code打开，里面可能有预置的调试配置！ 2. Git客户端（下载代码必备） Windows用户直接装Git for Windows，安装时记得勾选这个选项： Use Git and optional Unix tools from the Command Prompt （这样就能在CMD里用Linux命令了，真香！

弃用MobaXterm，拥抱开源软件Tabby

目录 * 引言 * MobaXterm * MobaXterm - Windows下的增强型终端 * 🚀 核心功能点 * 🖥️ X服务器功能 * 💻 终端功能 * 🌐 网络协议支持 * 📁 文件管理功能 * 🔧 高级功能 * 🎨 界面定制 * 📊 会话管理 * 🔌 插件系统 * 🔒 安全功能 * 📱 便携特性 * 🌍 多语言支持 * 📈 专业版增强功能 * 版本说明： * 🔹 家庭版 (Home Edition) * 🔸 专业版 (Professional Edition) * 企业使用建议： * 使用场景： * Tabby * Tabby - 现代化的终端模拟器 * 🚀 核心功能点 * 💻 终端功能 * 🎨 界面定制 * 🔗 网络连接功能 * SSH客户端 * 其他协议 *

第4章：开源模型全景图：如何选择你的技术底座

第4章：开源模型全景图：如何选择你的技术底座引言开源大模型生态正在经历爆炸式增长。截至2024年6月，HuggingFace平台托管的模型数量已超过50万个，每月新增数千个模型。面对如此庞杂的选择，技术决策者往往陷入两难：是选择规模最大、性能最强的模型，还是选择更符合实际约束的务实方案？本章将建立一套系统的模型选型框架，通过参数规模-性能曲线分析、推理成本量化和许可证风险评估，为技术决策提供科学依据。 1. 开源模型生态现状分析 1.1 主流开源模型系列对比当前开源大模型生态已形成多个技术流派，各具特色： Llama系列（Meta）： * 技术特点：基于Transformer解码器架构，使用RoPE位置编码，采用Grouped-Query Attention优化 * 开源策略：社区友好许可证，允许商业使用（需申请） * 代表型号：Llama-2-7B/13B/70B，Llama-3-8B/70B * 优势：生态完善，工具链成熟，微调资源丰富 Mistral系列： * 技术特点：采用滑动窗口注意力（Sliding Window