跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

Diffusion Transformer (DiT):U-Net 换 ViT,应用于视频生成与机器人动作预测

Diffusion Transformer (DiT) 通过将扩散模型中的 U-Net 骨干替换为 Vision Transformer (ViT),显著提升了生成模型的扩展性与性能。文章深入解析了 DiT 的核心架构、三种条件策略及在视频生成领域的改造方案,包括时间注意力机制与分辨率适配。重点探讨了清华大学提出的 PAD(Prediction with Action)框架,该框架利用 DiT 联合去噪未来图像与机器人动作,实现了视觉策略学习与具身控制的统一。实验表明,结合大规模视频数据预训练能有效提升机器人在复杂任务中的成功率与规划能力。

雾岛听风发布于 2026/4/9更新于 2026/7/2047 浏览
Diffusion Transformer (DiT):U-Net 换 ViT,应用于视频生成与机器人动作预测

前言

Diffusion Transformer(DiT)是近年来扩散模型领域的重要创新。它不仅在视频生成中表现突出,在机器人动作预测等具身智能任务中也展现出巨大潜力。

第一部分 Diffusion Transformer (DiT):将扩散过程中的 U-Net 换成 ViT

1.1 什么是 DiT

1.1.1 架构核心:Transformer 替代卷积

在 ViT 出现之前,图像领域的扩散噪声估计器主要依赖基于 CNN 的 U-Net 架构。随着 Vision Transformer 的兴起,研究者开始尝试用 Transformer 替换扩散模型中的骨干网络。

2022 年 12 月,William Peebles 和 Saining Xie 在论文《Scalable Diffusion Models with Transformers》中提出了 DiT 结构。其核心思想是将 DDPM 中的卷积架构 U-Net 替换为 Transformer 架构,即 DiT = DDPM + ViT。

这种设计结合了视觉 Transformer 和扩散模型的优点,使得模型能够利用 Transformer 强大的全局建模能力来处理潜在空间中的图像块(patches)。

1.1.2 三种条件策略

DiT 通过不同的方式引入条件信息(Conditioning),主要包括以下三种策略:

  1. adaLN-Zero block 借鉴 ResNets 的初始化经验,作者对自适应层归一化(Adaptive Layer Norm)进行了修改。除了回归缩放参数 γ 和 β,还回归在残差连接前应用的维度方向缩放参数 α。实验表明,这种自适应层归一化效果最好。

  2. 交叉注意力块 (Cross-Attention) 将时间步 t 和类别 c 的嵌入连接成一个序列,作为额外的 token 输入。在多头自注意力之后增加一个交叉注意层,类似于 LDM 的设计。这种方式增加了约 15% 的计算开销。

  3. 上下文条件化 (In-context Conditioning) 将时间步和类别向量嵌入作为两个额外 token 追加到输入序列中,像 CLS Token 一样处理。这种方法无需修改标准 ViT 块,计算开销可忽略不计。

在推理过程中,加噪的潜在变量被分解为 patch 并经过多个 DiT Block 处理。最终输出噪声预测值及对应的协方差矩阵,经过 T 步采样后得到降噪后的潜在表示。

1.2 DiT 在视频生成领域中的应用

1.2.1 视频生成的改造方案

要将 DiT 用于视频生成,需要在架构上进行两项关键改造:

  1. 时空信息的融合 将噪音 Patch 线性化后,并入 Text Prompt Condition 和 Time Step Condition,共同作为 Transformer 的输入。Transformer 内部通常包含三个子模块:

    • Local Spatial Attention:负责收集单帧内的空间信息。
    • Causal Time Attention:负责收集历史时间信息,确保时间一致性。
    • MLP 模块:对时间和空间信息进行非线性融合。
  2. 支持多分辨率与长宽比 为了支持不同长宽比和分辨率的视频,需要设计特定的 Attention Mask 机制。例如,使用 0/1 Attention Mask 矩阵,确保某帧的 Patch 只能看到本帧内的其他 Patch,而不会泄露到其他帧的信息。这有效解决了 NaViT 导致的分辨率适配问题。

1.2.2 典型应用:CogVideo

CogVideo 是 DiT 在视频生成领域的代表性应用之一,展示了该架构在处理长时序视频生成时的优势。

1.3 相关工作

1.3.1 U-ViT:清华团队的早期探索

在 DiT 提出之前,清华大学朱军团队于 2022 年 9 月发布了《All are Worth Words: A ViT Backbone for Diffusion Models》,提出了 U-ViT 架构。该工作同样尝试用 Transformer 替代 U-Net,并引入了长跳跃连接(Long Skip Connections)以保留低级特征,加速训练收敛。相比 DiT,U-ViT 在 CIFAR10、CelebA 等多个数据集上进行了验证。

1.3.2 Simple Diffusion:Google Research 的实践

Google Brain Team 在 2023 年 1 月提出的 Simple Diffusion 也采用了类似的思路。他们指出,对于加噪应根据图像大小调整,且仅将 U-Net 架构缩放到 16×16 分辨率即可改善性能。该工作进一步提出了具有 Transformer 骨干的 U-ViT 变体,实现了端到端的高效训练。

1.3.3 U-DiT:北大与华为的最新进展

2024 年 11 月,北大与华为合作提出了 U-DiT。针对直筒型 DiT 在隐空间生成效果好但在图像空间可能存在的不足,该研究重新拾起 U-Net 结构,将其与 Transformer 有机结合。通过下采样自注意力机制,在降低算力消耗的同时提升了生成质量。

第二部分 DiT 在机器人动作预测中的典型应用

2.1 预测与动作扩散器 PAD

2.1.1 框架概述

DiT 在机器人动作预测领域的应用日益广泛。除了 RDT、CogACT 等工作外,清华大学等机构联合提出的 PAD(Prediction with Action)框架是一个重要的统一策略学习方案。该框架在 DiT 架构下整合了预测和动作,通过联合去噪同时预测未来图像和动作。

PAD 的核心优势在于灵活的 DiT 骨干网络允许其在大规模视频数据上进行联合训练,并可扩展至深度图像等其他模态。

2.1.2 提出背景

现有的扩散生成模型在视觉任务上表现出色,而扩散策略在机器人控制中也显示出有效性。然而,以往的两阶段方法将预测和动作学习分离,忽视了两者之间的深层联系。PAD 旨在解决这一问题,利用预训练扩散模型中编码的物理知识来增强具身控制。

2.2 PAD 模型架构与训练

2.2.1 预备知识与流程

在模仿学习情境下,PAD 考虑像素输入且受语言条件制约的机器人控制。由于机器人数据收集昂贵,框架能够在机器人数据集和视频数据集上进行协同训练,利用互联网上的大规模 RGB 视频数据增强视觉策略学习。

去噪过程从最噪声的潜在样本开始,逐步减少噪声以恢复真实样本。PAD 框架在联合潜在去噪过程中同时预测未来帧和动作。

输入包括当前观测(RGB 图像、机器人姿态、深度图)以及自然语言指令。输出则对应未来的预测图像、深度图和机器人动作。PAD 不仅预测单一未来步骤,还可以预测 k 个未来步骤,视为机器人的 k 步规划。

2.2.2 模型架构细节

鉴于原始数据格式多样,作者首先将所有模态映射到潜在空间:

  • RGB 图像:通过预训练的冻结 VAE 编码器处理,转换为 token 序列。
  • 自然语言:通过冻结的 CLIP 编码器处理,生成文本嵌入。
  • 深度图像:下采样并分词。
  • 机器人姿态:使用 MLP 编码并线性转换。

DiT 骨干网络通过自注意力机制有效地整合了各种模态。输入 token 序列被连接在一起,经历一个联合的潜在去噪过程。这种设计使得 PAD 能够同时在仅有 RGB 的视频数据集和机器人数据集上进行训练。

对于联合条件生成,作者将未来观测初始化为白噪声,并在通道维度上连接条件潜变量和噪声潜变量。这些 token 被输入到多层 DiT 中,以预测未来帧的潜在表示。

2.2.3 训练过程

初始化:PAD 权重从 ImageNet 上预训练的 DiT 模型初始化。由于参数不兼容,舍弃标签嵌入层,对新的文本嵌入层进行零初始化,并复制图像潜在 tokenizer 的权重。

训练目标:训练 PAD 模型以同时预测添加到样本数据上的噪声。损失函数采用 DDPM 损失,共同最小化不同模态的潜在扩散目标,并使用超参数平衡各模态之间的预测损失。

2.3 实验结果

2.3.1 策略训练细节

为了节省资源,作者首先在 BridgeData-v2 数据集上预训练模型,建立图像预测先验,随后适应于 Metaworld 模拟环境和现实世界熊猫操作任务。实验发现,在早期适应阶段增加图像预测损失的权重可以加速收敛。

在执行阶段,机器人使用简单的线性插值运动规划器移动到第一个期望姿态,触发下一次预测循环。策略执行使用 75 步的 DDIM 采样。

2.3.2 消融研究

PAD 框架能够容纳额外的模态。在实际操控实验中,结合深度图像输入(PAD-depth)观察到不同模态之间的预测结果高度一致。深度输入的加入提升了操控任务的性能,有助于代理识别距离变化。此外,该框架未来还可扩展至触觉力或点云等模态。

目录

  1. 前言
  2. 第一部分 Diffusion Transformer (DiT):将扩散过程中的 U-Net 换成 ViT
  3. 1.1 什么是 DiT
  4. 1.1.1 架构核心:Transformer 替代卷积
  5. 1.1.2 三种条件策略
  6. 1.2 DiT 在视频生成领域中的应用
  7. 1.2.1 视频生成的改造方案
  8. 1.2.2 典型应用:CogVideo
  9. 1.3 相关工作
  10. 1.3.1 U-ViT:清华团队的早期探索
  11. 1.3.2 Simple Diffusion:Google Research 的实践
  12. 1.3.3 U-DiT:北大与华为的最新进展
  13. 第二部分 DiT 在机器人动作预测中的典型应用
  14. 2.1 预测与动作扩散器 PAD
  15. 2.1.1 框架概述
  16. 2.1.2 提出背景
  17. 2.2 PAD 模型架构与训练
  18. 2.2.1 预备知识与流程
  19. 2.2.2 模型架构细节
  20. 2.2.3 训练过程
  21. 2.3 实验结果
  22. 2.3.1 策略训练细节
  23. 2.3.2 消融研究
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • PCA实战笔记:降维、代码与避坑思路
  • FPGA 摄像头采集处理显示指南:OV5640 到 HDMI 实时显示
  • 自然语言处理在金融领域的实战应用
  • 基于 Web Unlocker 与 n8n 的自动化资讯系统实战
  • GitHub Copilot Agent 模式配置与使用经验
  • 55 类空基算法开放接入,赋能无人机低空智能应用
  • Java 面试题及答案(208 道)
  • 鸿蒙应用运维监控、生态运营与变现实战
  • 前端 AJAX 详解与动态页面爬虫实战思路
  • 大模型服务选型实战:AI Ping 性能评测工具深度体验
  • AI 产品经理入行必备知识梳理
  • 主流无人机倾斜摄影三维建模服务商盘点
  • Python 使用 Selenium 实现网页自动化操作指南
  • Dubbo 服务降级与 Mock 机制实战
  • 大模型 Agent 智能体原理与核心架构解析
  • 量子图像传输中的量子纠错效率优化技术
  • Python 零基础入门:环境搭建与基础语法实战
  • Java 异常处理:捕获规则与自定义异常
  • 播客转多平台内容矩阵全自动化实战:OpenAI Whisper + Claude
  • 命令行工具 MCPHost:利用模型上下文协议连接大模型与外部工具

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online