跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

人形全身 VLA 模型Ψ0:人类视频预训练与流匹配动作专家

Ψ0 模型通过 800 小时人类视频与 30 小时机器人数据预训练 VLM,再后训练 MM-DiT 动作专家,最后用 AMO 做下肢跟踪。该方案避免混合异构数据,采用分阶段训练提升泛化能力。引入训练阶段实时分块技术解决推理延迟导致的抖动问题。实验显示其在八项真实任务中成功率显著优于 GR00T 等基线,证明了高质量数据与合理架构在人形全身控制中的关键作用。

Kubernet发布于 2026/4/8更新于 2026/9/1065 浏览
人形全身 VLA 模型Ψ0:人类视频预训练与流匹配动作专家

Ψ0:面向通用人形移动操作的基础模型

南加州大学 PSI Lab、NVIDIA 和 WorldEngine 联合提出了Ψ0,一种用于人形机器人全身灵巧操作(Loco-Manipulation)的视觉语言动作(VLA)模型。该工作旨在解决大规模遥操作数据稀缺的问题,通过结合人类第一视角视频与少量真实机器人数据,实现高效的技能学习。

核心思路

传统方法试图混合人类与机器人数据进行端到端训练,但这往往因为两者动作分布的本质差异而效果次优。Ψ0 采用了一种分阶段的训练范式:

  1. 预训练阶段:在约 800 小时的人类自视角视频和 30 小时的真实机器人交互数据上,对 VLM 主干进行自回归预训练。目标是让模型学习任务层面的运动先验及与下游任务对齐的视觉表征。
  2. 后训练阶段:利用高质量的人形机器人数据,单独训练一个基于流(Flow-based)的动作专家(MM-DiT)。这一步专注于捕捉特定机器的动力学特性,使其能直接在关节空间预测动作序列。
  3. 微调阶段:使用少量域内遥操作数据对动作专家进行微调,快速适应新任务。

这种设计避免了单纯堆砌数据,而是强调数据质量与分阶段学习的效率。

模型架构

Ψ0 采用三重系统架构,遵循以往基础模型的设计思路:

  • System-0(下肢控制):接收高层策略输出的 8 自由度下肢动作(如躯干姿态、底座高度、速度等),通过现成的强化学习控制器 AMO 映射为 15 自由度的下肢关节角。
  • System-1(动作专家):多模态扩散 Transformer(MM-DiT),约 5 亿参数。它接收 VLM 提取的特征作为条件,并行输出未来的全身动作片段。相比朴素 DiT,其双调制设计和联合注意力机制能更有效地融合视觉与语言信息。
  • System-2(视觉语言骨干):使用 Qwen3-VL-2B-Instruct 作为基础,负责理解自然语言指令并提取视觉特征。

整体输出包含 43 个自由度的全身动作,涵盖双手、手臂、躯干及下肢状态。

训练细节

预训练策略

针对计算成本,作者并未要求 VLM 预测长序列动作,而是仅预测单步下一个动作 token。为此,团队重新训练了 FAST tokenizer,将连续动作离散化,平均 L1 重建损失降至 0.005,并将每个动作序列压缩至约 20 个 token。数据集主要来自 EgoDex(约 829 小时)和 Humanoid Everyday(31 小时)。

后训练与微调

冻结 VLM 主干,仅优化 MM-DiT 动作专家。后训练使用 Humanoid Everyday 数据集,跨任务学习通用技能;微调则针对具体任务(如抓取、推动),仅需 80 条遥操作轨迹即可收敛。实验显示,这种少量数据微调的方式足以让模型掌握长时程、高灵巧性的技能。

实时动作分块(RTC)

面对数十亿参数的推理延迟,Ψ0 采用了训练阶段的实时分块(Training-time RTC)技术。通过在训练中随机遮蔽部分动作 token 来模拟推理延迟,迫使模型学会基于已执行动作平滑生成后续动作。这有效消除了传统同步推理中的停顿抖动,确保机器人在执行复杂任务时的流畅性。

远程操作定制

为了采集高质量的行走 - 操作数据,团队设计了定制的遥操框架:

  • 上半身:使用 PICO 头显配合腕部追踪器,结合 MANUS 手套获取手指精细运动,通过多目标逆运动学求解器映射到机器人手臂。
  • 下半身:腰部与脚部追踪器推断平移速度与偏航指令,输入 RL 策略保证行走稳定性。

这种解耦设计允许单人操作员同时完成复杂的全身协调任务,且避免了纯视觉追踪常见的遮挡问题。

实验结果

在八个真实世界长时域任务上的评估表明,Ψ0 在所有开源基线中表现最佳。相比第二名的 GR00T-N1.6,整体成功率提升了至少 40%。消融实验进一步证实了预训练 VLM 的重要性,以及 MM-DiT 结构相对于朴素 DiT 的优势。特别是在处理需要双臂协同或长距离导航的任务时,Ψ0 展现了更强的鲁棒性。

该工作不仅提供了一个高性能的人形 VLA 模型,也为未来如何利用低成本人类视频数据驱动具身智能提供了有价值的参考路径。

目录

  1. Ψ0:面向通用人形移动操作的基础模型
  2. 核心思路
  3. 模型架构
  4. 训练细节
  5. 预训练策略
  6. 后训练与微调
  7. 实时动作分块(RTC)
  8. 远程操作定制
  9. 实验结果

更多推荐文章

查看全部
  • LTX-2 模型本地化部署与效率提升指南
  • 2026 年 3 月全球 AI 前沿动态:模型、机器人及硬件突破
  • OpenSpec 助力 AI 编程:基于需求驱动的规范化工作流
  • YOLO-DRONE:无人机低空巡检模型实测与电力部署解析
  • 荣耀 MWC 2026 发布 Robot Phone 与人形机器人,探索 AI 硬件生态
  • Python 全流程图文安装教程
  • MediaPipe Web 端接入实战:从 CDN 到工程化落地
  • 前端 CI/CD 流程与自动化部署实践
  • 大厂 AI 岗位核心技能指南:前端、后端与算法实战
  • Win10 系统禁用 Microsoft 365 Copilot 弹窗的 6 种方法
  • 知网与维普 AIGC 检测算法对比:实测差异与应对策略
  • Ubuntu 20.04 系统无声问题排查与解决方案
  • 2026 年 3 月 18 日人工智能前沿动态与产业观察
  • 数据库 SQL 防火墙:内核级主动防御 SQL 注入方案
  • 2026 无人机 AI 算法全景图:7 大场景 50+ 算法详解
  • C++26 标准更新:std::execution on 函数深度解析
  • STM32 上运行 AI 模型的四种方案及案例解析
  • Mac mini M4 部署 OpenClaw + Ollama 本地大模型接入飞书机器人
  • Docker 拉取镜像失败报错及配置镜像源解决方案
  • Java 图论基础:有向图与无向图详解

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online