引言
机器人领域正经历由基础模型驱动的革命。如同大语言模型重塑了自然语言处理,视觉 - 语言 - 动作模型(VLA)正在改变机器人学习的范式。
Physical Intelligence 公司先后发布了两代 VLA 模型:
- π₀(2024 年 10 月):首个通用机器人策略
- π₀.5(2025 年 4 月):具备开放世界泛化能力的 VLA
本文将深入分析这两个模型的核心差异,帮助理解 VLA 技术的演进方向。
π₀:首个通用机器人策略
设计目标
π₀ 的核心目标是实现灵巧操作和跨具身控制。它追求让机器人完成前所未有的复杂技能,例如折叠衣物、组装纸板箱、清理餐桌或装袋杂货。
模型架构
π₀ 采用双专家并行加共享注意力的架构设计。这种设计允许 VLM Expert 负责视觉 - 语言理解,而 Action Expert 专注于动作生成。
┌─────────────────────────────────────────────────────────────────────┐
│ π₀ 架构 │
├─────────────────────────────────────────────────────────────────────┤
│ 输入 │
│ ├── 图像 ──► SigLIP 视觉编码器 │
│ ├── 语言 ──► Tokenizer │
│ └── 状态 ──► MLP 编码 │
│ │
│ ▼ │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ VLM Expert (PaliGemma 3B) │ │
│ │ ↕ │ │
│ │ 逐层共享注意力机制 │ │
│ │ ↕ │ │
│ │ Action Expert (Gemma 300M) │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │
│ ▼ │
│ 输出:连续动作(通过 Flow Matching 生成) │
└─────────────────────────────────────────────────────────────────────┘
关键设计特点包括:
- 双专家架构:职责分离,VLM 理解,Action 生成。
- 逐层共享注意力:两层专家通过共享自注意力机制交互。
- Flow Matching:使用流匹配生成连续动作。
- 非对称信息流:Action tokens 可关注 VLM tokens,但 VLM tokens 被遮蔽以保护预训练知识。
训练数据
训练数据主要包含 Open X-Embodiment 开源数据集、基于 PaliGemma 的互联网规模预训练以及来自 8 种不同机器人的灵巧任务数据。
推理流程
推理时先进行 VLM 前向传播生成 KV Cache,随后通过 Flow Matching 迭代生成动作序列。
