【论文阅读】DreamZero:World Action Models are Zero-shot Policies

优质文章学习记录

10 Apr 2026 — 4 min read

快速了解部分

基础信息（英文）：

题目: World Action Models are Zero-shot Policies
时间: 2026.02
机构: NVIDIA
3个英文关键词: World Action Models (WAMs), Zero-shot Generalization, Video Diffusion
paper

1句话通俗总结本文干了什么事情

本文提出了一种名为DreamZero的机器人基础模型，通过同时预测视频和动作（world action model），让机器人能像人类一样通过“脑补”画面来规划动作，从而在从未见过的任务和环境中实现零样本泛化。

研究痛点：现有研究不足 / 要解决的具体问题

现有的视觉语言动作模型（VLAs）虽然擅长语义理解，但缺乏对物理世界动态（如几何、动力学）的理解，难以泛化到从未见过的新动作或新环境，且通常需要大量重复的演示数据。

核心方法：关键技术、模型或研究设计（简要）

采用预训练的视频扩散模型作为骨干，构建了一个名为World Action Model (WAM) 的架构。该模型通过联合预测未来的视频帧和机器人动作，利用视频预测作为视觉规划器来指导动作生成。

深入了解部分

作者想要表达什么

作者旨在证明，通过将机器人策略学习转化为联合视频与动作预测问题，可以利用网络规模的视频数据预训练模型，从而获得强大的物理直觉和空间感知能力，解决传统VLAs在物理交互泛化上的瓶颈。

相比前人创新在哪里

范式转变：不同于VLAs仅学习“看到什么做什”，WAMs学习“动作如何改变世界”。
数据效率：打破了传统观念，证明可以从多样、非重复的数据中有效学习，无需每个任务的大量重复演示。
跨具身迁移：展示了惊人的跨具身迁移能力，仅需少量人类或其他机器人的视频（无动作标签）即可显著提升新任务性能。

解决方法/算法的通俗解释

DreamZero的工作原理类似于给机器人装了一个“内部模拟器”。当给定指令时，模型首先在内部“脑补”出完成任务的视频画面，然后根据这个脑补的画面反推需要执行的具体动作。

解决方法的具体做法

模型架构：基于14B参数的视频扩散模型Wan2.1，增加了状态和动作编码器/解码器。
训练方式：使用Flow Matching目标，联合去噪视频潜变量和动作潜变量。
推理优化：提出了DreamZero-Flash技术，通过解耦视频和动作的噪声时间表，实现了单步去噪的实时推理（7Hz）。

基于前人的哪些方法

基于预训练的VLMs和Video Diffusion Models的研究基础，特别是利用了Wan2.1-I2V作为视觉骨干，并借鉴了流匹配算法进行训练。

实验设置、数据、评估方式、结论

实验设置：在AgiBot G1（双臂移动 manipulator）和Franka（单臂）机器人上进行预训练和评估。
数据：使用了约500小时的AgiBot异构数据，以及DROID数据集。
评估方式：在未见过的任务（如解鞋带、熨衣服）和未见过的环境中评估任务进度。
结论：DreamZero在零样本泛化上比最先进的VLAs提升了2倍以上；仅需10-20分钟的其他机器人或人类视频数据，性能相对提升超42%。

提到的同类工作

GR00T N1.6, π₀.σ (pi-zero), RT-2, OpenVLA, CosmoPolicy。

和本文相关性最高的3个文献

Bjorck et al., 2025 (GR00T N1.6)
Physical Intelligence, 2025 (π₀.σ)
Team Wan, 2025 (Wan2.1-I2V-14B-480P)

我的

WAM，输入video和action，以及text，输出action和video。

有一个把历史frames送入kv cache的操作，然后用的是GT frames。左侧图是对比，右侧是本文。Q是y轴，x轴是KV（记忆），模型在看问题Q时可以参考KV记忆。

Xilinx FPGA | 管脚约束 / 时序约束 / 问题解析

注：本文为 “Xilinx FPGA | 管脚约束 / 时序约束 / 问题解析” 相关合辑。略作重排，未整理去重。如有内容异常，请看原文。 Xilinx FPGA 管脚 XDC 约束之：物理约束 FPGA技术实战于 2020-02-04 17:14:53 发布说明：本文简单介绍 Xilinx FPGA 管脚物理约束，包括位置（管脚）约束和电气约束。 1. 普通 I/O 约束管脚位置约束：set_property PACKAGE_PIN "管脚编号" [get_ports "端口名称&

Whisper-large-v3常见问题全解，语音识别避坑指南

Whisper-large-v3常见问题全解，语音识别避坑指南语音识别不是“上传音频→点一下→出文字”这么简单的事。尤其当你第一次用 Whisper-large-v3，满怀期待地拖进一段会议录音，结果等了两分钟只返回一句“无法识别”，或者中文识别错成日文、带口音的方言直接失语、GPU显存爆满报错OOM……这些都不是模型不行，而是你还没踩过它最常设的那些“坑”。这篇指南不讲论文、不堆参数，只聚焦一个目标：让你今天下午就能稳稳跑通 Whisper-large-v3，识别准、速度快、不报错、少折腾。内容全部来自真实部署环境（RTX 4090 D + Ubuntu 24.04）下的反复验证，覆盖从启动失败、语言误判、音频异常到性能卡顿等 12 类高频问题，每一条都配可复现的操作步骤和一句话原因解释。 1. 启动就失败？先查这三件事很多用户反馈“python3 app.py 运行报错退出”，根本没看到

终极指南：5步掌握llama.cpp量化技术，让大模型内存占用直降70%

终极指南：5步掌握llama.cpp量化技术，让大模型内存占用直降70% 【免费下载链接】llama.cppPort of Facebook's LLaMA model in C/C++ 项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp 还在为大模型推理时内存爆满而苦恼吗？作为C/C++实现的LLaMA模型移植项目，llama.cpp通过创新的量化（Quantization）技术，将模型参数量化为低精度格式，在保持推理质量的同时大幅降低内存需求。本文将为你揭秘量化技术的核心原理、实战配置和性能优化技巧，帮你轻松在消费级硬件上运行千亿参数模型。量化技术：大模型部署的破局利器传统FP32精度模型在推理时需要消耗大量内存，以70亿参数模型为例，仅权重就需要占用约28GB显存。量化技术通过将模型参数从32位浮点数压缩为4位、8位整数，就像把高清视频转为标清——虽然细节略有损失，但核心内容依然清晰可用。 llama.cpp的量化方案通过精度分级+

解密Copilot：如何打造高效的AI原生应用

解密Copilot：如何打造高效的AI原生应用一、引言：从“工具使用者”到“AI合作者”的革命钩子：你经历过这些“开发至暗时刻”吗？凌晨3点，你盯着屏幕上的Cannot read properties of undefined错误，第10次检查接口返回的数据结构——明明昨天还能跑通；写一个分页组件，你翻了3次Ant Design文档，却还是记不住Pagination组件的showTotal属性怎么用；改祖传代码时，你花了1小时理解上一任开发者的“天才逻辑”，最后发现只是少写了一个await；这些场景，每一个开发者都不陌生。我们总在“找工具”“记语法”“修低级错误”上浪费大量时间，而真正创造价值的“逻辑设计”“创意实现”却被挤压到了碎片时间。直到2021年GitHub Copilot发布，一切开始改变： * 当你输入// 写一个React的登录表单，它自动生成带表单验证、状态管理的完整组件； * 当你写const users = await