PAPER DEEP DIVE
机器人渲染的机器人分解世界模型
动作条件视频世界模型预测未来观测,本文提出通过机器人渲染构建机器人分解的世界模型。
动作条件视频世界模型从初始观测和动作信号预测未来观测。在机器人领域,动作通过两个截然不同的过程影响未来观测:首先通过机器人体和控制器的动作实现过程,然后通过接触和物体运动的场景响应过程。直接用动作命令作为条件,要求世界模型自己学会动作实现过程;而用已记录的未来状态作为条件,则会泄漏模型本应预测的交互结果。本文提出机器人因子化世界模型,将两个机器人特有因子移出世界模型:(1) 动作实现——将命令通过机器人自身的控制器和运动学展开为部署可用的名义轨迹;(2) 机器人渲染——将名义轨迹通过机器人 URDF 渲染为显式的机器人几何。实验证明渲染接口优于向量条件基线,并可泛化到未见过的机器人体型。
1. 问题动机与核心挑战
世界模型预测环境如何响应智能体的动作而演化。对于物理机器人,动作在场景交互之前必须经过体态相关的实现过程。直接用机器人控制信号作为条件的世界模型,必须同时学会两件事:控制信号如何实现为机器人运动,以及场景如何响应这些运动。关键挑战是:找到一种部署可用的视觉条件信号,既保留场景响应预测作为模型任务,又不泄漏未来交互结果。
核心问题是:机器人动作应该如何呈现给视频世界模型?本文将动作到观测的映射分解为两个间隙:
$$\text{动作实现间隙} = \hat{\mathbf{a}}_{1:F} \to \mathbf{q}_{1:F} \quad \text{(控制信号到名义轨迹)}$$ $$\text{名义-实现间隙} = \mathbf{q}_{1:F} \to \mathbf{x}_{1:F} \quad \text{(名义轨迹到接触场景状态)}$$第一个间隙由机器人特定的实现过程处理,第二个间隙连同物体运动和遮挡变化留给世界模型预测。
2. 机器人因子化视觉世界模型接口
动作条件机器人世界模型从当前观测和动作序列 $\mathbf{a}_{1:F}$ 预测未来视频 $\mathbf{V}_{1:F}$。用实现算子 $\Phi_R$ 将动作映射为名义轨迹:
$$\mathbf{q}_{1:F} = \Phi_R(\mathbf{a}_{1:F}; \mathbf{q}_0)$$然后用渲染算子 $\Pi_R$ 沿目标相机轨迹 $\mathcal{C}_{1:F}$ 渲染名义轨迹:
$$(\mathbf{M}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{eef}}_{1:F}) = \Pi_R(\mathbf{q}_{1:F}; \mathcal{C}_{1:F})$$同时,初始场景状态 $\mathbf{S}_0$ 通过静态上下文流沿同一相机轨迹渲染:
$$(\mathbf{B}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{scene}}_{1:F}) = \Pi_S(\mathbf{S}_0; \mathcal{C}_{1:F})$$世界模型学习条件分布:
$$p_\theta\left(\mathbf{V}_{1:F} \mid \mathbf{B}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{scene}}_{1:F}, \mathbf{M}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{eef}}_{1:F}, \mathcal{T}\right)$$文本提示 $\mathcal{T}$ 仅包含场景上下文,排除对动作或未来结果的描述。这一分解将机器人特定控制信号转化为模型可见的机器人几何,将实现和渲染算子作为固定预处理步骤。
图1展示了视觉世界模型接口:静态上下文携带场景和视角信息,渲染的名义机器人几何携带动作信息,扩散模型预测场景响应。
3. 名义轨迹条件
部署时视觉条件信号必须满足两个要求:推理时可用,且对从动作实现的机器人运动保持信息量。三种候选信号的对比:
| 信号类型 | 推理可用 | 信息泄漏 | 体态无关 |
|---|---|---|---|
| 原始动作 $\mathbf{a}_{1:F}$ | 是 | 无 | 否(绑定特定机器人) |
| 名义轨迹 $\mathbf{q}_{1:F}$ | 是 | 无 | 是(渲染后统一) |
| 实现状态 $\mathbf{x}_{1:F}$ | 否 | 泄漏交互结果 | 是 |
名义轨迹是动作与交互之间的中间信号:由机器人自身控制器和运动学实现,在观测场景交互之前产生。它在自由空间中与实现运动一致,在接触介导交互处发散——恰好是世界模型应预测的部分。
图2说明了为何名义轨迹是世界模型条件的正确中间信号:控制器实现的运动与接触场景中实际观测到的状态之间的名义-实现间隙,正是世界模型应预测的部分。
4. 深度感知渲染接口
RGB 网格渲染在图像空间定位机器人,但 RGB 无法解析末端执行器与场景的空间关系。当末端执行器与物体在图像上重叠时,RGB 无法区分前方、后方还是接触深度。因此增加末端执行器深度 $\mathbf{D}^{\text{eef}}_{1:F}$ 和场景深度 $\mathbf{D}^{\text{scene}}_{1:F}$,提供超越图像平面重叠的几何线索。
图4的深度消融实验显示:省略深度时,模型可能将图像平面重叠误判为接触;加入末端执行器和场景深度后,模型能正确区分接触相关的邻近关系与图像平面重叠。
5. 场景响应模型学习
用潜在视频扩散模型实例化公式4。采用视频修复骨干网络,静态上下文视频作为条件输入,预测时域上应用全遮罩。所有条件流由预训练视频 VAE 编码并与噪声视频潜在拼接:
$$\mathbf{c} = \left[\mathcal{E}(\mathbf{B}^{\text{rgb}}_{1:F}), \mathcal{E}(\mathbf{M}^{\text{rgb}}_{1:F}), \mathcal{E}(\mathbf{D}^{\text{scene}}_{1:F}), \mathcal{E}(\mathbf{D}^{\text{eef}}_{1:F})\right]$$训练最小化潜在流匹配目标。对采样噪声潜在 $\boldsymbol{\epsilon}$ 和噪声水平 $\sigma$,形成 $\mathbf{z}_\sigma = (1-\sigma)\mathbf{z}_0 + \sigma\boldsymbol{\epsilon}$,目标速度 $\mathbf{u} = \boldsymbol{\epsilon} - \mathbf{z}_0$:
$$\mathcal{L} = \mathbb{E}_{\mathbf{z}_0, \sigma, \boldsymbol{\epsilon}}\left[\left\|\mathbf{u} - v_\theta(\mathbf{z}_\sigma, \sigma \mid \mathbf{c}, \mathcal{T})\right\|_2^2\right]$$
graph TD
A[动作序列 a_1:F] --> B[实现算子 Phi_R
控制器+运动学]
B --> C[名义轨迹 q_1:F]
C --> D[渲染算子 Pi_R
URDF网格RGB+末端深度]
E[初始场景 S_0] --> F[静态上下文 Pi_S
场景RGB+场景深度]
D --> G[条件流拼接]
F --> G
G --> H[潜在视频扩散模型
预测场景响应V_1:F]
style B fill:#f9f,stroke:#333,stroke-width:2px
style D fill:#bbf,stroke:#333,stroke-width:2px
style H fill:#bfb,stroke:#333,stroke-width:2px
6. 实验设置
数据集:DROID(Franka Panda 7-DoF 机械臂远程操作数据,41,642个片段)和 RoboCasa-GR1(人形 VLA DiT4DiT 执行 24 个任务 × 50 集,9,380 个片段)。所有数据处理为 81 帧、480×832、16fps 片段。评估使用 256 个 DROID 和 128 个 RoboCasa-GR1 留出片段。
名义化:对 DROID,在无场景的 Isaac Lab 环境中重放原始遥操作关节和夹爪目标,机器人自身控制器产生物理可跟踪的名义轨迹。对 RoboCasa-GR1,DiT4DiT 控制器动作从片段起始状态无碰撞重放,获取 Fourier GR-1 名义状态。
基线:Ctrl-World(7-DoF 笛卡尔位姿条件,SVD 骨干)和 AdaLN 状态向量基线(将名义轨迹作为数值状态输入)。
7. 主要实验结果
表1展示主要动作接口对比。在 SVD 骨干上,渲染接口(PSNR=25.05)优于 Ctrl-World 位姿条件(PSNR=23.15)。在 Wan 2.1 14B 骨干上,渲染网格+深度接口在 DROID 上达到 PSNR=21.87,在 RoboCasa-GR1 上达到 PSNR=24.61,均优于 AdaLN 状态向量基线(18.57/17.67)。
| 骨干网络 | 方法 | DROID PSNR↑ | RoboCasa PSNR↑ |
|---|---|---|---|
| SVD 1.5B | Ctrl-World 位姿 | 23.15 | — |
| SVD 1.5B | 渲染网格(本文) | 25.05 | — |
| Wan 2.1 14B | AdaLN 状态向量 | 18.57 | 17.67 |
| Wan 2.1 14B | 渲染网格+深度(本文) | 21.87 | 24.61 |
表2的消融实验在 DROID 上隔离了两个因子。名义轨迹渲染相比原始动作网格提升了 PSNR(22.44 vs 21.57),说明将动作实现分配给机器人局部栈产生更好的渲染对齐。加入末端执行器和场景深度后进一步提升(PSNR=23.08)。
| 变体 | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|
| 原始动作网格 | 21.57 | 0.860 | 0.175 |
| 名义网格 | 22.44 | 0.872 | 0.164 |
| 名义网格+EEF/场景深度 | 23.08 | 0.874 | 0.161 |
8. 定性分析与下游应用
图3的定性对比显示:AdaLN 状态向量基线虽能保留场景外观,但动作弱或错位;渲染机器人几何直接在目标相机帧中暴露动作,预测的场景变化更好地定位在机器人运动和接触区域周围。
反事实轨迹编辑:在真实 DROID 片段上保持初始场景不变,改变渲染的机器人运动轨迹,预测的场景响应也随之改变,证明模型将渲染几何作为动作信号。
未见体态组合:HRDexDB 提供未见过的 xArm 6 臂 + Inspire F1 手组合。将留出机器人运动渲染为相机对齐 URDF 几何,通过同一训练模型,条件机制保持不变,仅渲染几何改变,展示了接口级的体态泛化。
人类演示到机器人视频:将 DexYCB 人类操作视频中的手部运动重定向到机器人并渲染为相同网格+深度接口,世界模型无需关心运动来源即可消费渲染的机器人几何。
9. 局限性
局限性1:URDF和标定依赖。渲染接口需要已知机器人 URDF 和相机到机器人标定,在标定设置中是标准要求,但每个新体态都需要这些信息。
局限性2:静态场景假设。相机移动时,静态上下文流假设有完全可用的静态场景表示——在仿真中完全可用,但真实世界仅部分观测。前馈 3D 重建可以提供,但消除外观差距可能需要额外训练。
局限性3:失败数据不足。DROID 片段以成功为主,模型很少见到抓取失败、滑动和误判接触的情况;收集失败数据将提高这些场景的鲁棒性。
10. 总结
本文提出机器人因子化世界模型,将动作实现和机器人渲染从视频世界模型中分解出来。动作被实现为部署可用的名义轨迹并渲染为相机对齐的机器人几何,使模型将动作视为可见机器人几何并学习场景如何响应。在 DROID 和 RoboCasa-GR1 上的实验证明渲染接口优于向量条件基线,同一接口还可扩展到未见过的机器人体态和重定向的人类演示。核心洞察是:与其让世界模型学习动作实现,不如在渲染中显式提供它,让模型专注于场景响应预测这一共享问题。



