Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型World Model机器人渲染

机器人渲染的机器人分解世界模型

动作条件视频世界模型预测未来观测,本文提出通过机器人渲染构建机器人分解的世界模型。

Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo2026年7月24日2 分钟阅读
EN
Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo
Seoul National University / RLWRLD
arXiv:2607.22535

动作条件视频世界模型从初始观测和动作信号预测未来观测。在机器人领域,动作通过两个截然不同的过程影响未来观测:首先通过机器人体和控制器的动作实现过程,然后通过接触和物体运动的场景响应过程。直接用动作命令作为条件,要求世界模型自己学会动作实现过程;而用已记录的未来状态作为条件,则会泄漏模型本应预测的交互结果。本文提出机器人因子化世界模型,将两个机器人特有因子移出世界模型:(1) 动作实现——将命令通过机器人自身的控制器和运动学展开为部署可用的名义轨迹;(2) 机器人渲染——将名义轨迹通过机器人 URDF 渲染为显式的机器人几何。实验证明渲染接口优于向量条件基线,并可泛化到未见过的机器人体型。

1. 问题动机与核心挑战

世界模型预测环境如何响应智能体的动作而演化。对于物理机器人,动作在场景交互之前必须经过体态相关的实现过程。直接用机器人控制信号作为条件的世界模型,必须同时学会两件事:控制信号如何实现为机器人运动,以及场景如何响应这些运动。关键挑战是:找到一种部署可用的视觉条件信号,既保留场景响应预测作为模型任务,又不泄漏未来交互结果。

核心问题是:机器人动作应该如何呈现给视频世界模型?本文将动作到观测的映射分解为两个间隙:

$$\text{动作实现间隙} = \hat{\mathbf{a}}_{1:F} \to \mathbf{q}_{1:F} \quad \text{(控制信号到名义轨迹)}$$ $$\text{名义-实现间隙} = \mathbf{q}_{1:F} \to \mathbf{x}_{1:F} \quad \text{(名义轨迹到接触场景状态)}$$

第一个间隙由机器人特定的实现过程处理,第二个间隙连同物体运动和遮挡变化留给世界模型预测。

2. 机器人因子化视觉世界模型接口

动作条件机器人世界模型从当前观测和动作序列 $\mathbf{a}_{1:F}$ 预测未来视频 $\mathbf{V}_{1:F}$。用实现算子 $\Phi_R$ 将动作映射为名义轨迹:

$$\mathbf{q}_{1:F} = \Phi_R(\mathbf{a}_{1:F}; \mathbf{q}_0)$$

然后用渲染算子 $\Pi_R$ 沿目标相机轨迹 $\mathcal{C}_{1:F}$ 渲染名义轨迹:

$$(\mathbf{M}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{eef}}_{1:F}) = \Pi_R(\mathbf{q}_{1:F}; \mathcal{C}_{1:F})$$

同时,初始场景状态 $\mathbf{S}_0$ 通过静态上下文流沿同一相机轨迹渲染:

$$(\mathbf{B}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{scene}}_{1:F}) = \Pi_S(\mathbf{S}_0; \mathcal{C}_{1:F})$$

世界模型学习条件分布:

$$p_\theta\left(\mathbf{V}_{1:F} \mid \mathbf{B}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{scene}}_{1:F}, \mathbf{M}^{\text{rgb}}_{1:F}, \mathbf{D}^{\text{eef}}_{1:F}, \mathcal{T}\right)$$

文本提示 $\mathcal{T}$ 仅包含场景上下文,排除对动作或未来结果的描述。这一分解将机器人特定控制信号转化为模型可见的机器人几何,将实现和渲染算子作为固定预处理步骤。

视觉世界模型接口示意图

图1展示了视觉世界模型接口:静态上下文携带场景和视角信息,渲染的名义机器人几何携带动作信息,扩散模型预测场景响应。

3. 名义轨迹条件

部署时视觉条件信号必须满足两个要求:推理时可用,且对从动作实现的机器人运动保持信息量。三种候选信号的对比:

信号类型推理可用信息泄漏体态无关
原始动作 $\mathbf{a}_{1:F}$否(绑定特定机器人)
名义轨迹 $\mathbf{q}_{1:F}$是(渲染后统一)
实现状态 $\mathbf{x}_{1:F}$泄漏交互结果

名义轨迹是动作与交互之间的中间信号:由机器人自身控制器和运动学实现,在观测场景交互之前产生。它在自由空间中与实现运动一致,在接触介导交互处发散——恰好是世界模型应预测的部分。

动作到状态实现间隙

图2说明了为何名义轨迹是世界模型条件的正确中间信号:控制器实现的运动与接触场景中实际观测到的状态之间的名义-实现间隙,正是世界模型应预测的部分。

4. 深度感知渲染接口

RGB 网格渲染在图像空间定位机器人,但 RGB 无法解析末端执行器与场景的空间关系。当末端执行器与物体在图像上重叠时,RGB 无法区分前方、后方还是接触深度。因此增加末端执行器深度 $\mathbf{D}^{\text{eef}}_{1:F}$ 和场景深度 $\mathbf{D}^{\text{scene}}_{1:F}$,提供超越图像平面重叠的几何线索。

深度消融实验

图4的深度消融实验显示:省略深度时,模型可能将图像平面重叠误判为接触;加入末端执行器和场景深度后,模型能正确区分接触相关的邻近关系与图像平面重叠。

5. 场景响应模型学习

用潜在视频扩散模型实例化公式4。采用视频修复骨干网络,静态上下文视频作为条件输入,预测时域上应用全遮罩。所有条件流由预训练视频 VAE 编码并与噪声视频潜在拼接:

$$\mathbf{c} = \left[\mathcal{E}(\mathbf{B}^{\text{rgb}}_{1:F}), \mathcal{E}(\mathbf{M}^{\text{rgb}}_{1:F}), \mathcal{E}(\mathbf{D}^{\text{scene}}_{1:F}), \mathcal{E}(\mathbf{D}^{\text{eef}}_{1:F})\right]$$

训练最小化潜在流匹配目标。对采样噪声潜在 $\boldsymbol{\epsilon}$ 和噪声水平 $\sigma$,形成 $\mathbf{z}_\sigma = (1-\sigma)\mathbf{z}_0 + \sigma\boldsymbol{\epsilon}$,目标速度 $\mathbf{u} = \boldsymbol{\epsilon} - \mathbf{z}_0$:

$$\mathcal{L} = \mathbb{E}_{\mathbf{z}_0, \sigma, \boldsymbol{\epsilon}}\left[\left\|\mathbf{u} - v_\theta(\mathbf{z}_\sigma, \sigma \mid \mathbf{c}, \mathcal{T})\right\|_2^2\right]$$
graph TD
    A[动作序列 a_1:F] --> B[实现算子 Phi_R
控制器+运动学] B --> C[名义轨迹 q_1:F] C --> D[渲染算子 Pi_R
URDF网格RGB+末端深度] E[初始场景 S_0] --> F[静态上下文 Pi_S
场景RGB+场景深度] D --> G[条件流拼接] F --> G G --> H[潜在视频扩散模型
预测场景响应V_1:F] style B fill:#f9f,stroke:#333,stroke-width:2px style D fill:#bbf,stroke:#333,stroke-width:2px style H fill:#bfb,stroke:#333,stroke-width:2px

6. 实验设置

数据集:DROID(Franka Panda 7-DoF 机械臂远程操作数据,41,642个片段)和 RoboCasa-GR1(人形 VLA DiT4DiT 执行 24 个任务 × 50 集,9,380 个片段)。所有数据处理为 81 帧、480×832、16fps 片段。评估使用 256 个 DROID 和 128 个 RoboCasa-GR1 留出片段。

名义化:对 DROID,在无场景的 Isaac Lab 环境中重放原始遥操作关节和夹爪目标,机器人自身控制器产生物理可跟踪的名义轨迹。对 RoboCasa-GR1,DiT4DiT 控制器动作从片段起始状态无碰撞重放,获取 Fourier GR-1 名义状态。

基线:Ctrl-World(7-DoF 笛卡尔位姿条件,SVD 骨干)和 AdaLN 状态向量基线(将名义轨迹作为数值状态输入)。

7. 主要实验结果

主实验对比表格

表1展示主要动作接口对比。在 SVD 骨干上,渲染接口(PSNR=25.05)优于 Ctrl-World 位姿条件(PSNR=23.15)。在 Wan 2.1 14B 骨干上,渲染网格+深度接口在 DROID 上达到 PSNR=21.87,在 RoboCasa-GR1 上达到 PSNR=24.61,均优于 AdaLN 状态向量基线(18.57/17.67)。

骨干网络方法DROID PSNR↑RoboCasa PSNR↑
SVD 1.5BCtrl-World 位姿23.15
SVD 1.5B渲染网格(本文)25.05
Wan 2.1 14BAdaLN 状态向量18.5717.67
Wan 2.1 14B渲染网格+深度(本文)21.8724.61
消融实验表格

表2的消融实验在 DROID 上隔离了两个因子。名义轨迹渲染相比原始动作网格提升了 PSNR(22.44 vs 21.57),说明将动作实现分配给机器人局部栈产生更好的渲染对齐。加入末端执行器和场景深度后进一步提升(PSNR=23.08)。

变体PSNR↑SSIM↑LPIPS↓
原始动作网格21.570.8600.175
名义网格22.440.8720.164
名义网格+EEF/场景深度23.080.8740.161

8. 定性分析与下游应用

定性对比

图3的定性对比显示:AdaLN 状态向量基线虽能保留场景外观,但动作弱或错位;渲染机器人几何直接在目标相机帧中暴露动作,预测的场景变化更好地定位在机器人运动和接触区域周围。

反事实轨迹编辑:在真实 DROID 片段上保持初始场景不变,改变渲染的机器人运动轨迹,预测的场景响应也随之改变,证明模型将渲染几何作为动作信号。

未见体态组合:HRDexDB 提供未见过的 xArm 6 臂 + Inspire F1 手组合。将留出机器人运动渲染为相机对齐 URDF 几何,通过同一训练模型,条件机制保持不变,仅渲染几何改变,展示了接口级的体态泛化。

人类演示到机器人视频:将 DexYCB 人类操作视频中的手部运动重定向到机器人并渲染为相同网格+深度接口,世界模型无需关心运动来源即可消费渲染的机器人几何。

9. 局限性

局限性1:URDF和标定依赖。渲染接口需要已知机器人 URDF 和相机到机器人标定,在标定设置中是标准要求,但每个新体态都需要这些信息。

局限性2:静态场景假设。相机移动时,静态上下文流假设有完全可用的静态场景表示——在仿真中完全可用,但真实世界仅部分观测。前馈 3D 重建可以提供,但消除外观差距可能需要额外训练。

局限性3:失败数据不足。DROID 片段以成功为主,模型很少见到抓取失败、滑动和误判接触的情况;收集失败数据将提高这些场景的鲁棒性。

10. 总结

本文提出机器人因子化世界模型,将动作实现和机器人渲染从视频世界模型中分解出来。动作被实现为部署可用的名义轨迹并渲染为相机对齐的机器人几何,使模型将动作视为可见机器人几何并学习场景如何响应。在 DROID 和 RoboCasa-GR1 上的实验证明渲染接口优于向量条件基线,同一接口还可扩展到未见过的机器人体态和重定向的人类演示。核心洞察是:与其让世界模型学习动作实现,不如在渲染中显式提供它,让模型专注于场景响应预测这一共享问题。

最好的世界模型不预测机器人怎么动——它预测世界怎么回应。把机器人的几何还给渲染器,把交互的未知留给学习器。

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日