Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

具身智能PaperEmbodied AI

LeapBot-WA:基于预测潜在对齐的世界锚定动作模型

提出LeapBot-WA世界锚定动作模型,通过预测潜在对齐摆脱像素级视频生成瓶颈,提升世界-动作模型的表示效率。

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma2026年7月27日2 分钟阅读
EN

1. 论文概览:以预测性潜在对齐锚定世界-动作模型

LeapBot-WA 由 Pei Liu、Nan Zheng、Lang Zhang 等于 2026 年 7 月提出,为世界-动作模型(WAM)建立了全新的"预测性潜在"范式。当前 WAM 普遍依赖像素级视频生成,迫使模型重建与任务无关的视觉细节,耗散表征能力并使策略易受视觉干扰物影响。LeapBot-WA 将联合嵌入预测架构(JEPA)运作化为"世界锚"(World-Anchor),将世界建模的核心从视觉合成转向预测性语义对齐,直接在潜在基础空间内提取抽象物理动力学。为弥合非高斯预测特征与扩散先验间的模态鸿沟,引入各向同性语义自编码器(ISAE),将锚的潜在空间重塑为扩散友好的流形以防离岸漂移。此外设计了非对称 MoT 架构:训练时锚 DiT 作为特权动力学专家引导动作 DiT;推理时剪除该重分支实现零开销执行。在 LIBERO 上取得预测模型 SOTA,在 RoboTwin 2.0 上匹敌顶级生成式 WAM 而无需大规模轨迹预训练,并展现卓越零样本鲁棒性与真实世界迁移。

LeapBot-WA 总览

2. 核心问题:像素级生成的表征瓶颈

世界动作模型通过预测环境演化来增强策略的前瞻性,但主流方法依赖像素级视频生成。这带来根本瓶颈:强迫模型重建光照、背景纹理等与任务无关的视觉细节,耗散表征容量,并使策略在面对视觉干扰物时脆弱。LeapBot-WA 追问:能否将世界建模的核心从"画未来"转为"想象未来的抽象物理语义",从而既保留前瞻性又避免重建负担?

3. 方法:双路径预测性潜在框架

3.1 框架总览

LeapBot-WA 将原始观测映射到控制动作,采用双路径架构:由预测锚驱动的表示管线,与由非对称 MoT 驱动的生成管线。给定多视角观测 $\mathbf{o}$、语言指令 $l$ 与本体感受状态 $s$,定义语义潜在 $\mathbf{z}$ 与共享上下文 $\mathbf{c}$:

$$\mathbf{z} = \mathrm{ISAE}(\Phi_{\text{JEPA}}(\mathbf{o})), \qquad \mathbf{c} = \Psi_{\mathrm{enc}}(l, s) \tag{1}$$

其中 $\Phi_{\text{JEPA}}$ 为预测锚。LeapBot-WA 优化一个联合扩散目标,将动作轨迹 $\mathbf{a}$ 与语义演化 $\mathbf{z}$ 耦合,确保导出的策略被锚的预测先验物理锚定。

3.2 扩散友好的语义自编码(ISAE)

框架的根本挑战是预测锚特征为非高斯,而扩散先验假设高斯。ISAE 将锚的潜在空间重塑为各向同性流形,使高层语义先验成为生成就绪的稳定动作合成基础。设 $\Phi_{\text{JEPA}}(\mathbf{o})$ 输出语义令牌 $\mathbf{u}$,ISAE 编码为 $\mathbf{z} = E_{\text{ISAE}}(\mathbf{u})$,重建损失为:

$$\mathcal{L}_{\text{rec}} = \|\mathbf{u} - D_{\text{ISAE}}(\mathbf{z})\|_2^2 + \lambda_{\text{iso}} \mathcal{L}_{\text{SIGReg}}(\mathbf{z})$$

其中 $\mathcal{L}_{\text{SIGReg}}$ 为各向同性正则化,防止维度坍缩。消融显示:无 SIGReg 时潜在秩仅 38.1、梯度范数方差 1.25;加入后秩恢复至 92.3、方差降至 0.18,多步漂移从 0.45 降至 0.21。

ISAE 架构

3.3 视角感知残差条件化

共享权重 ISAE 将多视角观测投影到统一特征空间,但下游多视角动力学建模仍需相机身份知识。为在不破坏对称编码的前提下保留多视角空间感知,在 Anchor DiT 输入端直接引入视角残差。给定扩散步 $t$ 的含噪语义潜在 $\mathbf{z}^{(v),t}$:

$$\mathbf{h}^{(v)} = \mathrm{Proj}\!\left(\mathrm{Norm}(\mathbf{z}^{(v),t})\right) + \mathbf{e}^{(v)}_{\mathrm{view}} \tag{8}$$

其中 $\mathbf{e}^{(v)}_{\mathrm{view}}$ 为视角 $v$ 的可学习嵌入。该分解让语义内容、相机身份与扩散条件在下游 Transformer 中各司其职。

3.4 意图条件化动力学建模

Anchor DiT 分支在 ISAE 潜在空间内运作,目标是预测世界的未来语义状态。绕过像素级生成的表征瓶颈,专注于场景的抽象动作相关动力学(如布料折叠的拓扑变化)。关键在于将其表述为意图条件化世界模型:显式以共享上下文 $\mathbf{c}$(封装语言指令与本体感受)为条件,但完全独立于目标动作轨迹 $\mathbf{a}$。通过故意剥夺世界模型的逐步低层运动命令,防止语义表示坍缩为平凡控制捷径,迫使模型学习泛化的意图驱动物理先验——仅凭机器人当前物理构型想象任务的高层语义后果。

3.5 非对称潜在动力学蒸馏

为将抽象动力学从意图条件化世界模型转移到控制策略,提出联合去噪语义状态与动作的非对称蒸馏机制。语义与动作序列在共享扩散时间步 $t$ 被流匹配噪声独立腐蚀:

$$\mathbf{z}^t = (1-t)\mathbf{z} + t\boldsymbol{\epsilon}_z, \qquad \mathbf{a}^t = (1-t)\mathbf{a} + t\boldsymbol{\epsilon}_a \tag{9}$$

含噪语义与动作令牌由 Anchor DiT 与 Action DiT 在非对称 MoT 内处理。核心设计是非对称掩码交互,拼接令牌 $\mathbf{H}^{(\ell)}=[\mathbf{H}_s^{(\ell)}; \mathbf{H}_a^{(\ell)}]$(公式 10),施加联合掩码自注意力:

$$\mathrm{Attn}_{\mathrm{asym}}(\mathbf{H}^{(\ell)}) = \mathrm{Softmax}\!\left(\frac{\mathbf{Q}\mathbf{K}^\top}{\sqrt{d}} + \mathbf{M}\right)\mathbf{V} \tag{11}$$

其中非对称掩码 $\mathbf{M}$ 阻止 Anchor DiT 注意动作令牌,同时保留 Action DiT 对语义令牌的注意。这诱导优雅的层级控制结构:Anchor DiT 作为先知梦想目标导向的未来,Action DiT 则从其语义预见中蒸馏动力学。推理时剪除 Anchor DiT 实现零开销。

非对称 MoT 去噪

4. 实验:仿真与真实世界

4.1 仿真结果

在 RoboTwin 2.0 基准上,LeapBot-WA 取得 91.46% 平均成功率,显著超越预训练 VLA 如 $\pi_{0.5}$ 与 X-VLA。在随机化设置下达 92.34%,在 WAM 中创 SOTA,超越使用大量机器人预训练的模型(如 Lingbot-VA)。在 LIBERO 套件上,LeapBot-WA 在预测性 WAM 类别中取得 97.3% 最佳成功率,显著超越 PALM 与 VLA-JEPA 等预测基线,同时与 Motus、ImageWAM 等计算更昂贵的生成模型高度竞争。

基准LeapBot-WA类别对比亮点
RoboTwin 2.0 平均91.46%预测性 WAM超越 $\pi_{0.5}$、X-VLA
RoboTwin 2.0 随机化92.34%WAM SOTA超越 Lingbot-VA(需大规模预训练)
LIBERO 均值97.3%预测 WAM 最佳超越 PALM、VLA-JEPA
LIBERO-Plus 零样本73.1%预测 WAM SOTA大幅超越 VLA-JEPA、JEPA-VLA

4.2 真实世界结果

部署于真实 UR5 机器人,任务要求识别、抓取并放置各种果蔬到指定容器,在不同桌面纹理与光照下进行。尽管仿真与真实环境存在域差距,代理保持精确控制并展现平滑稳定轨迹,确认了表征质量与正则化潜在空间有效迁移到可靠执行。

RoboTwin 2.0 定量结果

4.3 消融研究

跨域迁移与表征质量:线性探测显示混合域预训练一致降低 MSE——动作预测降 4.6%,动力学预测降 37.9%,本体感受降 28.5%。各向同性正则化对潜在几何的影响:无 SIGReg 时潜在秩 38.1、梯度方差 1.25(表征坍缩与不稳定);加入后秩 92.3、方差 0.18,多步漂移 0.45→0.21,插值抖动 5.1→1.2,成功率从 42.5% 升至 71.3%。

潜在几何指标无 SIGReg有 SIGReg改善
潜在秩38.192.3↑142%
梯度方差1.250.18↓85.6%
多步漂移0.450.21↓53.3%
插值抖动5.11.2↓76.5%
成功率42.5%71.3%↑67.8%
LIBERO 套件成功率

5. 局限性

  • 依赖基础模型质量:性能仍与底层预测基础模型的表征质量绑定,若基础模型在某些域表征不足则受限。
  • 细粒度接触物理:当前潜在中心方法擅长空间与语义理解,但建模极细粒度接触物理或高频触觉交互可能需进一步对齐。
  • 长时序规划未扩展:当前范式尚未扩展到长时序任务规划,留作未来工作。
  • 多模态先验未集成:未来工作将探索集成视听或触觉先验到世界锚空间。

6. 总结

LeapBot-WA 证明:机器人操作中世界建模的核心效用在于抽象物理预见而非照片级真实渲染。通过预测性潜在空间与 ISAE 弥合表征鸿沟,建立了一个重动力学分支在训练时作特权专家、推理时被剪除的框架,实现零开销动作生成与卓越的零样本鲁棒性。在 LIBERO 取得预测 WAM SOTA(97.3%),在 RoboTwin 2.0 匹敌顶级生成式 WAM(91.46%)而无需大规模预训练,LIBERO-Plus 零样本达 73.1%。核心洞见是:让一个"梦想"未来语义的特权专家在训练时引导动作生成器,推理时将其剪除——预见力被蒸馏进了策略而不再增加开销。

flowchart LR
    A["多视角观测 o"] --> B["预测锚 Φ_JEPA
(微调 JEPA)"] B --> C["语义令牌 u"] C --> D["ISAE 各向同性自编码"] D --> E["扩散友好潜在 z"] L["语言指令 l"] --> F["共享上下文 c = Ψ_enc(l, s)"] S["本体感受 s"] --> F F --> G["Anchor DiT
(意图条件化世界模型)"] E --> G G -->|"非对称掩码注意力
蒸馏动力学"| H["Action DiT"] E --> H H --> I["动作轨迹 a"] I --> J["零开销推理
(Anchor DiT 剪除)"]
当一个梦想未来语义的特权专家在训练时引导动作生成器、推理时却被悄然剪除,预见力便被蒸馏进了策略——世界模型的价值不在画面的逼真,而在物理的抽象预见。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
ABot-N1:通用视觉语言导航基础模型

ABot-N1:通用视觉语言导航基础模型

高德ABot-N1是一个慢快双系统视觉语言导航基础模型:4B慢系统输出思维链与Target/Affordance双像素目标,2B快系统经QFormer动作查询解码连续SE(2)轨迹点,用统一像素接口覆盖坐标点、物体、POI、指令跟随与人员跟随五类任务。3000万样本预训练+GRPO安全感知后训练,并发布ABotN-PointBench与ABotN-POIBench两个闭环基准。五基准全部SOTA:POI入口到达77.3%(+35.0个百分点),室外/室内坐标点导航92.9%/95.4%,并部署于途途四足机器人Jetson AGX Orin。

视觉语言导航VLN导航基础模型2026年7月11日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日