Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型世界-动作模型视频生成

Robust-WAM:桥接世界-动作模型的生成式预训练与语义前瞻

提出视频生成式世界-动作模型的通用后训练方法,保留 VAE 潜空间的生成路径并添加轻量语义前瞻对齐目标,用可学习查询 token 将未来场景语义引入动作流,使动作基于外观不变的动态表示,在 OOD 泛化仿真和真机上持续提升多种 WAM 基线成功率。

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li2026年8月6日5 分钟阅读
EN

作者:Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构:香港科技大学(广州)· 北京航空航天大学 · 华为基础模型部

论文arXiv:2608.05903 · 代码:未公开

日期:2026年8月6日

一句话总结

Robust-WAM 提出视频生成式世界-动作模型的通用后训练方法,保留 VAE 潜空间的生成路径以继承大规模视频预训练的动态先验,同时在动作流上添加轻量语义前瞻对齐目标——用可学习查询 token 对齐 DINOv3 CLS 嵌入,使动作基于外观不变的动态表示,在 LIBERO-Plus 和真机照明变化下持续提升多种 WAM 基线的 OOD 成功率。

研究背景与动机

世界-动作模型(WAM)将预训练视频生成模型(VGM)适配为机器人控制,利用从网络规模视频中学到的动态先验来引导动作生成。这些先验捕捉了世界如何演化:物体如何移动、接触和交互。然而,主流 WAM 在 VAE 潜空间中工作,该空间为像素重建优化,迫使空间保留真实外观——纹理和光照——大量先验被分配给与动作无关的外观细节。继承这种外观偏差后,动作流在视觉分布外条件下(如光度或色相变化)容易被干扰。

图1:(a) VAE 潜空间 WAM 继承大规模 VGM 预训练的动态先验,但潜空间随外观变化,策略在视觉偏移下崩溃。(b) 语义潜空间世界模型对视觉偏移鲁棒,但无法利用预训练动态先验。(c) Robust-WAM 保留 VAE 生成路径并向动作流注入语义先验,兼得两者优势。

为克服此限制,近期方法在语义潜空间(如 DINO 或 V-JEPA)中重建视觉生成。这些模型视觉鲁棒,但放弃了大规模预训练 VGM 的强动态先验——重新获得该知识需要在大量视频数据上重新预训练。这使 WAM 面临根本性权衡:VAE 基 WAM 继承强动态先验但对外观变化脆弱,语义潜空间 WAM 对外观鲁棒但无法利用大规模预训练。

Robust-WAM 正是为解决这一困境而设计。核心思想:不替换整个潜空间,而是直接在动作表示中纠正外观偏差。保留 VAE 生成路径以继承大规模预训练,同时在动作流上添加轻量语义前瞻对齐目标,使动作基于外观不变的动态表示——在光照变化和其他视觉 OOD 条件下保持可靠。

预备知识

理解 Robust-WAM 需要几个核心概念。首先是世界-动作模型(WAM):将预训练 VGM 与动作 DiT 耦合,联合去噪两条流——未来帧的 VAE 潜空间和动作块。视频流提供动态先验,动作流通过注意力读取视频流生成动作。其次是流匹配目标:通过线性插值在数据和噪声之间 corrupt 样本,回归将噪声样本送回干净数据的速度场。第三是VAE 潜空间:VGM 的预训练编码器将图像压缩为潜表示,优化目标为像素重建,保留外观细节。

另一个关键概念是语义特征空间:自监督视觉模型(如 DINOv3)的 CLS 嵌入提供场景内容的外观不变摘要——总结物体及其空间排列,丢弃纹理和光照细节。

方法详解:Robust-WAM

Robust-WAM 是视频生成式 WAM 的通用后训练方法,由三个核心设计组成:保留 VAE 生成路径、语义前瞻对齐、跨架构集成。核心创新是在动作流中引入可学习查询 token,对齐未来帧的语义特征,使动作获得外观不变的前瞻能力。

框架总览

flowchart TB
    subgraph WAM["原始 WAM (保留)"]
        OT[当前观测 o_t + 语言 l] --> VD[Video DiT
去噪 VAE 潜空间] VD --> HV[视频隐状态 H^v] OT --> AD[Action DiT
去噪动作块] HV --> AD AD --> AC[动作块输出] end subgraph SFA["语义前瞻对齐 (新增)"] QT[可学习查询 token q
K个, 每个对应未来帧+视角] --> AD2[Action DiT
查询与动作 token 同序列] AD2 --> QO[查询输出隐状态] GT[未来真值帧] --> DINO[冻结 DINOv3 CLS
外观不变语义特征] DINO --> TARGET[对齐目标 z*_k] QO --> ALIGN[余弦相似度对齐
L_align] TARGET --> ALIGN end ALIGN --> LOSS[总损失 L = L_WAM + lambda * L_align]

上图展示了 Robust-WAM 的完整框架。原始 WAM 的视频分支保持不变,保留 VAE 空间预训练。新增的语义前瞻对齐在动作流中引入 K 个可学习查询 token,其输出与冻结 DINOv3 CLS 嵌入对齐。训练时教师和对齐头存在,推理时丢弃,仅保留查询 token。

世界-动作模型预备

给定当前观测 $o_t$ 和语言指令 $\ell$,WAM 联合去噪两条流。视频流:$T_f$ 个未来帧的 VAE 潜空间 $\mathbf{x} = \mathcal{E}(o_{t+\Delta}, o_{t+2\Delta}, \ldots, o_{t+T_f\Delta})$,其中 $\mathcal{E}$ 是冻结 VAE 编码器。动作流:$H$ 个控制步的动作块 $\mathbf{a} = a_{t:t+H-1}$,进入动作 DiT 为 $L$ 个 token $\mathbf{h}^a \in \mathbb{R}^{L \times d}$。两条流用流匹配目标训练。流时间 $s \sim \mathcal{U}[0,1]$,独立高斯噪声 $\epsilon, \epsilon' \sim \mathcal{N}(\mathbf{0}, \mathbf{I})$,各流通过线性插值 corrupt:

$$\mathbf{x}^s = s\epsilon + (1-s)\mathbf{x}, \quad \mathbf{a}^s = s\epsilon' + (1-s)\mathbf{a}$$

视频 DiT 回归将噪声潜空间送回干净潜空间的速度:

$$\mathcal{L}_{\text{video}} = \mathbb{E}\left[\left\|v^v_\theta(\mathbf{x}^s, s \mid o_t, \ell) - (\epsilon - \mathbf{x})\right\|^2\right]$$

动作 DiT 在关注视频隐状态 $\mathbf{H}^v$ 的同时回归动作速度:

$$\mathcal{L}_{\text{act}} = \mathbb{E}\left[\left\|v^a_\theta(\mathbf{a}^s, s \mid \mathbf{H}^v, o_t, \ell) - (\epsilon' - \mathbf{a})\right\|^2\right]$$

两流联合优化:

$$\mathcal{L}_{\text{WAM}} = \mathcal{L}_{\text{video}} + \lambda_a \mathcal{L}_{\text{act}}$$

动作预测因此通过 $\mathbf{H}^v$ 继承预训练 VGM 的动态先验。推理时从 $s=1$ 到 $s=0$ 积分 $v^a_\theta$ 产生动作块。

语义前瞻对齐

Robust-WAM 在动作流中添加表示对齐目标。引入 $K$ 个可学习查询 token $\mathbf{q} \in \mathbb{R}^{K \times d}$,每个对应一个未来时间步和相机视角,前置于动作序列:

$$\mathbf{h} = [\mathbf{q}; \mathbf{h}^a] \in \mathbb{R}^{(K+L) \times d}$$

共享位置编码:每个查询复用 WAM 自身位置编码映射 $\Phi(\cdot, p)$,使用其描述的未来动作步的位置索引。查询 $k$ 对应第 $j$ 个未来帧和第 $c$ 个相机视角,索引为 $k = (j-1)C + c$,其位置索引为对应动作 token 的位置 $\tau_j$。这建立了查询与其描述的未来步之间的时序对应关系——告诉模型该查询在看多远的未来。

语义前瞻目标:对齐目标为对应真值未来帧的冻结 DINOv3 ViT-B/16 CLS 嵌入 $\mathbf{z}^*_k \in \mathbb{R}^{d_z}$($d_z = 768$)。选择 DINOv3 CLS 是因为自监督语义特征对外观高度不变——CLS token 总结场景内容(物体及其空间排列),丢弃纹理和光照。对齐到未来而非当前帧使查询编码演示动作导向何处,为动作流提供外观不变的前瞻。查询输出经对齐头 $g$ 投影后与目标计算余弦相似度损失:

$$\mathcal{L}_{\text{align}} = -\sum_{k=1}^{K} \cos\left(g(\bar{\mathbf{h}}_k), \mathbf{z}^*_k\right)$$

总损失为:

$$\mathcal{L} = \mathcal{L}_{\text{WAM}} + \lambda_{\text{align}} \mathcal{L}_{\text{align}}$$

其中 $\lambda_{\text{align}} = 0.1$。查询与动作 token 处于同一序列,动作块在两者间双向注意力:每个查询通过 WAM 已有注意力读取动作计划和视频流,每个动作 token 读取查询携带的未来语义。动作生成因此条件于忽略纹理和光照的特征,在仅外观变化时保持稳定。

推理时丢弃教师:训练时教师特征仅通过 $\mathcal{L}_{\text{align}}$ 监督查询输出,从不作为查询输入。推理时丢弃 DINOv3 教师和对齐头 $g$,仅保留 $K$ 个查询 token,查询输入和动作流注意力路径保持不变。

跨架构集成

Robust-WAM 兼容不同 WAM 架构。动作专家 WAM(MoT 架构,如 GE-Act、FastWAM、Motus):查询直接前置于专家 token 序列,加入专家自注意力并以与动作 token 相同方式交叉关注视频塔。统一 WAM(如 LingBot-VA):查询插入动作段,分配与对应动作 token 相同的序列、帧和噪声 ID,在原始 flex-attention 掩版规则下继承动作 token 的注意力模式,允许与同未来步的动作 token 双向交互同时保持跨步自回归顺序。

实验结果

LIBERO-Plus 上的 OOD 鲁棒性

表1:Clean LIBERO 和 LIBERO-Plus 上的对比。Robust-WAM 在两种 WAM 上均提升 OOD 成功率而不牺牲域内性能。
方法LIBERO (域内)LIBERO-Plus (OOD)
OpenVLA76.515.6
$\pi_0$-FAST85.561.6
OpenVLA-OFT97.169.6
LDA-1B(语义潜空间)90.645.5
FastWAM97.649.7
FastWAM + Robust-WAM97.9 (+0.3)58.9 (+9.2)
GE-Act96.578.0
GE-Act + Robust-WAM97.3 (+0.8)80.9 (+2.9)

表1:Clean LIBERO 和 LIBERO-Plus 平均成功率(%)。

GE-Act + Robust-WAM 在所有方法中取得最佳 LIBERO-Plus 性能(80.9%),比最强基线 GE-Act 提升 2.9 个百分点。FastWAM 从 49.7% 提升至 58.9%(+9.2),GE-Act 从 78.0% 提升至 80.9%(+2.9)。同时域内性能不降反升——FastWAM 从 97.6% 到 97.9%,GE-Act 从 96.5% 到 97.3%。与 LDA-1B 的对比突显了大规模视频生成预训练的重要性:无此预训练的语义潜空间 WAM LDA-1B 在域内 90.6%、OOD 45.5%,而 GE-Act + Robust-WAM 分别达 97.3% 和 80.9%——语义表示用于增强而非替换预训练 VGM 的动态先验时更有效。

逐扰动轴分析

扰动轴FastWAM+Robust-WAMGE-Act+Robust-WAM
布局60.567.8 (+7.3)82.885.4 (+2.6)
相机16.328.7 (+12.4)51.954.8 (+2.9)
光照78.990.2 (+11.3)95.495.2 (-0.2)
背景52.362.6 (+10.3)84.787.1 (+2.4)
噪声37.956.8 (+18.9)81.685.1 (+3.5)

表2:LIBERO-Plus 逐扰动轴成功率(%)。

在 FastWAM 上,最大增益出现在传感器噪声(+18.9)、相机扰动(+12.4)、光照变化(+11.3)和背景变化(+10.3),仅机器人初始状态未提升。增益超越光度偏移——布局扰动改变场景空间排列,相机扰动改变视角和图像投影,两者均提升表明语义目标也惠及几何和视角变化的鲁棒性。

消融研究

对齐目标选择:DINOv3 CLS 提升 +9.2 为最强;DINOv3 Patch token +7.3;Depth Anything 3 patch +7.1;DINOv3 CLS + DA3 组合仅 +6.8——简单组合语义和几何目标不提供互补增益,联合优化两组查询和对齐目标可能阻碍优化。因此采用单一 DINOv3 CLS 目标。

查询设计:完整时序查询设计达 58.9%,去除时序位置编码降至 55.0%(-3.9),用当前帧目标替代未来帧降至 52.7%(-6.2)。这证明未来步索引和未来语义目标均不可或缺。

真机部署

图3:真机任务。在标准照明下训练,在紫色和青色未见照明下评估。

在 Franka Research 3 平台上评估三个桌面任务:胡萝卜→面包、猕猴桃→篮子、叠杯子。在标准照明下采集演示,评估时仅改变照明为紫色和青色——均未出现在演示中。每任务每条件 25 次 rollout。

方法域内OOD差距
FastWAM64.026.737.3
GE-Act80.057.322.7
Robust-WAM (GE-Act)82.780.02.7

表5:真机评估。Robust-WAM 将 OOD 成功率从 57.3% 提升至 80.0%,域内到 OOD 差距从 22.7 缩小到 2.7。

两个基线在未见照明下急剧退化:FastWAM 从 64.0% 降至 26.7%,GE-Act 从 80.0% 降至 57.3%。Robust-WAM 在 GE-Act 上将 OOD 平均成功率从 57.3% 提升至 80.0%,域内到 OOD 差距从 22.7 缩小到 2.7,同时保持域内性能(82.7% vs 80.0%)。各任务 OOD 提升达 20-28 个百分点。因场景几何、物体放置和指令不变仅照明变化,结果表明未来语义对齐降低了对外观偏移的敏感性。

局限分析

论文未设独立局限章节,但从方法设计和实验中可推断若干局限。首先,语义前瞻对齐依赖 DINOv3 CLS 作为对齐目标——该特征虽外观不变但可能丢失对动作有用的细粒度几何信息(如物体精确位姿),消融中 DINOv3 Patch token 虽略低但仍有可观增益,暗示更丰富的语义目标可能在不同场景下更优。其次,查询 token 数量 $K$ 固定(16 或 24),对长时程任务可能不足以覆盖所有未来步。第三,真机评估仅测试照明变化这一种 OOD 条件,对更复杂的视觉偏移(如新物体外观、新场景)的鲁棒性未被验证。

从独立判断角度,对齐权重 $\lambda_{\text{align}}$ 的固定值值得关注。论文使用 $\lambda_{\text{align}} = 0.1$,但不同 WAM 架构和任务可能需要不同权重——过强可能干扰原始动作生成,过弱则语义对齐不足。论文未讨论该权重的敏感性分析。此外,推理时查询 token 的额外计算开销未被量化报告——虽声称轻量,但 $K$ 个额外 token 在每步推理中增加注意力计算量,对实时控制的影响有待评估。

总结与展望

Robust-WAM 解决了世界-动作模型在 VAE 潜空间预训练的动态先验与语义潜空间的外观鲁棒性之间的根本权衡。通过保留 VAE 生成路径并添加轻量语义前瞻对齐,用可学习查询 token 对齐 DINOv3 CLS 嵌入,动作流获得外观不变的前瞻能力。在 LIBERO-Plus 和真机照明变化下,Robust-WAM 持续提升多种 WAM 基线的 OOD 成功率而不牺牲域内性能。

这项工作的核心洞察——"语义表示用于增强而非替换预训练动态先验时更有效"——为世界模型的设计提供了重要指导。与其在语义空间中从零重建,不如在 VAE 空间保留大规模预训练并用语义目标修正动作表示的偏差。这一思路可能扩展到其他需要平衡预训练效率和任务鲁棒性的场景。

"不必在继承与鲁棒之间二选一——保留预训练的动态先验,用语义前瞻修正动作的视野偏差。Robust-WAM 证明:增强比替换更有效。"

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日