PAPER DEEP DIVE
世界行动模型 (WAMs):统一 VLA 与世界模型
提出世界行动模型 (WAMs),统一状态预测与动作生成,弥补 VLA 局限。构建分类体系并分析数据生态。
论文:World Action Models: The Next Frontier in Embodied AI
作者:Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang
机构:复旦大学 · 上海创智学院 · 新加坡国立大学
链接:arXiv:2605.12090 · GitHub: Awesome-WAM · 项目主页
代码状态:综述类论文,无模型代码;官方维护 Awesome-WAM 论文清单仓库(1200+ stars,持续更新)。
一句话总结
这篇综述首次系统定义了「世界行动模型(World Action Models, WAMs)」这一具身智能新范式——把世界模型的预测式状态建模与 VLA 的动作生成统一进同一个基础模型,建模未来状态与动作的联合分布 $p(o^{\prime}, a \mid o, l)$,并给出 Cascaded/Joint 两大架构族谱、四类训练数据生态与三维评测协议的完整版图。
研究背景与动机
具身 AI 的目标是让机器人在非结构化物理环境中感知、推理与行动。近几年领域收敛到一个强势范式:视觉-语言-行动(VLA)模型,把预训练的视觉-语言骨干改造成通用机器人策略。RT-2、OpenVLA、$\pi_{0}$ 等工作展示了惊人的泛化能力——遵循新语言指令、操作未见过的物体、跨机器人本体少样本迁移。这些结果证明,大规模视觉-语言预训练积累的语义理解可以有效接地到运动行为中。
但标准 VLA 有一个结构性缺陷:它们学习的是反应式的「观测→动作」直接映射,并不显式建模世界在干预之下如何演化。缺乏预测性物理推理,使得在需要预判未来状态的场景中泛化受限。于是,把世界模型(预测环境动力学的模型)整合进行动生成管线,成为自然的演进方向——这正是 WAM 范式的由来。
然而文献现状是碎片化的:架构五花八门(级联管线、联合扩散、离散 token 化、隐式表征对齐),训练目标各异,应用场景分散,缺乏统一的概念框架与术语边界。各种「视频动作模型」「视频策略」「行动世界模型」的称呼混用,让研究者难以比较与定位。这篇综述要做的,就是给这个新兴领域画出第一张完整地图。
综述的三大贡献:其一,形式化定义 WAM 并与相邻概念(VAM、Video Policy、AWM)精确辨析;其二,把现有方法组织进 Cascaded(级联)与 Joint(联合)两大架构分类树,并按生成模态、条件机制、动作解码策略进一步细分;其三,系统梳理数据生态(遥操作、便携人类演示、仿真、互联网自我中心视频)与评测协议(视觉保真度、物理常识、动作合理性),并指出五大开放挑战。
预备知识:VLA 与世界模型的形式化
论文用概率语言为整个领域奠基。设具身智能体在每个时刻接收观测 $o \in O$(视觉输入、本体感觉等)、语言指令 $l \in L$,产生动作 $a \in A$,记 $o^{\prime}$ 为下一时刻的观测。VLA 模型把机器人控制表述为多模态序列建模,其训练目标是给定多模态上下文时动作的条件概率:
$$\mathcal{L}_{\text{VLA}}=\mathbb{E}_{(o,l,a)\sim\mathcal{D}}\left[-\log p(a\mid o,l)\right]$$
世界模型(WM)则是预测式转移函数,内化物理环境的因果动力学——给定先前状态 $o$ 与假设干预序列 $a$,模拟环境状态的演化:
$$\mathcal{L}_{\text{WM}}=\mathbb{E}_{(o,a,o^{\prime})\sim\mathcal{D}}\left[-\log p(o^{\prime}\mid o,a)\right]$$
WAM 把两者统一:它必须同时满足两条判据——(1)前向预测建模:生成或利用未来状态 $o^{\prime}$ 的可量化表征(显式像素视频、光流,或物理接地的隐空间);(2)耦合动作生成:动作 $a$ 必须与预期未来状态严格对齐,或以联合概率输出、或以级联/统一隐空间中的策略条件化实现。形式化目标即联合分布建模:
$$\mathcal{L}_{\text{WAM}}=\mathbb{E}_{(o,l,o^{\prime},a)\sim\mathcal{D}}\left[-\log p(o^{\prime},a\mid o,l)\right]$$
论文还专门做了概念辨析:WAM 是模态无关的超集,视频动作模型(VAM)只是其中把视频帧合成作为预测目标的特例;视频策略(Video Policy)仅继承视频骨干的时空表征而直接输出动作,缺乏显式预测承诺,不算 WAM;而用 WAM 取代早期文献的 AWM(Action World Model)命名,是把系统从「增强模拟器」重新定位为「Agent 主类别」,确立其作为 VLA 直接概念继承者的身份。
图1:世界模型服务于 VLA 学习与评测的示意总览——世界模型既可作为策略学习的监督来源(模仿学习、强化学习),也可作为策略评测的环境。
方法详解:WAM 架构分类树
综述把 WAM 架构分为两大范式。Cascaded WAM 采用顺序管线:世界模型先预测下一状态(像素、隐空间或光流),随后独立的动作模型从该「视觉计划」解码可执行指令。这种解耦提供天然归纳偏置——世界模型无需懂机器人运动学,动作模型无需解决长程场景预测——但两阶段之间的耦合形状决定了每一处设计决策。Joint WAM 则把预测式状态建模与动作生成装进同一个模型,在统一目标下联合训练,迫使模型内化环境动力学与控制信号之间的因果相互依赖。
graph TD WAM[World Action Models
p of o-prime and a given o and l] --> CASC[Cascaded WAM
sequential pipeline] WAM --> JOINT[Joint WAM
single unified model] CASC --> EXPL[Explicit Planning
pixel-space plan] CASC --> IMPL[Implicit Planning
latent-space plan] EXPL --> IDML[Learned Action Extraction
UniPi / VLP / RoboEnvision] EXPL --> GEOM[Geometric Action Extraction
flow / pose tracking] IMPL --> LAT[Latent plan + policy
VPP / LAPA / villa-X] JOINT --> AR[Autoregressive Generation] JOINT --> DIFF[Diffusion-based Generation] AR --> DEC[Explicit Decoupled
GR-1 / GR-MG / GR-2] AR --> UNI[Unified Discrete Tokens
CoT-VLA / WorldVLA] AR --> PLAT[Predictive Latent
VLA-JEPA] DIFF --> USTR[Unified Stream DiT
PAD / UWM / DreamZero] DIFF --> MSTR[Multi-Stream Coupled
CoVAR / Motus / LDA-1B]
图2:基于论文第 4 章内容整理的 WAM 架构分类树(Mermaid 重绘)。
级联 WAM:像素空间的显式规划
最直接的级联实现用原始像素帧作为中间表征。UniPi 奠定了两阶段蓝图:文本条件的时空 U-Net 扩散模型合成任务执行视频,再用卷积逆动力学模型(IDM)在相邻帧对之间回归动作。但单次长程生成存在语义漂移与误差累积,后续工作从多个角度修补:VLP 引入 VLM 做层级子动作生成与树搜索价值打分,把误差累积限制在每个片段内;RoboEnvision 采用非自回归策略,用 VLM 分解的子任务指令条件化生成关键帧,再插值合成完整视频。可控性与效率方面,ThisThat 用指示性指代表达("this"/"that")加手势坐标联合条件化,解决同类多物体场景下纯语言接地的歧义;Say, Dream, and Act 用对抗蒸馏减少去噪步数,并引入帧率无关的视频预测机制。
几何动作提取是另一条路线:不学习逆动力学,而是从生成视频中用封闭几何计算恢复动作。Im2Flow2Act 把光流估计搬到隐空间,用 AnimateDiff 生成流场绕开像素级视频合成;3DFlowAction 将其升维到三维稠密流场;NovaFlow 与 Dream2Flow 走向零训练运行——直接用预训练视频生成模型,经深度估计与点跟踪导出三维物体级流场,无需演示数据。姿态跟踪路线上,Dreamitate 以工具为人类与机器人动作之间的链接代理,立体视频扩散模型生成人类工具使用视频,MegaPose 逐帧跟踪工具 6-DoF 位姿,逆运动学映射到关节指令,使动作提取完全独立于机器人形态。
级联 WAM:隐空间的隐式规划
像素级视频合成的计算开销是实时部署的主要瓶颈。隐式规划的动机来自一个观察:扩散过程中形成的中间隐表征已经编码了规划所需的动力学信息,解码回像素空间毫无必要。VPP 直接展示了这一权衡:预训练 VAE 编码观测帧,扩散模型单步预测未来隐序列,轻量策略网络以这些隐变量为条件产生动作,首次在这一家族中达到兼容实时控制的规划推理速度。LAPA 则走离散隐动作 token 路线,用 C-ViViT tokenizer 加 LWM-Chat-1M 世界模型,把「预测未来」转化为「预测隐动作」。
图3:论文 Figure 1——代表性 WAM 工作的时间演化与分类树。左支为 Joint WAM(自回归与扩散两条路线,扩散连续方法再分 Unified/Multi-Stream),右支为 Cascaded WAM(显式与隐式表征对齐两条轨迹)。
联合 WAM:自回归生成
自回归分支把未来状态与控制信号序列化进统一 token 空间,用因果从左到右解码建模联合分布。核心张力在于:早期视觉幻觉会级联成后续动作失败,而顺序解码的计算瓶颈又与实时执行的低延迟需求冲突。论文按表征范式梳理出三条线:
(1)显式解耦表征:GR-1 证明视频重建预训练的 transformer 可以微调为同时解码未来视觉 patch 与连续动作的双分支头,内化的视频预测充当动作生成的强正则化器;GR-MG 引入 [PROG] token 与扩散生成的视觉目标,把世界 rollout 解耦为宏/微步层级;GR-2 转向全离散视觉管线(VQGAN token),把视觉 rollout 当作隐式规划器,与 CVAE 参数化的连续动作 chunking 耦合。
(2)统一离散表征:随着通用视觉-语言基础模型扩展,连续动作与高维图像被完全量化进单一共享 LLM 词表,由同一个 next-token 预测头生成。CoT-VLA 用混合注意力路由——先因果注意力自回归生成离散视觉思维链,再切换全注意力同步预测动作 token;WorldVLA 用模态特定因果掩码,禁止当前动作 token 关注同一 chunk 内先前生成的动作,强迫局部预测完全接地于历史视觉与语言上下文;RynnVLA-002 在离散 MLLM 骨干后挂轻量连续动作 Transformer 头,并行解码连续动作 chunk。
(3)预测式隐表征:VLA-JEPA 基于 Qwen3-VL-2B,放弃显式 token 生成,转而在抽象连续隐空间上自回归预测未来隐变量——继承 JEPA「预测目标嵌入而非重建像素」的哲学,用更低的开销换取更抽象、可泛化的环境表征。
| 模型 | 参数量 | 骨干 | 输入→输出模态 | 评测环境 |
|---|---|---|---|---|
| GR-1 | 195M | GPT 式因果 Transformer | 观测/文本/本体感觉 → 未来 patch + 连续动作 | CALVIN;真机 Kinova Gen2 |
| GR-2 | 30–719M | GPT 式因果 Transformer | 观测/文本/本体感觉 → 未来 VQ token + 连续动作 | CALVIN;真机 Kinova Gen3 |
| CoT-VLA | 7B | VILA-U | 观测/文本 → 未来视觉 token + 离散动作 | LIBERO, Bridge-V2 |
| WorldVLA | 7B | Chameleon 式 MLLM | 观测/文本 → 未来 VQ token + 离散动作 | LIBERO |
| RynnVLA-002 | 5B | Chameleon + 动作头 | 观测/文本/状态 → 未来 VQ token + 连续动作 | LIBERO;真机 SO100 |
| VLA-JEPA | 2B | Qwen3-VL-2B | 观测/文本 → 未来隐变量 + 连续动作 | LIBERO, SimplerEnv;真机 Franka |
表1:自回归 Joint WAM 代表方法汇总(源自论文 Table 2)。
联合 WAM:扩散生成
扩散分支用多步生成过程刻画未来状态的复杂分布,从根本上绕开自回归的顺序瓶颈,支持闭环控制所需的高频执行。论文按预测流的结构耦合分为单流与多流两族。
单流(Unified Stream)把世界与动作变量吸收进同一骨干(通常是单个 DiT)。PAD 从零训练,把 RGB、机器人位姿、深度编码进统一隐序列,在共享去噪目标下联合预测未来帧与动作 chunk;消融证实移除未来图像预测或视频共训练都会损害控制性能——显式世界建模监督对动作训练质量有实质贡献。UWM 的巧妙之处在于解耦噪声调度:在同一个 Transformer 内给世界与动作变量分配独立可控的噪声水平,测试时通过独立控制两侧噪声,一个模型就能切换为策略推理、前向动力学、逆动力学或纯视频生成四种模式;对无动作视频数据,只需把动作侧完全加噪即可。DreamZero 直接构建在 Wan2.1 图生视频骨干上,仅加轻量状态/动作编码器与动作解码器,用 KV-cache 观测替换在每个执行 chunk 后以真值观测替换想象帧以抑制视觉漂移,再叠加异步执行、DiT 缓存、量化与 CUDA 图编译,把推理推到约 7Hz。Cosmos Policy 基于 Cosmos-Predict2,把本体感觉、动作 chunk、未来状态与价值函数全部编码为隐帧交错进同一去噪序列,单个 checkpoint 同时充当策略、世界模型与价值函数。
多流(Multi-Stream)把联合预测分布到多个协同分支,按耦合界面分三类:交叉注意力耦合(CoVAR 的 Bridge Attention 拼接视频与动作特征做联合注意力再拆分;LDA-1B 用共享 MM-DiT 注意力层加模态特定投影,在结构化 DINO 隐空间预测未来);隐状态耦合(视频 DiT 的中间隐状态条件化动作 DiT);共享表征(统一编码器融合后再分别解码)。Mixture-of-Transformers 成为这一族的通用底座:LingBot-VA 用交错视频隐变量与动作 token 的自回归序列加跨 chunk KV-cache 保持因果一致性;DexWorldModel 用双状态 TTT 记忆替代增长的 KV-cache,并把世界表征从 RGB 换成 DINOv3 语义特征;AIM 用意图因果注意力掩码,让未来信息只经预测价值图到达动作头;Being-H0.7 解决训练-推理不对称——训练时世界分支显式生成未来表征并蒸馏进隐查询,推理时直接丢弃世界分支只留隐查询,大幅降低推理成本。Motus 进一步引入预训练 VLM 的语义理解专家,世界、动作、语义三分支经三模态联合注意力交互,UniDiffuser 式调度器给每个模态独立噪声水平,一个骨干统一承担 VLA、世界模型与逆动力学多角色。
图4:论文 Figure 6——扩散式 Joint WAM 的主要架构模式分类:(1a) 单流 DiT(显式/隐式世界建模)、(2a) 交叉注意力耦合双流、(2b) 隐状态耦合双流、(2c) 共享表征编码-解码。
数据生态:WAM 的统一数据消化能力
训练鲁棒可泛化 WAM 的根本瓶颈是具身数据的可得性与质量。与靠被动抓取的互联网文本成长的大语言模型不同,WAM 需要严格的物理接地。论文指出 WAM 的独特优势是「统一数据消化」:标准 VLA 严格依赖成对的观测-动作轨迹(昂贵稀缺),纯世界模型靠无动作视频繁荣但缺乏控制接地,而 WAM 既能用高质量 $(o,a,o^{\prime})$ 三元组紧耦合内部表征,又具备架构灵活性去消化海量无配对数据(如无动作视频学视觉物理)。论文用「迁移难度 × 扩展难度」二维地图组织四类数据范式:
图5:论文 Figure 7——训练 WAM 的具身数据版图总览,按迁移难度(纵轴)与扩展难度(横轴)映射四类数据范式。
(1)机器人中心遥操作:提供精确运动学接地。代表数据集从 QT-Opt(58 万轨迹,KUKA)到 OXE(100 万+轨迹、527 种技能、22 种机器人)、DROID(7.6 万轨迹、564 个场景)、AgiBot World(100 万+轨迹、87 种技能、含触觉与深度),以及 2026 年 Unitree G1 人形的 LeRobot 框架数据。(2)便携人类演示(UMI 风格):用消费级手持夹持器采集人类灵巧操作,桥接人类灵巧性与真实交互,扩展成本远低于遥操作。(3)仿真数据:提供无限程序化变体与特权空间监督,沿三条轴演进——程序化生成与环境复杂度扩展、3D/4D 具身建模的时空动力学、高保真触觉监督的接触丰富物理。(4)人类与自我中心视频:近乎无界的被动世界动力学先验,关键进展在于弥合「动作鸿沟」——从视频中恢复姿态估计与本体感觉接地,把被动观看转化为可用于动作学习的信号。
| 数据集 | 年份 | 规模 | 机器人本体 | 采集方式 | 模态 |
|---|---|---|---|---|---|
| QT-Opt | 2018 | 58 万轨迹 | KUKA LBR iiwa | 脚本 | RGB |
| RT-1 | 2022 | 13 万+轨迹,700+技能 | Everyday Robots | 遥操作 | RGB, 文本 |
| BridgeData v2 | 2023 | 6 万+轨迹,13 技能 | WidowX 250 | 遥操作/脚本 | RGB, 深度, 文本 |
| OXE | 2023 | 100 万+轨迹,527 技能 | 22 种机器人 | 遥操作/脚本/手动 | RGB, 深度, 文本, 点云 |
| DROID | 2024 | 7.6 万轨迹,564 场景 | Franka | 遥操作 | RGB, 深度, 文本 |
| AgiBot World | 2025 | 100 万+轨迹,87 技能 | AgiBot G1 | 遥操作 | RGB, 深度, 触觉, 本体, 文本 |
表2:机器人中心操作数据集精选(源自论文 Table 4)。
评测:世界建模能力与动作策略能力
综述指出现有评测的根本割裂:世界建模与动作策略被两套互不相干的指标分别衡量。对世界建模能力,论文沿三个维度组织:视觉保真度、物理常识、动作合理性。
视觉保真度层面,像素级用 PSNR 衡量重建保真:
$$\mathrm{PSNR}(x,y)=10\log\left(\frac{\mathrm{MAX}^{2}}{\mathrm{MSE}(x,y)}\right)$$
用 SSIM 比较亮度、对比度与结构信息;感知层面用 LPIPS 在深度特征空间度量加权距离:
$$\mathrm{LPIPS}(x,y)=\sum_{l}\frac{1}{H_{l}W_{l}}\sum_{h,w}\left\|w_{l}\odot\bigl(\hat{f}_{l}(x)_{hw}-\hat{f}_{l}(y)_{hw}\bigr)\right\|_{2}^{2}$$
DreamSim 提供人类对齐的感知相似性(在人类三元组判断上训练的融合嵌入空间),DINO 特征余弦相似度作为语义/实例级对齐信号;分布层面用 FVD 计算真实与生成视频在预训练视频特征空间的 Fréchet 距离:
$$\mathrm{FVD}=\|\mu_{r}-\mu_{g}\|_{2}^{2}+\mathrm{Tr}\!\left(\Sigma_{r}+\Sigma_{g}-2\left(\Sigma_{r}\Sigma_{g}\right)^{1/2}\right)$$
物理常识评测细分为物体动力学(无支撑物体会不会悬空、流体是否遵守重力)与运动轨迹合理性;动作合理性则衡量合成转移是否包含足够信息以反解出可执行控制信号。动作策略侧的评测基准覆盖通用操作(CALVIN、LIBERO、RLBench、SIMPLER)、双臂与人形平台、移动操作、接触与形变操作以及真机基准五大类。
开放挑战与未来方向
论文识别出五大挑战。架构耦合:尚无系统性受控研究在匹配的规模、数据与评测协议下比较级联与联合范式——显式视觉预测对物理接地是否严格必要、各耦合机制实际提供什么归纳偏置,都是未解问题;有证据表明某些 WAM 的收益主要来自训练期的辅助梯度而非推理期的显式未来帧生成,这指向 JEPA 式隐空间预测的更高效路线。多模态物理状态表征:现有 WAM 几乎一律在 RGB 模态预测未来,但接触丰富操作最关键的触觉分布、接触力、声学特征、材料柔度恰恰在像素空间不可见——需要「模态自适应预测」能力。数据混合设计:每种数据源的边际贡献如何随规模与域差距变化、人类视频预训练的收益是语义还是动力学层面,都需要信息论视角而非经验调参。长程规划与时间抽象:当前 WAM 集中在短程操作,长程 rollout 的分布漂移与误差累积需要层级化世界-动作建模。推理延迟:DreamZero 把 WAM 推理推到约 7Hz,但仍远落后于当代非生成式 VLA 策略的 50Hz 标准——根本问题是「下游控制到底需要多少预测保真度」,这指向任务自适应预测保真度。评测方法学:PSNR/FVD 类指标允许物理错误的视频拿高分,任务成功率又忽视 WAM 的核心前提;论文提议反事实一致性(动作对想象未来扰动的适应度)与前瞻条件成功率(执行轨迹是否严格遵循生成的视觉计划)等耦合指标。安全部署:自信地想象错误物理未来的模型可能承诺难以中断的长动作序列,但预测能力同样提供了安全机会——在执行前用物理约束或保守不确定性估计校验世界预测。
局限性
作者自述层面:论文明确承认现有评测范式是「割裂的」(decoupled)——没有任何已建立协议能联合评测世界建模与动作生成这两个相互依赖的组件,缺乏量化想象未来与生成动作之间因果一致性的指标;综述自身也未能在统一实验条件下验证各架构范式的实际优劣(文献缺乏可比设置)。
笔者补充:其一,作为快速演化领域的早期综述(2026 年 5 月),其分类树的生命周期取决于社区是否收敛到稳定术语,Cascaded/Joint 的二分在混合架构(如 Being-H0.7 训练时联合、推理时丢弃世界分支)面前边界已经模糊。其二,综述的架构比较表(Table 1–3)以定性维度为主(参数规模、骨干、I/O 模态、评测环境),缺少跨方法的统一性能对比,读者无法直接判断哪条技术路线在控制成功率上占优——这本身也是作者指出的「架构时尚」问题的镜像。
总结与展望
这篇综述的价值不在提出新模型,而在为一个术语混乱、架构爆炸的新兴领域建立了第一份系统性地图:WAM 的形式化定义(联合分布目标)给出了进入门槛的判据,Cascaded/Joint 二分法及其细分轴(生成模态、条件机制、动作解码)让 100+ 篇工作各归其位,数据生态与评测协议的梳理则指出了工程上的真实瓶颈。从 VLA 到 WAM 的转变,本质是从 token 级预测走向状态级预测——动作不再是反应式输出,而是与对物理未来的想象严格耦合的决策。随着 Cosmos、Wan2.1 等视频骨干与机器人数据的共同成熟,「想象然后行动」有望成为通用具身智能体的默认架构。作者判断,下一个阶段的关键词将是:受控架构比较实验、多模态物理状态、任务自适应预测保真度、以及把世界预测用作执行前安全校验的「预测整合安全」。
金句
「VLA 学习的是世界如何被反应,WAM 学习的是世界如何演化——并把动作锚定在那个被想象的未来之上。」
「世界模型从离线监督者变为内部预测核心,使 WAM 得以实时推理世界动力学。」
「同一个预测能力既让 WAM 比反应式策略更强大,也让它的失败模式更具后果。」



