Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLAPaperVision-Language-Action

DeVA:面向机器人策略学习的物理引导解耦视频-动作模型

提出DeVA,通过物理引导实现解耦的视频-动作模型,服务于机器人策略学习与VLA,提升物理一致性。

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman2026年7月27日2 分钟阅读
EN

1. 论文概览:解耦视频-动作模型与物理引导

DeVA(Decoupled Video-Action Model)由 UC Irvine 的 Mengqi Zhang、Sahil Khose 等与 Georgia Tech 于 2026 年 7 月提出,是一个用专用视频与动作专家、多级特征迁移与物理显著引导的解耦视频-动作模型。VLA 模型虽受益于大规模预训练,但其静态预训练目标对物理动力学与时序因果提供的监督有限,控制相关知识只能从下游机器人示教学到。视频生成模型通过未来预测编码丰富的时空先验,是 promising 的基础。但现有视频-动作模型要么将视频与动作预测耦合于共享骨干使策略适配难优化,要么在引导动作分支时未充分利用视频信息。DeVA 从多层视频层迁移表示到动作专家,实现丰富信息交换的同时使策略学习更可处理,并用物理显著引导(可供性/深度)监督中间视频特征与动作流。在 RoboCasa 达 72.0%(仅用 50 示教/任务,超越用 300-3000 示教的方法),LIBERO 达 99.0%,LIBERO-Plus 达 80.8%,真实双臂任务达 74%。

DeVA 总览

2. 核心问题:视频-动作耦合的优化困境

可泛化机器人操作需策略能预见视觉场景如何演化并同时执行语言指令。视频生成模型通过未来预测编码丰富时空先验,但将其与动作预测耦合于共享骨干时,视觉动力学与机器人动作被迫共享单一特征空间,策略适配更难优化;而若仅松散利用视频信息引导动作分支,则未充分利用视频先验。DeVA 追问:能否既让视频与动作专家解耦以保持各自专用容量,又通过结构化交互让动作专家获取视频骨干学到的预测动力学?设视频与动作专家参数为 $\theta_v, \theta_a$,联合优化目标为:

$$\min_{\theta_v, \theta_a} \mathbb{E}\left[\mathcal{L}_v(\theta_v) + \mathcal{L}_a(\theta_a, \phi(\theta_v))\right], \quad \theta_v \perp \theta_a$$

其中 $\phi(\cdot)$ 表示从视频到动作的多级特征迁移,$\theta_v \perp \theta_a$ 表示参数解耦。

3. 方法:解耦架构与多级特征交互

3.1 解耦视频-动作架构

DeVA 由视频专家(未来观测建模)与动作专家(机器人动作预测)组成。视频专家从 Cosmos-Predict2(潜在视频扩散 Transformer)初始化,其时空 VAE 将视频观测编码为紧凑潜在令牌,视频 Transformer 在当前帧与语言指令条件下建模演化。动作专家采用类似 DiT 架构在动作域预测与对应预测未来对齐的动作轨迹。两专家维护各自参数与令牌表示,避免视觉动力学与机器人动作共享单一特征空间,同时通过各自生成目标联合优化。设视频专家输出多层特征 $\{F_v^{(l)}\}$,动作专家通过跨注意力接收:

$$F_a^{(l)} = \text{CrossAttn}\left(Q_a^{(l)},\, K_v^{(l)},\, V_v^{(l)}\right) + F_a^{(l-1)}$$

其中 $Q_a^{(l)}$ 为动作查询,$(K_v^{(l)}, V_v^{(l)})$ 来自第 $l$ 层视频特征。桥接令牌 $B$ 聚合视频上下文后经自注意力引入动作流:

$$B^{(l)} = \text{SelfAttn}\left([B^{(l-1)}; \text{Agg}(F_v^{(1:l)})]\right), \quad F_a^{(l)} \mathrel{+}= \text{Proj}(B^{(l)})$$

3.2 多级特征交互

完全隔离会阻止动作专家获取视频骨干学到的预测动力学。扩散模型跨网络层与去噪阶段编码互补表示,DeVA 从多层迁移中间视频表示到对应动作块(层级跨注意力)。可学习桥接令牌通过聚合视频上下文并经自注意力引入动作流,提供额外紧凑接口。这让解耦不失连通。

物理引导模块

3.3 物理显著引导

多级交互为动作专家提供预测视频表示,但这些表示主要为未来预测优化,可能未显式强调成功控制所需的交互区域与几何结构。DeVA 对中间视频特征施加任务条件化可供性与相对深度监督,解码特征也注入动作专家作物理引导。可供性与深度解码:从视频骨干层均匀采样特征送入轻量 DPT 风格解码器(含交错时序注意力层),预测两互补物理信号。可供性图定义为:

$$\mathcal{A}_t(u, v) = P\left(p_t^{ee} = (u, v) \mid O_t, T\right)$$

其中 $p_t^{ee}$ 为末端执行器在图像平面的位置,每像素表示其在指令 $T$ 下作为交互位置的概率。语言特征通过 FiLM 层融入可供性解码器。仿真中从真值接触位置或投影末端位置构建可供性目标并用高斯核转为平滑热图;真实数据用现成可供性模型生成伪标签。相对单目深度用深度预测模型估计。物理引导注入:从解码器最终时空块提取特征,投影到视频特征空间分辨率并展平为令牌,与多级视频表示在通道维拼接,作为动作跨注意力的额外键值。

3.4 训练与推理

两阶段训练:阶段1视频与解码器预热;阶段2联合视频-动作训练。联合损失为视频去噪 $\mathcal{L}_v$ 与动作去噪 $\mathcal{L}_a$ 之和:

$$\mathcal{L}_{\text{total}} = \mathcal{L}_v + \lambda_a \mathcal{L}_a + \lambda_{\text{aff}} \mathcal{L}_{\text{aff}} + \lambda_{\text{dep}} \mathcal{L}_{\text{dep}}$$

其中 $\mathcal{L}_{\text{aff}}, \mathcal{L}_{\text{dep}}$ 为可供性与深度监督损失。推理时动作专家生成动作 chunk。

4. 实验

4.1 RoboCasa 仿真

在 24 个厨房操作任务上评估,每任务 50 rollout × 3 种子共 3600 rollout。DeVA 达 72.0% 成功率,仅用 50 示教/任务,在同等数据预算下提升最高 22.0 个百分点,并超越多个用 300-3000 示教训练的方法。

RoboCasa 任务 rollout 示例 RoboCasa 基准对比表
基准DeVA对比亮点
RoboCasa(50示教/任务)72.0%超越300-3000示教方法
LIBERO(4套件均值)99.0%最高整体均值
LIBERO-Plus(鲁棒性)80.8%超OpenVLA-OFT 11.2pp
真实双臂(3任务均值)74%GR00T-N1.6 48%, Cosmos 34%

4.2 LIBERO 与 LIBERO-Plus

四标准套件(Spatial/Object/Goal/Long)共 40 任务,每任务 50 rollout × 3 种子。DeVA 达最高整体均值 99.0%。LIBERO-Plus 含 10030 个扰动变体,每变体 1 rollout,DeVA 达 80.8%,超最强基线 OpenVLA-OFT 11.2 个百分点。99.0% 到 80.8% 的 18.2 点下降揭示了分布内与鲁棒性间的残余鸿沟。

LIBERO 基准对比 LIBERO-Plus 鲁棒性

4.3 真实世界部署

在 I2RT 平台三项双臂任务(Handover Marker、Lift Pot、Pick Up Bottles)上,每任务 30 示教,多任务微调 DeVA、Cosmos Policy、GR00T-N1.6,各 10 试验。DeVA 均值 74%,对比 GR00T-N1.6 48%、Cosmos Policy 34%。

5. 消融研究

在 RoboCasa 上消融预测视觉建模与物理引导(等预算):目标图像预测使成功率从 19.8% 升至 25.8%,未来视频预测进一步升至 36.8%;解耦架构+多级特征迁移达 66.0%。可供性与相对深度各自独立提升基模,二者结合达最高 72.0%。训练效率:解耦变体约 40-50K 步收敛,基模与物理引导变体分别约 66% 与 71%,而统一对应体仅 34%;DeVA 处理的训练样本比 Cosmos-Policy 少最多 20×。

配置成功率增量
仅动作模型19.8%基线
+目标图像预测25.8%+6.0
+未来视频预测36.8%+11.0
+解耦+多级迁移66.0%+29.2
+可供性+深度引导72.0%+6.0

6. 局限性

  • 计算成本继承:DeVA 继承预训练视频骨干的计算成本,训练时空注意力于未来观测比仅动作策略学习更昂贵。
  • 推理开销:联合去噪视频与动作流比仅预测紧凑潜在状态与动作引入额外推理开销。
  • 鲁棒性鸿沟:LIBERO 99.0% 到 LIBERO-Plus 80.8% 的 18.2 点下降揭示了分布内与鲁棒性间的残余鸿沟。
  • 真实数据伪标签依赖:可供性伪标签依赖现成模型,深度依赖预测模型,其误差可能传播。
  • 效率提升未实现:潜在空间预测与加速采样作为未来方向,当前效率仍待改善。

7. 总结

DeVA 是一个解耦视频-动作模型,通过专用专家、多级特征迁移与物理显著可供性/深度引导,将预测视频表示迁移到机器人控制。在仿真基准与真实双臂操作上,DeVA 以有限示教取得强性能,比匹配的统一架构收敛更快,并受益于物理引导,展示了视频生成先验对机器人策略学习的 promise。核心洞见是:视频与动作不必共享骨干——解耦让各自专精,而多级跨注意力与物理引导让视频先验的预测动力学与几何结构有效流入动作策略,既保容量又促迁移。

flowchart LR
    A["当前帧+语言指令"] --> B["视频专家 Cosmos-Predict2
未来观测建模"] B --> C["多层视频特征 F_v^(l)"] C --> D["DPT解码器
可供性+深度"] D --> E["物理引导特征"] C --> F["层级跨注意力
+桥接令牌"] E --> F F --> G["动作专家 DiT
动作chunk预测"] G --> H["机器人执行"] H --> A
视频与动作不必共享骨干——解耦让各自专精,而多级跨注意力与物理引导让视频先验的预测动力学与几何结构有效流入动作策略,既保容量又促迁移。

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日