PAPER DEEP DIVE
面向未见机器人操作的动力学感知元模仿学习
本文提出动力学感知的元模仿学习方法,通过对操作动力学的元学习实现对未见机器人操作任务的泛化。
DAMI:动力学感知的元模仿学习用于未见机器人操作泛化
论文:Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation | 作者:Zhenduo Shang, Xiyao Liu, Bohan Li 等 | 机构:中科院沈阳自动化所 / 沈阳工业大学 | 链接:https://arxiv.org/abs/2607.15880
一句话总结
DAMI 将 3D 扩散策略与元学习结合,通过视觉-运动轨迹(VMT)模块捕获任务时空动力学、非配对统一任务(U2T)模块融合多模态观测、任务条件特征调制(TCFM)注入低层 3D 特征,使智能体能从少量演示快速适应未见操作任务,在 Meta-World 和 RLBench 上大幅超越基线。
研究背景与动机
模仿学习(IL)从专家演示中获取复杂机器人操作技能,但从有限演示中学到的策略常受分布偏移和复合误差影响,收集额外演示代价高昂。许多方法为单个任务训练专用策略或使用多任务模型记忆训练模式,导致对分布外任务泛化能力差。
少样本泛化提供了一种更数据高效的方向,利用先验知识解决新任务。但传统元学习方法在大分布偏移下难以推断新任务的动力学。上下文模仿学习(ICIL)作为一种无梯度范式直接将演示作为推理上下文,但这些非参数方法依赖视觉相似性而非任务动力学或动作语义,在任务结构不同时性能受限。
3D 策略学习的进展表明显式 3D 表示对捕获非结构化环境中的空间结构至关重要。扩散策略已成为建模多模态动作分布和生成复杂视觉运动行为的强大范式。但当只有少量演示可用时,直接微调高容量 3D 扩散策略会造成数据可用性与模型容量之间的不匹配——策略容易过拟合支撑轨迹而非学习可迁移的任务动力学。
图1:传统方法的泛化差距。标准方法过拟合已见数据,在未见任务上失败。底部序列展示动作误解:机器人未能用张开夹爪推动圆柱体。
方法详解
DAMI 将 3D 扩散策略与元学习目标结合。策略以文本指令、完整参考演示和当前观测为条件,从稀疏数据推断任务特定行为。架构包含三个核心模块:VMT、U2T 和 TCFM。
图2:DAMI 架构概览。给定当前观测、语言指令和完整参考演示,DAMI 使用元学习 3D 扩散策略预测动作轨迹。
扩散元模仿公式
DAMI 采用扩散策略范式建模动作轨迹。给定干净动作轨迹 $\mathbf{A}_0$,前向扩散过程逐步将其扰动为噪声轨迹 $\mathbf{A}_k$。反向过程由条件 U-Net 实现,从噪声样本预测干净轨迹。扩散损失为:
$$\mathcal{L}_{diff} = \mathbb{E}_{k, \mathbf{A}_0, \epsilon}\left[\left\|\mathbf{A}_0 - \hat{\mathbf{A}}_{0,\theta}(\mathbf{A}_k, k, \mathbf{f}_{obs}, \mathbf{H}_{demo}, \mathbf{f}_{text})\right\|^2\right]$$
为支持快速适应,将该扩散目标与完整 MAML 过程集成。内循环在支撑集上适应当前初始化 $\theta$:
$$\theta'_i = \theta - \alpha \nabla_\theta \mathcal{L}_{diff}(\theta, B_i^{sup})$$
外循环从平均查询集元梯度更新共享初始化:
$$\bar{\mathbf{g}}_t = \nabla_\theta \frac{1}{|\mathcal{B}|} \sum_{\mathcal{T}_i \in \mathcal{B}} \mathcal{L}_{diff}(\theta'_i, B_i^{qry})$$
$$\theta \leftarrow \text{AdamW}(\theta, \bar{\mathbf{g}}_t; \eta_t)$$
通过内循环更新保留计算图,使元梯度包含完整 MAML 的二阶导数项。评估时,基础任务通过元训练获得的 EMA 策略直接推理,新任务从同一 EMA 策略初始化后在少量演示上微调。
视觉-运动轨迹模块(VMT)
纯视觉演示编码会过度强调静态物体外观,不足以区分推、拉、按等操作意图。VMT 联合建模视觉状态和运动命令,使表示能捕获"在什么动作下发生什么变化"而非仅依赖静态视觉线索。参考演示轨迹 $\tau = \{(\mathbf{f}_{v,t}, \mathbf{a}_t)\}_{t=1}^T$ 包含视觉表示 $\mathbf{f}_{v,t} \in \mathbb{R}^{D_v}$ 和本体感受动作 $\mathbf{a}_t \in \mathbb{R}^{D_a}$。
首先通过可学习线性投影将拼接特征投射到共享潜在流形:
$$\mathbf{e}_t = \phi_{\text{proj}}([\mathbf{f}_{v,t} \oplus \mathbf{a}_t])$$
其中 $\oplus$ 表示拼接,$\mathbf{e}_t \in \mathbb{R}^{D_{model}}$ 为第 $t$ 步的统一令牌。添加可学习位置嵌入 $\mathbf{P}$ 后,由 Transformer 编码器处理以建模全局时间依赖:
$$\mathbf{H}_{demo} = \text{Transformer}(\mathbf{E} + \mathbf{P})$$
图3:VMT 模块示意图。联合编码视觉特征和运动动作以捕获时空动力学。
非配对统一任务模块(U2T)
U2T 协调非结构化文本指令、结构化参考演示和当前观测。"非配对"意味着参考演示和当前观测无需时间对齐或逐帧匹配——它们共享任务语义但可能对应不同状态或执行阶段。使用模态特定仿射投影对齐演示和文本令牌:
$$\mathbf{e}_m = \mathbf{W}_m \cdot \text{LN}(\mathbf{f}_m) + \mathbf{b}_m, \quad m \in \{demo, text\}$$
在扩散步骤 $k$,时间步嵌入 $\mathbf{e}_k$ 与当前观测特征拼接后由 U-Net 条件 MLP 变换:
$$\mathbf{h}_k = \text{MLP}([\mathbf{e}_k \oplus \mathbf{f}_{obs}])$$
U2T 输入和第一个下采样块条件为:
$$\mathbf{Z}_{in} = [\mathbf{e}_{demo} + \mathbf{P}_{demo} \| \mathbf{e}_{text} + \mathbf{P}_{text} \| \mathbf{h}_k]$$
$$\mathbf{C}_{\text{Down}_1} = \text{U2T}(\mathbf{Z}_{in}) = \text{TransformerEncoder}(\mathbf{Z}_{in})$$
任务条件特征调制(TCFM)
将去噪网络实现为修改的 1D 条件 U-Net。由于早期下采样层执行几何接地和局部接触推理,U2T 融合仅应用于第一个下采样块,其余块使用更轻量的观测-时间步条件。使用 FiLM 调制第 $j$ 个 U-Net 块的特征:
$$\tilde{\mathbf{h}}_j = \boldsymbol{\gamma}_j(\mathbf{c}_j) \odot \mathbf{h}_j + \boldsymbol{\beta}_j(\mathbf{c}_j)$$
其中 $\boldsymbol{\gamma}_j$ 和 $\boldsymbol{\beta}_j$ 是产生调制系数的学习投影,层特定条件为 $\mathbf{c}_j = \mathbf{C}_{\text{Down}_1}$(当 $j = \text{Down}_1$)或 $\mathbf{h}_k$(其他)。
flowchart TB
A["当前观测 Ot
点云 + 机器人状态"] --> B["视觉编码器"]
B --> C["观测特征 f_obs"]
D["文本指令 l"] --> E["冻结 CLIP 编码器"]
E --> F["文本特征 f_text"]
G["参考演示 tau
200帧完整轨迹"] --> H["VMT 模块
视觉+动作联合编码"]
H --> I["演示令牌 H_demo"]
C --> J["条件 MLP
h_k = MLP(e_k + f_obs)"]
I --> K["U2T 模块
Transformer 融合"]
F --> K
J --> K
K --> L["TCFM 调制
FiLM 注入 U-Net"]
L --> M["3D 扩散 U-Net
预测动作轨迹"]
M --> N["H 步动作序列"]
实验结果
实验在 Meta-World(ML10 和 ML45 协议)和 RLBench(FS25 设置)上进行。ML10 包含 10 个训练任务和 5 个测试任务,ML45 包含 45 个训练任务和 5 个测试任务,RLBench FS25 在 25 个基础任务上训练并在 5 个未见任务上评估。
| 方法 | ML10 基础平均 | ML45 基础平均 | ML10 新任务平均 | ML45 新任务平均 |
|---|---|---|---|---|
| Meta-World | 39.60 | 7.93 | 29.33 | 12.53 |
| DP3 | 82.13 | 47.24 | 48.87 | 37.53 |
| Mamba | 72.17 | 50.90 | 35.93 | 17.00 |
| FreqPolicy | 80.77 | 45.87 | 46.47 | 13.47 |
| FlowPolicy | 78.03 | 45.85 | 27.53 | 13.07 |
| DAMI | 87.23 | 79.05 | 56.80 | 37.53 |
表1:Meta-World 基础任务和新任务成功率(%)。DAMI 在基础和新任务上均大幅领先。
DAMI 在基础任务上 ML10 达到 87.23%(vs DP3 的 82.13%),ML45 达到 79.05%(vs DP3 的 47.24%),提升显著。在未见任务上,DAMI ML10 达到 56.80%(vs DP3 的 48.87%),ML45 达到 37.53%(与 DP3 持平)。在 RLBench FS25 新任务上,DAMI 平均 10.80%(vs DP3 的 9.93%),超越所有基线。
| 方法 | RLBench FS25 新任务平均 |
|---|---|
| DP3 | 9.93 |
| Mamba | 0.00 |
| FreqPolicy | 1.20 |
| FlowPolicy | 0.20 |
| DAMI | 10.80 |
表2:RLBench FS25 新任务成功率(%)。DAMI 超越所有基线。
消融研究表明 VMT 模块捕获的时空动力学对泛化至关重要——移除 VMT 后新任务成功率显著下降。U2T 的 Transformer 融合比简单拼接更有效,TCFM 的 FiLM 调制比直接注入条件更好地保留了低层 3D 几何信息。真实世界实验在物理机器人上验证了 DAMI 的有效性,适应过程仅需不到两分钟。
图4:DAMI 元训练算法。内循环适应 + 外循环元梯度更新 + EMA 维护。
局限性
- 需要任务特定微调:新任务仍需少量演示进行微调,非完全零样本泛化。作者在实践者说明中指出"当前局限包括需要任务特定微调"。
- 额外计算开销:完整 MAML 的二阶导数计算增加了训练成本。相比直接推理的基线,DAMI 的元训练需要更多计算资源和时间。
- 评估任务范围有限:实验仅在 Meta-World 和 RLBench 的有限任务集上评估,更广泛物体、感知和操作条件下的可靠性有待验证。作者指出"评估在有限的操作任务集上"。
总结与展望
DAMI 证明了将表达力强的 3D 扩散策略与数据高效的元学习目标结合是可行的。VMT 模块通过联合编码视觉和动作捕获任务动力学而非静态外观,U2T 模块以非配对方式融合多模态观测,TCFM 通过 FiLM 调制将任务条件注入低层 3D 特征。这三个组件协同减少了对密集演示的依赖,支持对新任务的快速适应。
在 Meta-World 和 RLBench 上,DAMI 在基础任务直接推理和新任务少样本适应方面均超越最先进基线,特别是在 ML45 的 45 任务大规模设置下优势最为显著(79.05% vs 47.24%)。真实世界实验进一步验证了其实用性。
金句:看懂一个任务不在于记住物体长什么样,而在于理解"做什么动作会发生什么变化"——DAMI 让机器人从演示中学习动力学逻辑,而非记忆静态画面。



