PAPER DEEP DIVE
DynaWM:动力学感知蒸馏实现双足轮式机器人连续楼梯平滑运动
在并发师生框架中引入世界模型(深度残差网络预测未来地形状态)和动量目标编码器(BYOL 式 EMA),通过预测损失强制教师编码器学习时空感知表示,为 student 提供稳定蒸馏目标,解决连续楼梯平滑运动问题。
DynaWM:动力学感知蒸馏与世界模型用于连续楼梯平滑运动
论文:DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs | 作者:Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang | 机构:北京理工大学 | 链接:https://arxiv.org/abs/2606.24089
一句话总结
DynaWM 通过引入世界模型作为前向动力学感知正则化器和动量目标编码器提供稳定蒸馏目标,解决双足轮式机器人连续楼梯行走中教师编码器动力学表示弱化和学生编码器维度坍缩问题,实现了更强的地形适应性和运动平滑性。
研究背景与动机
双足轮式机器人结合了轮式运动的高能效和足式系统的地形适应性,在平坦地面上高效巡航的同时能主动部署腿部克服障碍。基于模型预测控制和深度强化学习的进展已使这些平台能成功穿越斜坡、草地和单步障碍。然而长楼梯穿越仍然具有挑战性——当前教师-学生框架存在动力学感知表示弱化和地形几何编码不完整的问题。
特权学习范式(特别是教师-学生蒸馏框架)已成为将地形感知纳入控制策略的主导方案。教师策略在拥有外感受信息(如地形高程图和接触力)的特权下训练,然后通过 DAgger 蒸馏将知识转移到仅依赖本体感受观测的学生策略。然而现有方法存在三个主要问题:第一,仅通过策略梯度优化的教师编码器倾向于弱化动力学感知表示,只编码与即时奖励直接相关的地形特征而忽略更广泛的几何信息。第二,教师编码器和学生编码器同时更新时,教师动力学表示的快速变化会导致学生编码器维度坍缩。第三,潜在空间是不透明的黑盒,无法验证对地形高度的真实建模能力。
图1:使用本方法训练的模型在不同宽度和高度的户外楼梯上评估。
方法详解
DynaWM 包含三个互联模块:世界模型学习(前向动力学感知正则化)、并发教师-学生训练、BYOL 动量目标蒸馏。
图2:DynaWM 框架。世界模型正则化教师编码器,动量目标编码器提供稳定蒸馏目标。
世界模型用于动力学感知表示
教师编码器 $E_{\theta^t}$ 被设计为同时实现两个功能:生成用于前向状态预测的潜在变量 $z_t^t = E_{\theta^t}(s_t^t)$,以及为策略网络提供地形特征。世界模型 $W_\omega$ 接收教师编码器输出 $z_t^t$ 和当前特权观测 $s_t^t$ 预测下一特权状态:
$$\hat{s}_{t+1}^t = W_\omega(z_t^t, s_t^t)$$
训练世界模型同时将动力学感知梯度传播到教师编码器,最小化预测残差:
$$\mathcal{L}_{pred}(\theta^t, \omega) = \mathbb{E}_{(s_t, s_{t+1}) \sim \mathcal{B}}\left[\left\|W_\omega(z_t^t, s_t^t) - s_{t+1}\right\|^2\right]$$
梯度 $\nabla_{\theta^t} \mathcal{L}_{pred}$ 回传到教师编码器,迫使其提取本质动力学变量同时过滤静态或无关特征。世界模型实现为深度残差网络,每个残差块遵循:
$$\mathbf{h}_{i+1} = \mathbf{h}_i + \mathcal{F}_i(\mathbf{h}_i)$$
其中 $\mathcal{F}_i$ 通过四个连续的 Dense-LayerNorm-Swish 单元学习变换。跳跃连接促进稳定梯度流,允许世界模型捕获地形序列中的长程时间依赖。
动量目标编码器用于稳定蒸馏
受 BYOL 启发,引入动量目标编码器解决教师编码器非平稳性问题。维护两组学生编码器参数:动量目标网络 $E_{\hat{\theta}^s}$ 使用指数移动平均渐进跟随在线网络 $E_{\theta^s}$:
$$\hat{\theta}_{t+1}^s = \tau \hat{\theta}_t^s + (1-\tau) \theta_t^s$$
其中 $\tau \in [0.9, 0.99]$ 为接近 1 的衰减系数。在线网络上施加预测头 $q_\xi$ 引入不对称性,防止在线编码器坍缩到与目标编码器相同的平凡表示。蒸馏目标使用归一化均方误差损失:
$$\mathcal{L}_{moment} = \left\|\frac{q_\xi(z_t^s)}{\|q_\xi(z_t^s)\|_2} - \frac{\hat{z}_t^s}{\|\hat{z}_t^s\|_2}\right\|_2^2$$
该损失将在线表示拉向归一化目标表示。通过对齐目标编码器输出而非直接对齐教师,在线学生从稳定的目标准则中学习,有效防止维度坍缩。还可选地添加慢更新的对齐损失 $\mathcal{L}_{mse} = \|z_t^s - z_t^t\|_2^2$,总学生目标为 $\mathcal{L}_s = \mathcal{L}_{pred} + \lambda \mathcal{L}_{mse}$。
奖励设计
除基础的速度跟踪和关节扭矩限位外,引入关节范围约束奖励 $r^{hr}$、轴距距离约束 $r^{fd}$、基座位置约束 $r^{pb}$ 和腿部平衡奖励 $r^{lb}$。其中髋关节速率奖励 $r^{hr} = \|\max(0, \mathbf{q}^{hip} - 0.05)\|_2$ 权重为 0.1,鼓励使用膝踝关节而非过度依赖髋关节。
flowchart TB
A["特权观测 st
地形高程图+接触力"] --> B["教师编码器 E_theta_t"]
B --> C["潜在表示 z_t_t"]
C --> D["世界模型 W_omega
预测下一状态"]
D --> E["预测损失 L_pred
正则化教师编码器"]
C --> F["PPO 策略训练
教师 Actor-Critic"]
G["本体感受历史 ot
关节+IMU"] --> H["学生编码器 E_theta_s"]
H --> I["在线表示 z_t_s"]
I --> J["预测头 q_xi"]
H --> K["动量目标编码器
EMA 更新"]
K --> L["目标表示 z_hat_t_s"]
J --> M["动量损失 L_moment
归一化 MSE"]
L --> M
E --> N["梯度回传
动力学感知"]
M --> H
实验结果
训练在 IsaacGym 中进行,使用 4000 个并行环境(3000 教师 + 1000 学生),策略以 200Hz 训练、50Hz 更新,硬件以 500Hz 运行。训练地形包括平地、斜坡(≤30°)、金字塔台阶(≤0.18m)、离散不平地形(≤0.16m)和粗糙表面(≤0.03m)。
| 奖励项 | 定义 | 权重 |
|---|---|---|
| 线速度跟踪 | $\exp(-8.3\|\mathbf{v}_{xy} - \mathbf{v}_{xy}^{cmd}\|_2^2)$ | 7.0 |
| 角速度跟踪 | $\exp(-8.3\|\boldsymbol{\omega}_z - \boldsymbol{\omega}_z^{cmd}\|_2^2)$ | 4.0 |
| 朝向 | $\|\mathbf{g}_{xy}\|_2$ | -10.0 |
| 髋关节速率 | $\|\max(0, \mathbf{q}^{hip} - 0.05)\|_2$ | 0.1 |
| 腿部位置偏差 | $\|\mathbf{q}^{left} - \mathbf{q}^{right}\|_2$ | -0.8 |
| 关节位置偏差 | $\|\mathbf{q} - \mathbf{q}^{def}\|_2$ | -1.2 |
表1:部分奖励项及权重。髋关节速率奖励鼓励使用膝踝关节。
PCA 可视化显示,带世界模型正则化的教师编码器展现清晰的地形高度分层,而无世界模型的教师编码器表示纠缠。完整学生框架成功复制了教师的结构化流形,而无世界模型的学生遭受维度坍缩,无动量目标的学生无法正确编码地形。
| 消融变体 | 预测损失 | PC-相关性 | 地形适应 |
|---|---|---|---|
| DynaWM(完整) | 最低 | 最高 | 最强 |
| w/o 世界模型 | — | 低 | 弱 |
| w/o 动量目标 | — | 维度坍缩 | 失败 |
| MLP 世界模型 | 较高 | 中等 | 中等 |
| ResNet 世界模型 | 中等 | 较高 | 较好 |
表2:消融研究。Dense-LayerNorm-Swish 世界模型在预测损失和策略性能上均最优。
图3:PCA 可视化。(a) 带世界模型的教师编码器展现地形高度分层;(d) 无世界模型的学生维度坍缩。
图4:训练曲线。DynaWM 在预测损失和 episode 奖励上优于消融变体。
真实世界实验在双足轮式机器人上验证,成功穿越不同宽度和高度的连续楼梯,展现出更平滑的运动和更好的地形适应性。
局限性
- 训练地形多样性有限:虽然包含五种地形类型,但连续楼梯的高度和宽度范围有限(台阶高度≤0.18m),更极端的楼梯配置未评估。
- 世界模型预测精度依赖地形复杂度:对于高度动态或非结构化地形,残差网络的世界模型可能无法准确预测未来状态,影响教师编码器的动力学感知质量。
- 硬件验证规模有限:真实世界实验仅在单一双足轮式机器人平台上验证,跨平台泛化能力未系统评估。
总结与展望
DynaWM 通过两个核心创新解决了教师-学生蒸馏框架中的动力学表示弱化和维度坍缩问题。世界模型作为前向动力学正则化器,迫使教师编码器保留对地形动力学建模至关重要的几何信息,而非仅最大化即时奖励。动量目标编码器通过 BYOL 范式提供稳定的蒸馏目标,使学生能从非平稳教师监督中鲁棒学习。PCA 可视化量化验证了编码器以分层方式编码地形高度的能力。
在连续楼梯穿越任务上,DynaWM 展现出更强的地形适应性和运动平滑性,真实世界部署验证了其有效性。这一框架为足式机器人的地形感知表示学习提供了可解释、可验证的方法论。
金句:好的表示不仅要"看到"地形,还要"理解"地形会如何变化——DynaWM 用世界模型让编码器学会预测未来,用动量目标让蒸馏在风浪中保持稳定。



