PAPER DEEP DIVE
WARL:面向腿式机器人任务无关学习的力矩增强强化学习
提出WARL力矩增强强化学习,将动作空间从关节扩展到力矩,提升腿式机器人的探索能力与运动性能。
1. 论文概览:力矩增强的足式机器人任务无关学习
WARL(Wrench-Augmented Reinforcement Learning)由东京大学 Keita Yoneda、Kento Kawaharazuka、Kei Okada 于 2026 年 7 月提出,通过在动作空间中引入 wrench(力与力矩)来解决足式机器人强化学习受限于关节空间探索能力不足的问题。该方法将 wrench 引导的探索与基于成功率的课程机制结合,在早期学习中扩展探索能力,最终目标是仅基于关节控制获取行为。四足机器人实验表明,WARL 能在多样地形与运动任务上鲁棒学习,无需地形特定奖励调整或复杂课程设计。消融研究验证了逐渐消除 wrench 的切换课程(Switching Curriculum)的有效性。研究也表明,引入 wrench 可能鼓励不充分利用机器人物理具身性的行为——设计与物理结构一致的 wrench 探索是关键未来挑战。
2. 核心问题:关节空间探索的局限
足式机器人强化学习已实现高运动性能,但受限于关节空间动作的探索能力不足。传统框架常涉及大量针对特定任务的学习环境与奖励设计启发式,新任务的设计成本高昂。例如,在跨越含大台阶不平地形的任务中,标准方法是使用启发式课程随学习进展逐步增加台阶高度;即使不用地形课程,也需要任务特定的精细奖励设计(如跳跃运动的细粒度奖励整形)。这些方法虽成功学习特定任务,但缺乏应用于广泛任务的通用性。根本原因在于:关节空间动作的探索范围有限,难以发现需要大幅度重心移动或瞬时力冲击的运动模式。
3. 背景:动作空间设计与空间探索能力
论文从动作空间设计角度分析探索能力差异。仅用关节空间动作时,策略输出 $\boldsymbol{q}^{\text{ref}}_t = \pi_j(\boldsymbol{s}_t)$,探索局限于关节角附近的小范围,难以产生大幅重心位移或瞬时大力。引入 wrench 后,动作空间扩展为:
$$\boldsymbol{a}_t = (\boldsymbol{q}^{\text{ref}}_t, \alpha\, \boldsymbol{w}_t), \quad \boldsymbol{q}^{\text{ref}}_t = \pi_j(\boldsymbol{s}_t), \quad \boldsymbol{w}_t = \pi_w(\boldsymbol{s}_t)$$其中 $\boldsymbol{w}_t$ 为 wrench 策略 $\pi_w$ 输出的力/力矩,$\alpha \in [0,1]$ 为课程衰减系数。wrench 提供直接施加力与力矩的能力,极大扩展空间探索范围。环境执行为:
$$\boldsymbol{s}_{t+1}, r_t = \text{Step}(\boldsymbol{q}^{\text{ref}}_t, \alpha\, \boldsymbol{w}_t)$$4. 方法:WARL 框架
4.1 总览
WARL 交替两阶段:(i) Joint+Wrench 学习阶段,同时优化 wrench 策略 $\pi_w$ 与关节策略 $\pi_j$;(ii) Joint-only 适应阶段,用 $\pi_j$ 在衰减的已保存 wrench 下复现运动。切换课程使早期高效空间探索,并通过衰减课程系数 $\alpha$ 逐渐移除 wrench 依赖。采用 Teacher-Student 框架,训练时用特权观测,通过学生蒸馏移除。
4.2 切换课程
初始化 $\pi_w, \pi_j$,$\alpha=1$。当 $\alpha > \epsilon$ 时循环:Joint+Wrench 学习直到成功率 $\zeta \geq \gamma$ 或变化 $|\Delta\zeta| \leq \delta$;冻结 $\pi_w$,$\alpha \leftarrow \sigma\alpha$;Joint-only 适应阶段用已保存 wrench 序列 $\mathcal{W}_{\text{saved}}$ 复现运动,直到再次满足条件。课程衰减率为:
4.3 保存 wrench 序列
在 Joint+Wrench 阶段,从成功回合保存 wrench 序列,供 Joint-only 适应阶段使用:$\boldsymbol{w}_t = \mathcal{W}_{\text{saved}}(t)$。这让关节策略在逐渐衰减的外力辅助下学习复现运动。
4.4 Teacher-Student 学习
训练时使用特权观测(如真实地形高度图),通过学生蒸馏过程移除,使部署时策略仅依赖本体感受与板载传感。蒸馏目标为:
$$\min_{\theta_S} \mathbb{E}\left[\| \pi_S(\boldsymbol{s}_t^{\text{onboard}}; \theta_S) - \pi_T(\boldsymbol{s}_t^{\text{priv}}) \|^2_2\right]$$其中 $\pi_T$ 为特权教师策略,$\pi_S$ 为学生策略,$\boldsymbol{s}^{\text{priv}}$ 含特权观测而 $\boldsymbol{s}^{\text{onboard}}$ 仅含板载传感。
5. 实验设置与结果
5.1 任务与机器人
在 KLEIYN 与 Unitree Go2 两种四足机器人上训练六项任务(四项目标到达 + 两项动态运动),除改变站立高度 $z^*$ 外无机器人特定调参。目标到达任务含 FlatGround、HurdleJump、IslandTraverse、RoughTerrain;动态任务含 FlipBack、BipedWalk。
| 任务类别 | 任务 | 挑战 |
|---|---|---|
| 目标到达 | FlatGround | 平地行走基线 |
| 目标到达 | HurdleJump | 跨栏 |
| 目标到达 | IslandTraverse | 跨岛间隙 |
| 目标到达 | RoughTerrain | 不平地形 |
| 动态运动 | FlipBack | 后空翻 |
| 动态运动 | BipedWalk | 双足行走 |
5.2 仿真学习结果
两种机器人在多样目标到达与动态运动任务上均成功学习。学习曲线显示奖励整体上升趋势,课程驱动的 wrench 衰减引起临时下降后通过自适应学习恢复。IslandTraverse 任务中机器人获得直接跳过 1.4m 间隙而不用中间落脚点的运动——这可能因 wrench 探索主导学习过程,未发现利用落脚点的运动。HurdleJump 任务 500 次迭代时的 wrench 与关节运动显示跨栏运动主要由学习到的 wrench 生成,同时协调腿部运动抬脚过栏。
5.3 消融研究
在 HurdleJump 任务上比较四种条件:(1) WARL、(2) w/o Switch(省略适应阶段,始终探索)、(3) w/o Wrench Reward(移除 wrench 量惩罚)、(4) Baseline(仅 PPO+关节控制)。WARL 整体成功率提升最稳定;w/o Switch 因省略适应阶段,策略依赖 wrench,课程后期成功率下降;Baseline 探索能力不足。成功率定义为:
| 消融条件 | 说明 | 结果 |
|---|---|---|
| WARL(完整) | 切换课程+wrench奖励 | 最稳定提升 |
| w/o Switch | 省略适应阶段 | 后期成功率下降(3/10成功) |
| w/o Wrench Reward | 移除wrench量惩罚 | wrench过度使用 |
| Baseline | 仅PPO+关节控制 | 探索能力不足 |
6. 讨论
探索范围扩大带来的目标运动发现概率提升可近似为:
$$P_{\text{find}}(\text{wrench}) \geq P_{\text{find}}(\text{joint}), \quad \Delta t_{\text{learn}} \propto \frac{1}{|\mathcal{E}|}$$力矩探索的优势:加速学习(更高探索能力缩短目标运动发现时间);减少启发式学习设计(更广探索空间减少对精细奖励调参与逐步课程的依赖)。挑战:引入 wrench 可能鼓励不充分利用物理具身性的行为(如直接跳过间隙而非用落脚点)。框架改进:wrench 策略与关节策略用相同奖励虽简单但角色本质不同——wrench 策略主要是促进关节策略学习,应评估其多有效促进关节策略自主达成目标,可引入分层 RL 的内-外环结构。也可将 wrench 生成运动作为模仿目标。
理想 wrench 策略应以关节策略自主学习进展为评估标准,形式化为:
$$\pi_w^* = \arg\max_{\pi_w} \mathbb{E}\left[\Delta \zeta_j \mid \pi_j, \pi_w\right]$$7. 局限性
- 具身性利用不足:引入 wrench 可能鼓励绕过机器人物理结构的行为(如直接跳过间隙不用落脚点),运动可能不够自然。
- wrench 与关节策略奖励未分离:两者角色本质不同但用相同奖励,可能导致 wrench 策略不考虑具身性。
- wrench 衰减策略单一:当前仅用线性衰减 $\alpha \leftarrow \sigma\alpha$,更智能的衰减或模仿学习替代有待探索。
- 真实机器人迁移未充分验证:虽在 MuJoCo 模拟器中执行了真实机器人策略,但完整 sim-to-real 迁移的鲁棒性需更多实验。
- 计算开销:训练时需同时维护 wrench 与关节两个策略,增加计算成本。
8. 总结
WARL 是一个通过在动作空间引入 wrench 来增强足式机器人探索能力的框架,结合切换课程逐渐移除 wrench 依赖,最终获取仅关节控制的策略。在四足机器人 KLEIYN 与 Go2 上,跨六项任务(目标到达与动态运动)无需任务特定调参即可鲁棒学习,证明了任务无关性。消融验证了切换课程与 wrench 奖励的有效性。讨论揭示了 wrench 探索的加速与减设计优势,以及具身性利用不足的挑战。核心洞见是:用外力(wrench)扩大探索范围以发现目标运动,再通过课程逐渐撤去外力让关节策略学会自主复现——探索的增强与具身性的保留,是力矩增强学习需要平衡的两端。
flowchart TD
A["初始化 π_w, π_j, α=1"] --> B{"α > ε?"}
B -->|是| C["Joint+Wrench 学习阶段"]
C --> D["q_ref = π_j(s), w = π_w(s)"]
D --> E["Step(q_ref, α·w)"]
E --> F["更新 π_j, π_w"]
F --> G["保存成功回合 wrench 序列"]
G --> H{"ζ≥γ 或 |Δζ|≤δ?"}
H -->|否| C
H -->|是| I["冻结 π_w, α ← σ·α"]
I --> J["Joint-only 适应阶段"]
J --> K["w = W_saved(t)"]
K --> L["Step(q_ref, α·w)"]
L --> M{"ζ≥γ 或 |Δζ|≤δ?"}
M -->|否| J
M -->|是| B
B -->|否| N["输出仅关节策略 π_j"]



