Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

具身智能PaperEmbodied AI

WARL:面向腿式机器人任务无关学习的力矩增强强化学习

提出WARL力矩增强强化学习,将动作空间从关节扩展到力矩,提升腿式机器人的探索能力与运动性能。

Keita Yoneda, Kento Kawaharazuka, Kei Okada2026年7月27日2 分钟阅读
EN

1. 论文概览:力矩增强的足式机器人任务无关学习

WARL(Wrench-Augmented Reinforcement Learning)由东京大学 Keita Yoneda、Kento Kawaharazuka、Kei Okada 于 2026 年 7 月提出,通过在动作空间中引入 wrench(力与力矩)来解决足式机器人强化学习受限于关节空间探索能力不足的问题。该方法将 wrench 引导的探索与基于成功率的课程机制结合,在早期学习中扩展探索能力,最终目标是仅基于关节控制获取行为。四足机器人实验表明,WARL 能在多样地形与运动任务上鲁棒学习,无需地形特定奖励调整或复杂课程设计。消融研究验证了逐渐消除 wrench 的切换课程(Switching Curriculum)的有效性。研究也表明,引入 wrench 可能鼓励不充分利用机器人物理具身性的行为——设计与物理结构一致的 wrench 探索是关键未来挑战。

WARL 概念示意

2. 核心问题:关节空间探索的局限

足式机器人强化学习已实现高运动性能,但受限于关节空间动作的探索能力不足。传统框架常涉及大量针对特定任务的学习环境与奖励设计启发式,新任务的设计成本高昂。例如,在跨越含大台阶不平地形的任务中,标准方法是使用启发式课程随学习进展逐步增加台阶高度;即使不用地形课程,也需要任务特定的精细奖励设计(如跳跃运动的细粒度奖励整形)。这些方法虽成功学习特定任务,但缺乏应用于广泛任务的通用性。根本原因在于:关节空间动作的探索范围有限,难以发现需要大幅度重心移动或瞬时力冲击的运动模式。

3. 背景:动作空间设计与空间探索能力

论文从动作空间设计角度分析探索能力差异。仅用关节空间动作时,策略输出 $\boldsymbol{q}^{\text{ref}}_t = \pi_j(\boldsymbol{s}_t)$,探索局限于关节角附近的小范围,难以产生大幅重心位移或瞬时大力。引入 wrench 后,动作空间扩展为:

$$\boldsymbol{a}_t = (\boldsymbol{q}^{\text{ref}}_t, \alpha\, \boldsymbol{w}_t), \quad \boldsymbol{q}^{\text{ref}}_t = \pi_j(\boldsymbol{s}_t), \quad \boldsymbol{w}_t = \pi_w(\boldsymbol{s}_t)$$

其中 $\boldsymbol{w}_t$ 为 wrench 策略 $\pi_w$ 输出的力/力矩,$\alpha \in [0,1]$ 为课程衰减系数。wrench 提供直接施加力与力矩的能力,极大扩展空间探索范围。环境执行为:

$$\boldsymbol{s}_{t+1}, r_t = \text{Step}(\boldsymbol{q}^{\text{ref}}_t, \alpha\, \boldsymbol{w}_t)$$

4. 方法:WARL 框架

4.1 总览

WARL 交替两阶段:(i) Joint+Wrench 学习阶段,同时优化 wrench 策略 $\pi_w$ 与关节策略 $\pi_j$;(ii) Joint-only 适应阶段,用 $\pi_j$ 在衰减的已保存 wrench 下复现运动。切换课程使早期高效空间探索,并通过衰减课程系数 $\alpha$ 逐渐移除 wrench 依赖。采用 Teacher-Student 框架,训练时用特权观测,通过学生蒸馏移除。

WARL 学习流程

4.2 切换课程

初始化 $\pi_w, \pi_j$,$\alpha=1$。当 $\alpha > \epsilon$ 时循环:Joint+Wrench 学习直到成功率 $\zeta \geq \gamma$ 或变化 $|\Delta\zeta| \leq \delta$;冻结 $\pi_w$,$\alpha \leftarrow \sigma\alpha$;Joint-only 适应阶段用已保存 wrench 序列 $\mathcal{W}_{\text{saved}}$ 复现运动,直到再次满足条件。课程衰减率为:

4.3 保存 wrench 序列

在 Joint+Wrench 阶段,从成功回合保存 wrench 序列,供 Joint-only 适应阶段使用:$\boldsymbol{w}_t = \mathcal{W}_{\text{saved}}(t)$。这让关节策略在逐渐衰减的外力辅助下学习复现运动。

4.4 Teacher-Student 学习

训练时使用特权观测(如真实地形高度图),通过学生蒸馏过程移除,使部署时策略仅依赖本体感受与板载传感。蒸馏目标为:

$$\min_{\theta_S} \mathbb{E}\left[\| \pi_S(\boldsymbol{s}_t^{\text{onboard}}; \theta_S) - \pi_T(\boldsymbol{s}_t^{\text{priv}}) \|^2_2\right]$$

其中 $\pi_T$ 为特权教师策略,$\pi_S$ 为学生策略,$\boldsymbol{s}^{\text{priv}}$ 含特权观测而 $\boldsymbol{s}^{\text{onboard}}$ 仅含板载传感。

动作空间设计对比

5. 实验设置与结果

5.1 任务与机器人

在 KLEIYN 与 Unitree Go2 两种四足机器人上训练六项任务(四项目标到达 + 两项动态运动),除改变站立高度 $z^*$ 外无机器人特定调参。目标到达任务含 FlatGround、HurdleJump、IslandTraverse、RoughTerrain;动态任务含 FlipBack、BipedWalk。

任务类别任务挑战
目标到达FlatGround平地行走基线
目标到达HurdleJump跨栏
目标到达IslandTraverse跨岛间隙
目标到达RoughTerrain不平地形
动态运动FlipBack后空翻
动态运动BipedWalk双足行走

5.2 仿真学习结果

两种机器人在多样目标到达与动态运动任务上均成功学习。学习曲线显示奖励整体上升趋势,课程驱动的 wrench 衰减引起临时下降后通过自适应学习恢复。IslandTraverse 任务中机器人获得直接跳过 1.4m 间隙而不用中间落脚点的运动——这可能因 wrench 探索主导学习过程,未发现利用落脚点的运动。HurdleJump 任务 500 次迭代时的 wrench 与关节运动显示跨栏运动主要由学习到的 wrench 生成,同时协调腿部运动抬脚过栏。

六任务学习曲线与运动快照

5.3 消融研究

在 HurdleJump 任务上比较四种条件:(1) WARL、(2) w/o Switch(省略适应阶段,始终探索)、(3) w/o Wrench Reward(移除 wrench 量惩罚)、(4) Baseline(仅 PPO+关节控制)。WARL 整体成功率提升最稳定;w/o Switch 因省略适应阶段,策略依赖 wrench,课程后期成功率下降;Baseline 探索能力不足。成功率定义为:

HurdleJump 学习到的 wrench 与关节动作 成功率与课程权重变化
消融条件说明结果
WARL(完整)切换课程+wrench奖励最稳定提升
w/o Switch省略适应阶段后期成功率下降(3/10成功)
w/o Wrench Reward移除wrench量惩罚wrench过度使用
Baseline仅PPO+关节控制探索能力不足

6. 讨论

探索范围扩大带来的目标运动发现概率提升可近似为:

$$P_{\text{find}}(\text{wrench}) \geq P_{\text{find}}(\text{joint}), \quad \Delta t_{\text{learn}} \propto \frac{1}{|\mathcal{E}|}$$

力矩探索的优势:加速学习(更高探索能力缩短目标运动发现时间);减少启发式学习设计(更广探索空间减少对精细奖励调参与逐步课程的依赖)。挑战:引入 wrench 可能鼓励不充分利用物理具身性的行为(如直接跳过间隙而非用落脚点)。框架改进:wrench 策略与关节策略用相同奖励虽简单但角色本质不同——wrench 策略主要是促进关节策略学习,应评估其多有效促进关节策略自主达成目标,可引入分层 RL 的内-外环结构。也可将 wrench 生成运动作为模仿目标。

消融研究结果

理想 wrench 策略应以关节策略自主学习进展为评估标准,形式化为:

$$\pi_w^* = \arg\max_{\pi_w} \mathbb{E}\left[\Delta \zeta_j \mid \pi_j, \pi_w\right]$$

7. 局限性

  • 具身性利用不足:引入 wrench 可能鼓励绕过机器人物理结构的行为(如直接跳过间隙不用落脚点),运动可能不够自然。
  • wrench 与关节策略奖励未分离:两者角色本质不同但用相同奖励,可能导致 wrench 策略不考虑具身性。
  • wrench 衰减策略单一:当前仅用线性衰减 $\alpha \leftarrow \sigma\alpha$,更智能的衰减或模仿学习替代有待探索。
  • 真实机器人迁移未充分验证:虽在 MuJoCo 模拟器中执行了真实机器人策略,但完整 sim-to-real 迁移的鲁棒性需更多实验。
  • 计算开销:训练时需同时维护 wrench 与关节两个策略,增加计算成本。

8. 总结

WARL 是一个通过在动作空间引入 wrench 来增强足式机器人探索能力的框架,结合切换课程逐渐移除 wrench 依赖,最终获取仅关节控制的策略。在四足机器人 KLEIYN 与 Go2 上,跨六项任务(目标到达与动态运动)无需任务特定调参即可鲁棒学习,证明了任务无关性。消融验证了切换课程与 wrench 奖励的有效性。讨论揭示了 wrench 探索的加速与减设计优势,以及具身性利用不足的挑战。核心洞见是:用外力(wrench)扩大探索范围以发现目标运动,再通过课程逐渐撤去外力让关节策略学会自主复现——探索的增强与具身性的保留,是力矩增强学习需要平衡的两端。

flowchart TD
    A["初始化 π_w, π_j, α=1"] --> B{"α > ε?"}
    B -->|是| C["Joint+Wrench 学习阶段"]
    C --> D["q_ref = π_j(s), w = π_w(s)"]
    D --> E["Step(q_ref, α·w)"]
    E --> F["更新 π_j, π_w"]
    F --> G["保存成功回合 wrench 序列"]
    G --> H{"ζ≥γ 或 |Δζ|≤δ?"}
    H -->|否| C
    H -->|是| I["冻结 π_w, α ← σ·α"]
    I --> J["Joint-only 适应阶段"]
    J --> K["w = W_saved(t)"]
    K --> L["Step(q_ref, α·w)"]
    L --> M{"ζ≥γ 或 |Δζ|≤δ?"}
    M -->|否| J
    M -->|是| B
    B -->|否| N["输出仅关节策略 π_j"]
用外力扩大探索范围以发现目标运动,再通过课程逐渐撤去外力让关节策略学会自主复现——探索的增强与具身性的保留,是力矩增强学习需要平衡的两端。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
ABot-N1:通用视觉语言导航基础模型

ABot-N1:通用视觉语言导航基础模型

高德ABot-N1是一个慢快双系统视觉语言导航基础模型:4B慢系统输出思维链与Target/Affordance双像素目标,2B快系统经QFormer动作查询解码连续SE(2)轨迹点,用统一像素接口覆盖坐标点、物体、POI、指令跟随与人员跟随五类任务。3000万样本预训练+GRPO安全感知后训练,并发布ABotN-PointBench与ABotN-POIBench两个闭环基准。五基准全部SOTA:POI入口到达77.3%(+35.0个百分点),室外/室内坐标点导航92.9%/95.4%,并部署于途途四足机器人Jetson AGX Orin。

视觉语言导航VLN导航基础模型2026年7月11日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日