PAPER DEEP DIVE
Extreme-RGMT:面向鲁棒通用人形控制的高动态技能持续学习
Extreme-RGMT提出持续学习方法用于人形机器人的高动态技能获取,实现对通用机器人控制的鲁棒泛化。
一、研究背景与动机
人形机器人控制的核心目标是让机器人逐步获得接近人类专家水平的全身运动能力。人类专家能执行高度动态、富接触、强协调的复杂运动,这些能力建立在稳定的基础运动技能之上。通过长期练习,人类能扩展运动边界同时保留已获得的能力。这种从基础运动到专家技能的渐进发展为机器人学习提供了自然启示。
然而,现有通用运动跟踪方法离这一目标还很远。现有方法能从大规模运动库训练统一控制器,支持基本行走、简单姿态跟随和常规全身运动,但这些能力主要覆盖相对平滑的运动模式。对于专家级高动态运动(如空翻、侧空翻),现有控制器仍难以可靠执行。
关键原因在于:高动态运动的有效控制需求集中在少数短暂时段(如空中姿态调整和着陆恢复),策略在这些时段失败后产生的rollout几乎不含有效的成功转换。在大规模通用运动训练中,这些稀疏但关键的学习信号进一步被大量常规运动样本稀释,使统一控制器难以自然获得专家级高动态技能。另一方面,专门优化方法依赖预处理的高质量运动数据,但这类数据缺乏真实运动中的噪声和不一致性,且专门训练会退化已获得的行为——这就是稳定性-可塑性困境。
二、系统概述
2.1 问题建模
将问题建模为部分可观测马尔可夫决策过程(POMDP)$\mathcal{M}=(\mathcal{S},\mathcal{O},\mathcal{A},P,r,\gamma)$。在每个控制步 $t$,策略 $\pi_\theta$ 接收本体感知观测历史 $o^{\mathrm{prop}}_{t-H:t}$、过去动作 $a_{t-H-1:t-1}$ 和局部参考运动窗口 $g_{t-L:t+L}$,输出残差关节位置命令 $a_t$。
本体感知观测定义为:
其中 $\mathbf{g}_t^{\mathrm{proj}}$ 是投影到基座的重力方向,$\omega_t$ 是基座角速度,$q_t-q_0$ 是关节位置偏移,$\dot{q}_t$ 是关节速度。动作空间为29维残差关节位置命令,加到参考关节姿态上得到目标关节位置:
采用非对称actor-critic设置:actor仅使用可部署观测,critic额外接收特权信息(参考基座高度、跟踪体连杆位置/方向、基座线速度)。
2.2 策略架构
本体感知历史和动作历史分别编码后交织排列,经因果历史编码器聚合为查询向量。参考运动窗口独立编码后作为交叉注意力的键和值:
这种状态依赖的参考聚合机制使策略能关注与当前控制状态最相关的参考窗口部分。之后引入有限标量量化(FSQ)瓶颈 $\hat{u}_t=\mathcal{Q}_{\mathrm{FSQ}}(u_t)$,将信息约束为离散有界潜在表示,降低对高动态参考轨迹局部不一致性的敏感度。
三、阶段一:通用运动跟踪训练
3.1 运动数据分层
运动集 $\mathcal{D}$ 包含LAFAN1、AMASS和自采Xsens惯性动捕数据,重定向到Unitree G1形态并以50Hz重采样。训练基础策略 $\pi_{\mathrm{base}}$ 后,将每条运动序列切分为10秒片段,用5次随机rollout评估完成率。完成率≥80%的归入已掌握运动集 $\mathcal{D}_m$(2.82小时),其余归入挑战运动集 $\mathcal{D}_c$(0.28小时)。
| 运动集 | 符号 | 时长(小时) | 训练角色 |
|---|---|---|---|
| 已掌握 | $\mathcal{D}_m$ | 2.82 | 能力巩固与广覆盖 |
| 挑战 | $\mathcal{D}_c$ | 0.28 | 高动态技能获取 |
3.2 自适应运动采样
采用自适应运动采样,将更多rollout初始化分配给难以跟踪的时间段。每个时间段维护失败统计的指数移动平均:
四、阶段二:渐进式高动态技能扩展
4.1 PACE:渐进式获取与巩固
PACE通过非对称环境分配解决稳定性-可塑性困境:$\xi=0.8$ 的环境用于挑战运动集 $\mathcal{D}_c$ 的技能获取,$1-\xi=0.2$ 用于已掌握运动集 $\mathcal{D}_m$ 的能力巩固。巩固环境均匀采样 $\mathcal{D}_m$ 维持广覆盖,获取环境自适应采样 $\mathcal{D}_c$ 聚焦难点。
关键创新是巩固约束:在巩固环境中约束策略不过度偏离基础策略。巩固损失 $\mathcal{L}_{\mathrm{con}}$ 限制策略漂移,权重 $\lambda_{\mathrm{con}}$ 随训练进度自适应调整——训练初期较强以保护已掌握能力,后期逐渐放松以允许更充分的技能获取。
4.2 STAR:段感知轨迹优势重采样
自适应采样仅在时间段级别分配采样机会,无法区分同一困难时段内不同质量的轨迹尝试。STAR将时间段级难度信息转化为转移级难度权重,并进行难度条件优势归一化:
高难度组 $H$ 和其余组 $E$ 独立归一化优势,避免共享统计量掩盖高难度区域的相对学习潜力。然后STAR评估连续轨迹片段的改进潜力,按片段平均原始优势 $q_{b,\tau}$ 排序,每个高难度时段保留top 5%的片段:
选中的片段以 $\rho_{\mathrm{star}}=0.25$ 的比例混入PPO小批量,使获取侧更新聚焦于高难度时段中改进潜力更大的轨迹经验。
五、实验结果
5.1 通用与专业运动跟踪
| 方法 | 源内成功率↑ | 未见运动成功率↑ | 挑战运动成功率↑ |
|---|---|---|---|
| ExBody2 | 85.63 | 66.78 | - |
| BeyondMimic | 94.72 | 85.53 | 76.5 |
| Extreme-RGMT (Stage I) | 96.12 | 89.47 | 78.2 |
| Extreme-RGMT (Full) | 96.05 | 89.82 | 90.9 |
完整方法在保持通用能力(源内96.05%、未见89.82%)的同时,将挑战运动成功率从78.2%提升到90.9%,显著优于仅训练Stage I的版本。这验证了PACE+STAR在保留通用能力的同时有效获取高动态技能。
5.2 STAR的跨数据源效果
| 来源 | 无STAR | 完整方法 | 提升 |
|---|---|---|---|
| AMASS运动 | 82.2 | 90.9 | +8.7 |
| 自采Xsens运动 | 45.5 | 86.3 | +40.8 |
STAR在Xsens运动上的增益远大于AMASS(+40.8 vs +8.7)。Xsens惯性动捕数据质量较低,更易受根漂移、局部姿态不一致和接触时序错误影响,其高动态片段更依赖有限有效经验的高效利用。STAR通过优先高优势片段,在关键时段强化有效学习信号。
5.3 真实世界部署
| 评估 | 统一编码 | 无FSQ | 无STAR | 完整方法 |
|---|---|---|---|---|
| AMASS回放 | 85.0 | 80.0 | 80.0 | 90.0 |
| Xsens遥操(高动态) | 75.0 | 65.0 | 45.0 | 85.0 |
| Xsens遥操(通用) | 90.0 | 100.0 | 100.0 | 100.0 |
完整方法在固定回放和高动态遥操中均最强,同时保持通用遥操100%成功率。无STAR变体在高动态Xsens遥操上退化最严重(45.0%),突显在惯性动捕输入含噪声时优先有效轨迹经验的重要性。
六、方法工作流
七、局限性与讨论
八、总结与启示
Extreme-RGMT的核心贡献在于将持续学习范式引入人形机器人高动态技能获取。两阶段设计的深刻之处在于:先建立广覆盖的通用基础,再通过非对称的获取-巩固机制渐进扩展能力边界。PACE的巩固约束直接对应持续学习中的知识保持需求——防止新技能学习侵蚀已掌握能力;STAR则解决了高动态运动中有效经验极度稀缺的核心矛盾——不是简单增加困难时段的采样频率,而是在轨迹片段级别识别和优先真正有学习价值的经验。
STAR在Xsens数据上+40.8%的惊人增益揭示了一个重要洞察:数据质量越低、噪声越大,智能的经验利用就越关键。Xsens惯性动捕数据的根漂移和局部不一致性使其高动态片段更易失败,但也正是这些失败-恢复边界蕴含了最密集的学习信号。FSQ瓶颈的设计同样体现了对真实世界噪声的鲁棒性考量——通过将命令表示约束为离散有界空间,降低对参考轨迹局部误差的敏感度。
真实世界部署中,策略能直接执行训练语料中不存在的高动态运动(通过在线Xsens输入),这表明学到的不是简单的运动记忆,而是可泛化的高动态控制能力——将通用人形运动跟踪控制器推向人类专家级高动态运动能力。



