PAPER DEEP DIVE
使用选择性对抗运动先验的多步态人形机器人学习
在统一强化学习框架中为人形机器人学习多样化运动技能仍具挑战性,因为不同步态间稳定性和动态表达性的冲突需求。本文提出多步态学习方法,使人形机器人掌握五种不同步态——行走、正步、跑步、爬楼梯和跳跃——使用选择性对抗运动先验。
一、研究背景与动机
人形机器人在为人类设计的环境中操作具有巨大潜力,但实现这一潜力需要自适应地执行多种运动行为的能力。实际部署不仅需要步行以高效通行,还需要跑步以快速移动、跳跃以跨越间隙或障碍、爬楼梯以实现多层导航,以及正步走等特殊步态用于结构化或仪式性场景。每种步态对控制系统提出根本不同的要求:步行强调能效和稳定平衡,跑步需要快速发力生成和空中相位管理,跳跃要求短时间窗口内最大化垂直冲量,爬楼梯需要精确落脚和间隙控制,正步走需要持续伸腿和严格姿态约束。
核心挑战不仅在于单独获取每种步态,而在于在共享策略架构、观测空间和奖励结构的统一框架中学习它们。强化学习已成为学习复杂运动技能的引人注目的方法,但在多种步态下扩展RL引入新困难:策略必须调和跨行为的冲突动态,奖励函数必须在运动特性迥异的步态间保持有效,观测空间必须为所有行为编码充分信息。对抗运动先验(AMP)通过训练判别器区分智能体生成和参考运动片段来正则化策略,已被证明能减少关节抖动、改善落脚一致性。然而现有工作对所有行为统一施加AMP,而未探索AMP是否总是有益这一关键问题。
本文的核心洞察是:AMP的有效性关键取决于目标步态的性质。AMP擅长强化具有中等关节幅度的周期性、重复性运动模式(如步行、正步走、爬楼梯),但对于需要大关节偏移、快速加速和爆发动态的步态(如跑步、跳跃),AMP的正则化会过度约束运动。因此本文提出选择性AMP策略:在AMP有助的步态上应用,在AMP有碍的步态上省略。
二、核心贡献
本文的三个核心贡献:(1)一个统一RL框架,使用一致策略架构和基于正弦关节参考跟踪的奖励函数学习五种实用步态——步行、正步走、跑步、跳跃和爬楼梯。所有步态共享相同观测空间、网络结构和奖励公式,仅在参考轨迹参数和奖励权重上不同。(2)选择性AMP策略,对周期性、稳定性关键的步态施加AMP,对高度动态、敏捷的步态省略。(3)五种步态的全真实机器人验证,包含量化比较包括跟踪误差、收敛速度、成功/摔倒率和AMP与非AMP性能对比。

图1:多步态学习流水线总览。策略在仿真中根据步态类型有无AMP训练,然后部署到物理机器人。
三、RL问题形式化
每种步态学习任务被形式化为MDP,定义为元组 $(\mathcal{S}, \mathcal{A}, r, \gamma, \rho_0)$。五种步态共享相同MDP结构,仅在参考轨迹生成、奖励权重参数和AMP配置上不同。
状态空间:策略在每个时间步接收50维观测向量 $\mathbf{o}_t \in \mathbb{R}^{50}$,包括基座线速度(缩放2.0)、速度指令、相位编码 $[\sin(2\pi\phi_t), \cos(2\pi\phi_t)]$、基座角速度(缩放0.25)、投影重力向量、关节位置误差、关节速度(缩放0.05)和上一步动作。相位变量更新为:
$$\phi_{t+1} = (\phi_t + \Delta t / T_{\text{cycle}}) \bmod 1$$策略接收 $N=21$ 帧连续观测历史,堆叠为 $50 \times 21 = 1050$ 维输入,实现隐式速度和加速度估计。
动作空间:策略输出12维动作向量,对应12个驱动关节的目标位置偏移。目标关节位置计算为:
$$q_{\text{target}} = a_t \cdot k_{\text{action}} \cdot k_{\text{gain}} + q_{\text{default}}$$其中 $k_{\text{action}}$ 为动作缩放因子(步行/爬楼梯0.25,跑步0.3,正步走0.4),$k_{\text{gain}} = \tau_{\text{max}}/K_P$ 为归一化增益。目标位置发送至PD控制器:
$$\tau = K_P(q_{\text{target}} - q) - K_D \dot{q}$$策略以50Hz执行,PD控制器以200Hz运行。指数移动平均滤波器平滑动作,5-10步随机动作延迟模拟真实延迟。
四、参考轨迹设计
对于周期性步态(步行、正步走、跑步、爬楼梯),参考为正弦模式。相位信号 $s = \sin(2\pi\phi_t)$,左髋参考为 $q_{\text{ref}}^{\text{L,hip}} = -s \cdot \mathds{1}_{s<0}$,左膝参考为:
$$q_{\text{ref}}^{\text{L,knee}} = 2s \cdot \sigma \cdot \mathds{1}_{s<0}$$其中 $\sigma$ 为目标关节位置尺度(步行和跑步0.26,正步走0.28),右腿在 $s>0$ 时以相反符号镜像。每种步态通过其 $(T_{\text{cycle}}, \text{stance\_ratio})$ 对调制:步行(0.8s, 0.6)、正步走(0.7s, 0.45)、跑步(0.4s, 0.35)、爬楼梯(0.7s, 0.6)。
跳跃使用4.0s分段周期轨迹,包含五个阶段:蹲下($\phi<0.30$,$\sin^2$膝关节屈曲)、起跳(0.30-0.42,快速伸展)、飞行(0.42-0.48,保持伸展)、着陆(0.48-0.75,冲击吸收和恢复)、站立($\phi \geq 0.75$,默认姿态)。课程在2000-10000次PPO迭代中渐进增加蹲下深度。
五、统一奖励函数
五种步态共享统一奖励公式,总奖励为各项加权和:
$$r_{\text{total}} = \sum_i w_i r_i$$奖励项分四类:(1)关节跟踪奖励——对髋和膝关节使用双指数和:
$$r_{\text{track}} = 0.15 \sum_{j \in \{\text{hip,knee}\}} \sum_{i \in \{\text{L,R}\}} \left(e^{-4e_{ij}^2} + e^{-20e_{ij}^2}\right)$$其中 $e_{ij} = q_{ij} - q_{\text{ref},ij}$ 为关节误差。(2)基座平衡和姿态奖励——包括朝向奖励、高度奖励、线速度和角速度跟踪。(3)运动平滑性奖励——惩罚动作一阶和二阶变化、关节速度和力矩。(4)安全与步态特定奖励——摔倒终止条件(基座触地或横滚$>0.8$rad、俯仰$>1.0$rad),跳跃使用跳跃高度目标($w=150.0$,以0.275m为中心的高斯奖励)和垂直起跳速度($w=120.0$,分段非线性)。
关键设计原则:五种步态使用相同奖励公式,多样性源于参考规格、权重调优和步态特定项而非结构差异。
六、选择性AMP策略
AMP引入判别器网络 $D_\phi$ 训练以区分专家运动片段和策略生成的状态转换。判别器输出标量logit $D(s_t, s_{t+1})$,转换为奖励信号:
$$r_{\text{AMP}} = \alpha \cdot \max\left(0, 1 - \frac{1}{4}(D(s_t, s_{t+1}) - 1)^2\right)$$该奖励与任务奖励线性插值:
$$r_{\text{combined}} = (1-\beta) \cdot r_{\text{AMP}} + \beta \cdot r_{\text{task}}$$其中 $\alpha$ 为每步态AMP奖励幅度系数,$\beta \in [0,1]$ 控制AMP正则化与任务优化的平衡。判别器使用二元交叉熵损失加梯度惩罚训练:
$$\mathcal{L}_D = \mathbb{E}_{\text{policy}}[(D+1)^2] + \mathbb{E}_{\text{expert}}[(D-1)^2] + \lambda \cdot \mathbb{E}_{\text{expert}}[\|\nabla_{(s,s')} D\|^2]$$其中梯度惩罚系数 $\lambda=10$。
选择性配置:步行和爬楼梯使用 $\alpha=0.3, \beta=0.8$;正步走使用 $\alpha=0.6, \beta=0.7$(更高$\alpha$强制直腿风格);跑步和跳跃使用 $\alpha=0.0, \beta=1.0$(完全禁用AMP),跳跃额外禁用对称损失以允许起跳时非对称力生成。
| 步态 | $\alpha$ | $\beta$ | 对称损失 |
|---|---|---|---|
| 步行 | 0.3 | 0.8 | 是 |
| 正步走 | 0.6 | 0.7 | 是 |
| 跑步 | 0.0 | 1.0 | 是 |
| 爬楼梯 | 0.3 | 0.8 | 是 |
| 跳跃 | 0.0 | 1.0 | 否 |
七、训练流程与域随机化
使用PPO算法在Isaac Gym中训练4096个并行环境。Actor网络使用MLP(隐藏层[512,256,128],ELU激活),PPO运行5个学习epoch,4个mini-batch,学习率$5 \times 10^{-4}$,折扣因子$\gamma=0.99$,GAE参数$\lambda=0.95$。
为弥合仿真到现实差距,训练中施加广泛域随机化:摩擦系数[0.2,1.5]、基座质量扰动[-2,+5]kg、连杆惯性缩放[0.5,1.8]、质心位移[-0.1,0.1]m、电机强度[0.7,1.0]、PD增益缩放[0.8,1.2]、关节摩擦和阻尼、5-10步动作延迟、外部扰动脉冲(最大线速度2.0m/s)。
八、Sim-to-Real零样本迁移
训练好的策略以零样本方式部署到物理人形机器人——无需在真实硬件上微调。部署流程包括:(1)策略导出为ONNX格式(含观测归一化器),通过ONNX Runtime在机器人机载计算机上加载;(2)策略以50Hz在机载运行,从外部IMU和关节编码器接收本体感知观测,由于基座线速度在硬件上无法直接测量,对应观测通道置零,依赖观测历史堆栈隐式捕获速度信息;(3)PD控制器以500Hz根据策略输出的目标位置计算关节力矩,50Hz截止频率的一阶低通滤波器平滑策略动作。
九、实验结果——五种步态总体性能
在统一策略结构、共享观测设计和共同奖励组织下,框架学习并部署了五种运动模式。下表总结量化性能:
| 步态 | 关节跟踪 | 收敛步数 | 成功率 | 训练误差 | 姿态稳定性 |
|---|---|---|---|---|---|
| 步行 | 0.40 | 2500 | 95% | 10.0 | 2.3 |
| 正步走 | 0.94 | 2500 | 97% | 5.4 | 1.2 |
| 爬楼梯 | 1.00 | 5200 | 85% | 1.0 | 0.95 |
| 跑步 | 0.50 | 3000 | 96% | 4.8 | 1.3 |
| 跳跃 | 15.5 | 3000 | 83% | 6.0 | 8.6 |
正步走在AMP辅助下达到最高的97%成功率和最低的0.94跟踪误差,AMP有效强化了高抬腿和直膝摆动的独特风格。爬楼梯收敛最慢(5200步)但训练误差最低,反映了地形课程学习的效果。跳跃成功率最低(83%)且姿态稳定性最差(8.6),反映了爆发性运动的固有难度。

图2:五种学习步态在真实机器人上的代表性图像序列:步行、爬楼梯、正步走、跳跃和跑步。
十、AMP效果分析
AMP对具有清晰周期结构和稳定性优先目标的步态最有效,但对高度动态和强爆发性运动可能变为限制。以正步走(有AMP)和跳跃(无AMP)为代表案例:在AMP下,正步走展现总奖励快速增长、低训练误差和失败率迅速衰减——AMP的主要贡献不仅是更高的终端回报,而是强化周期结构和风格一致性。

图3:AMP对比训练曲线。(a)有AMP的正步走。(b)无AMP的跳跃。每面板报告总奖励、训练误差和失败率。
对于跑步,强AMP先验不一定使策略无法运动,但会增加行为保守性,使学习行为更像平滑快走而非真正具有清晰空中相位的爆发性步态。跳跃在无AMP设置下仍实现持续奖励增长和低失败率,同时关节跟踪信号稳步改善——这表明当表达性探索被保留时,仅任务奖励即可驱动有效的起跳、飞行和着陆恢复。
十一、方法流程图
50维观测+12维动作"] --> B{"步态类型判断"} B -->|"周期性/稳定性关键"| C["启用AMP
步行/正步走/爬楼梯"] B -->|"高度动态/敏捷"| D["禁用AMP
跑步/跳跃"] C --> E["正弦参考轨迹生成"] D --> E E --> F["统一奖励函数
跟踪+平衡+平滑+安全"] F --> G["PPO训练
Isaac Gym 4096环境"] C --> G D --> G G --> H["域随机化
摩擦/质量/惯性/延迟"] H --> I["ONNX导出
零样本迁移"] I --> J["物理机器人部署
50Hz策略+500Hz PD"]
十二、真实机器人鲁棒性
从三个角度评估真实机器人鲁棒性:长时间连续性、重复试验一致性和轻度外部扰动下恢复。步行和正步走强调节奏一致性和受控躯干振荡;爬楼梯强调足部间隙、踏步放置和楼梯转换后姿态恢复;跑步强调快速短支撑切换中的稳定性;跳跃强调同步起跳、空中姿态控制、着陆吸收和返回下一个运动周期。真实机器人部署表明学习策略不限于仿真中视觉合理的运动,而是展现出物理执行所需的连续性和可重复性。
十三、局限性
本文的局限性包括:(1)跳跃步态的成功率最低(83%)且姿态稳定性最差(8.6),反映了爆发性运动的固有难度和着陆恢复的挑战;(2)所有步态在12自由度下半身平台上验证,未扩展到全身人形机器人;(3)基座线速度在硬件上无法直接测量,置零后依赖观测历史隐式估计,可能在高速运动中引入误差;(4)训练配置需要按步态手动调优参数(如$k_{\text{action}}$、$\sigma$、$T_{\text{cycle}}$),自动化程度有限。
十五、训练配置深度分析
五种步态的训练配置反映了其运动特性的本质差异。步行、正步走和跑步主要在平坦或低复杂度地形上训练,爬楼梯在三角网格楼梯上配合课程学习训练,跳跃在平坦地形上训练以强调垂直冲量生成、空中稳定和着陆恢复。环境数量也因步态而异:步行、正步走和爬楼梯使用4096个并行环境,而跑步和跳跃使用2048个——后者减少环境数是为了降低高动态运动的训练不稳定性,因为爆发性动作的探索需要更谨慎的梯度更新。
最大迭代次数同样差异化:步行和爬楼梯40001次,正步走20001次(AMP加速收敛使其更快达到稳定),跑步40001次,跳跃仅11000次。跳跃使用较少迭代是因为其分段轨迹设计提供了更强的结构性先验,且跳跃课程在早期即开始增加蹲下深度,使策略快速进入有效的起跳-着陆模式。跳跃还使用了稍高的熵系数以适应更强的探索需求,这是五种步态中唯一超参数调整的例外。
PPO的超参数在所有步态间共享:5个学习epoch、4个mini-batch、学习率$5 \times 10^{-4}$、KL散度目标0.01(自适应学习率调度)。物理步长0.005s,策略每4个物理步更新一次,有效控制周期0.02s。这些共享设置证明了统一框架的有效性——通过参考轨迹、奖励权重和AMP配置的差异化而非架构变化来实现步态多样性。
十六、PD控制器增益的步态特化
PD控制器的增益配置因步态而显著不同,反映了各步态对关节刚度和阻尼的不同需求。步行类步态的 proportional gains $K_P$ 从75到280 N·m/rad(髋俯仰和膝280、髋滚转240、髋偏航75、踝关节75),derivative gains $K_D$ 从5到14 N·m·s/rad。正步走采用显著更高的刚度(髋俯仰450、膝800、髋滚转300、髋偏航150、踝关节200)和阻尼(膝$K_D$高达40),以支撑其独特的直腿伸展和高抬腿姿态——这些高增益确保腿部在摆动相中保持伸直,避免因重力或惯性导致的屈曲。
跑步使用中等增加的增益(髋俯仰和膝300、髋滚转240、髋偏航100、踝关节80),平衡了快速发力生成和关节稳定性。计算力矩被截断到每关节最大限制(60-150 N·m),这些限制在URDF effort字段中指定。力矩限制的差异化设计——膝关节最高(150 N·m)以支撑跑步和跳跃的爆发力需求,髋偏航最低(60 N·m)因为该方向不需要大力矩——体现了对物理机器人执行器容量的精细利用。
十七、AMP判别器架构与参考数据
AMP判别器采用3层MLP架构,隐藏维度[1024,512,256],ReLU激活函数。输入为当前状态 $s_t$ 和下一状态 $s_{t+1}$ 的拼接,捕获单个状态转换。判别器输出标量logit,通过AMP奖励公式转换为策略奖励信号。判别器使用二元交叉熵损失加梯度惩罚训练,梯度惩罚系数 $\lambda=10$ 确保判别器决策边界的平滑性,防止过拟合到参考数据的特定噪声模式。
参考运动数据由捕获的人类运动序列组成,处理为200,000个预加载状态转换。这些参考数据为步行、正步走和爬楼梯提供了丰富的周期性运动模式,但对于跑步和跳跃等高度动态运动,可用的人类参考数据有限,且其运动幅度可能无法覆盖机器人执行器的完整能力范围。这正是选择性AMP策略的数据层面动机——当参考数据无法充分覆盖目标运动空间时,AMP判别器的正则化会错误地惩罚策略探索执行器能力边界的必要运动极端值。
十九、评估指标体系的设计理念
本文的评估指标体系从优化和执行两个视角全面评估多步态策略,包含关节跟踪质量、收敛速度、任务可靠性、训练稳定性和姿态稳定性五个维度。关节跟踪指标反映策略保持步态预期运动学组织的能力——对于步行、正步走和爬楼梯,主要反映支撑相和摆动相之间的协调;对于跑步和跳跃,反映在高速或爆发动态下维持目标运动模式的能力。收敛步数量化达到稳定状态所需的优化成本——步态在更少迭代内稳定说明在统一公式下更易优化,需要更多迭代的步态对接触切换、姿态恢复或时间协调提出更强要求。
执行时的成功率和摔倒率描述任务可靠性——高成功率表明机器人能重复维持期望步态,高摔倒率通常表明对初始条件、节奏控制或动态恢复的敏感性。训练误差表征优化的平滑性——较低误差通常对应更稳定的参数更新,持续较大误差暗示更强振荡和更高不确定性。姿态稳定性衡量全身控制质量——更高的姿态稳定性对应更小的躯干振荡、更平滑的横滚-俯仰调节和更一致的相位转换。这些指标的综合运用使评估超越"运动是否出现"的二元判断,深入到运动是否遵循预期结构、训练是否稳定收敛、执行是否可控的全面评估。值得注意的是,这些指标并非简单地跨步态归一化比较,而是旨在表征每种步态在统一框架下的训练和执行行为特征。由于奖励组成和任务难度跨步态不同,各指标值应结合步态特性解读——例如跳跃的关节跟踪值15.5远高于步行的0.40,但这不意味着跳跃跟踪质量更差,而是反映了爆发性运动中关节误差的绝对值天然更大的物理现实。类似地,爬楼梯的85%成功率虽低于正步走的97%,但考虑到楼梯地形中的精确落脚需求和连续的高度变化,这一成功率已具有实际部署价值。
二十、总结
本文提出了一个统一RL框架用于多步态人形运动,配合选择性AMP策略。在共同策略架构和奖励公式下,方法学习了步行、正步走、爬楼梯、跑步和跳跃五种代表性步态,并迁移到物理人形平台。结果表明运动先验对周期性、稳定性导向的步态有益,但应对高度动态行为减弱或移除。框架通过统一RL公式、步态依赖先验选择和真实机器人验证,为多步态学习提供了实用且可复现的基线。研究提示,实用人形移动不仅依赖更强策略,还需要在共享学习框架内组织多样行为的原则性方法。



