Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

步态优化人形机器人ZMP

HumoSlope:物理引导的生物力学步态自适应实现人形陡坡行走

两阶段框架:Stage I 用坡面自适应 ZMP 正则化建立平衡先验,Stage II 用生物力学步态适配器(BSGA)根据地形描述符调节质心高度和下肢协调——上坡髋驱动、下坡膝制动。盲感知在 Unitree G1 上实现 36° 陡坡行走。

Xuanyu Chen, Mohan Liu, Dengchen Mei, Zhihao Gu, Haitian Zhang, Kaimin Mao, Haiyue Zhu, Shijun Yan, Lin Wang2026年7月8日3 分钟阅读
EN

HumoSlope:极端斜坡地形人形机器人运动的物理引导生物力学步态适配

作者:Xuanyu Chen, Mohan Liu, Dengchen Mei, Zhihao Gu, Haitian Zhang, Kaimin Mao, Haiyue Zhu, Shijun Yan, Lin Wang  |  机构:南洋理工大学 & A*STAR  |  arXiv:2607.07830v1


一句话总结

本文提出 HumoSlope,一个两阶段物理引导框架,通过斜坡自适应 ZMP 正则化器(Stage I)和生物力学斜坡步态适配器 BSGA(Stage II),使人形机器人能在极端斜坡地形(最高 36° 仿真 / 32.1° 真实草坡)上实现纯本体感知的鲁棒盲行运动,同时避免蹲伏步态退化。


研究背景与动机

无模型强化学习已使人形机器人运动取得显著进展,策略能穿越楼梯、踏石和跑酷障碍。然而,连续陡坡作为专门的运动体制仍几乎未被探索,尽管它在日常环境中极为常见(坡道、草坡、户外不平路径、自然山坡)。

斜坡与离散地形的本质区别在于:斜坡对全身施加持续重力偏置,而非仅需短时落脚选择。随着坡度增加,机器人必须在保持动态稳定性的同时控制姿态,应对质心投影偏移、支撑几何变化和持续下肢载荷。在通用奖励公式下,策略会收敛到保守的低质心蹲伏步态(类似"Groucho 步态"),虽然降低了翻倒风险,但导致姿态退化、关节过载,并限制了坡度穿越能力的上限。

Figure 1: 真实斜坡运动

图1:真实世界斜坡运动。机器人穿越草坡达 62.7%(32.1°),并泛化到湿滑表面、草地、波浪地形和水平走道。

本文的核心洞察是:鲁棒斜坡运动不仅需要动态稳定性,还需要斜坡条件化的姿态控制。为此提出通过不对称生物力学步态调制实现斜坡自适应运动平衡。


问题形式化

将运动问题建模为部分可观测马尔可夫决策过程(POMDP),采用非对称 actor-critic 观测:

$$\langle\mathcal{S},\mathcal{A},\mathcal{P},\mathcal{R},\mathcal{O}^{\pi},\mathcal{O}^{V},\gamma\rangle$$

其中 actor 观测 $\mathbf{o}_t^{\pi} \in \mathcal{O}^{\pi}$ 仅包含可部署的本体感知信号(基座角速度、投影重力、速度指令、关节状态、动作历史),部署时无需外感知。训练时 critic 观测 $\mathbf{o}_t^V \in \mathcal{O}^V$ 额外包含特权状态和地形信息(真实基座线速度、压缩高度扫描 $\mathcal{H}_{49}$、PCA 地形描述符 $\boldsymbol{\phi}_5^{\mathrm{PCA}}$)。动作为关节位置残差目标,由底层 PD 控制器跟踪。Actor $\pi_\theta$ 用 PPO 优化,critic $V_\phi$ 使用特权信息。


方法详解

Stage I:斜坡自适应 ZMP 正则化

现有 ZMP/RL 奖励通常在世界水平参考面上评估平衡偏差。但在斜坡上,水平参考面与实际支撑面不对齐,引入几何偏差。HumoSlope 在局部倾斜支撑面上评估 ZMP 偏差。

首先定义接触力加权支撑锚点,在两脚间根据支撑力插值:

$$\mathbf{p}_{\mathrm{sa}}=\frac{(F_{L}+\varepsilon)\mathbf{p}_{L}+(F_{R}+\varepsilon)\mathbf{p}_{R}}{F_{L}+F_{R}+2\varepsilon}$$

从主支撑脚估计局部支撑面法向 $\mathbf{n}_c = \mathbf{R}(\mathbf{q}_{\mathrm{foot}})[0,0,1]^\top$,用质点表观比力 $\mathbf{F}_{\mathrm{app}} = \mathbf{g} - \mathbf{a}_{\mathrm{com}}$。地形对齐 ZMP 位置通过射线 $\mathbf{p}_{\mathrm{com}} + t\mathbf{F}_{\mathrm{app}}$ 与局部支撑面的交点求得:

$$t = \frac{(\mathbf{p}_{\mathrm{sa}}-\mathbf{p}_{\mathrm{com}})^{\top}\mathbf{n}_{c}}{\mathbf{F}_{\mathrm{app}}^{\top}\mathbf{n}_{c}}, \quad \mathbf{p}_{\mathrm{zmp}}^{\mathrm{ta}}=\mathbf{p}_{\mathrm{com}}+t\mathbf{F}_{\mathrm{app}}$$

偏差 $d_{\mathrm{zmp}}^{\mathrm{ta}} = \|\mathbf{p}_{\mathrm{zmp}}^{\mathrm{ta}}-\mathbf{p}_{\mathrm{sa}}\|_2$ 被塑造为密集奖励:

$$r_{\mathrm{zmp}}^{\mathrm{ta}}=\exp\left(-d_{\mathrm{zmp}}^{\mathrm{ta}}/\sigma_{\mathrm{zmp}}\right)$$

该正则化仅在 Stage I 使用,帮助 actor 获得地形一致的平衡先验。

Stage II:生物力学斜坡步态适配器(BSGA)

Figure 2: 框架概览

图2:两阶段框架概览。Actor 部署时仅用本体感知;训练时特权 critic 和奖励门控使用地形描述符。

对射线投射高度扫描点应用 PCA,投影法向至机器人航向帧,得到纵向坡度角 $\theta_{\mathrm{slope}}$ 和横坡角 $\theta_{\mathrm{bank}}$。五维 PCA 地形描述符为:

$$\boldsymbol{\phi}^{\mathrm{PCA}}_{5}=\left(\theta_{\mathrm{slope}},\theta_{\mathrm{bank}},|\theta_{\mathrm{slope}}|,\mathbbm{1}_{\mathrm{up}},\mathbbm{1}_{\mathrm{down}}\right)$$

BSGA 核心奖励由三个描述符条件化的软奖励先验组成:

$$r_{\mathrm{BSGA}}^{\mathrm{core}}=w_{\mathrm{com}}\,r_{\mathrm{com}}+w_{\mathrm{bio}}\,r_{\mathrm{bio}}+w_{\mathrm{swing}}\,r_{\mathrm{swing}}$$

CoM 分支:用斜坡条件化目标高度替代固定高度参考。设 $\rho_{\mathrm{slope}} \in [0,1]$ 为从 $|\theta_{\mathrm{slope}}|$ 导出的归一化坡度强度:

$$h_{\mathrm{tgt}}=h_{\mathrm{nom}}\cos(|\theta_{\mathrm{slope}}|)+\rho_{\mathrm{slope}}\left(b_{\mathrm{up}}\mathbbm{1}_{\mathrm{up}}+b_{\mathrm{down}}\mathbbm{1}_{\mathrm{down}}\right)$$

其中 $h_{\mathrm{nom}}$ 为平地 CoM 高度参考,$b_{\mathrm{up}}, b_{\mathrm{down}}$ 为上坡/下坡的非对称偏移。$r_{\mathrm{com}}$ 软惩罚 CoM 高度与 $h_{\mathrm{tgt}}$ 的偏差。

生物力学分支:编码上坡/下坡不对称性——上坡需髋主导的正功推进,下坡需膝主导的制动和负功:

$$r_{\mathrm{bio}}=\frac{w_{\mathrm{up}}\,r_{\mathrm{hip}}+w_{\mathrm{down}}\,r_{\mathrm{down}}}{w_{\mathrm{up}}+w_{\mathrm{down}}}, \quad r_{\mathrm{down}}=\lambda_{\mathrm{brake}}\,r_{\mathrm{brake}}+\lambda_{\mathrm{stride}}\,r_{\mathrm{stride}}$$

其中 $r_{\mathrm{hip}}$ 偏置上坡向髋主导推进,$r_{\mathrm{down}}$ 结合受控膝主导制动和减少过度跨步。

摆动腿分支:提供校准的斜坡相关髋俯仰参考:

$$q_{\mathrm{hip,swing}}^{\star}(\theta_{\mathrm{slope}})=\beta_{0}+\beta_{1}\,\mathrm{clip}\left(\theta_{\mathrm{slope}},0,\theta_{\mathrm{clip}}\right)$$

系数从 Stage I 回滚中按接触力过滤的上百分位髋俯仰趋势拟合。$r_{\mathrm{swing}}$ 在摆动相软跟踪此目标。

flowchart TD
    A["Stage I: 混合地形训练
斜坡自适应ZMP正则化"] --> B["平衡先验 actor
热启动"] B --> C["Stage II: 斜坡轨道训练
BSGA 姿态/步态适配"] C --> D["特权 critic: PCA描述符 + 高度扫描"] C --> E["奖励门控: CoM高度 + 生物力学 + 摆动腿"] D --> E E --> F["部署: 纯本体感知 actor
无需外感知"]

实验结果

在 Isaac Lab 中基于 Unitree G1 人形机器人训练,使用 PPO 和数千并行环境,单卡 NVIDIA RTX 5090 GPU。在 35m 留出复合斜坡轨道上评估,包含平坦、上坡、下坡、平台段,五种地表变体(光滑、波浪、倾斜、粗糙、条纹)。

方法输入0° SR10° SR20° SR30° SR最大坡度
URL本体感知99.7%97.7%37.5%0.0%47% (25°)
FastTD3本体感知100%100%77.3%0.0%70% (35°)
Gallant深度感知99.7%90.7%78.9%0.0%60% (31°)
HumoSlope本体感知100%100%100%77.1%73% (36°)

在 0°–20° 范围内,HumoSlope 达到近乎完美的成功率,且成功试验的穿越时间最短。在最具挑战性的 30° 坡度上,所有基线均无法完成轨道,而 HumoSlope 仍达 77.1% 成功率和 27.54m 平均距离。在额外坡度极限扫描中达到最高 73%(36°)。

Figure 3: ZMP偏移示意

图3:斜坡上水平参考偏差 $d_{\mathrm{horiz}}$ 与地形对齐偏差 $d_{\mathrm{zmp}}^{\mathrm{ta}}$ 不同。

消融变体SR (20°)MXDCoT$\bar{h}_{\mathrm{com}}$$\tau_{\mathrm{knee}}^{\mathrm{pk}}$
完整模型98.2%31.751.3800.669117.9
仅 Stage I100%32.200.9250.53582.9
无斜坡自适应 ZMP55.6%22.081.9060.720115.5
无 BSGA critic 线索93.2%30.561.6760.72783.4
无 BSGA 奖励先验26.9%18.091.6030.722108.9
无 BSGA0.0%9.591.6210.659136.4

消融实验表明:仅 Stage I 虽然在 20° 达到 100% 成功率,但 CoM 高度更低、穿越时间更长,说明是保守蹲伏策略。移除斜坡自适应 ZMP 后成功率大幅下降。移除整个 BSGA 导致完全失败,且 CoM 高度低、峰值膝力矩最大(136.4),符合蹲伏姿态退化和失控下肢载荷的特征。

Figure 4: 姿态对比

图4:HumoSlope 在不同地形段展现不同全身姿态——上坡前倾、平地近直立、下坡轻微后仰;URL 基线呈现蹲伏 Groucho 步态。

真实世界实验

在 Unitree G1 上部署于六种户外地形:沥青坡、波浪坡、路侧坡、两块草坡和日常走道。部署 actor 使用与仿真相同的本体感知观测,无在线外感知。草坡平均坡度从 5.2° 到 32.1°,局部测量达 36.4°。HumoSlope 实现了盲连续穿越,甚至在雨后湿滑条件下也能穿越沥青和波浪坡。

Figure 5: 生物力学诊断

图5:HumoSlope 保持更高 CoM 高度并有温和坡度依赖调制;URL 保持低质心蹲伏姿态。20° 轨道上 HumoSlope 显示更高上坡髋俯仰力矩并在下坡增加膝屈曲。


局限性

  1. 部署 actor 是盲的,无法预判即将到来的坡度转换,姿态调整仅在本体感知与地形交互后才出现。
  2. 在突变障碍、可变形表面或高度不规则户外地形上可能性能受限。
  3. 摩擦力归一化虽使不同坡度可比,但极端低摩擦场景(如冰面)未充分测试。

总结与展望

HumoSlope 通过两阶段物理引导框架实现了人形机器人在连续陡坡上的盲行运动。Stage I 用斜坡自适应 ZMP 正则化器学习地形一致平衡先验,Stage II 用 BSGA 门控生物力学姿态/步态/摆动腿先验。部署 actor 完全基于本体感知。实验表明在仿真和真实世界均实现了改进的鲁棒性和姿态适配。

金句:"鲁棒斜坡运动不仅需要动态稳定性,还需要斜坡条件化的姿态控制。"——将地形一致物理先验与描述符门控生物力学奖励适配相结合,是实现鲁棒人形斜坡运动的有效路径。未来工作将探索添加可选视觉感知以提供前瞻地形线索,同时保持本体感知斜坡适配能力。


深度解读由 RobotWorld paper-detail-generator 基于全文精读生成 | arXiv:2607.07830v1

相关论文