PAPER DEEP DIVE
基于感知内部模型学习人形运动
与四足机器人可以使用盲策略导航多种地形不同,人形机器人由于高自由度和本质上不稳定的形态,需要精确感知才能稳定运动。然而引入感知信号往往会给系统引入额外干扰,降低鲁棒性、泛化性和效率。本文提出感知内部模型解决这些问题。
论文元信息
标题:Learning Humanoid Locomotion with Perceptive Internal Model(基于感知内部模型的人形机器人运动学习)
作者:Junfeng Long, Junli Ren, Moji Shi, Zirui Wang, Tao Huang, Ping Luo, Jiangmiao Pang
机构:上海人工智能实验室、香港大学、浙江大学、上海交通大学
项目页面:junfeng-long.github.io/PIM
一句话总结
本文提出感知内部模型(PIM),通过将 LiDAR 高程图作为感知输入融入混合内部模型(HIM)的状态估计中,使人形机器人能在 3 小时内完成训练并零样本部署到 Unitree H1 和 Fourier GR-1 上,实现连续爬楼梯(成功率超过 90%)及跨越各种复杂地形。
研究背景与动机
与四足机器人可以用"盲"策略(仅靠本体感知信息)在多样地形上导航不同,人形机器人由于自由度高、形态固有不稳定,需要精确的感知信息才能实现稳定运动。然而,将感知信号引入控制系统往往会带来额外扰动,可能降低系统的鲁棒性、泛化性和效率。这是人形机器人运动控制面临的核心矛盾:不引入感知,机器人在复杂地形上容易摔倒;引入感知,又会带来域间差距和计算开销。
现有方法大多采用"盲"策略或多阶段训练范式。盲策略只能让机器人在平坦地面和轻微不平的地形上行走,遇到楼梯等需要精确落脚点的场景就会摔倒。一些方法依赖先验运动轨迹来实现类人行走,但难以应对挑战性地形。Humanoid Parkour Learning 虽然利用了感知信息,但无法应对连续楼梯等需要精细落脚点的地形,因为它通过额外训练阶段模拟硬件噪声,牺牲了感知精度。多阶段训练过程计算昂贵且复杂,难以快速迭代。
另一个关键问题是仿真到现实的感知差距。在仿真中渲染深度图像需要额外计算内存和效率成本,而且仿真深度图与真实相机数据之间存在难以弥合的域间差距。大多数方法直接编码深度图或原始点云,这种方式容易受到相机移动和噪声的影响。相机在机器人行走过程中会随身体晃动,导致深度图不稳定,点云也会因振动而抖动,这些扰动会被策略网络放大,影响控制效果。
本文的核心洞察是:不直接使用深度图或点云,而是构建一个以机器人为中心的持续更新的高程图作为感知表示。这种表示方式有三个优势:第一,高程图考虑了里程计信息并持续维护局部地图,让机器人能清晰感知脚下地形,不受相机瞬时抖动影响;第二,仿真中无需渲染深度图,直接查询地形高度即可,引入的计算开销极小;第三,高程图对传感器移动和噪声更鲁棒,因为它是一种经过滤波和累积的表示。基于此,作者提出了感知内部模型(PIM),在混合内部模型(HIM)的基础上将感知信息融入状态估计。
作者希望 PIM 能够作为未来人形机器人控制方法的基础算法。该方法仅需单阶段训练,3 小时内即可在 RTX 4090 上完成,并支持零样本部署到不同的人形机器人平台上。这一训练效率远超需要多阶段训练的方法,使得快速迭代和实验成为可能。
预备知识
理解本文需要掌握混合内部模型(HIM)的基本原理。HIM 是一种基于对比学习的状态估计方法,它从本体感知观测历史中预测机器人下一步的线速度和潜在状态。线速度通过简单的回归训练到地面真值,下一步本体感知信息通过批级对比学习在潜在空间中预测——将同一轨迹的当前和未来观测作为正样本对,其他轨迹的样本作为负样本对,通过类似 SwAV 的交换分配任务优化。HIM 支持批级学习、单阶段训练和高训练效率,但仅使用本体感知信息,在复杂地形上估计精度不足。
另一个关键概念是发散运动分量(DCM),它是倒立摆模型中描述平衡状态的关键量:$\xi = \theta + \dot{\theta}/\omega$,其中 $\theta$ 为俯仰角,$\omega$ 为自然频率。DCM 的变化率直接反映系统的平衡趋势——如果 DCM 发散,系统将失去平衡。在本文中,PIM 利用感知信息来更准确地预测 DCM 相关的状态量。
系统架构
整个框架基于 HIM,PIM 在其基础上增加了感知信息用于状态预测。系统输入包括本体感知信息和感知信息,通过 PIM 进行状态估计(预测线速度和潜在状态),再由 PPO 策略网络输出动作。训练在仿真中进行,推理时使用真实 LiDAR 高程图替代仿真中的地面真值高度。这个设计的巧妙之处在于:仿真中直接使用地面真值高度图作为感知输入,避免了渲染深度图的计算开销和域间差距;推理时使用真实传感器构建的高程图,与仿真中的地面真值高度图天然对齐。

图2:PIM 框架总览。感知信息被整合到状态预测器中,实现更全面准确的状态估计
观测设计
策略观测 $\mathbf{o}_t$ 由四部分组成:速度指令 $\mathbf{c}_t=[v_x^c, v_y^c, \omega_{yaw}^c]$、本体感知信息(关节位置 $\theta_t$、关节速度 $\dot{\theta}_t$、基座角速度 $\omega_t$、重力方向 $\mathbf{g}_t$)、感知信息 $\mathbf{p}_t$(高程图采样点)以及上一时刻动作 $\mathbf{a}_{t-1}$。观测被分为非感知部分 $\mathbf{o}_t^n = [\mathbf{c}_t, \omega_t, \mathbf{g}_t, \theta_t, \dot{\theta}_t, \mathbf{a}_{t-1}]$ 和感知部分 $\mathbf{o}_t^p = [\mathbf{p}_t]$。Critic 网络在训练时可以访问特权信息如线速度 $v_t$,以提供更准确的状态值估计。这种非对称 Actor-Critic 设计让策略网络不依赖特权信息,但训练时可以利用它加速收敛。
本体感知观测定义为:
$$ \mathbf{o}^{n}_{t}=[\mathbf{c}_{t},\,\mathbf{\omega}_{t},\,\mathbf{g}_{t},\,\mathbf{\theta}_{t},\,\dot{\mathbf{\theta}}_{t},\,\mathbf{a}_{t-1}] $$
其中命令向量 $\mathbf{c}_{t}=[v_{x}^{c},v_{y}^{c},\omega_{\text{yaw}}^{c}]$,感知观测 $\mathbf{o}^{p}_{t}=[\mathbf{p}_{t}]$ 为高程图扫描,$\mathbf{p}_t$ 为机器人中心 $0.8m \times 1.2m$ 区域的地形高度。
方法详解
PIM 的核心改进:感知信息融入状态估计
PIM 的核心改进是将当前感知观测 $\mathbf{o}_t^p$ 与本体感知历史 $\mathbf{o}_{t-H:t}^n$ 拼接,共同用于下一步状态估计。因为地形在机器人状态转移中起着重要作用——同样的动作在平地和楼梯上会产生截然不同的状态变化。如果状态估计器不知道脚下是楼梯还是平地,就难以准确预测机器人的下一步状态。PIM 通过将感知信息引入状态估计,使估计器能"理解"地形对机器人运动的影响,从而提供更准确的状态预测。具体来说,PIM 输出线速度估计 $\hat{v}_{t+1}$ 和潜在变量 $l_t$(预测下一步本体感知信息),这两者被送入策略网络与当前观测一起产生动作。
PIM的状态预测损失定义为:
$$ \mathcal{L}_{\text{pred}}=MSE\left(G_{a}(\pi(\mathbf{o}^{n}_{t},\mathbf{o}^{p}_{t},PIM(\mathbf{o}^{n}_{t-H:t},\mathbf{o}^{p}_{t}))),\,\mathbf{o}^{n}_{t+1}\right) $$
价值函数预测损失为:
$$ \mathcal{L}_{V}=MSE\left(V(\mathbf{o}^{n}_{t},\mathbf{o}^{p}_{t}),\,V(G_{o}^{n}(\mathbf{o}^{n}_{t}),G_{o}^{p}(\mathbf{o}^{p}_{t}))\right) $$
对称性正则化
PIM 引入了对称性正则化来提高步态协调性。三个算子分别是:$G_o^n$ 翻转本体感知观测(关于 x-z 平面)、$G_o^p$ 翻转感知观测、$G_a$ 翻转动作。策略对称性损失要求翻转输入后的策略输出等于翻转原输出的动作:
$$\mathcal{L}_{symmetry}^{policy} = MSE(G_a(\pi(\mathbf{o}_t^n, \mathbf{o}_t^p, PIM(\mathbf{o}_{t-H:t}^n, \mathbf{o}_t^p))), \pi(G_o^n(\mathbf{o}_t^n), G_o^p(\mathbf{o}_t^p), PIM(G_o^n(\mathbf{o}_{t-H:t}^n), G_o^p(\mathbf{o}_t^p))))$$
价值对称性损失为 $\mathcal{L}_{symmetry}^{value} = MSE(V(\mathbf{o}_t^n, \mathbf{o}_t^p), V(G_o^n(\mathbf{o}_t^n), G_o^p(\mathbf{o}_t^p)))$。这一正则化确保策略在左右对称的地形和状态下产生对称的行为——如果机器人左脚踩到台阶,策略应该产生与右脚踩台阶镜像对称的动作。这减少了策略需要学习的有效状态空间,加速了训练收敛并提高了步态的自然性。
高程图感知模块
真实实验中使用 elevation mapping 模块生成高程图。地图坐标系与初始躯干位置重合并固定在世界中,z 轴对齐重力方向。这一对齐至关重要——对于人形机器人来说,如果地图 z 轴与重力方向有偏差,高度图就会失真,影响落脚点判断。系统通过对地图坐标系进行初始旋转来确保与平均加速度方向(即重力方向)对齐。点云经过高度过滤保留地面点后,与里程计数据一起输入高程图模块生成网格高度图。
系统测试了两种传感器配置:第一种使用单个 Mid-360 LiDAR 同时提供里程计(通过 FAST-LIO 集成)和点云数据;第二种使用 Realsense T265 提供里程计、Realsense D435 提供点云。两种配置在稳定运动时都能提供准确的高程图,但 LiDAR 配置在快速或不规则运动场景下表现更鲁棒,因为 LiDAR 对光照变化不敏感且测距精度更高。
高程采样在以机器人为中心的 0.8m×1.2m 区域内采样 96 个点,这些点相对于基座连杆的 z 坐标作为感知输入。这个区域覆盖了机器人前方和下方的关键落脚区域,96 个点的分辨率足以表征台阶的轮廓。采样点的排列方式确保了机器人能"看到"即将踩到的区域,为落脚点选择提供及时信息。

图3:由单个 LiDAR 实现的地形感知模块,彩色网格图展示了地图坐标系中的地形高度
动作课程与训练流程
训练引入动作空间课程:将手臂关节和腰部关节等对运动任务不太重要的关节初始范围设为零,随着训练进行逐渐增大范围。这简化了训练难度——初期机器人只需学习腿部运动,待腿部控制稳定后再逐步引入上肢和躯干的运动。这一课程设计借鉴了人类运动发展的规律——婴儿先学会腿部支撑和行走,再逐步学会协调上肢摆动。
训练交替进行策略优化(PPO)和 PIM 优化——策略优化时冻结 PIM,PIM 优化时使用收集的轨迹。这种交替优化避免了同时训练估计器和策略的不稳定性。整个训练在 RTX 4090 上仅需 3 小时,远快于多阶段训练方法。训练效率的关键在于仿真中无需渲染深度图——直接查询地形高度即可,省去了大量的渲染计算。
方法流程图
flowchart TB
A[Proprioceptive
Observation History] --> D[PIM State Estimator]
B[Elevation Map
from LiDAR/RGBD] --> C[Sample 96 Points
0.8m x 1.2m]
C --> D
D --> E[Estimated Velocity
+ Latent State]
E --> F[PPO Policy Network]
G[Current Observations] --> F
F --> H[Joint Actions]
H --> I[Humanoid Robot
H1 / GR-1]
I --> A
I --> B
实验结果与分析
PIM vs HIM 对比
PIM(使用感知进行状态估计)与 HIM(不使用感知进行状态估计)的对比表明,PIM 在训练效率、估计精度和可通行地形难度上均优于 HIM。PIM 能更快达到更低的估计损失,并使机器人能够穿越更困难的地形。这验证了将感知信息融入状态估计的核心价值——不仅让策略"知道"地形,还让状态估计器"理解"地形对机器人运动的影响。具体来说,在相同的训练步数下,PIM 的估计损失显著低于 HIM,且能达到更高的地形难度等级。
楼梯穿越实验
系统能让人形机器人成功穿越 15cm 高的楼梯,连续爬楼梯成功率超过 90%。这超越了现有方法的水平,现有方法大多只能在简单的低台阶上行走,遇到连续楼梯就会摔倒。实验在 Unitree H1 和 Fourier GR-1 两种不同人形机器人上验证了跨平台泛化能力,无需针对不同机器人重新设计策略——同一策略只需调整机器人 URDF 模型即可部署到不同平台。

图4:Unitree H1 和 Fourier GR-1 两种人形机器人的硬件参数对比
多地形穿越实验
除了楼梯,系统还验证了在木制平台(高度 0.4m 以上)、斜坡(15 度)和间隙等地形上的穿越能力。H1 能够连续踏上木制平台并跳过两个平台之间的间隙。这些实验证明了 PIM 在多种极端地形上的有效性,且步态自然、成功率高。这些地形覆盖了人形机器人在真实场景中可能遇到的主要挑战。
奖励函数设计
系统设计了丰富的奖励函数来引导人形机器人运动。关键的特色奖励包括:足部横向距离(惩罚两脚距离过近,权重 2.5)、足部地面平行(通过在每只脚上采样5个点计算高度方差来惩罚足部倾斜,权重 -2.0)、线速度跟踪(权重 1.0)、以及多种关节偏差惩罚。此外还有足部绊倒惩罚(当足部水平力超过垂直力3倍时触发,权重 -3.0)、接触力惩罚、关节功率惩罚等。足部地面平行奖励是人形机器人特有的设计——通过在每只脚上采样前、中、后、左、右5个点,计算它们到地面的距离方差来衡量足部是否水平,这对于确保脚掌完全踩在台阶上至关重要。
| 奖励项 | 公式 | 权重 |
|---|---|---|
| 线速度跟踪 | $\exp\{-\frac{\|\mathbf{v}_{xy}^{cmd}-\mathbf{v}_{xy}\|_2^2}{\sigma}\}$ | 1.0 |
| 角速度跟踪 | $\exp\{-\frac{(\omega_{yaw}^{cmd}-\omega_{yaw})^2}{\sigma}\}$ | 1.0 |
| 足部横向距离 | $|y_{left}^B - y_{right}^B| - d_{min}$ | 2.5 |
| 足部地面平行 | $\sum_{feet} Var(H_i)$ | -2.0 |
| 足部绊倒 | $\mathbf{1}\{\exists i, |\mathbf{F}_i^{xy}| > 3|F_i^z|\}$ | -3.0 |
| 关节功率 | $\frac{|\tau\|\dot{\theta}\|^T}{\|\mathbf{v}\|_2^2+0.2*\|\omega\|_2^2}$ | -2.5e-5 |
线速度跟踪奖励使用指数形式:
$$ r_{v}=\exp\left\{-\frac{\|\mathbf{v}_{xy}^{\text{cmd}}-\mathbf{v}_{xy}\|_{2}^{2}}{\sigma}\right\} $$
角速度跟踪奖励为:
$$ r_{\omega}=\exp\left\{-\frac{(\omega_{\text{yaw}}^{\text{cmd}}-\omega_{\text{yaw}})^{2}}{\sigma}\right\} $$
跨平台验证
系统在两种截然不同的人形机器人上进行了验证:Unitree H1 和 Fourier GR-1。这两种机器人在身高、体重和自由度上都有差异,但同一策略无需修改即可部署到两者上。这证明了 PIM 的平台无关性——策略学习的是通用的运动控制规律,而非针对特定硬件的调参。跨平台能力对于实际部署至关重要,因为不同场景可能使用不同型号的机器人。
| 验证维度 | 实验内容 | 结果 |
|---|---|---|
| 楼梯穿越 | 15cm 台阶连续攀爬 | 成功率 >90% |
| 平台跨越 | 0.4m 以上木制平台 | 成功踏上并站稳 |
| 斜坡行走 | 15 度斜坡 | 稳定行走 |
| 间隙跳越 | 两平台间间隙 | 成功跳越 |
| 跨平台 | H1 和 GR-1 | 同一策略零样本部署 |
讨论
PIM 的设计哲学是"让状态估计器和策略都拥有感知"。传统方法只让策略网络接收感知信息,状态估计器仍仅依赖本体感知。但状态估计的准确性直接影响策略决策——如果估计器不知道脚下是楼梯,预测的线速度就会有偏差,策略基于错误的估计做出决策。PIM 将感知信息同时送入状态估计器和策略网络,形成"双重感知"——估计器用感知修正状态预测,策略用感知规划落脚点,两者协同工作。
方法的适用边界在于高程图的质量。高程图依赖里程计精度和点云质量——在特征缺失的环境中(如白墙走廊),FAST-LIO 里程计可能退化,导致高程图失真。此外,高程图是2.5D表示(每个 x-y 位置只有一个高度值),无法表示头顶障碍物或悬空结构。对于需要3D感知的场景(如低矮通道、悬空管道),需要扩展为体素网格表示。
局限性分析
作者自述局限:方法目前验证的地形种类虽然多样但仍有局限,更极端的地形条件(如湿滑表面、松散碎石)尚未测试。高程图的质量依赖里程计精度,在特征缺失的环境中可能退化。
独立判断:96 个采样点的 0.8m×1.2m 感知范围对大型障碍物可能不够——如果前方有超出感知范围的深坑或高墙,机器人无法提前规划。LiDAR 配置虽然鲁棒但增加了硬件成本和重量,对人形机器人的功耗和负载有影响。高程图模块需要点云过滤保留地面点,这在复杂遮挡场景下可能失效——例如楼梯扶手、墙壁等非地面结构可能被错误保留或过滤。方法目前专注于运动控制,未涉及上肢任务,未来需要与操作策略结合才能实现完整的具身智能。对称性正则化假设机器人和环境是左右对称的,在非对称环境(如单侧斜坡)中可能引入偏差。
总结与展望
本文提出感知内部模型(PIM),通过将 LiDAR 高程图融入 HIM 的状态估计,实现了人形机器人在复杂地形上的感知运动控制。方法的三个关键优势是:高程图表示对传感器噪声和移动鲁棒、仿真中无需渲染深度图使训练仅需 3 小时、单阶段训练即可零样本部署。在 Unitree H1 和 Fourier GR-1 上的实验验证了跨平台泛化能力,连续爬楼梯成功率超过 90%,还能穿越平台、斜坡和间隙等多种地形。PIM 有潜力成为未来人形机器人控制方法的基础算法,为后续结合上肢操作的完整具身智能奠定运动控制基础。



