PAPER DEEP DIVE
学习地形感知的感知式腿式移动操作全身控制
腿式操作机器人集成了卓越的地形适应能力与移动操作能力。然而,在复杂地形上实现协调的全身操作控制仍面临重大挑战。本文提出了一种地形感知的全身控制框架,使腿式操作机器人能够在感知复杂地形的同时执行操作任务。该方法通过感知模块获取地形信息,并将其纳入全身控制策略中,使机器人能够根据地形条件自适应调整运动和操作行为。实验表明,统一策略在复杂地形上实现了更大的可达空间、更小的跟踪误差和更少的意外跌倒,突出了腿式操作机器人在跨复杂地形执行移动操作任务方面的强大能力。
TA-WBC:面向感知式腿式移动操作的地形感知全身控制
论文:Learning Terrain-Aware Whole-Body Control for Perceptive Legged Loco-Manipulation
作者:Sikai Guo, Yudong Zhong, Guoyang Zhao, Botao Dang, Zhihai Bi, Jun Ma
机构:香港科技大学(广州)机器人与自治系统学部
链接:arXiv:2605.31343
一句话总结
TA-WBC 是一种地形感知的腿式操作器全身控制框架,通过混合外感知编码器提取地形特征、基于足接触平面的末端采样解耦基座波动、双策略蒸馏避免灾难性遗忘,使四足+臂的统一RL策略在复杂地形上实现更大的可达空间、更小的跟踪误差和更少的意外跌倒。
研究背景与动机
腿式操作器将四足的越野能力与机械臂的操作能力结合,在人本环境中前景广阔。通过协调腿和臂的控制,全身控制器可以显著扩展操作工作空间——例如弯折前腿让末端触地,或抬高前体抓取高处物体。然而,现有的全身控制器大多仅依赖本体感知,不包含有效地形感知所需的关键外感知。这一限制阻碍了机器人适应不同环境条件和导航复杂地形的能力。
现有腿式移动操作方法可分为两类。解耦方法将基座运动和臂操作分离——先用 locomotion 策略导航再用 IK 控制臂,但无法利用全身协调的优势。统一方法通过单一策略同时控制腿和臂,但大多缺乏地形感知——虽然 PILOT 在人形机器人上实现了感知式跨地形操作,但四足腿式操作器的感知式全身控制仍是挑战。
核心困难在于:在复杂不平环境中执行操作任务时,机器人既要掌握高维控制动力学,又要确保末端跟踪的鲁棒性。基座在不平地形上的高度和姿态持续变化(尤其俯仰角变化显著),使得在固定地面坐标系中采样末端目标完全失效——当地形坡度变化时,固定的采样球会产生不可达或不安全的末端目标。
TA-WBC 通过三项核心创新解决上述挑战:(1) 混合外感知编码器从足中心环形采样的高程图中提取地形特征;(2) 基于足接触平面(FCP)的末端采样球解耦基座波动;(3) 双策略蒸馏集成全身协调与地形适应能力,避免灾难性遗忘。
方法详解
图1:TA-WBC框架概览。先训练准平面上的感知式全身策略π_s和复杂地形上的感知式locomotion策略π_l,然后在两者监督下训练统一策略π。
状态空间设计。状态空间由本体感知 $o^{p}_{t}$ 和外感知 $o^{e}_{t}$ 组成。本体感知包含基座状态 $s^{\text{base}}_{t}\in\mathbb{R}^{5}$(roll/pitch/角速度)、关节位置 $q_{t}\in\mathbb{R}^{18}$、关节速度 $\dot{q}_{t}\in\mathbb{R}^{18}$、上一步动作 $a_{t-1}\in\mathbb{R}^{12}$、指令 $c_{t}$、足接触状态 $s^{\text{foot}}_{t}\in\{0,1\}^{4}$、步态时序参考 $g_{t}\in\mathbb{R}^{5}$ 和环境外物理 $\hat{z}_{t}^{p}\in\mathbb{R}^{20}$:
$$o^{p}_{t}=[s^{\text{base}}_{t},q_{t},\dot{q}_{t},a_{t-1},c_{t},s^{\text{foot}}_{t},g_{t},\hat{z}_{t}^{p}]$$
外感知 $o^{e}_{t}\in\mathbb{R}^{50\times 4}$ 为围绕每个足的高程图。完整观测包含10步历史:
$$o_{t}=[o^{p}_{t-H},o^{p}_{t-H+1}\ldots,o^{p}_{t-1},o^{p}_{t},o^{e}_{t}]$$
混合外感知编码器。围绕每个足 $k\in\{1,2,3,4\}$ 以5个半径 $r=\{0.07,0.14,0.21,0.30,0.42\}$ 采样 $N_k=50$ 个高度点,角度 $\theta\in[0,2\pi)$ 均匀分布。每个足的高度矩阵 $M^{f}_{k}$ 经1D卷积提取特征,4个足共享同一编码器网络生成外感知潜向量 $z^{e}=[z^{e}_{1},z^{e}_{2},z^{e}_{3},z^{e}_{4}]\in\mathbb{R}^{80}$。这种混合分层编码器利用了圆形采样的周期性和四足的形态对称性,加速收敛。
图2:外感知观测的高程采样点细节。不同颜色对应不同足,θ=0方向以黑色点表示。
基于足接触平面的末端采样。先前方法在固定地面坐标系的球中均匀采样末端目标,在非平面地形上因基座高度和姿态持续变化而失效。TA-WBC 构造距离不变的采样球,相对于足接触平面(FCP)定义。FCP由四个足接触点最小二乘拟合确定,法向量 $\mathbf{n}_{f}\in\mathbb{R}^{3}$ 满足平面方程:
$$\mathbf{n}_{f}\cdot\mathbf{x}+d_{f}=0,\quad\|\mathbf{n}_{f}\|=1$$
基座位置 $\mathbf{p}_{b}$ 沿法向量投影到FCP得到投影点 $\mathbf{p}_{\mathcal{G}}$,基座x轴投影到地形平面:
$$\mathbf{v}_{\text{proj}}=\mathbf{x}_{\mathcal{B}}-(\mathbf{x}_{\mathcal{B}}\cdot\mathbf{n}_{f})\mathbf{n}_{f}$$
构建地面投影坐标系 $\mathcal{G}$,其旋转矩阵定义为:
$$\mathbf{z}_{\mathcal{G}}=\mathbf{n}_{f},\quad\mathbf{x}_{\mathcal{G}}=\frac{\mathbf{v}_{\text{proj}}}{\|\mathbf{v}_{\text{proj}}\|},\quad\mathbf{y}_{\mathcal{G}}=\mathbf{z}_{\mathcal{G}}\times\mathbf{x}_{\mathcal{G}}$$
采样坐标系 $\mathcal{S}$ 的原点在 $\mathcal{G}$ 中偏移 $\mathbf{p}_{c}$,三轴与 $\mathcal{G}$ 相同。末端目标在半径 $r_s=0.8$ m 的球中均匀采样,并在当前和目标位置间插值:
$$\mathbf{p}_{t}^{\text{cmd}}=\frac{t}{T_{i}}\mathbf{p}^{\text{cur}}+\left(1-\frac{t}{T_{i}}\right)\mathbf{p}^{\text{end}},\quad t\in[0,T_{i}]$$
双策略蒸馏。两阶段训练:阶段1训练准平面全身策略 $\pi_s$ 和复杂地形locomotion策略 $\pi_l$(随机臂构型);阶段2在两者监督下训练统一策略 $\pi$,蒸馏损失为地形条件的KL散度:
$$\mathcal{L}_{\text{distill}}=\mathbb{E}_{s}\left[\mathbb{I}(s)D_{\text{KL}}(\pi_{s}\parallel\pi)+(1-\mathbb{I}(s))D_{\text{KL}}(\pi_{l}\parallel\pi)\right]$$
其中 $\mathbb{I}(s)$ 在准平面或站立命令时为1(从 $\pi_s$ 蒸馏全身操作技能),否则为0(从 $\pi_l$ 蒸馏locomotion反射)。
flowchart TD A[阶段1a: 准平面训练] --> B[全身操作策略 π_s] C[阶段1b: 复杂地形训练] --> D[地形locomotion策略 π_l] B --> E[阶段2: 双策略蒸馏] D --> E E --> F[统一策略 π] F --> G[本体感知 o_p] F --> H[混合外感知编码器] H --> I[足中心高程采样 50×4] I --> J[1D卷积 → z_e ∈ R^80] F --> K[FCP末端采样球] K --> L[解耦基座波动] G --> M[PPO + 蒸馏损失] J --> M L --> M M --> N[12腿关节 + 6臂关节]
实验结果
| 方法 | V_m(m³)↑ | l_ter↑ | E_v(m/s)↓ | E_ee(m)↓ | r_c(%)↓ |
|---|---|---|---|---|---|
| 简单地形 | |||||
| TA-WBC(本文) | 1.142 | 9.00 | 0.105 | 0.038 | 0.52 |
| Blind WBC | 1.108 | 8.87 | 0.108 | 0.045 | 0.61 |
| BL+IK(解耦) | 0.876 | 8.90 | 0.099 | 0.067 | 0.55 |
| 复杂地形 | |||||
| TA-WBC(本文) | 0.825 | 9.00 | 0.109 | 0.042 | 0.56 |
| PL+IK | 0.701 | 8.80 | 0.115 | 0.078 | 0.72 |
| BL+IK | 0.688 | 5.57 | 0.205 | 0.289 | 24.37 |
在简单地形上TA-WBC与Blind WBC性能相当(地形感知不损失平地性能),但末端跟踪误差更小(0.038 vs 0.045m),且工作空间显著大于解耦方法BL+IK(1.142 vs 0.876 m³)。在复杂地形上TA-WBC优势明显——工作空间0.825 m³ vs PL+IK的0.701和BL+IK的0.688,跌倒率仅0.56% vs BL+IK的24.37%。BL+IK因无法提前感知地形导致高跌倒率,PL+IK虽能感知地形但保持固定基座俯仰限制了工作空间。
图3:复杂地形上的仿真结果对比。TA-WBC在楼梯和斜坡上允许前腿弯折实现全身协调,显著扩展可达工作空间。
| 配置 | V_m(m³)↑ | E_ee(m)↓ | r_c(%)↓ |
|---|---|---|---|
| (a) 无外感知 | 0.766 | 0.289 | 24.37 |
| (b) 基座中心采样 | 0.814 | 0.070 | 2.57 |
| (c) 平MLP编码器 | 0.809 | 0.103 | 4.20 |
| (d) 无蒸馏 | 0.742 | 0.161 | 0.88 |
| TA-WBC(完整) | 0.825 | 0.042 | 0.56 |
消融实验证明每个组件的贡献。无外感知时跌倒率高达24.37%(vs 0.56%),验证外感知不可或缺。基座中心采样替代足中心采样使跌倒率增至2.57%(4.6倍),证明足中心采样对局部地形感知的重要性。平MLP替代混合编码器使跌倒率增至4.20%(7.5倍)。无蒸馏模块使工作空间从0.825降至0.742 m³(-10%),证明蒸馏避免了梯度干扰。
图4:解耦控制器与TA-WBC在末端目标触地时的对比。TA-WBC通过前腿弯折实现全身协调到达地面。
真机部署
策略通过零样本迁移部署到真实机器人。全身actor以50 Hz输出腿关节目标位置,PD控制器以500 Hz运行。利用板载深度相机和LiDAR构建高程图。高层命令(末端位姿、基座线/角速度)通过Meta Quest 3 VR遥操作获取。真机实验验证了站立全身运动和长时程跨地形操作。
足接触平面采样的设计哲学
基于足接触平面(FCP)的末端采样是本文最具创新性的设计之一。传统方法在固定地面坐标系中采样末端目标,这在平地上有效——基座高度和姿态不变,采样球的原点固定。但在复杂地形上,基座高度和姿态随地形持续变化:上坡时基座俯仰角增大、高度升高;下楼梯时基座高度逐级下降。如果采样球仍固定在地面坐标系,末端目标会随基座运动而漂移——上坡时目标可能变得不可达(基座升高导致末端离目标更远),下坡时目标可能变得不安全(末端可能撞地)。
FCP采样的核心思想是将采样坐标系锚定在足接触平面而非地面。足接触平面由四个足接触点最小二乘拟合确定,反映了机器人当前实际站立的地面平面——无论地形如何倾斜,FCP始终与足下实际地面平行。采样球的原点在FCP上以固定偏移定义,三轴与FCP对齐:z轴为FCP法向量(垂直于实际地面),x轴为基座前向在FCP上的投影,y轴由右手定则确定。这样,当地形坡度变化时,采样坐标系自动跟随旋转,末端目标始终在合理的相对位置——上坡时采样球自动倾斜,末端目标仍在可达范围内。
FCP仅在检测到所有四足有效接触时更新——由垂直接触力显著大于水平分量判定。这避免了摆动足更新FCP导致的不稳定。末端目标在半径 $r_s=0.8$ m 的球中均匀采样,并在当前和目标位置间以 $T_i$ 为周期插值,确保平滑过渡。这种设计的训练效率提升显著——消融实验显示基座中心采样替代足中心采样使跌倒率增至2.57%(4.6倍),证明局部地形感知对采样质量的重要性。
双策略蒸馏的必要性
双策略蒸馏解决的是多技能融合中的灾难性遗忘问题。如果直接在复杂地形上训练同时包含locomotion和操作的统一策略,会面临两个困难:第一,复杂地形上的locomotion本身就需要大量训练才能稳定,叠加操作目标后训练更难收敛;第二,即使统一策略在复杂地形上学会了locomotion,操作技能可能因梯度干扰而退化——locomotion和操作的梯度方向可能冲突。
TA-WBC的两阶段方案巧妙地解耦了技能学习。阶段1分别训练两个专家策略:$\pi_s$ 在准平面上学习全身操作(地形简单,聚焦操作技能),$\pi_l$ 在复杂地形上学习locomotion(随机臂构型,聚焦地形适应)。阶段2通过地形条件的KL蒸馏将两者融合:在准平面或站立时从 $\pi_s$ 蒸馏操作技能,在复杂地形行走时从 $\pi_l$ 蒸馏locomotion反射。蒸馏损失 $\mathcal{L}_{ ext{distill}}$ 确保统一策略 $\pi$ 在两种场景下都不遗忘对应专家的技能。消融实验证实无蒸馏时工作空间从0.825降至0.742 m³(-10%),且末端跟踪误差从0.042增至0.161m(3.8倍),验证了蒸馏对避免梯度干扰的关键作用。
这种蒸馏方案与简单的课程学习(先学简单再学复杂)不同——课程学习中后学技能可能覆盖先学技能,而蒸馏通过KL约束确保两种技能同时保留。指标函数 $\mathbb{I}(s)$ 的地形条件设计使蒸馏来源自动切换,无需人工干预场景判断。
混合外感知编码器的效率
混合外感知编码器的设计兼顾了感知质量和训练效率。足中心环形采样将高程图从全局表示转换为4个足部的局部表示,每个足50个采样点以5个同心圆排列。这种设计有两个优势:第一,足中心采样直接感知足即将接触的区域,对步态决策最相关;第二,4个足共享同一编码器网络,利用四足的形态对称性减少参数量并加速收敛。1D卷积处理环形采样的周期性结构,比2D卷积更高效。
消融实验中,平MLP替代混合编码器使跌倒率从0.56%增至4.20%(7.5倍),说明混合编码器的卷积结构对提取地形特征至关重要——平MLP无法有效利用环形采样的空间结构。基座中心采样替代足中心采样使跌倒率增至2.57%,因为基座中心采样无法精确感知足部局部地形。这些结果验证了"足中心+卷积"设计的必要性。
从工程角度看,TA-WBC的零样本sim-to-real迁移值得关注。策略在仿真中训练后直接部署到真实机器人,无需额外微调。50 Hz策略推理+500 Hz PD控制的分层架构平衡了计算延迟和控制精度。VR遥操作提供了高层命令输入接口,虽非自主决策但为验证阶段提供了灵活的交互方式。板载深度相机+LiDAR的高程图构建框架在真实环境中表现稳定,支撑了地形感知的可靠性。
与PILOT(人形机器人感知式跨地形操作)相比,TA-WBC首次将感知式WBC扩展到四足腿式操作器。四足与双足的形态差异带来了独特挑战——四足的基座姿态变化范围更大(可弯折前腿),工作空间扩展潜力更大但也需要更精细的全身协调。TA-WBC的FCP采样和双策略蒸馏正是针对四足形态特性设计的解决方案。
从实验结果的细节可以进一步理解TA-WBC的优势。在简单地形上,TA-WBC的工作空间 $V_m=1.142$ m³,而解耦方法BL+IK仅0.876 m³——30%的工作空间扩展来自全身协调:当末端目标在基座固定时超出臂的可达范围,TA-WBC能主动调整基座姿态(如弯折前腿降低基座、抬高前体升高基座)来扩展臂的有效可达范围。BL+IK将臂视为负载无法利用这种协调,工作空间受限。同时TA-WBC的末端跟踪误差 $E_{ee}=0.038$m优于BL+IK的0.067m,因为统一策略能预测性地调整基座为臂创造更好的操作姿态。
在复杂地形上优势更为显著。BL+IK因无地形感知在楼梯和斜坡上跌倒率高达24.37%——机器人无法提前抬起足避免碰撞。PL+IK虽能感知地形避免跌倒(0.72%),但保持固定基座俯仰限制了工作空间(0.701 m³)——机器人在楼梯上保持水平基座,臂无法利用基座姿态调整扩展可达范围。TA-WBC不仅避免跌倒(0.56%),还允许在楼梯和斜坡上弯折前腿实现全身协调,工作空间达0.825 m³——比PL+IK大18%。这一对比清晰展示了"感知+协调"的双重价值。
消融实验中无外感知的配置(a)跌倒率24.37%与BL+IK相同,印证了BL+IK的高跌倒率根源在于缺乏外感知。配置(d)无蒸馏虽跌倒率0.88%尚可,但工作空间0.742 m³和末端误差0.161m显著退化——蒸馏主要影响操作技能而非locomotion。这说明locomotion和操作的学习确实存在梯度干扰,蒸馏通过约束策略分布保持两种技能的共存。这些细粒度的消融结果为后续工作的组件优化提供了明确的优先级指导。
综合来看,TA-WBC的技术路线对腿式移动操作领域具有方法论启示。地形感知不再是locomotion的专属需求,操作同样需要地形信息——FCP采样将地形信息融入操作目标定义,使操作技能能跨地形泛化。双策略蒸馏为多技能融合提供了可复用的范式——当两个技能分别在不同场景下容易学习但直接联合训练困难时,分阶段专家训练+蒸馏融合是有效的解决方案。混合编码器的足中心采样+卷积结构为高效地形感知提供了设计参考——比全局高程图的2D卷积更聚焦、更高效。这些设计原则可迁移到其他腿式操作器平台和更复杂的操作任务中。
局限性
VR遥操作依赖。当前高层命令通过VR头显获取,非自主决策。实际部署需要集成自主目标识别和任务规划,VR仅作为验证阶段的遥操作接口。
高程图质量依赖。地形感知依赖板载深度相机和LiDAR构建的高程图质量。在纹理缺失、强光照变化或动态障碍环境中,高程图可能不准确,影响地形感知和足中心采样的可靠性。
总结
TA-WBC通过混合外感知编码器、FCP末端采样和双策略蒸馏,首次在四足腿式操作器上实现了地形感知的全身控制。统一策略在复杂地形上实现更大可达空间(0.825 m³)、更低末端跟踪误差(0.042m)和更低跌倒率(0.56%)。消融证明外感知、足中心采样、混合编码器和蒸馏缺一不可。零样本真机部署验证了sim-to-real迁移能力。

