PAPER DEEP DIVE
学习腿式操作机器人的动态拾取与放置
腿式操作机器人通过将敏捷行走与多功能臂控制相结合,将机器人能力扩展到静态操作之外。然而,在保持协调行走的同时实现精确操作仍是一个重大挑战。本工作提出了一种层次化强化学习框架,用于使用配备 6 自由度机械臂的四足机器人执行动态拾取与放置任务。该框架包含一个显式质量估计模块,能够对不同的物体重量实现自适应全身控制。在仿真中,系统对最高 2.3kg 载荷实现了 86.05% 的成功率。该方法还通过六个代表性场景的真实实验进行了验证,这些场景在物体物理属性(尺寸和质量)和任务高度上有控制变化。具体而言,在从地面到 1.1m 高桌面的大垂直工作空间内,系统对最高 1.3kg 载荷展示了 73.3% 的平均成功率,平均执行时间为 4.06 秒。与以往处理轻量物体并以缓慢分段运动执行拾放的方式不同,该框架利用并发行走和操作实现动态连续执行。
腿式操作器的动态拾取与放置学习
论文:Learning Dynamic Pick-and-Place for a Legged Manipulator
作者:Moonkyu Jung, Jiseong Lee, Zhengmao He, Donghoon Youm, Juhyeuk Mun, HyeongJun Kim, Hyunsik Oh, Donghyuk Choi, Jungwoo Hur, Jie Song, Jemin Hwangbo
机构:KAIST 机器人与AI实验室、港科大(广州)机器人与自治系统学部
链接:arXiv:2605.15713
一句话总结
本文提出一种分层强化学习框架,使四足+6自由度机械臂的腿式操作器实现动态连续拾取放置——低层控制器稳定全身运动并提供随机臂扰动下的鲁棒基座,高层控制器通过LSTM在线质量估计实现自适应全身控制,仿真成功率达86.05%(负载至2.3 kg),真机6场景平均成功率73.3%(负载至1.3 kg),平均执行时间仅4.06秒,比先前准静态方法快10倍。
研究背景与动机
腿式操作器——集成四足基座与机械臂的机器人——有潜力将拾取放置能力大幅扩展到传统固定基座和轮式操作器受限的结构化平面环境之外。四足基座提供高自由度和自适应移动性,实现从稳定行走到敏捷跑酷的多样动态行为。本文目标是设计一个控制器,通过充分利用四足的移动性和全身姿态来实现快速准确的拾取放置操作。
现有方法的主要局限是准静态执行——先停止移动再操作,将拾取放置分解为缓慢的分段动作。Yokoyama等人将任务分解为模块化视觉运动技能,但依赖机器人内部控制器导致执行缓慢,无法实现统一的移动-操作协调。Zhang等人将多阶段教师策略蒸馏为单一学生策略,虽然展示了基于视觉的自主拾取放置,但执行仍为准静态,平均43.8秒/任务,且主要限于地面级放置。这些方法在移动和操作之间存在"停止-操作"的离散切换,无法利用并发的移动与操作。
本文的核心洞察是:通过分层策略结构(低层稳定基座+高层任务执行),结合显式质量估计模块实现自适应全身控制,可以使腿式操作器在基座持续运动的过程中完成精确抓取——末端执行器在接触瞬间速度趋近零,而基座仍保持高达1 m/s的平面速度和-1 rad/s的偏航速率。这种动态协调将执行时间从43.8秒降至4.06秒,实现10倍加速,并将工作空间从地面扩展到1.1 m高桌面——超过机器人基座高度的两倍。
方法详解
系统采用分层控制结构。低层控制器生成12个腿关节的期望位置以稳定基座运动和调节全身姿态;高层控制器生成任务级命令同时控制移动和操作。高层动作分解为基座和臂两部分:
$$\boldsymbol{a}^{\text{high}}=[a^{\text{base}},a^{\text{arm}}]$$
其中基座命令 $a^{\text{base}}=[v_{x},v_{y},\omega_{z},\phi,\Delta h]$ 包含线速度、角速度、俯仰角和高度变化,臂命令 $a^{\text{arm}}=[q^{\text{arm},0}_{\text{des}},\ldots,q^{\text{arm},5}_{\text{des}},a^{\text{gripper}}]$ 包含6个关节期望位置和夹爪开合。
图1:分层训练框架。步骤1:低层运动控制器通过RL训练生成鲁棒的全身运动;步骤2:高层控制器基于低层控制器训练拾取放置任务。
低层全身运动控制器。接收基座速度命令 $[v_{x},v_{y},\omega_{z}]$ 和姿态控制命令 $[\Delta h,\phi]$,输出12个腿关节期望位置 $q^{leg}_{des,t}$。策略观测 $o^{\text{low}}=[x,d,a]$ 包含基座和腿的本体感知状态 $x$、臂本体感知状态 $d$ 和上一步动作 $a$。采用非对称actor-critic框架,critic获得特权观测 $[h_{base},V_{base},T_{air},T_{stance},f_{grf},H_{scan}]$(基座高度、线速度、各腿空/支撑时间、地面反力、足部高度扫描)。
与先前方法不同,本文将基座姿态视为可控变量——先前方法从末端执行器目标在地面固定系中唯一确定基座姿态,而本文允许高层控制器灵活搜索满足任务目标的最优基座和臂配置。
随机臂运动生成器。在低层训练时施加动态扰动。每个关节独立分配目标位置和轨迹时长,产生异步运动模式。关节位移定义为:
$$\Delta q_{i}=q_{\text{target},i}-q_{\text{init},i}$$
每个关节 $i\in\{0,1,2,3,4,5\}$ 独立选择匀速或对称匀加速运动模式。训练时末端附加高达2 kg随机负载模拟不同物体重量。控制器从臂状态历史中隐式学习补偿臂-基座接口处的外力扰动,而非显式估计。
高层控制器。观测 $o^{\text{high}}=[s^{r},s^{o},a^{\text{high}},p_{\text{pick}},p_{\text{place}},i_{\text{phase}}]$ 包含机器人状态 $s^r$、物体SE(3)状态 $s^o$、上一步动作、拾取/放置位置和当前阶段索引。关键组件是LSTM在线质量估计模块,从历史观测中估计物体质量 $m_{\text{obj}}$ 和接触状态 $C_{\text{contact}}$,使策略能自适应调整举起高度——对重物主动增加举起余量。
flowchart TD A[高层观测 o_high] --> B[LSTM 质量估计] B --> C[物体质量 m_obj] B --> D[接触状态 C_contact] C --> E[自适应全身控制] D --> E E --> F[基座命令 a_base] E --> G[臂命令 a_arm] F --> H[低层控制器] G --> H H --> I[12腿关节位置] H --> J[6臂关节+夹爪] I --> K[四足基座] J --> L[机械臂] K --> M[动态抓取: 基座运动+臂精确控制] L --> M M --> N[连续拾取放置 4.06s]
成功率驱动课程学习。三个课程等级 $L_{\text{pick}}$、$L_{\text{place}}$、$L_{\text{release}}$ 从接近零初始化,根据各自子目标成功率递增至1.0。任务难度通过4个参数控制:(i)机器人到拾取桌距离、(ii)桌间距离、(iii)物体质量、(iv)放置和释放成功标准。每50次迭代,若成功率超过阈值(拾取0.90、放置0.85、释放0.85),等级增加0.01。为防止不平衡进展,$L_{\text{pick}}$ 和 $L_{\text{place}}$ 需保持在0.015的同步裕度内。
奖励设计。任务分解为6阶段——预抓取、抓取、搬运、放置、撤退、完成——每阶段结合稀疏和稠密奖励。预抓取稠密奖励引导末端接近物体:
$$R_{\text{EE\_to\_Obj}}=k_{1}\cdot e^{-25\cdot\|p_{\text{obj}}-p_{\text{ee}}\|^{2}}+k_{2}\cdot e^{-1\cdot\|p_{\text{obj}}-p_{\text{ee}}\|^{2}}$$
双指数项兼顾精确接近(高斯核σ=1/25)和大范围引导(σ=1)。搬运阶段物体到放置点的稠密奖励同样使用双指数:
$$R_{\text{Obj\_to\_Place}}=k_{6}\cdot e^{-5\cdot\|p^{key}_{\text{obj}}-p^{key}_{\text{place}}\|^{2}}+k_{7}\cdot e^{-25\cdot\|p^{key}_{\text{obj}}-p^{key}_{\text{place}}\|^{2}}$$
放置阶段要求物体直立,通过惩罚物体z轴偏离垂直方向实现:
$$R_{\text{orient}}=k_{27}\cdot e^{-\|\mathbf{p}_{\text{obj}}-\mathbf{p}_{\text{place}}\|}\cdot(\mathbf{R}_{\text{obj}}^{(z)}-1)^{2}$$
该惩罚随物体接近放置点而增大,确保放置时物体直立。基座惩罚项正则化垂直速度和角速度:
$$R_{\text{base\_pen}}=k_{19}\cdot(V^{2}_{z}+0.02\cdot|\omega_{x}|+0.02\cdot|\omega_{y}|)$$
实验结果
实验在自研四足平台+Unitree Z1机械臂(6-DoF臂+1-DoF夹爪,有效负载约2.3 kg)上进行。成功定义为:10秒内将物体直立放置在放置桌中心5 cm内,并撤退末端≥10 cm不扰动物体。
| 方法 | 成功率(%) | 完成时间(s) | 说明 |
|---|---|---|---|
| 本文(显式估计) | 86.05 | 3.92±0.40 | 统一策略+LSTM质量估计 |
| 隐式适应 | 85.5 | 3.98 | 双编码器,训练成本更高 |
| 无估计 | 82.0 | 4.05 | 仅域随机化 |
| 分段策略 | 70.0 | 5.26 | 分段执行,无值传播 |
本文的显式估计模块与隐式适应性能相当,但训练时间减少11.32%。无估计基线在分布外重物质量范围退化更明显——重物需要更大举起余量,显式质量估计使策略能主动调整举起高度,而非被动反应。分段策略成功率显著下降,因为分段抓取策略目光短浅,仅优化即时抓取完成而忽略抓取姿态是否适合后续放置。
图2:低层控制器扰动抑制性能。关节1周期运动(幅度1 rad)产生的偏航扰动下,基座偏航速率波动被有效抑制。
| 场景 | 仿真成功率 | 真机成功率 | 真机时间(s) |
|---|---|---|---|
| 标称(∅6×10cm, 0.83kg, 0.6↔0.9m) | 9/10 | 9/10 | 4.07±0.66 |
| 重物(1.3 kg) | 8/10 | 3/10 | 4.76±0.86 |
| 轻物(0.47 kg) | 8/10 | 8/10 | 3.74±0.72 |
| 方物(5×5×10cm) | 9/10 | 8/10 | 4.08±0.74 |
| 大尺寸(∅7×10cm) | 10/10 | 6/10 | 3.74±0.97 |
| 大高度差(0↔1.1m) | 7/10 | 7/10 | 3.54±0.61 |
6场景真机平均成功率73.3%,平均时间4.06s。重物场景真机退化最严重(仿真8/10→真机3/10),可能因Z1臂在1.3 kg负载下力矩跟踪精度下降。大尺寸场景真机也退化(10/10→6/10),大直径物体抓取更易滑落。大高度差场景仿真和真机一致(7/10),说明全身姿态控制在极端高度差下仍有挑战。
图3:抓取时刻的基座运动分析。末端速度趋近零时基座仍保持1 m/s平面速度和-1 rad/s偏航速率,实现动态协调。
动态抓取分析
抓取时刻的运动分析是本文的核心亮点。在最快情况下,末端执行器速度平滑收敛至约0.2 m/s时,基座仍保持高达1 m/s的平面速度和-1 rad/s偏航速率。这说明控制器实现了真正的动态协调:基座提供连续动量实现高效任务执行,臂执行可靠抓取所需的精确低速控制。这是与准静态方法的本质区别——后者在抓取前必须完全停止基座运动。
与现有方法的深度对比
本文与现有腿式操作器工作的核心区别在于动态性。先前的拾取放置方法采用准静态执行范式:机器人在抓取前停止移动,完成抓取后再恢复移动,放置时再次停止。这种"停止-操作-移动-停止-操作"的离散模式虽然安全但效率极低——Zhang等人的方法平均43.8秒完成一次拾取放置,而本文仅需4.06秒,实现10倍加速。加速的来源不是更快的关节速度或更强的执行器,而是消除了停止等待的时间——基座在整个任务过程中持续运动,臂在基座运动中完成抓取和放置。
实现这种动态协调的关键是分层策略结构。如果直接训练单一策略学习19自由度动作空间(12腿+7臂/夹爪)的整个拾取放置任务,会遇到两个困难:第一,训练早期臂-基座耦合不稳定,基座运动不稳定导致臂策略聚焦于避免失稳而非完成任务,常常收敛到保守姿态;第二,19自由度的探索空间太大,学习效率极低。分层结构通过先训练低层控制器稳定基座(在随机臂扰动下),为高层策略提供一个稳定的"运动基座",使其能聚焦于任务执行而非平衡维护。这种分而治之的策略在腿式操作器领域已被验证有效,但本文的独特之处在于低层控制器将基座姿态视为可控变量而非被动约束——先前方法从末端目标唯一确定基座姿态,而本文允许高层灵活搜索最优基座-臂配置。
LSTM在线质量估计是另一个关键创新。在拾取放置任务中,物体质量直接影响动力学——举起1.3 kg物体和0.47 kg物体需要不同的力矩分配和举起策略。如果策略不知道物体质量,只能通过域随机化被动适应,反应滞后。本文的LSTM从历史观测中隐式估计质量 $m_{ ext{obj}}$ 和接触状态 $C_{ ext{contact}}$,使策略能在抓取前就主动调整举起高度——对重物增加余量防止举起不足,对轻物减少余量提高效率。实验表明这种显式估计比隐式潜在空间适应(双编码器)性能相当但训练效率高11.32%,因为质量是低维变量(标量),用LSTM直接估计比高维潜在表示更高效。
6阶段奖励设计是长时序任务稳定训练的关键。拾取放置涉及6个顺序子目标——预抓取、抓取、搬运、放置、撤退、完成——每个子目标的达成是下一个阶段的前提。如果使用单一全局奖励,值估计在任务阶段间不稳定,策略容易陷入早期局部最优。本文的阶段性设计仅在当前阶段激活相关奖励项,先前阶段的奖励项在子目标达成后停用,确保每个阶段仅受其目标引导。双指数稠密奖励(如 $R_{ ext{EE\_to\_Obj}}=k_1 e^{-25\|p_{ ext{obj}}-p_{ ext{ee}}\|^2}+k_2 e^{-\|p_{ ext{obj}}-p_{ ext{ee}}\|^2}$)兼顾精确接近和大范围引导——高斯核σ=1/25的项在末端接近物体时提供精细引导,σ=1的项在远距离提供大范围吸引。
成功率驱动课程学习解决了从简单到复杂的渐进训练问题。三个课程等级独立控制拾取、放置、释放的难度,同步约束防止不均衡进展(如精通拾取但很少尝试放置)。训练从全等级0.10开始(短距离、轻物、宽松标准),每50次迭代根据成功率递增0.01。这种渐进式难度提升使策略不会在初始就面对过难的任务而无法学习,也不会停留在过简单的任务而过拟合。
从工程角度看,本文的真机sim-to-real差距分析值得借鉴。重物场景的显著退化(仿真80%→真机30%)提示Z1臂在接近额定负载时力矩跟踪精度下降是主要瓶颈,这需要通过系统辨识或力矩前馈补偿来缓解。大尺寸物体的退化(仿真100%→真机60%)则提示抓取策略对物体几何变化的泛化能力有限——大直径物体在夹爪中更易滑落,可能需要力感知或触觉反馈来增强抓取鲁棒性。大高度差场景仿真和真机一致(70%),说明全身姿态控制本身是固有挑战而非sim-to-real差距。这些分析对未来腿式操作器的工程改进具有指导价值。
值得注意的是,本文的框架虽在四足+Z1臂平台上验证,但其方法论具有平台通用性。分层结构、LSTM质量估计、6阶段奖励和课程学习的设计原则可迁移到其他腿式操作器配置(如双臂人形、轮式+臂)。关键约束是低层控制器需要能在臂扰动下稳定基座——这取决于具体平台的动力学特性。对于臂质量相对基座更大的平台,低层训练可能需要更多扰动样本和更长训练时间。
与感知集成的未来方向也值得关注。当前真机实验假设物体位姿已知,实际部署需要视觉感知管道。将视觉感知引入高层观测 $o^{ ext{high}}$ 需要处理感知延迟(深度相机通常30 Hz而控制50 Hz)、噪声和遮挡。一种可行方案是将视觉感知作为异步观测源,与本体感知以不同频率融合,避免感知延迟拖慢控制循环。此外,物体位姿估计误差会直接传导到抓取精度,可能需要在线误差校正机制来保证整体系统的鲁棒性和可靠性,这也是从实验室走向实际部署的必经之路,值得在后续工程化中重点关注和持续改进优化,以确保系统在各种实际场景中都能保持稳定可靠的运行表现。
局限性
重物真机退化。1.3 kg重物场景真机成功率仅30%(仿真80%),Z1臂额定负载有限,重物下力矩跟踪精度下降导致抓取和举起失败。训练中负载达2.3 kg但真机仅验证到1.3 kg。
感知简化。本文聚焦动态能力而非感知复杂度,真机实验中物体位姿假设已知。实际部署需要集成视觉感知(如深度相机+目标检测)来实现自主拾取放置,这会增加额外延迟和误差。
总结
本文提出分层RL框架实现腿式操作器的动态拾取放置。低层控制器在随机臂扰动下稳定基座,高层控制器通过LSTM质量估计实现自适应全身控制。6阶段奖励设计和成功率驱动课程学习使长时序任务稳定收敛。仿真成功率86.05%,真机6场景平均73.3%、4.06秒,比准静态方法快10倍,工作空间从地面扩展到1.1 m高桌面。动态抓取时基座保持1 m/s运动而末端趋近零速,实现了真正的并发移动与操作。

