PAPER DEEP DIVE
基于接触引导探索与多评价家强化学习的非抓取移动操作
论文将抓取算法生成的 25 个候选点转化为可退出的探索目标,用任务、探索和正则三个价值头解耦强化学习信号,并在 5000 到 10000 步之间调度优势权重。完整方法在椅子运输仿真中达到 94.1% 成功率和 4.4% 倾翻率,真机零样本完成 40/58 次未见 IKEA 物体运输。
论文元信息
标题:Contact-Guided Exploration for Non-Prehensile Locomanipulation with Multi-Critic RL
团队:Simone Tolomei、Mayank Mittal、Franco Angelini、Manolo Garabini、Paolo Salaris、Marco Hutter
发布日期:2026-08-28
论文链接:arXiv 2608.28140
项目页:tolomeis.github.io/contact-guided-exp
代码状态:论文未提供公开代码仓库;训练栈基于 Isaac Lab 与修改后的 RSL-RL 实现。
一句话总结
论文用抓取算法生成物体接触候选,再把接触探索与任务执行、动作正则分成三个评价家,通过优势权重调度让四足移动操作机器人先学会接触,再学会稳定搬移,最终在真机上完成 40/58 次未见家具的非抓取运输。
研究背景与动机
搬椅子、推箱子、开 dishwasher 这类任务看起来不像精细抓取,却比很多抓取问题更难。物体与机械臂之间没有稳定的闭合约束,接触状态会随法向力、摩擦锥和相对位姿不断切换。机器人还要同时照顾浮动车体的稳定、机械臂的工作空间、目标物体的姿态与速度。模型预测控制可以把这些约束写进目标函数,但为了实时求解,常常要简化接触模型;一旦真实接触打滑、丢失或产生未预测的旋转,控制器就需要重新规划。
深度强化学习提供了一条不依赖显式接触解析模型的路径。策略可以直接在仿真中经历接触、打滑和恢复,学习到低层控制规律。可是,非抓取移动操作的探索空间极大:机械臂要先找到有效接触点,底盘要进入能持续施力的位置,随后两者还要协同推动物体到达目标。如果只有稀疏的成功奖励,随机探索几乎不可能及时碰到有效交互序列。
更麻烦的是,奖励里通常存在大量平滑项、能耗项和限位惩罚。这些正则项在每一个时间步都有信号,而“推动物体到目标”可能很久才有一次反馈。于是策略会先学会少动、慢动、远离物体,用避免碰撞和降低能耗换取较低惩罚,最后完全绕开任务。这种局部最优不是奖励写错,而是不同目标的时间尺度和密度不一致导致的结构性问题。
已有强化学习工作在推箱、开门等任务上取得进展,但很多方法依赖较大且稳定的接触面,或在物体表面均匀采样探索点。对箱子这类凸几何,均匀采样还能工作;对椅子、折叠椅和三脚桌这样的非凸物体,很多采样点会落在腿部空隙、靠背内侧或机械臂够不到的位置,探索效率迅速下降。
论文抓住一个观察:通用抓取算法虽然为“抓住物体”而设计,但它输出的候选点往往位于椅子腿、把手、面板等结构性强、力传递合理的区域。即使任务是非抓取的,这些点仍然可以作为接触引导先验。问题在于,如果把接触引导一直作为奖励,策略可能停在“反复摸接触点”而不是“把物体搬走”。因此,探索必须既能启动,又能退出。
预备知识
论文的控制对象是 ALMA 四足移动操作平台。系统采用分层结构:高层策略不直接输出所有腿部关节,而是给出四维底盘指令和六维机械臂关节目标;底盘指令包括纵向速度、横向速度、偏航角速度和底盘高度。预训练并冻结的行走策略接收这些底盘指令与机械臂状态,输出腿部关节目标。这样,移动操作学习可以集中在“应该去哪里、抬高多低、手臂放在哪里”,不必从零学行走。
强化学习侧的基础是 PPO。标准 PPO 只有一个价值函数,所有奖励项在标量奖励中加权相加。论文把它扩展为多评价家形式:环境输出按任务、探索、正则三组分开的向量奖励,每一组拥有对应价值头。这样,任务价值、接触探索价值和动作平滑价值不会因为提前加权而在同一个函数里互相污染。

图 2:接触采样、多评价家优势混合、分层控制与三种任务的系统总览。
方法详解
接触候选不是手工标注。训练每遇到一个物体网格,论文先调用通用抓取算法生成候选点。椅子任务取算法返回的 25 个点;每个回合重置时,再从中随机选一个作为本回合的末端接触目标。这样,不同回合会引导机械臂尝试不同腿位、不同面板和不同钩取方向。对箱推任务,论文保留均匀表面采样,因为箱子的可见面本身适合持续推压。

图 3:红色标记为抓取算法给出的候选接触点,训练中每次回合采样一个作为末端引导目标。
候选点数量是一个真实权衡。论文指出,点太少会让策略过度执着于少数位置,甚至为了靠近候选点牺牲移动任务;点太多则退化成近似均匀网格采样,复杂非凸物体上的不可行点增多,接触发现变慢。25 个点的作用是把探索集中到结构相关区域,同时保留足够多样性。
奖励分成三组。任务组包含物体朝目标速度和物体位置跟踪;探索组包含末端执行器跟踪接触点;正则组包含底盘动作变化率、机械臂动作变化率、钩取高度惩罚和动作限位惩罚。任务组权重固定为 0.75,探索组权重从 0.10 降到 0.01,正则组权重从 0.15 升到 0.24。探索权重在 5000 到 10000 步之间线性衰减,正则权重在同一区间线性上升。
这个调度写出如下形式:
$$w_{\mathrm{exp}}(k)=\begin{cases}0.10,&k\le 5000\\0.10-0.09\frac{k-5000}{5000},&5000<k<10000\\0.01,&k\ge 10000\end{cases}$$
$$w_{\mathrm{reg}}(k)=\begin{cases}0.15,&k\le 5000\\0.15+0.09\frac{k-5000}{5000},&5000<k<10000\\0.24,&k\ge 10000\end{cases}$$
$$w_{\mathrm{task}}=0.75$$
这里的关键不是简单地“先给探索高权重”,而是让探索目标拥有独立的价值估计。标量奖励调度也可以降低探索权重,但任务、探索和正则仍然共享一个价值函数;当它们的优势方向冲突时,价值网络必须学一个混合后的期望,策略梯度的来源难以区分。多评价家把三组回报分开估计,再在优势层面混合,调度作用在梯度贡献上。
对每个价值头 $V_{\phi_h}$,时间差分误差定义为:
$$\delta_t^h=r_t^h+\gamma V_{\phi_h}(s_{t+1})-V_{\phi_h}(s_t)$$
对应优势由后续时间差分误差累积得到:
$$A_t^h=\sum_{k=0}^{\infty}\gamma^k\delta_{t+k}^h$$
随后三组优势按当前权重相加,得到驱动 PPO 更新的合成优势:
$$A_t=\sum_{h=1}^{3}w_h A_t^h$$
价值损失也不是把所有头强行变成一个总回报,而是按头计算经验回报 $R_t^h$,再求加权平方误差:
$$\mathcal{L}^{\mathrm{VF}}(\phi)=\sum_{h=1}^{3}w_h\left|V_{\phi_h}(s_t)-R_t^h\right|^2$$
策略本体仍使用 PPO 的截断代理目标。设重要性比率 $\rho_t(\theta)$,更新最大化:
$$\mathcal{L}^{\mathrm{CLIP}}(\theta)=\hat{\mathbb{E}}_t\left[\min\left(\rho_t(\theta)A_t,\mathrm{clip}\left(\rho_t(\theta),1-\epsilon,1+\epsilon\right)A_t\right)\right]$$
正则里有一个容易被误读的项。钩取高度惩罚用于阻止机械臂压到不安全的高度。其原始形式是:
$$r_{\mathrm{hk}}=e^{\max(0,\,0.15-z_{\mathrm{ee}})}-1$$
当末端高度 $z_{\mathrm{ee}}$ 低于 0.15 米时,指数项快速增大;高于阈值时为 0。由于这个原始值的量级远小于其他奖励,表中系数是 -5000。这不是任意夸大惩罚,而是把指数惩罚重新缩放到可比较范围。

图 4:同一物体与不同目标位置下,策略选择朝运动方向一致的接触侧并调整底盘位姿。
动作空间刻意保持小而分层次。高层输出 10 维动作:底盘 4 维指令加机械臂 6 维关节目标。底盘高度不是固定常数,而是动作的一部分。论文解释,机械臂向前下方伸的时候,肩关节容易碰到限位;如果底盘能降低,末端就能用更舒适的臂形接近低处钩点。真机策略最终学会把底盘降到比标准行走高度低约 15 厘米。
观测分为 actor 和 critic 两类。actor 只用机载可得的本体量与物体状态,包括关节状态、投影重力向量、底盘速度、物体位置、姿态和相对目标的误差,全部转换到机器人底盘坐标系。critic 额外使用特权信息:物体线速度、角速度和当前回合选中的接触点。actor-critic 分离保证部署时不需要依赖真机不可得的观测量。
网络结构共用主干、分叉价值头。actor 是 256 维 LSTM,后面接 [256, 128, 64] 的多层感知机,激活函数为 ELU,最后输出高斯动作分布参数。多评价家 critic 也先用共同 LSTM 和初始 MLP 层提取时序特征,仅在末端分出三个价值头。论文强调,与单评价家相比,这种结构的显存和训练时间差异可忽略。
训练用大规模并行仿真。Isaac Lab 同时运行 4096 个环境,仿真步长 0.005 秒,控制步长 0.02 秒。每个环境包含机器人、目标物体和随机目标位置。回合重置时随机化机器人初始位姿、关节状态、物体质量和摩擦。物体摩擦范围是 0.2 到 1.5,物体质量是 2 到 4 千克,机器人底盘附加质量随机化范围为正负 5 千克。
椅子资产包括 15 个 IKEA CAD 模型和 100 个程序生成椅子。程序化椅子的总高度取 0.70 到 1.10 米,座位离地高度取 0.35 到 0.55 米,座位宽度和深度各取 0.40 到 0.60 米,座位与靠背厚度取 0.02 到 0.05 米,腿截面取 0.03 到 0.06 米。这些数值覆盖了从轻便椅到高背椅的大范围形态。
目标命令是相对物体初始位置的二维点,每次重置在以物体为中心、半径 2 米的圆盘内均匀采样。PPO 的 actor 与 critic 学习率均为 0.0001,折扣因子 0.99,GAE 参数 0.95,clip 范围 0.2,KL 目标 0.01,每个 epoch 更新 5 次,每次 4 个 mini-batch。

图 5:箱推与椅子运输中不同方法的成功率、超时、脱接触和倾翻分析。
flowchart TD M[Object mesh] --> G[Grasp It Like a Pro 2.0] G --> C[25 contact candidates] C --> R[Sample p target at episode reset] R --> A[High level LSTM actor] A --> U[4D base command] A --> J[6D arm joint target] U --> L[Frozen locomotion policy] L --> Q[Leg joint targets] J --> E[End effector contact] Q --> B[Base motion] B --> E E --> RT[Task reward group] E --> RE[Exploration reward group] A --> RR[Regularization reward group] RT --> VH[Task value head] RE --> VE[Exploration value head] RR --> VR[Regularization value head] VH --> AX[Weighted advantage mixing] VE --> AX VR --> AX AX --> P[PPO clipped update] P --> S[Exp weight decay and reg weight increase]
实验结果
仿真主结果说明调度的价值。论文比较四种方法:普通 PPO、带奖励权重调度的 PPO、固定权重多评价家 PPO,以及完整的多评价家 PPO 加权重调度。所有方法都在训练中看到接触引导奖励。结果显示,完整方法达到 94.1% 成功率,倾翻率为 4.4%,平均完成时间 9.2 秒。带奖励调度但不拆分评价家的方法完成时间为 9.1 秒,但学习稳定性差很多。
跨 5 个随机种子,完整方法成功率标准差是 0.98%。固定权重多评价家为 4.2%,标量奖励调度为 1.2%,普通 PPO 为 9.7%。这说明多评价家带来的稳定性与权重调度带来的任务聚焦是两个互补因素:只拆分评价家能解决接触发现,但探索目标残留会破坏运输稳定;只调度标量奖励能减少脱接触,却无法拆开价值估计中的冲突。
| 方法 | 关键机制 | 论文报告的结果 |
|---|---|---|
| 普通 PPO | 单一价值函数,标量奖励加权 | 成功率标准差 9.7%;椅子任务脱接触率 9.1% |
| PPO + WS | 奖励项权重随训练衰减 | 脱接触率降到 4.0%;完成时间 9.1 秒;稳定性仍差 |
| Multi-Critic PPO | 任务、探索、正则各有价值头,但权重固定 | 能有效找到接触,但倾翻率明显升高 |
| Multi-Critic PPO + WS | 分组价值头加优势权重调度 | 成功率 94.1%,倾翻率 4.4%,完成时间 9.2 秒,成功率标准差 0.98% |
论文还测试了一个没有任何探索奖励的变体,成功率为 0%。这个消融非常直接:即使有大规模并行仿真和任务奖励,缺乏接触先验时,策略无法可靠发现非抓取交互。普通 PPO 在椅子任务上的脱接触率为 9.1%,标量奖励调度把它降到 4.0%,说明引导探索确实有效;但完整方法的稳定提升来自价值头的解耦。
评价指标定义也影响理解。成功表示物体到达目标 0.2 米内;脱接触表示物体位移小于 0.2 米;倾翻表示物体倾斜超过 35 度。作者说明,35 度只是统一标注阈值,不等于每个物体的精确倾翻角;在 30 到 40 度内改变阈值时,方法排序和趋势不变。
定性行为显示策略理解物体拓扑。固定机器人和物体初始位姿,只在物体周围均匀采样目标后,策略会根据目标方向选择接触侧。若目标是向左牵引,机械臂与底盘倾向于组织到能持续施加控制力的侧面,而不是机械地走向最近候选点。策略还会把底盘放在机械臂较优工作空间内,避免奇异位形。
真机实验覆盖 4 个未见 IKEA 物体,共 58 次尝试。总体成功 40 次,成功率 69.0%。主要基准 ADDE 为 27/37、72.90%;SANDSBERG 为 8/14、57.14%。案例研究包括折叠椅 VIHALS 的 3/3 和无靠背三脚桌 LOVBACKEN 的 2/4。LOVBACKEN 特别重要,因为策略必须把训练中学到的椅子腿钩取模式迁移到缺少靠背、拓扑不同的桌子上。
| 物体 | 类型 | 成功次数 | 总次数 | 成功率 |
|---|---|---|---|---|
| ADDE | 主要基准 | 27 | 37 | 72.90% |
| SANDSBERG | 主要基准 | 8 | 14 | 57.14% |
| VIHALS | 折叠椅案例 | 3 | 3 | 100.00% |
| LOVBACKEN | 三脚桌案例 | 2 | 4 | 50.00% |
| 总体 | 四个未见物体 | 40 | 58 | 69.00% |

图 6:四足移动操作平台在多类未见 IKEA 物体上的零样本运输测试。
真机成功率从仿真的 94.1% 明显回落,ADDE 和 SANDSBERG 分别为 72.9% 和 57.1%。作者定位的主要失败链是:为了避免正前方自碰撞,策略有时从侧向接近;侧向接近带来较急的偏航指令;真机上偏航运动加剧里程计漂移;状态估计误差又导致更激进的动作,最终把物体推倒。这个失败模式不是“策略完全没学会”,而是仿真中的理想状态估计与真机里程计误差之间的差距。
恢复行为是论文里很有价值的涌现结果。当第一次钩取滑掉或落空时,策略不会僵住,而是重新调整底盘,加大末端轨迹幅度,再次建立接触并继续任务。论文用图 7 展示了这个序列:先重新定位,再增大摆动,然后恢复运输。对一个非抓取任务来说,这种失败后重试能力比单次成功更有部署意义。

图 7:初次滑脱后,策略重新定位底盘、增大机械臂摆幅并再次建立稳定接触。
动态目标跟踪验证了局部控制器能力。实验中人为实时改变目标位置,策略能继续调整底盘速度和接触力,使椅子沿变化轨迹运动。作者认为这说明该策略可以直接接到高层路径规划器后面,不必假设目标在整个回合内固定。
负载测试显示非抓取控制能借用地力和底盘。椅子附加 5 千克负载后,总质量达到 6.5 千克,超过了机械臂完全伸展时的额定静态负载。策略仍能完成运输。原因不是机械臂硬扛负载,而是钩取点、底盘推进和地面支持共同分担了物体运动所需的力。

图 8:左侧为附加 5 千克负载的运输,右侧为人为推动椅子后的扰动恢复。
扰动测试进一步检验闭环稳定性。运输过程中由人推动椅子,训练环境并没有显式模拟这一扰动。策略在接触被迫脱离后能重新规划接近路径、重新钩住物体并继续把椅子送到目标。这暗示域随机化和接触引导让策略学到了一些状态修正能力,而不只是复现固定开环轨迹。
洗碗机任务出现接触序列切换。候选点同时放在把手和门板上。策略先钩把手启动开门;随着门板角度变化,接触点切换到门板,用推压动作把门放到完全打开位置。简单 PPO 也能完成该任务,但通常固定在把手附近准静态拉动,机械臂长期靠近关节限位。完整方法将机械臂关节处于限位 10% 范围内的时间比例平均降低 59%。
这个结果把“探索奖励”的价值从初始接触扩展到了多阶段接触。把手适合启动铰链运动,门板适合后续施力。若奖励只优化最终开门成功,策略可能找到一条可行但费力的轨迹;接触候选让中间交互结构进入学习信号,权重调度又避免策略一直停留在候选点附近。
局限性
作者明确承认两点:一是三项任务还不足以覆盖更广域偏移,需要更多环境、物体和传感条件验证;二是真机物体位姿依赖外部动作捕捉,限制了野外部署。这两点决定了当前系统的验证范围:它证明了策略和接触先验可以零样本迁移到真实家具,但还没有证明可以在普通家庭感知条件下部署。
真机失败链也暴露了工程边界。侧向接近导致的急偏航会降低里程计质量,随后引发更激进动作。若只靠机载本体感知,系统缺少对物体真实位姿的可靠修正。未来要么加入物体级状态估计和接触观测,要么训练时显式注入里程计漂移与延迟,否则 Sim-to-Real 差距可能继续集中在 SANDSBERG 这类案例上。
固定权重调度虽然有效,但依赖任务相关的经验调参。论文在椅子运输上选定 5000 到 10000 步的衰减区间,并原样用于其他任务。如果接触发现延迟明显变化,固定窗口可能过早取消引导或过晚退出探索。作者提出用基于表现的自适应课程替代固定调度,这是合理的下一步。
仿真到真机的成功率差距仍然显著。仿真为 94.1%,真机主要基准在 57.1% 到 72.9% 之间。论文没有把差距全部归因于单一因素,但外部动捕、里程计误差、真实接触摩擦和结构变形都可能在其中。若要把 69% 提升到可靠服务机器人水平,需要更细的失败分类与在线恢复评估。
总结与展望
这篇论文的工程贡献在于把一个抽象探索问题拆成了可操作组件:抓取算法负责给出物理上合理的接触候选,密集探索奖励负责把末端引向候选,独立评价家负责让探索信号不污染任务价值,权重调度负责让引导最终退出。它与“给成功奖励加 shaping”的区别在于,每个组件都有独立的学习目标和退出机制。
实验说服力主要来自消融链。没有探索奖励为 0%,标量调度降低脱接触但不稳定,固定多评价家解决接触但增加倾翻,完整方法同时提升成功率与稳定性。真机 69% 不算完美,但 40/58 次结果、4 种物体、3 脚桌案例、6.5 千克负载和人为扰动共同说明策略学到了可迁移的接触行为。
下一步最有价值的工作是把外部动作捕拿掉,加入基于机载视觉或触觉的物体状态估计;把固定调度换成根据接触发现率、成功率或限位占比调整的自适应课程;并把侧向接近和急偏航作为显式风险项纳入训练。这样,接触引导探索才可能从实验室基准走向家庭环境中的长时间运行。
金句
“抓取点可以教机器人接触,但只有让探索权重退场,机器人才会从找到接触走向完成搬运。”



