Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

强化学习全身控制多评论家

用于全身末端执行器旋量跟踪的多评论家学习方法

在单一策略中学习行走和手臂运动的全身控制面临挑战,因为两个任务存在冲突目标。例如,高效的行走通常偏好水平基座朝向,而末端执行器跟踪可能受益于基座倾斜以扩大可达范围。此外,当前使用基于位姿任务规范的强化学习(RL)方法缺乏直接控制末端执行器速度的能力,使得平滑执行轨迹非常困难。为解决这些限制,我们提出了一种基于 RL 的框架,支持动态的、速度感知的全身末端执行器控制。该方法引入多评论家执行器架构,解耦行走和操作的奖励信号,简化奖励调参并使策略能更有效地解决任务冲突。此外,我们设计了基于旋量的末端执行器任务规范,可同时跟踪离散位姿和运动轨迹。我们通过使用配备机械臂的四足机器人的仿真和硬件实验验证了该方法。所得控制器可同时行走和移动末端执行器,并展现出涌现的全身行为——在没有明确公式的情况下基座协助手臂扩展工作空间。

Aravind Elanjimattathil Vijayan, Andrei Cramariuc, Mattia Risiglione, Christian Gehring, Marco Hutter2025年7月11日3 分钟阅读
EN

研究背景与动机

四足机器人在复杂地形上的移动能力已经相当成熟,但当需要在移动过程中同时操作机械臂完成精确的末端轨迹跟踪时,现有方法面临两大核心挑战。第一,目标冲突问题:高效的行走控制倾向于保持躯干水平以降低能耗并维持步态稳定,而末端执行器的可达性往往需要躯干倾斜来扩展工作空间;同时,行走时躯干速度跟踪精度远不足以支撑精确的末端控制,导致统一策略在精度上大幅下降。具体来说,行走过程中躯干线速度跟踪误差通常在分米量级,而末端执行器精确操作需要厘米甚至毫米级精度,两者之间存在数量级差距。第二,任务表征问题:当前强化学习方法多采用目标位姿跟踪来定义末端任务,但这种方式缺乏对速度的显式规范——控制器试图刚性跟踪每一个离散路径点,在连续轨迹执行时产生颠簸和不平滑运动,这在工业操作、服务机器人等需要平滑轨迹的场景中不可接受。

已有的解决方案各有局限:Portela 等人将行走与末端运动分离,需要控制器切换且无法在移动中操作手臂;基于 MPC 的全身控制器虽能同时实现移动和高精度末端运动,但难以建模复杂交互且鲁棒性不足;轮腿系统因车轮减少了步态相关的躯干运动而更容易实现手臂运动,但适用范围有限。从技术发展脉络来看,早期的解耦方案虽然降低了问题难度,但牺牲了全身协同的潜力——当手臂需要到达超出其自身工作空间的位置时,躯干无法主动配合。统一策略方案虽然保留了协同潜力,但单一评价者难以平衡相互冲突的奖励信号,往往导致策略在移动和操作之间折中,两方性能都不理想。本文针对上述问题,提出了一种基于多评价者演员架构和 twist 末端命令公式的强化学习框架,旨在实现移动与操作目标冲突的自动调和以及连续平滑的轨迹跟踪。

核心方法:多评价者架构与 Twist 命令

任务定义与状态空间

系统基于 ANYmal 四足机器人搭载 6 自由度机械臂平台,采用师生蒸馏框架。特权教师策略接收 187 维状态向量:

$$\bm{s}_t = [\bm{h}_t, \bm{o}_t, \bm{p}_t, \bm{a}_{t-1}, \bm{c}_t] \in \mathbb{R}^{187}$$

其中 $\bm{h}_t \in \mathbb{R}^{72}$ 为本体感知历史,$\bm{o}_t \in \mathbb{R}^{45}$ 为特权观测(地形高度图等),$\bm{p}_t \in \mathbb{R}^{32}$ 为本体参数,$\bm{a}_{t-1} \in \mathbb{R}^{18}$ 为上一时刻动作,$\bm{c}_t \in \mathbb{R}^{20}$ 为命令向量。命令向量包含躯干线/角速度、末端执行器线/角速度、目标位姿估计等。动作输出 18 维:6 维手臂关节增量加 12 维腿部关节增量:

$$\bm{a}_t = [\bm{a}_t^{arm}, \bm{a}_t^{robot}], \quad \bm{a}_t^{arm} \in \mathbb{R}^{6}, \quad \bm{a}_t^{robot} \in \mathbb{R}^{12}$$

关节位置更新通过截断动作实现:$\bm{q}_{t+1} = \bm{q}_t + \text{clamp}(\bm{a}_t / \sigma_a, -1, 1)$,其中 $\sigma_a$ 为动作缩放因子。学生策略仅接收本体感知信息,通过蒸馏学习在部署时无需特权观测即可运行。这种师生架构在足式机器人领域已被广泛验证——教师可以利用地形高度图等特权信息训练出高质量策略,学生再通过行为克隆从教师的输出中学习如何在仅依赖本体感知的条件下复现相似性能,从而实现零样本仿真到真实迁移。

Twist 末端命令公式化

本文的核心创新之一是将末端任务表示为 twist 命令而非纯位姿目标。给定起点位姿 $(\bm{r}_s, \bm{\theta}_s)$ 和目标位姿 $(\bm{r}_g, \bm{\theta}_g)$,通过参数 $\alpha \in [0,1]$ 在 SE(3) 上插值得到中间位姿:

$$\bm{r}_i = \bm{r}_s + \alpha \cdot (\bm{r}_g - \bm{r}_s), \quad \bm{r} \in \mathbb{R}^{3}$$

$$\bm{\theta}_i = \bm{\theta}_s \boxplus \alpha \cdot (\bm{\theta}_g \boxminus \bm{\theta}_s), \quad \bm{\theta} \in SO(3)$$

其中 $\boxplus$ 和 $\boxminus$ 为 SO(3) 上的流形运算,确保旋转插值在流形上保持几何正确性。末端 twist(速度)命令直接从当前末端位姿与插值目标位姿之差计算:

$$\bm{v}_{EE} = \frac{1}{\Delta t}(\bm{r}_i - \bm{r}_{EE}), \quad \bm{\omega}_{EE} = \frac{1}{\Delta t}(\bm{\theta}_i \boxminus \bm{\theta}_{EE})$$

这一公式化的关键优势在于:控制器同时接收位姿目标和速度目标,使得轨迹执行时能够根据速度命令自然地平滑过渡,而非在离散路径点之间做刚性切换。课程学习策略在训练初期使用较大的 $\Delta t$(慢速)并逐步减小到较小值(快速),使策略逐步适应不同速度的轨迹跟踪。所有任务均在机器人中心坐标系下定义,将任务空间与躯干运动解耦——这意味着无论躯干如何运动,末端任务都在以机器人为中心的框架内描述,简化了协调控制。这种设计还有一个重要好处:当躯干因地形或步态需要倾斜时,末端任务目标不会因坐标系变换而漂移,策略可以直接在熟悉的坐标系中规划手臂运动。

多评价者演员学习架构

为解决移动与操作目标冲突问题,本文将奖励信号按功能分为三组:移动奖励(locomotion)、操作奖励(manipulation)和接触调度奖励(contact scheduling),每组分配独立的评价者 $V_{\phi_i}(\cdot)$。每个评价者独立估计对应奖励组的优势函数 $\hat{A}_i$,各优势函数独立归一化后求和作为总优势:

$$L(\theta) = \hat{\mathbb{E}}\left[\min\left(r_t(\theta)\hat{A}, \; \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}\right)\right]$$

其中 $r_t(\theta)$ 为策略比率,$\epsilon$ 为截断参数,$\hat{A} = \sum_i \hat{A}_i$ 为归一化后的总优势。独立归一化确保各评价者贡献量级一致,避免某一组奖励主导梯度方向。这一设计使得奖励缩放变得不敏感——消融实验表明,将移动或操作奖励放大 5 倍甚至 10 倍时,多评价者架构仍能同时学好两类任务,而单评价者架构则只学会其中一类而忽略另一类。这一结果的理论解释是:单评价者中,放大的奖励组产生更大的优势值,在梯度更新中主导策略优化方向,导致策略过度关注该组任务;而多评价者架构中,每个评价者独立归一化后,无论原始奖励绝对值多大,其优势贡献都被缩放到统一量级,从而保持了各组任务在策略更新中的平衡。

足部相位信号通过正弦函数生成:

$$\bm{h}_f = h_{max}\left[\sin(2\pi\theta_{LF}), \sin(2\pi\theta_{RF}), \sin(2\pi\theta_{LH}), \sin(2\pi\theta_{RH})\right]$$

其中 $\bm{\theta} = [\theta_{LF}, \theta_{RF}, \theta_{LH}, \theta_{RH}]$ 为四足相位,$h_{max}$ 为最大抬腿高度,用于驱动接触调度评价者学习正确的步态时序。正弦相位信号将离散的接触状态转化为连续信号,使策略能够预判足部切换时刻,提前调整重心和手臂运动,避免在足部切换瞬间产生末端跟踪突变。

flowchart TD
    A["特权观测 + 本体感知
187维状态"] --> B["教师策略 π_θ"] B --> C["18维动作输出
6维手臂 + 12维腿部"] C --> D["环境执行
ANYmal + 6DoF臂"] D --> E1["移动评价者 V_φ1"] D --> E2["操作评价者 V_φ2"] D --> E3["接触调度评价者 V_φ3"] E1 --> F["优势归一化求和
 = Σ Âᵢ"] E2 --> F E3 --> F F --> G["PPO 截断更新
L(θ) = E[min(r·Â, clip(r)·Â)]"] G --> B D --> H["Twist命令模块
v_EE = (r_i - r_EE)/Δt"] H --> B

奖励设计

奖励函数采用高斯核形式 $\Phi(\bm{v}, \sigma^2) = \exp(-\bm{v}^T\bm{v}/\sigma^2)$,对所有跟踪误差和正则项进行平滑惩罚。高斯核相比绝对值或二次惩罚的优势在于:它在零附近梯度较小(避免过约束),在偏离较大时梯度迅速增大(强惩罚),且函数值始终为正,便于多奖励项加权组合。移动奖励包括:躯干线速度跟踪 $\Phi(\hat{\bm{v}}_{b_{x,y}} - \bm{v}_{b_{x,y}}, 0.1)$、角速度跟踪 $\Phi(\hat{\bm{\omega}}_{b_z} - \bm{\omega}_{b_z}, 0.05)$、躯干高度跟踪 $\Phi(\hat{\bm{h}}_{b_z} - \bm{h}_{b_z}, 0.1)$、躯干姿态 $\Phi(\bm{\theta}_{b_{xy}}, 0.1)$、以及能量惩罚 $\Phi(\bm{\tau}_{t,robot}, 40.0)$ 和关节速度惩罚 $\Phi(\dot{\bm{q}}_{t,robot}, 4.0)$。操作奖励核心是末端 twist 跟踪误差:

$$\Phi\left(\bm{r}_{EE_t} - (\bm{r}_{EE_{t-1}} + \hat{\bm{v}}_{EE} \cdot \Delta t), 0.005\right) + \Phi\left(\bm{R}_{EE_t} \boxminus (\bm{R}_{EE_{t-1}} \boxplus \hat{\bm{\omega}}_{EE} \cdot \Delta t), 0.01\right)$$

该项惩罚末端实际运动与命令 twist 预测的预期运动之间的偏差,直接驱动策略精确跟踪速度命令。注意位置跟踪的核宽度仅为 0.005(5毫米量级),远小于移动奖励中的 0.1,反映了对末端精度的极高要求。接触调度奖励同时考虑支撑相和摆动相:支撑相惩罚足部力偏差和高度偏差,摆动相鼓励足部垂直力和水平速度归零,时序奖励为 $\text{Var}(t_{air_{t-2..t}}) + \text{Var}(t_{contact_{t-2..t}})$ 以鼓励均匀步态。域随机化覆盖足部静摩擦 [0.5, 1.2]、动摩擦 [0.3, 1.2]、躯干质量扰动 ±10kg、末端质量扰动 [0, 1.8]kg、外力 ±50N 等参数,确保零样本迁移的鲁棒性。

实验结果

仿真对比实验

在半圆轨迹跟踪任务下,将本文方法与 Taka 3-DoF、Taka 6-DoF、Ma、Portela 以及全身 MPC 控制器进行对比。仿真结果如下表所示:

控制器 站立位置误差 [m] 站立角度误差 [°] 行走位置误差 [m] 行走角度误差 [°]
本文方法0.01761.8150.03582.872
Taka 3-DoF0.05804.1960.41804.711
Taka 6-DoF0.04393.6080.04364.974
Ma0.03863.5150.04836.432
Portela0.03911.756

站立时本文方法位置误差仅 1.76cm,比次优的 Taka 6-DoF(4.39cm)低 60%;行走时 3.58cm 远优于 Taka 3-DoF 的 41.8cm。Portela 方法因不支持行走而无法在移动场景对比。值得注意的是,站立策略在训练时因双腿持续接触地面而具有天然稳定性优势,但本文方法在站立场景下仍然超越了纯站立策略 Portela,说明多评价者架构和 twist 命令的精度提升不依赖于稳定性的额外增益。在包含线速度和角速度误差的扩展对比中(含全身 MPC),本文方法在直线、圆形和工作空间扫描三种轨迹上均取得最低误差——例如圆形轨迹行走时位置误差仅 1.37cm,而 Taka 6-DoF 达 4.60cm,Ma 达 4.25cm。全身 MPC 虽然在站立时表现尚可,但在行走时因模型预测与实际动力学偏差增大而性能下降,而学习方法通过域随机化获得了更好的鲁棒性。

硬件实验与涌现行为

硬件实验在真实 ANYmal+臂平台上进行,测试了线性和半圆轨迹在不同速度下的跟踪性能。线性运动 XYZ 方向在 0.1m/s 速度下位置误差约 2.74cm、速度误差 0.0898m/s;在 0.2m/s 下位置误差 3.48cm、速度误差 0.1781m/s。半圆轨迹在 0.2m/s 下位置误差 7.32cm、速度误差 0.3590m/s。速度增大时误差相应增大,但总体保持在可接受范围内。

图1:四足机器人全身操作-移动框架,左图为协调全身行为,右图为行走中精确末端控制

图2:多评价者架构将移动、操作和接触调度奖励解耦到独立评价者

图3:工作空间扫描轨迹用于评估仿真中的跟踪性能

一个显著的涌现行为是基座辅助臂扩展工作空间:尽管没有任何显式公式化鼓励躯干辅助手臂,策略自发学会在手臂接近工作空间边界时倾斜躯干来扩展可达范围。这体现了多评价者架构促进移动和操作协同的优势——各评价者独立学习后通过共享演员自然协调,移动评价者不惩罚合理的躯干倾斜(只要不影响移动质量),操作评价者则通过末端精度提升间接奖励躯干配合。另一个涌现行为是运行时 trot 步态泛化:虽然训练仅使用静态行走步态,但部署时策略能泛化到 trot 步态下保持末端跟踪精度,说明 twist 命令的机器人中心坐标系定义使得步态变化不影响末端任务表征。"鸡头"实验中,机器人行走时末端保持静止目标,位置误差均值仅 1.56cm、最大 2.87cm,充分展示了全身任务协调能力——这相当于机器人在行走时手臂像鸡头一样保持稳定,对实际操作场景(如端水行走)有直接应用价值。

消融实验

消融项 结果
单评价者 vs 多评价者奖励放大5-10倍时,多评价者仍同时学好两类任务,单评价者只学一类
课程学习对twist命令从慢速到快速的课程学习显著提升高速轨迹跟踪精度
鸡头控制行走中位置误差均值1.56cm,最大2.87cm

消融实验中最具说服力的是单评价者与多评价者的奖励敏感性对比。当移动奖励或操作奖励被放大 5 倍时,单评价者策略完全偏向被放大的任务——如果放大移动奖励,策略学会优秀行走但手臂完全不动;如果放大操作奖励,策略学会精确手臂控制但机器人无法行走。而多评价者架构在同样放大倍数下仍然同时学好两类任务,证明了独立归一化机制的有效性。这一结果对实际工程意义重大:在实际部署中,不同任务的奖励量级往往难以预先平衡,多评价者架构消除了这一调参负担。课程学习消融则表明,如果一开始就以高速度训练 twist 跟踪,策略无法学会精确跟踪——必须从慢速开始,让策略先学会精确位姿控制,再逐步引入速度挑战。

局限性与未来方向

局限一:地形适应性受限。 当前移动性能仅限于中等粗糙地形,因为鲁棒粗糙地形控制器不是本文重点。作者明确指出未来计划通过包含感知的奖励公式化来扩展地形适应性,但训练全身教师策略同时包含鲁棒手臂操作和感知移动将显著增加训练时间并使后续调参更困难。不过多评价者架构本身应该能简化新增奖励项的调参——因为新奖励可以分配给独立的评价者,不影响已有评价者的优势估计。

局限二:关节限位触发安全机制。 全身操作中机器人偶尔达到肩关节限位,触发安全机制。未来可通过在策略训练中加入关节限位惩罚、终止条件或约束 PPO 来解决。训练仅用静态行走步态也是局限——更复杂步态(如奔跑、跳跃)下的操作能力未验证,而高速步态下躯干运动更剧烈,末端跟踪难度更大,twist 命令在高速场景下的有效性仍有待验证。

总结与启示

本文提出了面向四足机器人的全身操作-移动框架,通过多评价者 PPO 架构和 6D twist 末端命令公式实现连续平滑的轨迹跟踪。核心技术贡献包括:多评价者架构将移动、操作和接触调度奖励解耦到独立评价者,各优势独立归一化后求和避免梯度干扰,对奖励缩放不敏感且无需复杂调参——单评价者放大某组奖励时仅学对应目标而忽略另一目标;twist 末端命令显式包含速度信息 $\bm{v}_{EE} = \frac{1}{\Delta t}(\bm{r}_i - \bm{r}_{EE})$ 解决位姿跟踪缺乏速度规范导致的颠簸问题;机器人中心任务坐标系解耦任务与躯干运动;局部轨迹重初始化加速学习。在 ANYmal+臂平台上站立位置误差 1.76cm、行走 3.58cm,显著优于 Taka/Ma/Portela 基线和全身 MPC。涌现行为包括运行时 trot 步态泛化和基座辅助臂扩展工作空间——后者尽管无显式公式化,体现了多评价者架构促进移动和操作协同的优势。该工作为全身操作-移动控制提供了统一策略框架,奖励解耦和 twist 跟踪的思路可推广到更多多任务机器人控制场景,为人形机器人和其他足式操作系统的统一控制提供参考。训练配置方面,使用 PPO 学习率 $3.0 \times 10^{-4}$,GAE 参数 $\gamma=0.99$、$\lambda=0.95$,批大小 4096,每轮 24 个并行环境,评价者网络结构 [512, 256, 128]。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
LAC:人形机器人全身线性与角度柔顺控制

LAC:人形机器人全身线性与角度柔顺控制

LAC 提出通用人形全身柔顺控制器:在人体交互数据接触帧上施加采样的力/力偶扰动合成大规模柔顺响应数据,经教师-学生强化学习训练单一策略,实现对上半身外力的线性与角度柔顺、刚度全程单调调制,并在仿真、真机与遥操作移动操作中验证。

人形机器人全身控制柔顺控制2026年8月26日
超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进

超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进

Q-Planning 冻结大型行为克隆策略,只训练一个约十亿参数的离线 Q 函数。推理时,Q 对 BC 采样出的多个候选动作块做单步加权平均;在线自改进时,成功与失败回放都只用于更新 Q。10 轮迭代将 LIBERO 平均成功率从 92.1% 提升到 97.6%,双臂真机堆杯与插卡任务分别从 40%/25% 提升到 90%/80%。

机器人操控强化学习行为克隆2026年8月21日
运动先验重塑:让平地四足技能适应复杂地形

运动先验重塑:让平地四足技能适应复杂地形

论文提出分层强化学习框架:低层策略先在平地模仿犬类动作并形成运动先验,高层目标条件策略输出潜在步态指令与受约束关节残差,使 ANYmal-D 在楼梯、坡面、随机箱体和高障碍中保持自然动物风格步态,并完成感知运动、局部避障与目标导航。

四足机器人运动先验强化学习2025年5月21日