Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

人形机器人loco-manipulation灵巧操作

CoorDex:协调身体与手部先验实现连续灵巧人形行走操作

人形机器人行走操作常被简化为走走停停——走到物体前停下操作。CoorDex 提出协调身体与手部先验的框架,实现行走与操作同时进行的连续灵巧 loco-manipulation,无需停顿即可在移动中抓取和操控物体。

Sikai Li, Shuning Li, Zhenyu Wei, Yunchao Yao, Chenran Li, Mingyu Ding2026年6月22日2 分钟阅读
EN

1. 论文概览:协调身体与手部先验的连续灵巧人形行走操作

CoorDex 提出一个模块化学习管线,将高自由度人形机器人的行走与灵巧手操作映射为协调的潜在残差控制(coordinated latent residual control)。核心动机是:现有人形 loco-manipulation 常被简化为"走走停停"——走到物体前停下操作。CoorDex 通过分离全身腕部放置与手指协调,分别用身体先验和手部先验建模,再通过协调潜在残差策略耦合,实现行走中持续抓取和操控物体。在 Isaac Lab 中基于 Unitree G1(29-DoF 身体+20-DoF WUJI 灵巧手)验证三个任务:WalkGrab(行走中抓瓶)、OpenFridge(后退开门)、WalkPickTurn(拾取转体180°)。

CoorDex 系统概览

2. 核心问题:移动中的灵巧操作

人形机器人配备高自由度灵巧手,承诺单一机体既能导航人类环境又能操控日常物体。但实现这一承诺远非将末端执行器放到目标附近——机器人必须保持平衡、保持物体可达、接触前协调腕和手指姿态、合手时不扰动物体、运输物体时手-物交互不破坏全身动力学。现有方法的局限在于:手中心方法假设腕/臂轨迹由遥操作、规划或固定基座提供,无法处理"腕部放置从全身运动中涌现"的动态场景。CoorDex 的核心洞见是:非停顿灵巧操作需要身体先验和手部先验的分离但协调的建模——身体先验负责行走和腕部放置,手部先验负责手指协调,下游残差 RL 在低维潜在空间联合适配两者。

先验构建管线

3. 方法:协调潜在残差控制

3.1 先验构建

构建两个分离的运动先验:身体先验和手部先验。用 $x \in \{b, h\}$ 标记身体或手部子系统。身体先验训练全身运动跟踪教师 $\pi_T^b$,输入本体感受 $\mathbf{s}_t^{b,p}$ 和参考目标 $\mathbf{s}_t^{b,g}$,输出身体关节位置目标。手部先验在浮动手中训练特权跟踪教师 $\pi_T^h$,使用 ManipTrans 风格的手-物运动。蒸馏后得到编码器 $\mathcal{E}_x$、本体感受先验 $\mathcal{R}_x$ 和解码器 $D_x$。蒸馏损失为:

$$\mathcal{L}_{\text{distill}}^{x} = \mathcal{L}_{\text{action}}^{x} + \alpha_x \mathcal{L}_{\text{regu}}^{x} + \beta_x \mathcal{L}_{\text{KL}}^{x} \tag{1}$$

蒸馏后 $\mathcal{R}_x$ 和 $D_x$ 冻结,先验均值 $\boldsymbol{\mu}_t^{x,p}$ 提供下游残差 RL 的默认潜在命令。身体子系统 29-DoF 潜在维度 16,手部 20-DoF 潜在维度 12。

3.2 协调潜在残差策略

每步从冻结先验获取本体感受条件化先验均值:

$$\boldsymbol{\mu}_t^{b,p} = \text{Mean}[\mathcal{R}_b(\mathbf{z}_t^b \mid \mathbf{s}_t^{b,p})], \quad \boldsymbol{\mu}_t^{h,p} = \text{Mean}[\mathcal{R}_h(\mathbf{z}_t^h \mid \mathbf{s}_t^{h,p})] \tag{2}$$

残差策略预测潜在空间而非关节空间的残差:

$$\Delta\mathbf{z}_t = [\Delta\mathbf{z}_t^b, \Delta\mathbf{z}_t^h], \quad \Delta\mathbf{z}_t^b \in \mathbb{R}^{d_b}, \quad \Delta\mathbf{z}_t^h \in \mathbb{R}^{d_h} \tag{3}$$

共享协调躯干 $f_{\text{coord}}$ 产生任务级协调特征,再由身体头 $f_b$ 和手部头 $f_h$ 分别预测残差:

$$\mathbf{c}_t = f_{\text{coord}}(\mathbf{s}_t^{b,p}, \mathbf{s}_t^{h,p}, \mathbf{s}_t^{\text{task}}, \mathbf{s}_t^{\text{hand-object}}, \boldsymbol{\mu}_t^{b,p}, \boldsymbol{\mu}_t^{h,p}, \Delta\mathbf{z}_{t-1}) \tag{4}$$

修正后的潜在命令和最终关节目标为:

$$\tilde{\mathbf{z}}_t^b = \boldsymbol{\mu}_t^{b,p} + \Delta\mathbf{z}_t^b, \quad \tilde{\mathbf{z}}_t^h = \boldsymbol{\mu}_t^{h,p} + \Delta\mathbf{z}_t^h \tag{5}$$

$$\mathbf{a}_t^b = D_b(\mathbf{s}_t^{b,p}, \tilde{\mathbf{z}}_t^b), \quad \mathbf{a}_t^h = D_h(\mathbf{s}_t^{h,p}, \tilde{\mathbf{z}}_t^h) \tag{6}$$

协调残差策略架构与速度曲线

3.3 残差 RL 与环境设计

用 PPO 训练下游策略,保持身体和手部先验冻结。策略观测含身体本体感受、手部本体感受、任务状态、物体相对几何、指尖接触特征、先验均值和前一潜在残差。由于 actor 只输出 $\Delta\mathbf{z}_t$,探索发生在学习的潜在空间而非全关节空间。WalkPickTurn 使用 NoDemoRSI 机制:策略自身发现的状态快照作为后续 reset 点,无需专家状态或动作标签。每阶段采样概率按难度 $\max(1-\text{SR}_k, \epsilon)^p$ 自适应分配,$\epsilon=0.1$,阶段解锁需前阶段成功率超 0.70 且缓冲区满足最小快照数。

任务演示与消融对比

4. 实验

4.1 任务性能

三个任务验证统一接口支持多样的 loco-manipulation 技能。WalkGrab 最难(行走中连续抓取),OpenFridge 允许减速重定位,WalkPickTurn 更长时序但有 NoDemoRSI 支持。

任务成功率跌倒率掉落率任务指标
WalkGrab0.550.000.40速度保持~0.25m/s
OpenFridge0.660.00门角57.76°/60°
WalkPickTurn0.890.010.10最小航向误差9.98°

4.2 动作空间消融

在 WalkGrab 上对比三种变体。全关节空间移除两个先验,直接探索全身体+手关节空间,从未抓到瓶子。身体先验+手关节空间隔离手部难度——能走到瓶旁但不擅长手指协调,常减速停下尝试静止抓取。CoorDex 保持~0.25m/s 前向速度,不停顿即抓取。

方法成功率到达抓取停顿跌倒
全关节空间0.001.000.000.860.04
身体先验+手关节空间0.000.960.010.900.04
CoorDex0.551.000.550.000.00
动作空间消融可视化

4.3 协调残差预测

对比 Monolithic Latent Residual(单一 MLP 预测全潜在残差再分割)与 CoorDex(共享躯干+分离头)。两者使用相同冻结先验、潜在维度、RL 环境和奖励,唯一差异是策略架构。Monolithic 动作率 0.40(更高=更抖),CoorDex 动作率 0.22。

方法成功率动作率跌倒率
Monolithic Latent Residual0.000.400.02
CoorDex0.550.220.00
协调 vs 单片残差预测对比 真机硬件可视化

5. 局限性

  • 特权状态观测:当前策略使用特权状态观测(物体位姿、接触信号),未解决感知或视觉 sim-to-real 迁移。
  • 固定平台:实验聚焦固定 G1+WUJI 手平台,更广泛部署需跨更多机体和手形态的评估。
  • 掉落率较高:WalkGrab 掉落率 0.40 表明行走中抓取稳定性仍有提升空间,手-物交互扰动全身动力学的问题未完全解决。

6. 总结

CoorDex 提出模块化管线,将人形 loco-manipulation 映射为结构化潜在动作空间——身体和灵巧手各有分离先验,下游 RL 在低维潜在空间联合适配行走步态、腕部放置和手指接触。关键设计是分离但协调的先验组合:身体先验负责从全身运动中涌现腕部放置,手部先验捕捉可重用的手指协调模式,协调躯干让策略推理任务阶段和接触状态。消融证明身体+手双先验缺一不可——全关节空间从未抓取,仅身体先验退化为停顿抓取。核心洞见是:连续灵巧操作不是"先走后抓"而是"走中抓"——身体先验让腕到位、手部先验让指协调、残差 RL 让两者在行走中同步适配,三者缺一不可。

flowchart TD
    A["全身运动跟踪教师 π_T^b"] --> B["身体先验 R_b, D_b (29-DoF, dim=16)"]
    C["灵巧手跟踪教师 π_T^h"] --> D["手部先验 R_h, D_h (20-DoF, dim=12)"]
    E["运动捕捉演示"] --> A
    E --> C
    B --> F["冻结先验均值 μ_b"]
    D --> G["冻结先验均值 μ_h"]
    F --> H["协调躯干 f_coord"]
    G --> H
    I["任务状态+物体几何+接触"] --> H
    H --> J["身体残差头 f_b → Δz_b"]
    H --> K["手部残差头 f_h → Δz_h"]
    J --> L["z̃_b = μ_b + Δz_b"]
    K --> M["z̃_h = μ_h + Δz_h"]
    L --> N["身体解码器 D_b → 关节目标"]
    M --> O["手部解码器 D_h → 手指目标"]
    N --> P["PD 控制器 → G1 机器人"]
    O --> P
    P --> Q{"任务"}
    Q -->|WalkGrab| R["行走中抓瓶 0.55"]
    Q -->|OpenFridge| S["后退开门 0.66"]
    Q -->|WalkPickTurn| T["拾取转体 0.89"]
连续灵巧操作不是"先走后抓"而是"走中抓"——身体先验让腕到位、手部先验让指协调、残差 RL 让两者在行走中同步适配,三者缺一不可。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
LAC:人形机器人全身线性与角度柔顺控制

LAC:人形机器人全身线性与角度柔顺控制

LAC 提出通用人形全身柔顺控制器:在人体交互数据接触帧上施加采样的力/力偶扰动合成大规模柔顺响应数据,经教师-学生强化学习训练单一策略,实现对上半身外力的线性与角度柔顺、刚度全程单调调制,并在仿真、真机与遥操作移动操作中验证。

人形机器人全身控制柔顺控制2026年8月26日
GigaBrain-WBC:人形机器人全身控制的行为世界模型

GigaBrain-WBC:人形机器人全身控制的行为世界模型

首个用于人形机器人全身控制的行为世界模型(BWM),训练因果Transformer联合预测下一步动作、状态和潜在行为指令分布,使策略网络同时建模环境对行为的影响。自动地形标注管线从重定向运动中恢复3D接触几何,部署时检测不合理指令并回退到已学行为,在四项测试中成功率最高(地形交互81.3%、不合理指令83.1%、跌倒恢复99.3%),Unitree G1检查点可迁移至Maker L01机器人。

人形机器人Humanoid世界模型2026年8月18日
LATENT:从不完美人类动作学习人形网球技能

LATENT:从不完美人类动作学习人形网球技能

LATENT 以碎片化、不完整的人类网球动作数据为先验,经修正与组合学出可稳定击球的人形策略,部署到 Unitree G1,能与人类进行多拍对拉。

LATENT人形机器人网球2026年3月13日