Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

人形机器人全身运动运动生成

通过运动生成和运动跟踪学习全身人形运动

全身人形运动具有挑战性,因为高维控制、形态不稳定性以及需要使用机载感知对各种地形实时适应。直接将强化学习与奖励塑造应用于人形运动通常导致下半身主导行为,而基于模仿的方法在适应未见地形方面存在困难。本文提出通过运动生成和运动跟踪学习全身运动。

Zewei Zhang, Kehan Wen, Michael Xu, Junzhe He, Chenhao Li, Takahiro Miki, Clemens Schwarke, Chong Zhang, Xue Bin Peng, Marco Hutter2026年4月19日3 分钟阅读
EN

通过运动生成与运动跟踪学习全身人形机器人行走

arXiv:2604.17335|领域:人形机器人全身行走|平台:Unitree G1|Jetson Thor + Jetson Orin 板载|项目:wholebodylocomotion.github.io

一句话总结

论文提出全身人形行走框架:用扩散模型从重定向人类运动数据实时生成地形感知参考运动,用 RL 训练全身参考跟踪器,再用冻结的生成器在闭环中微调跟踪器以容忍不完美参考;在 Unitree G1 上板载感知与计算完成箱子攀登(75cm)、跨栏、上下楼梯及混合地形穿越,定量证明在线运动生成提升泛化、闭环微调提升鲁棒性。

研究背景与动机

全身感知人形行走是扩展人形机器人操作范围的重要但困难的一步。深度强化学习在四足系统上取得显著成功,但扩展到人形机器人仍相当困难——人形机器人自由度更高且形态约束更复杂。因此,仅靠奖励塑造训练 RL 全身人形控制器往往非平凡且探索效率低,无显式结构引导的纯 RL 控制器常收敛到全身协调有限的行走策略,难以获得挑战性地形穿越所需的协调行为。

为缓解奖励塑造和低效探索的困难,基于 RL 的运动模仿成为有前景的替代——利用参考数据,运动跟踪能高效转移高度协调的全身技能。但纯运动跟踪器本质上局限于重放编排好的轨迹,缺乏在非结构化多样环境中操作所需的适应性和反应性。达到人类级感知行走需要一种更高层的组合机制,能基于实时感知输入动态调整跨障碍物的行走风格。

技能组合的一种直接方案是蒸馏多个专用教师策略,或在单一模仿框架内从分离参考轨迹组合多技能。但当前方法未展示对多样技能集的强可扩展性或对新地形的鲁棒泛化。生成模型近期展示了可扩展运动控制的潜力——在大规模运动数据集上训练生成模型在角色控制和机器人控制中都有效,随着技能库扩展自然减少工程量。但直接部署表现力强的生成运动学轨迹可能引入运动伪影(足滑动、时间不连续),导致灾难性失败。

论文的方案是把扩散运动生成与 RL 运动跟踪结合并适配到实时机器人控制:用从人类运动数据学到的协调全身技能作为感知行走的技能组合模块,扩散生成器产生对应运动参考供低层跟踪策略使用。关键创新是用冻结生成器在闭环中微调跟踪器,使跟踪器学会容忍生成参考的不完美并充当"运动滤波器"。


图1:Unitree G1 上由扩散运动生成与 RL 运动跟踪使能的全身人形行走——硬件实验展示爬箱、下箱、跨栏及混合地形穿越。

方法详解

三阶段框架


图2:训练框架概览。(a) 数据收集与策展:人类运动经重建和重定向转为机器人运动再增强;(b) 预训练:扩散生成器和 RL 跟踪器仅在离线数据上训练;(c) RL 微调:冻结生成器运行下用随机方向命令和多样地形微调跟踪器。

框架分三阶段:(a) 收集不同地形的全身运动数据并转为动态可行机器人轨迹;(b) 在离线数据集上预训练 RL 运动跟踪器和扩散运动生成器;(c) 在更多样地形配置上微调运动跟踪器,保持生成器冻结并以滚动时域方式部署。

数据收集与策展

初始运动数据约 5 分钟,来自自录视频和公开数据集,含每种地形技能一个代表性运动:50cm 箱子攀登、35cm 跨栏、50cm 跳下、~20cm 台阶上下及全向行走。视频运动用 GVHMR 重建,再用接触约束 IK 求解器重定向到人形机器人,手动放置地形物体对齐原始运动。运动增强通过改变地形几何(缩放障碍高度、沿路径插入随机小箱)并用优化(地形穿透和运动平滑损失)保持一致性,最终数据集约 1 小时,覆盖 35-75cm 箱、25-45cm 跨栏、15-20cm 台阶。

预训练阶段

全身运动跟踪器:用 DeepMimic 风格 RL 框架配 PPO 在 IsaacLab 单 RTX 4090 上训练。设计模仿奖励 $r_{\text{mimic}}$ 和正则化项 $r_{\text{reg}}$ 使策略模仿所有参考运动同时尊重硬件物理约束:

$$R_{\text{pre}} = r_{\text{mimic}} + r_{\text{reg}}$$

跟踪器观测含参考状态(线/角速度 $\mathbb{R}^3$、关节位置速度 $\mathbb{R}^{23}$、关键体位置 $\mathbb{R}^{9 \times 3}$)、本体感知(5 帧基角速度/投影重力/关节位置速度/上次动作 $\mathbb{R}^{23}$)、地形高度扫描 $\mathbb{R}^{17 \times 11}$,输出 23 维目标关节位置。模仿奖励含基位姿跟踪、基速度跟踪、关节位置/速度跟踪、体位置跟踪等,均用指数衰减形式:

$$r_{\text{base pose}} = 3 \exp\!\left(-4\|\mathbf{p}_b^w - \mathbf{p}_b^{w*}\|^2 - \|\mathbf{q}_b \otimes \mathbf{q}_b^{*-1}\|^2\right)$$

扩散运动生成器:基于 MDM 架构预测 0.5 秒时域(25 帧)的全身参考运动序列,含根位置 $\mathbb{R}^3$、根朝向 $\mathbb{R}^4$、关节位置 $\mathbb{R}^{23}$、体连杆位置 $\mathbb{R}^{23 \times 3}$,以目标航向向量、地形高度扫描和过去两帧运动特征为条件。训练时随机采样运动序列,用前两帧为条件预测剩余帧,重建损失对比预测与真值,另加几何损失(速度、关节一致性、地形穿透)。

RL 微调阶段

直接组合预训练生成器和跟踪器仍可能因运动伪影、不完美参考的跟踪失败及训练分布外地形的有限泛化而受限。微调阶段用冻结生成器通过 RL 在更多样地形和变化目标方向下微调跟踪器。生成器以过去两帧机器人状态为条件产生参考帧形成闭环预测(而非自回归自身预测)。为降低部署延迟仅用 2 步去噪,并向生成器推理和跟踪器观测注入额外噪声提升鲁棒性。

引入航向跟踪任务奖励 $r_{\text{task}}$ 鼓励系统沿期望方向同时利用预训练获得的运动先验:

$$R_{\text{post}} = r_{\text{mimic}} + r_{\text{reg}} + r_{\text{task}}$$

$$r_{\text{heading}} = 1.5 \, \frac{\langle \mathbf{v}_b^b, \mathbf{d}_b \rangle}{\|\mathbf{v}_b^b\|}$$

微调地形更多样:15-25cm 台阶、25-55cm 连续跨栏、30-85cm 攀爬箱和金字塔台阶。微调后跟踪器有效充当运动滤波器——跟踪生成器产生的参考同时调整执行以用地形观测抑制不安全行为。目标航向和地形随机化使能了离线数据中不存在的行為(角箱攀登、箱上转向再下箱、连续跨栏)。

硬件部署

全管线板载部署于 Unitree G1。用 DLIO 配板载 Livox MID360 激光雷达和 IMU 估计基座位姿;用 Elevation Mapping CuPy 重建地形高度。因 G1 颈关节被动,剧烈运动导致头部运动退化位姿估计——融合激光 IMU 和躯干 IMU(从 DLIO 估计朝向减去躯干 IMU 移动平均俯仰)估计头部俯仰变化并补偿。扩散生成器用 TensorRT 加速推理降至 ~0.02s,部署时每 0.25s 滚动更新参考(生成器训练时域 0.5s/2Hz)。生成器跑在背部 Jetson Thor 上,跟踪控制器跑在 G1 集成的 Jetson Orin 上。

实验结果

硬件结果


图3:硬件实验结果。(A) 75cm 箱子攀登后三种方式跳下;(B) 楼梯和连续跨栏穿越;(C) 绕箱到达目标的局部导航;(D) 跨栏+楼梯+爬箱混合地形序列。

硬件实验展示控制器的有效性和跨地形泛化:箱子上下(含不同接近方向和箱上转向再下箱)、楼梯上下、不同高度连续跨栏,以及混合地形(跨栏+楼梯+爬箱,含训练中未见的组合如跳下后接上楼)。攀登时机器人用膝和手支撑,下箱时跳下用手缓冲。还观察到局部导航行为:当机器人状态不适合穿越障碍时,跟踪策略部分覆盖参考运动改为侧绕障碍以达目标。

定量结果

在线运动生成的收益:比较固定参考跟踪(Tracker Only)与完整系统(Tracker+Gen.),在箱攀、跨栏、上楼三任务各 500 机器人随机初始位姿。完整系统在所有任务上泛化更好、平均成功率更高:

任务Tracker Only 均值±SDTracker+Gen. 均值±SD
箱攀0.859 ± 0.2520.987 ± 0.014
跨栏0.805 ± 0.2310.990 ± 0.026
上楼0.845 ± 0.3000.997 ± 0.005

表1:固定参考跟踪与完整系统成功率对比——在线生成在所有任务上显著提升泛化并降低方差。

Tracker Only 在接近名义参考条件时表现好但随障碍高度增加变脆(80cm 箱仅 0.230,55cm 跨栏仅 0.348,25cm 台阶仅 0.114);完整系统在所有设定下一致鲁棒。这表明固定参考跟踪器的有限局部泛化不足以应对需改变运动时序或风格而非仅容忍小失配的显著地形变化。


图4:预训练跟踪器与微调跟踪器在五任务上的成功率对比——微调一致提升鲁棒性,困难设定增益最大。

微调跟踪器的影响:比较预训练与微调跟踪器在同一生成器下的五任务(爬上/爬下/跨栏/上楼/下楼)各 500 机器人。微调一致提升成功率,困难设定增益最大。原因:预训练跟踪器在固定离线轨迹(较平滑物理过滤)上优化,而部署时在线参考以噪声状态/方向/地形为条件可能含时间不连续或伪影——分布失配。微调使跟踪器适应生成参考的分布与不完美,学会有效利用运动模式完成任务并抑制不安全行为。

扩散生成的条件运动采样

扩散生成器从条件分布 $p(\mathbf{m}_{1:T} \mid \mathbf{h}, \mathbf{H}, \mathbf{m}_{-2:0})$ 采样未来运动序列 $\mathbf{m}_{1:T}$($T=25$ 帧),条件为航向向量 $\mathbf{h}$、地形高度扫描 $\mathbf{H}$ 和过去两帧运动 $\mathbf{m}_{-2:0}$。训练目标为重建损失加几何损失:

$$\mathcal{L}_{ ext{gen}} = \mathcal{L}_{ ext{recon}} + \lambda_v \mathcal{L}_{ ext{vel}} + \lambda_j \mathcal{L}_{ ext{joint}} + \lambda_p \mathcal{L}_{ ext{pen}}$$

其中 $\mathcal{L}_{ ext{vel}}$ 惩罚根速度不一致,$\mathcal{L}_{ ext{joint}}$ 惩罚关节位置跳变,$\mathcal{L}_{ ext{pen}}$ 惩罚地形穿透。部署时仅用 2 步去噪近似采样,通过微调跟踪器容忍这种快速近似的伪影。

滚动时域部署

部署时生成器以 0.5s 时域预测但每 0.25s 更新一次参考,形成滚动时域控制。设时刻 $t$ 生成器预测参考 $\hat{\mathbf{m}}_{t:t+T}$,但仅执行前 $T/2$ 步后重新预测:

$$\mathbf{m}_t^{ ext{exec}} = \hat{\mathbf{m}}_{t:t+T/2}, \quad ext{then re-predict at } t+T/2$$

这种半时域执行使跟踪器始终基于较新预测行动,提升对环境变化的响应性,同时避免全时域执行可能积累的预测漂移。

组件训练阶段输入输出频率/延迟
扩散生成器预训练(微调时冻结)航向+地形+2帧状态25帧运动参考2Hz/0.02s(TensorRT)
RL 跟踪器预训练+微调参考+本体感知+地形23维关节位置高频(控制环)
DLIO 位姿估计Livox+IMU基座位姿板载实时
高程建图DLIO位姿+深度地形高度图板载实时

表2:系统各组件的输入输出与频率——生成器低频提供风格,跟踪器高频执行物理,感知栈实时支撑。

从"生成器提供风格、跟踪器提供物理"的分工逻辑看,这一架构巧妙地解耦了运动学的多样性与动力学的可执行性。扩散生成器在大规模人类运动数据上学习,能采样多样的运动风格(爬、跨、跳),但这些运动学轨迹可能违反物理约束(足滑动、穿透)。RL 跟踪器在物理仿真中训练,确保输出的关节动作可执行且稳定,但其单独缺乏运动多样性(易收敛到单调步态)。两者结合使多样性与可执行性兼得——生成器探索运动空间,跟踪器将其锚定到物理可行域。

从闭环微调的分布失配视角看,这一阶段是系统鲁棒性的关键。预训练跟踪器在平滑离线轨迹上优化,但部署时生成器以噪声状态为条件产生的在线参考可能含时间不连续或伪影——这是训练分布与部署分布的失配。微调通过在闭环中暴露跟踪器于生成器的实际输出分布,使其学会适应这些不完美。Tracker Only 在 80cm 箱仅 0.230 而 Tracker+Gen. 达 0.962 的巨大差距,正是这种分布适应的量化体现——固定参考无法适应高度变化,而在线生成器能调整运动风格,微调跟踪器能容忍调整中的伪影。

从硬件部署的工程挑战看,被动颈关节的 IMU 融合补偿是一个易被忽视但关键的细节。G1 的颈关节被动意味着头部运动不受控,剧烈运动时头部晃动退化激光雷达位姿估计。论文通过从 DLIO 估计朝向减去躯干 IMU 移动平均俯仰来估计头部俯仰变化并补偿——这种多 IMU 融合策略解决了被动关节引入的感知噪声。这类工程细节虽非学术贡献核心,却是真实部署不可或缺的。

从局部导航行为的涌现看,论文报告了一个有趣现象:当机器人状态不适合穿越障碍时,跟踪策略部分覆盖参考运动改为侧绕障碍。这暗示微调使跟踪器学会了"何时不信任生成器"——在参考运动会致失败时主动偏离。这种安全覆盖能力是从纯模仿(忠实复现参考)向智能适配(条件化偏离参考)的进步,是运动滤波器角色的高级体现。

系统架构 Mermaid 图

flowchart TB
  subgraph Data["数据收集与策展"]
    VID["人类运动视频/数据集"]
    REC["GVHMR 重建+IK 重定向"]
    AUG["运动增强
缩放障碍/插入小箱/优化"] DS["~1h 运动数据集"] end subgraph Pretrain["预训练"] GEN["扩散运动生成器 MDM
预测0.5s/25帧 条件=航向+地形+2帧"] TRK["RL 运动跟踪器 DeepMimic
R_pre=r_mimic+r_reg"] end subgraph Finetune["RL 微调"] FGEN["冻结生成器 2步去噪"] FTRK["微调跟踪器
R_post=r_mimic+r_reg+r_task"] NOISE["注入噪声 随机航向
多样地形"] end subgraph Deploy["硬件部署"] LIDAR["DLIO+Livox 位姿估计"] EMAP["Elevation Mapping 地形"] JET["Jetson Thor 生成器 0.02s
Jetson Orin 跟踪器"] ROBOT["Unitree G1
23-DoF 全身控制"] end VID --> REC --> AUG --> DS DS --> GEN DS --> TRK GEN --> FGEN TRK --> FTRK FGEN --> FTRK NOISE --> FTRK FTRK --> JET LIDAR --> EMAP --> JET JET --> ROBOT

局限性

运动数据集规模有限。初始仅约 5 分钟运动数据(增强到 1 小时),每种地形技能仅一个代表性运动。更大多样性数据集可能进一步提升泛化,但当前规模已通过增强和微调达到可用性能。

扩散生成器推理延迟。虽用 TensorRT 和 2 步去噪降至 ~0.02s,仍比直接策略推理慢;滚动时域 0.25s 更新频率可能对高速动态场景不够。

依赖高质量位姿估计。板载 DLIO 配激光雷达的位姿估计在剧烈运动时受被动颈关节影响需 IMU 融合补偿,说明感知栈的鲁棒性仍是部署瓶颈。

地形组合的泛化有限验证。虽展示了训练中未见的混合地形(跳下接上楼),但更复杂的组合和完全未见地形类型是否泛化未充分量化。

总结与展望

论文证明结合运动生成与运动跟踪是实现感知全身人形行走的有效方式。扩散生成器从人类运动数据学到协调全身技能,作为地形感知的技能组合模块产生在线参考;RL 跟踪器把这些参考物理化为关节动作;闭环微调使跟踪器容忍生成不完美并充当运动滤波器。系统在 Unitree G1 上板载完成箱子攀登(75cm)、跨栏、上下楼梯及训练中未见的混合地形组合。

从更广阔的视角看,这项工作代表了人形机器人从"奖励塑造探索"向"运动先验引导"的范式转变。人类运动数据蕴含的协调全身技能是宝贵的先验知识,扩散模型提供了一种可扩展的方式来采样和组合这些技能。关键洞见是"生成器提供风格、跟踪器提供物理"——生成器负责运动学上的可行性和多样性,跟踪器负责动力学上的可执行性和鲁棒性,闭环微调弥合两者的分布失配。这种"运动学生成+动力学跟踪+闭环适配"的三段式架构,可能成为人形机器人全身技能泛化的通用范式。

金句

"生成器提供运动风格,跟踪器提供物理执行——闭环微调使跟踪器学会容忍生成的不完美并充当运动滤波器。"
"固定参考跟踪器的有限局部泛化不足以应对需改变运动时序或风格的地形变化——在线运动生成是泛化的关键。"

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
LAC:人形机器人全身线性与角度柔顺控制

LAC:人形机器人全身线性与角度柔顺控制

LAC 提出通用人形全身柔顺控制器:在人体交互数据接触帧上施加采样的力/力偶扰动合成大规模柔顺响应数据,经教师-学生强化学习训练单一策略,实现对上半身外力的线性与角度柔顺、刚度全程单调调制,并在仿真、真机与遥操作移动操作中验证。

人形机器人全身控制柔顺控制2026年8月26日
GigaBrain-WBC:人形机器人全身控制的行为世界模型

GigaBrain-WBC:人形机器人全身控制的行为世界模型

首个用于人形机器人全身控制的行为世界模型(BWM),训练因果Transformer联合预测下一步动作、状态和潜在行为指令分布,使策略网络同时建模环境对行为的影响。自动地形标注管线从重定向运动中恢复3D接触几何,部署时检测不合理指令并回退到已学行为,在四项测试中成功率最高(地形交互81.3%、不合理指令83.1%、跌倒恢复99.3%),Unitree G1检查点可迁移至Maker L01机器人。

人形机器人Humanoid世界模型2026年8月18日
LATENT:从不完美人类动作学习人形网球技能

LATENT:从不完美人类动作学习人形网球技能

LATENT 以碎片化、不完整的人类网球动作数据为先验,经修正与组合学出可稳定击球的人形策略,部署到 Unitree G1,能与人类进行多拍对拉。

LATENT人形机器人网球2026年3月13日