Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

步态优化人形机器人轮滑

基于强化学习的人形机器人轮滑运动控制

将强化学习与人形机器人结合,解决被动轮滑的欠驱动复杂力学问题,实现动态轮滑步态的新形态。

Ethan Marot, Thomas Bi, Clemens Schwarke, Victor Klemm, Marco Hutter, Raffaello D'Andrea2026年6月30日2 分钟阅读
EN

基于强化学习的人形机器人直排轮滑控制

论文:Reinforcement Learning-Based Control for an Inline Skating Humanoid Robot
作者:Ethan Marot, Thomas Bi, Clemens Schwarke, Victor Klemm, Marco Hutter, Raffaello D'Andrea(ETH Zurich)
链接:arXiv:2606.31807 | 平台:Booster T1(改装消费级直排轮) | 仿真:Isaac Gym + MuJoCo

从方法论角度看,本文证明纯奖励驱动的 RL 可以在被动轮欠驱动系统上涌现出人类级别的滑行技能,无需任何运动示范。球面-椭球跨模型训练管线解决了被动轮仿真接触伪影的关键难题,为类似被动接触系统的 sim-to-real 提供了可复用范式。CoT 降低 50% 的能效优势使直排轮滑成为长距离平坦环境移动的实用选择,而零样本硬件迁移和跨表面泛化验证了策略的鲁棒性。部分可观测性下的隐式状态估计能力,则为无传感器被动系统的控制提供了新思路与启示。

一句话总结:不依赖任何人类运动数据或模仿学习,纯靠奖励函数驱动 RL 让人形机器人学会直排轮滑的推蹬-滑行策略,CoT 比步行降低 50%,零样本迁移到真实硬件。

研究背景与动机

人形机器人硬件和强化学习的结合已能解决高度复杂的动态运动问题,但通过非驱动轮滑进行双足运动仍是一个未被充分探索的前沿。直排轮滑引入了相比标准行走或有驱动轮腿系统更高的不稳定性,但在长距离平坦环境中提供了高能效移动的潜力。本文聚焦直排轮而非四轮滑——虽然共线轮排列将每只脚的支撑面缩小到一条窄线,增加了任务难度,但直排轮能实现更高前进速度且专为长距离通行设计。

与有驱动轮腿系统不同,直排轮滑的推进不能利用轮轴电机扭矩。控制器必须执行精确的 6 自由度操作,策略性地倾斜轮刃以产生推进所需的侧向地面反力。这一高度动态的过程还受到部分可观测性的困扰——被动轮上没有编码器,系统必须完全通过次级传感器推断轮速和滑移等关键状态。已有方法依赖 ZMP 等经典框架,需要显式相位建模,且强制保守约束(如所有轮持续触地、避免摆动腿)以最大化稳定裕度。

本文的核心创新在于:不依赖人类运动数据、模仿学习或预计算轨迹,完全通过奖励结构让推蹬-滑行策略从 RL 中涌现。同时通过训练和验证使用不同几何轮模型来克服被动轮的固有不稳定性和仿真接触伪影。

方法详解

1. 机械设计

硬件平台为 Booster T1(23 自由度),腿部运动学非常适合轮滑:6 自由度腿(3 自由度髋、1 自由度膝、2 自由度踝),可精确控制滑轮位置和轮刃角度。标准脚被替换为消费级儿童直排轮滑鞋,靴子与金属框架和轮子分离,轮子直接安装在连接机器人跟关节的定制 SLA 支架上。使用 Formlabs Tough 1500 树脂以承受高速冲击,轴承升级为 ILQ-9 Twincam Pro 以最小化摩擦损耗,轮子换为低压缩性材料(Hydrogen Street 60/92A)以更好地匹配刚体仿真中的材料属性。

直排轮滑人形机器人

图1:直排轮滑策略的零样本 sim-to-real 迁移。MuJoCo 仿真模型(左)与物理 Booster T1 机器人(右)。

2. 问题建模

环境建模为无限时域部分可观测马尔可夫决策过程(POMDP)$M=(S,O,A,p,r,\gamma)$。采用非对称 actor-critic 架构:actor 使用 74 维纯本体感知观测 $o_t\in\mathbb{R}^{74}$(含投影重力、基座角速度、速度命令、步态相位钟、关节位置/速度、上次动作),critic 使用 88 维状态向量 $s_t\in\mathbb{R}^{88}$(包含无噪声地面真值版本加特权变量如基座线速度、高度、外力/外力矩)。actor 输出 21 维目标关节位置,传递给高频 PD 控制器。策略目标为:

$$\theta^{*}=\arg\max_{\theta}\;J(\pi_{\theta})=\arg\max_{\theta}\;\mathbb{E}_{\tau\sim p_{\pi}}\left[\sum_{t=0}^{\infty}\gamma^{t}r(s_{t},a_{t})\right]$$

3. 被动轮接触建模

被动轮仿真的核心挑战是物理引擎产生的伪影。高分辨率网格存在"粘性接触斑"现象——多点碰撞求解人为阻尼滚动运动;标准圆柱原语在轮刃倾斜时产生边缘裁剪,Isaac Gym 的 PhysX 通过施加人为恢复冲量来求解,RL 智能体迅速学会利用这一伪影获取低成本推进。

解决方案是解耦训练和验证的轮几何体:训练环境(Isaac Gym)使用球面原语匹配物理轮底部曲率,确保稳定的单点接触斑;验证环境(MuJoCo)使用椭球原语进行 sim-to-sim 测试。在两种几何近似下均表现鲁棒的策略被认为能良好泛化到真实轮几何。

轮模型对比

图3:Isaac Gym 中的球面原语(上)和 MuJoCo 中的椭球轮(下)。

4. 滚动奖励

标准双足奖励函数导致步态或拖步行为——智能体回避滚动的不稳定性。为激励真正的滑行,设计了运动学滚动奖励。首先计算每只脚的平均线速度,将轮角速度映射为线运动,仅对触地轮计算:

$$v^{*}=\frac{r\sum_{n=1}^{N}\omega_{n}^{*}c_{n}^{*}}{\sum_{n=1}^{N}c_{n}^{*}}$$

其中 $r$ 是轮半径,$N$ 是每只滑轮鞋的轮数,$c_n^*$ 是二值接触指示器。有效线速度取左右脚最大绝对值:$v_{\text{wheel}}=\max(|v_{\text{left}}|,|v_{\text{right}}|)$。滚动奖励用高斯核惩罚基座前进速度与轮速的平方误差:

$$r_{\text{wheel}}=\exp\left(-\frac{(v_x-v_{\text{wheel}})^2}{\sigma}\right)$$

5. 基于成功的命令课程

被动轮的固有不稳定性使初始探索极易导致终止摔倒,奖励稀疏。速度命令空间离散为线速度 $v_x^{\text{cmd}}$ 和角速度 $\omega_z^{\text{cmd}}$ 的 2D 网格。智能体从零速度命令开始训练(掌握基本平衡)。每回合结束时评估平均速度跟踪性能:

$$\bar{e}_v=\frac{1}{T}\sum_{t=1}^{T}\exp\left(-|v_{x,t}-v_x^{\text{cmd}}|\right)$$

成功度量 $S\in\{0,1\}$ 由跟踪性能和回合时长阈值决定:$S=1$ 当且仅当 $\bar{e}_v>\tau_{\text{track}}$ 且 $T\geq T_{\min}$。当智能体在某命令格持续成功时,课程动态解锁相邻更高速格。这种动态边界扩展使策略从站立逐步合成复杂滑行行为,过渡到滑行和高速动态转弯,而不导致值函数崩溃。

graph TD
  A[零速度命令: 学站立平衡] --> B[解锁低速格: 学滑行]
  B --> C[解锁中速格: 学加速]
  C --> D[解锁高速格: 学动态转弯]
  D --> E[全命令空间覆盖]
  style A fill:#7ed321,stroke:#4a8a14,color:#fff
  style B fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style C fill:#f5a623,stroke:#b97316,color:#fff
  style D fill:#e74c3c,stroke:#a93226,color:#fff
  style E fill:#9b59b6,stroke:#6c3483,color:#fff

从相关工作看,已有方法依赖 ZMP 等经典框架,需要显式相位建模,且强制保守约束(如所有轮持续触地、避免摆动腿)以最大化稳定裕度。这些保守策略牺牲了滑行的动态推进能力。本文放弃经典框架的保守假设,转而用 RL 探索完整的推蹬-滑行周期——包括单腿支撑的摆动相和双腿支撑的滑行相。GPU 并行仿真使这一高维探索成为可能:约 30 亿步、20,000 次 PPO 迭代积累了约 1.9 年仿真经验。与依赖人类运动数据的 AMP 方法不同,本文的纯奖励驱动路线更简洁但也更难收敛,需要精心的奖励工程和课程设计来引导策略发现滑行这一非直觉行为。

奖励结构设计与策略涌现

本文的核心创新在于不依赖人类运动数据、模仿学习或预计算轨迹,完全通过奖励结构让推蹬-滑行策略从 RL 中涌现。奖励函数包含速度跟踪项、姿态稳定项、关节正则化项和滚动奖励项。滚动奖励鼓励策略维持轮子持续滚动而非拖步或站立,这是区分滑行与步行的关键——消融实验显示无滚动奖励时策略退化为步态/拖步而非滑行。策略必须策略性地倾斜轮刃以产生推进所需的侧向地面反力,这一高度动态的 6 自由度操作完全从奖励信号中习得,无需人类示范。

部分可观测性与传感器策略

被动轮上没有编码器,系统面临严重的部分可观测性——轮速和滑移等关键状态必须完全通过次级传感器推断。控制器无法直接测量轮子滚动状态,只能依赖关节编码器、IMU 等间接信号估计。这种信息缺失使得策略必须学习隐式估计轮地接触状态,增加了学习难度但也增强了 sim-to-real 鲁棒性——策略不依赖难以精确建模的轮传感器读数,减少了仿真-现实差距的来源。训练时的域随机化进一步增强了这种鲁棒性。

实验结果

Sim-to-Sim 消融

训练约需 30 亿步、20,000 次 PPO 迭代(约 1.9 年仿真经验)。在 MuJoCo 椭球轮上 100 次试验验证:

方法仿真时间(s)v_x跟踪误差(m/s)ω_z跟踪误差(rad/s)
圆柱轮(利用伪影)60.01.340.56
无滚动奖励55.71.470.25
无课程56.70.700.13
部署策略(完整)60.00.430.12

圆柱轮策略在 Isaac Gym 中高奖励但在 MuJoCo 中几乎无法跟踪速度,确认了球面-椭球训练管线的必要性。无滚动奖励导致步态/拖步而非滑行。无课程虽接近完整策略但滑行技术不稳定。

能效分析

CoT 定义为:

$$\text{CoT}=\frac{\sum_{i=1}^{n}|\tau_i\dot{q}_i|}{mgv_x}$$

在 $v_x^{\text{cmd}}=1$ m/s、$\omega_z^{\text{cmd}}=0$ 时,步行策略 CoT 为 0.665,滑行策略为 0.326,降低 50%。更高速度下滑行策略保持低 CoT 而步行策略崩溃。真实世界部署在垫子表面(仿真训练分布外)仍验证了滑行在高速度下的显著能效优势。

速度 (m/s)步行 CoT滑行 CoT改善
0.5~0.5~0.5持平
1.00.6650.326-50%
1.5+崩溃~0.33步行不可行
硬件改装

图2:SLA 支架和直排轮滑鞋框架及轮子。支架经重量效率优化,集成拱形设计以抗高速冲击。

硬件部署

策略零样本迁移到物理 Booster T1。无系绳部署中机器人展示了前进加速、减速和运动中动态转弯。还能拒绝主动物理扰动。在木地板和砖铺路面等不同表面上均有效运行。

能效优势的物理机制

滑行策略 CoT 降低 50% 的物理机制在于滚动摩擦远低于步行中的反复抬腿-落地能耗。步行策略在每一步中需对腿做功加速和减速,而滑行策略通过轮刃倾斜产生侧向力推进,腿部主要维持平衡而非提供前进动力。更高速度下步行策略因腿摆动频率和冲击载荷激增而崩溃,而滑行策略的 CoT 保持平稳——这使直排轮滑成为长距离平坦环境高能效移动的有力候选。真实世界在垫子表面(训练分布外)的验证进一步确认了滑行在高速下的显著能效优势,表明该优势不局限于特定地面材质。

课程学习的作用

消融实验显示无课程训练的策略虽在速度跟踪误差上接近完整策略,但滑行技术不稳定。课程学习通过逐步增加任务难度——从低速稳定到高速机动——使策略先建立基础平衡再学习复杂推蹬时序。完整部署策略在 60 秒仿真中维持 0.43 m/s 的速度跟踪误差和 0.12 rad/s 的偏航跟踪误差,显著优于各消融变体,证明滚动奖励、课程学习和球面-椭球训练管线的协同不可或缺。

局限性

作者自述:物理空间限制无法在硬件上测试完整速度命令范围和精度。RL 优化景观导致策略收敛到"主导腿"推进策略——尽管尝试强制对称约束,策略仍偏向用一条腿推蹬。这一局部最优通过最小化重心转移的不稳定性提高了即时存活率,但偏离了人类滑冰者的交替高功率推蹬,表明步态可能仍非最优且能效较低。

分析判断:训练需 30 亿步(约 1.9 年仿真经验),计算成本高昂。被动轮无编码器导致部分可观测,轮速和滑移完全靠次级传感器推断,在高速或低摩擦表面可能产生显著估计误差。"主导腿"问题不仅是步态不美观——它导致 CoT 在偏航速度轴上的不对称,限制了转弯方向灵活性。仿真使用球面/椭球近似被动轮,真实轮的复杂接触特性(如轮刃磨损、表面不规则)未被建模。真实世界测试仅在垫子表面进行,对硬质光滑表面(轮滑设计的理想表面)的表现未充分报告。

局限性与边界条件:当前评估聚焦平坦或中等结构化表面,复杂地形(斜坡、台阶、碎石)下的滑行控制未验证。直排轮的共线轮排列将支撑面缩小到一条窄线,在侧向扰动下的恢复能力有限——虽然策略能拒绝主动物理扰动,但极端侧向冲击的鲁棒性有待量化。无编码器轮速估计的精度在高速和急转弯时可能下降,影响闭环控制质量。训练用球面轮、验证用椭球轮、部署用真实轮的多模型不一致虽被跨模型训练部分缓解,但残余差异仍可能贡献速度跟踪误差。Sim-to-real 迁移在垫子等训练分布外表面验证了泛化性,但更多真实世界场景的系统性评估仍是未来工作。

总结与展望

本文首次实现了人形机器人在被动消费级直排轮上的推蹬-滑行推进,策略完全从奖励结构涌现而非模仿人类数据。球面训练+椭球验证的解耦轮几何方案有效防止了 RL 利用物理引擎伪影。基于成功的命令课程使策略从站立平衡渐进发展到高速动态转弯。50% 的 CoT 降低和零样本 sim-to-real 迁移验证了被动轮滑作为人形机器人高效移动模式的实用价值。未来方向包括激励交替腿推进、扩展到冰滑(引入复杂摩擦和相变动力学)、以及开发在标准行走和滑行配置间自主切换的控制框架。

让机器人学会轮滑的精髓不在于教它模仿人类的每个动作,而在于设计正确的奖励——让"滚动"本身成为最优解,策略自然会找到推蹬-滑行的路径。

本文为零奖励示范驱动的人形被动轮运动控制建立了完整的方法论基线,其跨模型训练与课程学习策略可推广至其他被动接触欠驱动系统的 sim-to-real 迁移问题,具有广泛的适用性与重要的工程参考价值,值得后续研究持续关注与深入探索,以进一步拓展其应用边界与实际部署场景范围,推动相关技术走向更成熟、更成熟的工程实践。

总体而言,本文通过纯奖励驱动的 RL 实现了人形直排轮滑控制,CoT 较步行降低 50%,零样本迁移至真实硬件并在多种表面验证有效。球面-椭球跨模型训练管线、滚动奖励与课程学习的协同设计,为被动接触欠驱动系统的 sim-to-real 迁移提供了可复用的方法论框架,对推动腿式机器人高效移动技术的发展具有积极意义。

相关论文