Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

步态优化人形机器人Humanoid

GaitSpan:从行走到跑步的人形机器人步态生长

将预训练行走策略当作种子技能,通过 GaitWave 节奏生成、H-SLIP 步态动态塑形和残差适应三个模块,让一个策略连续覆盖行走→慢跑→跑步,在五种人形形态上实现零样本迁移。

Kwan-Yee Lin, Zilin Wang, Janelle J. Liu, Stella X. Yu2026年7月13日2 分钟阅读
EN

Kwan-Yee Lin, Zilin Wang, Janelle J. Liu, Stella X. Yu · University of Michigan, UC Berkeley · arXiv:2607.12114 · 项目主页: https://gaitspan2026.github.io/ · 代码状态: 未公开

一句话总结

GaitSpan 把已学会的行走策略当作"种子技能",通过节奏生成(GaitWave)、步态动态塑形(H-SLIP)和残差适应三个模块,让一个策略连续覆盖行走→慢跑→跑步,无需为每种步态单独训练或切换。

1. 研究背景与动机

人形机器人的运动控制是具身智能的核心难题之一。人类在加速时不会丢弃行走技能重新学跑步——而是复用平衡、支撑、重心转移、足部触地协调等运动结构,只改变节奏、步幅和触地时序。现有方法却做不到这种"技能生长"。

当前人形运动控制的主流路线各有局限:

  • 基于模型控制:提供结构和鲁棒性,但依赖手工设计的模板、相位变量、触地时序和特定形态的控制器,难以泛化。
  • 模仿学习:能从人体动捕数据复现丰富运动,但策略绑定于演示分布,在不同地形、形态、速度范围下泛化不可靠。
  • 强化学习:对地形和形态更灵活,但连续速度的步态多样性极难获得——稳定行走的奖励项会抑制跑步,而动态运动奖励又难以在速度增加时平衡和解释。

常见变通方案是训练离散技能/专家,再蒸馏或切换到一个策略。这对连续速度范围效率低下,且会引入跨技能干扰、边界附近的平均行为、以及步态风格间脆弱的过渡。没有已公开的模型或代码库能展示单个学习策略连续覆盖行走、慢跑和跑步。

GaitSpan 的出发点是:行走可以作为种子技能。会走的人形已拥有可复用的运动结构(平衡、支撑、身体协调、触地过渡)。要更快移动时,不应从头再学,而应在新的节奏下重生这些结构、扩展到更大步幅、并添加残差修正。

2. 核心方法

2.1 问题建模

将人形步态涌现建模为全身技能扩展问题。在每个时间步 $t$,机器人接收本体感知观测 $\mathbf{s}_{t}\in\mathcal{S}$ 和速度指令 $\mathbf{v}_{t}\in\mathcal{V}$,输出关节级动作 $\mathbf{a}_{t}\in\mathcal{A}$。目标是学习单个指令条件策略 $\pi_{\theta}$,平滑覆盖从行走到慢跑到跑步的步态族群。假设已有预训练行走策略 $\pi_{\mathrm{seed}}$(训练中冻结)。

核心架构用种子-残差适应:冻结的行走策略不作为常规残差方法中的静态基动作,而是作为可复用运动结构的生成器:

$$\mathbf{a}_{t}=\underbrace{\mathcal{G}_{\psi}\left(\left\{\mathbf{a}^{\mathrm{seed}^{(k)}}_{t}\right\}_{k=0}^{K},\boldsymbol{\alpha}^{\psi}_{t}\right)}_{\mathbf{a}^{\mathrm{wave}}_{t}}+\mathbf{a}^{\mathrm{res}}_{t}\quad\text{clipped to }(\mathbf{a}_{\min},\mathbf{a}_{\max})$$

其中 $\mathbf{a}^{\mathrm{seed}^{(k)}}_{t}=\pi_{\mathrm{seed}}\left(\mathcal{T}_{k}(\mathbf{s}_{t}),\tilde{\mathbf{v}}_{t}\right)$ 是对冻结种子策略施加不同时间变换后得到的"种子动作波",$\boldsymbol{\alpha}^{\psi}_{t}$ 是可学习层次记忆产生的指令条件组合系数。残差项 $\mathbf{a}^{\mathrm{res}}_{t}$ 捕捉超出结构化扩展范围的附加适应。

GaitSpan 框架图

图2:GaitSpan 框架。从冻结行走策略作为种子出发,GaitWave 通过种子派生动作波的层次组合生长节奏,H-SLIP 塑形动态步幅事件,残差分支提供附加适应。

2.2 GaitWave:从种子行走层次生长节奏

最简单的种子-残差架构(Vanilla)只在行走域内查询种子策略,所有向动态步态的生长都必须由残差编码,这是不够的。GaitWave 引入了将种子策略生长为指令条件动作波族的机制。

关键思路:对冻结种子策略施加 $K$ 个内部节奏变换 $\mathcal{T}_{k}(\cdot)$(如不同时间缩放),查询得到 $K$ 个种子派生动作 $\mathbf{a}^{\mathrm{seed}^{(k)}}_{t}$。然后用层次记忆 $\mathcal{M}_{\psi}^{l}$ 产生组合系数 $\boldsymbol{\alpha}^{\psi}_{t}=\operatorname{SoftBlend}\left(\mathcal{M}_{\psi}^{l},\mathbf{v}_{t}\right)$,学习如何混合这些波。

层次结构 $\mathcal{H}=\{2,4,\cdots,l\}$ 在不同分辨率 $L$ 下用 $L$ 个可学习记忆单元表示指令区间,实现全局连贯性和局部表达力:

$$\mathbf{\beta}^{(L)}_{t,j}=m^{(L)}_{\psi,j}\left(\mathbf{s}_{t},\mathbf{v}_{t}\right)\in\mathbb{R}^{K}$$

边界处用软混合避免不连续,不同分辨率的系数聚合为 $\boldsymbol{\alpha}_{t}=\sum_{L\in\mathcal{H}}\omega^{(L)}_{t}\boldsymbol{\alpha}^{(L)}_{t}$。最终动作波为:

$$\mathbf{a}^{\mathrm{wave}}_{t}=\mathbf{a}^{\mathrm{seed}}_{t}+\sum_{k=1}^{K}\alpha_{t,k}\mathbf{a}^{\mathrm{seed}}_{t}$$

低速时 GaitWave 可恢复接近种子行走的步态(给扩展节奏分量小权重);高速时层次记忆学习如何用种子派生节奏重塑行走动作。

flowchart TB
    subgraph Seed["Frozen Walking Policy π_seed"]
        S1[Observation s_t + Cmd v_t] --> SP[π_seed frozen]
    end
    subgraph GW["GaitWave: Rhythm Growth"]
        T1[T_k time transforms] --> SA1["Seed actions a_seed^(k)"]
        SA1 --> HM[Hierarchical Memory M_ψ]
        HM -->|coefficients α| CO[Composition G_ψ]
        CO --> AW["Action wave a_wave"]
    end
    subgraph HS["H-SLIP: Dynamic Shaping"]
        VL[Virtual Leg ℓ root/upper/lower]
        VL --> CR["Compression + Rebound + Flight"]
        CR --> RE[Dynamic Reward]
    end
    SP --> T1
    AW --> SUM["a = a_wave + a_res"]
    RE --> SUM
    SUM --> ROBOT[Humanoid Robot]

2.3 H-SLIP:层次虚拟腿动态塑形

GaitWave 扩展了从行走继承的节奏,但仅有节奏扩展不保证高速时涌现物理意义明确的动态步态。更快运动需要协调的动态事件:支撑加载与压缩、反弹、飞行和触地。H-SLIP 从弹簧倒立摆(SLIP)模型抽象中获得灵感。

为每只脚 $i$ 定义三级虚拟腿抽象:根-足(全局虚拟腿)、根-膝、膝-足:

$$\ell^{\mathrm{root}}_{t,i}=\left\|\mathbf{p}^{\mathrm{root}}_{t}-\mathbf{p}^{\mathrm{foot}}_{t,i}\right\|_{2},\quad\ell^{\mathrm{upper}}_{t,i}=\left\|\mathbf{p}^{\mathrm{root}}_{t,i}-\mathbf{p}^{\mathrm{knee}}_{t,i}\right\|_{2},\quad\ell^{\mathrm{lower}}_{t,i}=\left\|\mathbf{p}^{\mathrm{knee}}_{t,i}-\mathbf{p}^{\mathrm{foot}}_{t,i}\right\|_{2}$$

虚拟腿长度的时间变化 $\dot{\ell}^{x}_{t,i}$ 近似为差分。用接触指示 $c_{t,i}$ 定义压缩和反弹项:

$$r^{x}_{\mathrm{comp},t}=\sum_{i}c_{t,i}\operatorname{ReLU}\left(-\dot{\ell}^{x}_{t,i}\right),\quad r^{x}_{\mathrm{reb},t}=\sum_{i}c_{t,i}\operatorname{ReLU}\left(\dot{\ell}^{x}_{t,i}\right)$$

根-足级塑形全身支撑和质心动力学,上下腿级鼓励局部肢段在支撑和释放时协调运动。反弹用速度跟踪门调制,确保贡献于指令运动而非任务无关的弹跳:

$$g^{\mathrm{track}}_{t}=\exp\left(-\frac{\left\|\mathbf{v}^{\mathrm{base}}_{t,xy}-\mathbf{v}_{t,xy}\right\|_{2}^{2}}{\sigma_{\mathrm{track}}^{2}}\right)$$

3. 实验分析

3.1 实验设置

在五种人形配置上评估:Unitree G1(29/23 DoF)、Booster T1(29/23 DoF)、Booster K1(22 DoF)。用 IsaacGym 训练 4096 个并行环境,sim-to-sim 评估在 MuJoCo 上进行。指标包括跟踪误差(指令 vs 实际速度)、飞行时间(无触地的空中阶段时长)、能量(关节扭矩-速度乘积积分)。

步态涌现图

图3:不同速度和形态的涌现步态。足部触地图显示从站立行走到越来越动态的飞行模式的平滑过渡。

3.2 步态涌现

随着指令速度增加,GaitSpan 展现从稳定行走到长步幅、慢跑和跑步的连续渐进。低速产生规则交替支撑几乎无飞行,高速展现重组触地频率和更密的触地-飞行过渡。

关键发现:步态涌现因形态而异。同一速度下 Booster T1、K1 和 G1 展现不同足部触地模式,反映形态和驱动差异的形态特化适应——GaitSpan 不强加统一步态时序,而是提供共享技能生长原则让每种形态发展自己的运动模式。

跟踪精度与飞行时间

图4:三种形态下的跟踪精度和动态步态涌现。GaitSpan 保持低跟踪误差同时在高速产生大量飞行时间。

3.3 基线对比

基线跟踪误差飞行时间能量效率
行走种子(外推)高速严重退化几乎无飞行
能量多专家组合高速退化几乎无飞行保守运动
人体演示(AMP)中等中等较高
GaitSpan全速范围最低随速度递增大部分范围最低

三个核心发现:(1) 步态涌现不牺牲指令跟踪——所有形态和分布内外指令下跟踪误差保持低,飞行时间随速度增加。(2) 从一个行走技能生长步态比组装能量塑形专家更有效——多专家基线虽组合了分别训练的行为,但高速跟踪退化且几乎无飞行。(3) 种子技能生长可比人体运动先验更具指令响应性——GaitSpan 跟踪更准,触地动力学重组更清晰,且大部分范围能耗更低。

3.4 消融实验

组件跟踪误差飞行时间OOD 鲁棒性
仅 Vanilla 种子-残差
仅 GaitWave略低有限不足
仅 H-SLIP高速退化
完整 GaitSpan递增

GaitWave 和 H-SLIP 互补:GaitWave 提供结构化、指令条件的种子节奏扩展,H-SLIP 提供将扩展组织为受控动态步幅的物理偏置。训练策略上,从头训练(有无残差分支)和直接微调种子策略都不如 GaitSpan 的结构化扩展——直接微调会覆盖行走稳定结构却不可靠地发展跑步行为。

消融实验图

图6:关键组件和训练策略的消融研究(Booster T1)。

4. 讨论

GaitSpan 证明了"技能生长"范式的可行性:已习得运动技能不必只是训练终点,可以作为结构化扩展的种子,生成更丰富的相关行为族群。这对人形技能获取指明了一条更高性能、更高效、更可扩展的路线。

跨形态迁移是重要发现——同一步生长原则让不同形态发展各自的步态模式,而非强加统一时序。零样本 sim-to-sim 和真实地形部署验证了实际可部署性。

5. 局限分析

作者自述:GaitSpan 依赖行走种子的质量和覆盖范围——弱或窄的种子会限制涌现行为。它展示的是单步技能生长(从行走到慢跑跑步),而非将新获行为折回种子的持续自扩展。分阶段闭环递归可解决此局限,但何时以及如何重新播种需深入研究。

独立判断:虽然 GaitSpan 覆盖了行走到跑步的连续谱,但未涉及横向移动、转弯、上下台阶等更复杂的运动模式,技能生长原则在这些场景下的有效性仍有待验证。此外,H-SLIP 的 SLIP 抽象对非平面地形的适用性也可能受限。

6. 结论

GaitSpan 通过 GaitWave 节奏生成、H-SLIP 步态塑形和残差适应,将人形基础行走技能生长为更广的运动曲目。核心贡献不在于又一个步态控制器,而在于展示了一个学习运动技能可以超越训练终点——当被视为结构化扩展的种子时,能生成更丰富的相关行为族群。

已习得的行走不是训练的终点,而是步态族群可以从中生长的种子——技能生长而非技能切换,才是人形运动控制的更高效路线。

相关论文