PAPER DEEP DIVE
ZEST:面向运动型机器人控制的零样本具身技能迁移
ZEST 用单阶段强化学习,把动作捕捉、单目视频和关键帧动画三类异构参考动作统一训练成模拟策略,零样本部署到 Atlas、Unitree G1 和 Spot,实现全尺寸人形机器人上首个动态多接触技能,无需接触标签、状态估计器或逐技能调参。
论文元信息
标题:ZEST: Zero-shot Embodied Skill Transfer for Athletic Robot Control(零样本具身技能迁移:面向运动型机器人控制)
作者:Jean Pierre Sleiman, He Li, Alphonsus Adu-Bredu, Robin Deits, Arun Kumar 等(Boston Dynamics 与 RAI Institute)
论文链接:arXiv:2602.00401
代码状态:未开源(策略部署依赖 Boston Dynamics 专有软件栈,论文声明数据与结论均已包含在正文与附录中)
一句话总结
ZEST 用一套低调参的强化学习配方,把动作捕捉、单目视频重建和关键帧动画三种异质参考动作统一训练成全身控制策略,并在 Atlas、Unitree G1 与 Spot 三种机器人上零样本部署了军体匍匐、霹雳舞、翻箱、连续后空翻等高动态多接触技能。
研究背景与动机
人形机器人之所以被寄予厚望,是因为人类环境本身就是围绕人体形态与运动能力设计的。要在这样的环境里与人协作,机器人需要的不是单一任务上的熟练度,而是一整套协调、流畅、类人的全身动作库。但高自由度、间歇性多接触交互、以及不可避免的动力学建模失配,使得"让机器人像人一样动"成为控制领域最难的挑战之一。
过去十年的主流路线是"离线规划轨迹、在线跟踪":Boston Dynamics 的 Atlas 用 MPC 在线规划器加优化式全身控制器执行跑酷和舞蹈,研究界也把这一范式推广到扶栏爬楼梯、四足杂技、跨形态动作重定向等场景。这条路线的优点是通用、可解释,但每换一个技能都需要大量工程化调参,控制器对接触时序和模型误差极其敏感。
基于学习的动作模仿提供了另一条路,但已有工作通常只解决拼图的一角:要么只处理高保真动捕数据,要么只做行走类动作,要么依赖接触标签、状态估计器、参考窗口和繁重的奖励整形。ZEST 的动机就是把这些碎片整合成一个单一、系统化的配方:一个框架同时消化高保真动捕、带噪声的单目视频重建、以及完全不满足物理约束的动画,并且在三种不同形态的硬件上零样本落地。
这项工作的定位很明确:它不做行为发现(不从零探索新动作),而是把人类动作数据集当作通用技能来源,解决"如何把这些参考动作稳健地迁移到真实机器人上"这个工程与科学并重的问题。
预备知识:目标条件 MDP
ZEST 被形式化为目标条件 MDP $\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{G},P,r,\gamma)$。状态 $s_t\in\mathcal{S}$ 描述机器人与环境,动作 $a_t\in\mathcal{A}$ 是连续的电机指令。每个时刻智能体收到观测 $o_t=\psi(s_t,g_t)$ 与目标 $g_t\in\mathcal{G}$,采样动作 $a_t\sim\pi_\theta(\cdot|o_t,g_t)$,得到奖励 $r_t=r(s_t,a_t,g_t)$,系统转移到 $s_{t+1}\sim P(\cdot|s_t,a_t)$。策略参数通过最大化折扣回报优化:
$$J(\theta)\;=\;\mathbb{E}\!\left[\sum_{t=0}^{T-1}\gamma^{t}\,r(s_{t},a_{t},g_{t})\right]$$
目标变量 $g_t$ 有三种实例化方式:(i) 带时间索引的参考片段 $\hat{s}_{t:t+H}$($H\geq 0$,即单步或短窗口参考);(ii) 该片段的潜变量嵌入 $z_t=f(\hat{s}_{t:t+H})$;(iii) 相位变量 $\phi_t\in[0,1]$ 加轨迹编号。论文实际采用的是最简形式——下一步参考加当前本体感知,上一步动作作为唯一的历史信息。
方法详解
图1:ZEST 框架总览(论文 Figure 4)。三个阶段:异质参考数据处理与运动学重定向、仿真中的目标条件 MDP 训练(自适应采样 + 辅助力矩课程)、零样本硬件部署。
三种参考动作源。MoCap 用 Xsens 与 Vicon 系统采集,是最高保真的自然动作来源,几乎不需要后处理。ViCap 管线从单目手持手机视频重建 3D 人体动作:MegaSaM 负责相机运动与场景估计,TRAM 负责人体姿态估计,两者组合能显著抑制姿态抖动与脚部滑移等伪影——从拍摄到重定向完成只需数分钟,实现"早上拍、白天练、晚上上真机"的迭代节奏。关键帧动画则用于生成人体做不到或非人形平台(如四足)的动作,运动学上干净但往往动力学上不可行。
运动学重定向。所有以人为中心的数据通过时空优化映射到目标机器人骨架。目标函数包含若干加权项:跟踪源动作的根部位置与朝向、通过对齐坐标系对齐对应骨骼、以关节速度惩罚做正则。优化过程中还联合求解一个均匀缩放因子与时间重采样,保证抛体类动作与真实世界重力在物理上一致。约束是机器人正向运动学,以及与自身和地面的非穿透约束。关键是:全流程不使用任何接触标注,只依赖运动学信息。
观测空间:拒绝状态估计器。策略(actor)的观测只含本体感知与参考目标两部分:
$$\mathbf{o}_{t}=(\mathbf{o}_{\text{prop}},\ \mathbf{o}_{\text{ref}}),\qquad \mathbf{o}_{\text{prop}}=\big({}_{T}\bm{\omega}_{IT},\ {}_{T}\bm{g}_{I},\ \bm{q}_{j},\ \dot{\bm{q}}_{j},\ \bm{a}_{t-1}\big)$$
其中 ${}_{T}\bm{\omega}_{IT}$ 是基座角速度、${}_{T}\bm{g}_{I}$ 是重力投影方向、$\bm{q}_j$ 与 $\dot{\bm{q}}_j$ 是关节位置与速度、$\bm{a}_{t-1}$ 是上一步动作。论文刻意排除了需要状态估计器才能得到的量(全局基座位姿、线速度)。训练采用非对称 actor-critic 架构:critic 额外使用仿真中才有的特权信息(真实根部状态、接触力、关键身体位置、辅助力矩信号),策略本身只用硬件上可得的信号。这样部署时无需估计器融合,避开了估计器带来的延迟、偏差与脆弱的接触假设。
残差动作与基于转动惯量的 PD 增益。策略输出残差动作 $\bm{a}_t$,叠加到参考关节位置上作为位置指令送入关节级 PD 控制器:
$$\bm{q}^{\mathrm{cmd}}_{j}=\hat{\bm{q}}_{j}+\bm{\Sigma}\,\bm{a}_{t}$$
$\bm{\Sigma}$ 是正定对角的动作尺度矩阵:髋、膝这类需要前馈力矩辅助的关节给大尺度,头、腕这类 PD 环路就能搞定的关节给小尺度。PD 增益的选取把每个关节建模为独立二阶系统 $I\,\theta^{\prime\prime}(t)+K_{d}\,\theta^{\prime}(t)+K_{p}\,\theta(t)=0$,其中 $I$ 是该轴的等效电机转动惯量(armature),增益按期望自然频率 $\omega_n$ 调到临界阻尼:
$$K_{p}=I\,\omega_{n}^{2},\qquad K_{d}=2\,I\,\omega_{n}$$
$\omega_n$ 取得足够高以快速跟踪,又不至于让环路在部署时变脆或迫使仿真用极小步长。同一套增益在仿真与硬件上通用,从源头压缩 sim-to-real 差距。对 Atlas 膝盖、脚踝这类并联连杆执行器(PLA),论文给出三级渐进近似:无质量连杆假设的局部投影模型、处理耦合踝关节非对角转动惯量矩阵的 Jacobi 对角近似、以及在单一标称位形下一次算定并固定的标称转动惯量模型(省去每步更新约 20% 的计算开销)。Spot 则建立了更精细的电源限幅与电机磁饱和、传动摩擦等非线性模型,正反向做功效率用真机日志辨识——这正是三连后空翻这类极限动作能迁移成功的关键。
奖励设计:刻意保持通用。总奖励由跟踪、正则、存活三部分组成:
$$r_{\text{total}}\;=\;r_{\text{track}}+r_{\text{reg}}+r_{\text{survival}}$$
跟踪项采用衰减指数核而非二次惩罚:
$$r_{\text{track}}\;=\;\sum_{i}c_{t_{i}}\exp\!\Bigl(-\,\kappa\frac{\|\mathbf{e}_{i}\|^{2}}{\sigma_{i}^{2}}\Bigr)$$
$\mathbf{e}_i$ 覆盖基座线速度、角速度、姿态、关节位置与关键身体姿态等误差项,$c_{t_i}$ 与 $\sigma_i$ 是各项权重与带宽。这个核在参考附近有界、稠密且平滑。正则项惩罚动作突变、关节加速度过大、越限;存活项是每步常数奖励。所有项都不含任务或动作特化成分,也不依赖参考动作的接触标签——这使同一套奖励配方可以横跨所有技能。
自适应参考状态初始化(Adaptive RSI)。长时程片段用朴素的参考状态初始化会盲目采样相位:已掌握的区域被过采样,困难片段被欠采样。ZEST 把每条演示切成固定 $N$ 步的 bin,每个 bin 维护一个失败水平 $f_b$,由近期跟踪相似度分数经指数滑动平均(EMA)更新。重置时从 logit 正比于 $\{f_b\}$ 的分类分布中抽一个 bin,再在 bin 内均匀采相位;每个 bin 保留一个概率下限,防止已学会的技能被遗忘。训练中期快照(论文 Figure 3a–d)清楚显示:失败水平、采样概率、访问次数、辅助力矩缩放四个信号彼此耦合,最简单的动画深蹲(轨迹 8)几乎不被采样,最难的侧手翻接后空翻(轨迹 13)拿到最多的训练预算。
图2:训练中期各轨迹 bin 的辅助力矩缩放热图(论文 Figure 3a)——失败率高的 bin 获得更强的初始辅助。
辅助力矩自动课程。倒立、侧手翻、后空翻这类大基座旋转的技能在纯 RSI 下会立即触发早停、收敛极慢。ZEST 在基座上施加一个虚拟空间力矩:PD 项作用于基座姿态跟踪误差,加一个补偿标称躯干动力学的前馈项,再由增益 $\beta\in(0,\beta_{\text{max}})$ 缩放($\beta_{\text{max}}<1.0$,保证策略必须自己学会技能)。退火由自适应采样的 per-bin 失败水平自动驱动:失败越多辅助越强,跟踪改善后辅助快速衰减至零。这相当于体操教练逐渐松手的保护带,替代了手工设计的课程。
flowchart TB
A[MoCap: Xsens / Vicon] --> R[Kinematic Retargeting
spacetime optimization]
B[ViCap: MegaSaM + TRAM
monocular video] --> R
C[Keyframe Animation] --> M
R --> M[Goal-conditioned MDP
next-step reference + proprioception]
M --> P1[PPO in Isaac Lab
asymmetric actor-critic]
S1[Adaptive RSI
per-bin EMA failure levels] --> P1
S2[Assistive Wrench Curriculum
auto-annealed by failure] --> P1
P1 --> D[ONNX export + registry]
D --> V[Validation simulator
mirrors hardware stack]
V --> H[Zero-shot hardware
Atlas / G1 / Spot]
硬件部署管线。训练时策略检查点以 ONNX 导出并连同完整配置元数据登记入库;验证阶段按元数据自动配置一个镜像硬件软件栈的评估仿真器;验证通过后用同一套自动化流程部署到真机。论文强调策略本身并不绑定该管线,它只是加速迭代、消除人工配置误差的工程手段。每个技能用一个专用策略训练约 10 小时(约 7k 次迭代,单张 NVIDIA L4 GPU),硬件实验跨多次独立试验均稳定成功。
实验结果
MoCap 技能:全尺寸人形上的首批动态多接触行为。Atlas 上部署了行走、慢跑、前滚翻、四肢侧滚、四肢爬行、军体匍匐、侧手翻与霹雳舞,G1 上部署了乒乓球与侧手翻。行走与慢跑呈现出纯奖励整形极难塑造的自然步态特征:清晰的脚跟-脚趾滚动过渡、接近关节极限的膝盖充分伸展、减速时安静平稳的落地——论文将其归因于高保真参考保留了人类动作细节、执行器模型调得有响应但不僵、以及抑制瞬态冲击的正则。多接触技能全程不指定接触时序、不约束基座高度或直立姿态,所有动作从站立开始、回到站立结束;霹雳舞包含贴地身体接触加快速扫腿,甚至出现膝关节完全伸展的腿从另一条腿下方穿过的自接触段落。
| 动作(参考源) | 机器人 | 多接触 | 时长(s) | MAE(q) rad | MAD(R) rad | ML2(ω) rad/s |
|---|---|---|---|---|---|---|
| Walk(MoCap) | Atlas | 否 | 8.47 | 0.0568 | 0.0300 | 0.3642 |
| Jog(MoCap) | Atlas | 否 | 5.89 | 0.0413 | 0.0593 | 0.6994 |
| Forward roll(MoCap) | Atlas | 是 | 7.11 | 0.0616 | 0.1370 | 1.6541 |
| Army crawl(MoCap) | Atlas | 是 | 16.66 | 0.1033 | 0.0754 | 1.0107 |
| Cartwheel(MoCap) | Atlas | 是 | 5.98 | 0.0835 | 0.0643 | 1.7338 |
| Breakdance(MoCap) | Atlas | 是 | 6.56 | 0.0790 | 0.1334 | 1.9111 |
| Table-tennis(MoCap) | G1 | 否 | 29.98 | 0.108 | 0.402 | 1.827 |
| Soccer kick(ViCap) | Atlas | 否 | 6.00 | 0.0493 | 0.0504 | 1.2534 |
表1:部分硬件跟踪指标(论文 Table 1 摘录)。MAE(q) 为关节位置平均绝对误差,MAD(R) 为基座朝向平均角距离,ML2(ω) 为基座角速度平均 L2 误差,均为成功试验上的统计,越低越好。
图3:ZEST 跨数据源与机器人形态的硬件部署代表帧(论文 Figure 1)。
ViCap 技能:带噪视频动作的零样本迁移。Atlas 上执行了足球射门与三段舞蹈(A–C),包含长时间单脚支撑与连续跳跃;G1 上执行了带腾空相位的芭蕾段落,以及跳上箱、爬上箱、爬下箱三个场景交互技能。尽管重建参考存在明显伪影(姿态抖动、脚部滑移),关节与姿态跟踪误差仍维持在约 0.05 rad 的低水平。论文将其归因于奖励不强制紧贴参考根部轨迹的"松弛跟踪"设计,以及完全不依赖接触标签的 MDP。翻箱技能的鲁棒性测试尤其有说服力:名义箱高 0.75 m(训练随机化区间 0.70–0.80 m),连续五次爬箱五次成功;躯干附加 2 kg 负载仍成功;箱高超出训练分布时,爬上箱在 0.55 m 成功,爬下箱在 0.55 m 与 0.95 m 均成功;初始位姿在训练分布内(x 向 ±10 cm、偏航 ±0.3 rad)全部成功。这些技能全程只用本体感知,不向策略提供任何箱子的位置信息。
关键帧动画:跨形态的极限动作。动画让 Atlas 利用人体没有的连续关节完成倒立翻转(倒立支撑下旋转背部偏航关节);同一配方迁移到四足 Spot 后完成了前腿倒立平衡、连续后空翻、桶滚与"开心狗"动作。桶滚过程中机载 IMU 一度饱和,策略依然完成了动作。动画参考动力学上激进甚至不可行时,策略会有意放松对基座姿态与角速度的跟踪以保住可行性——这解释了 Table 1 中均值适中但最大值尖峰的形态。
消融实验。多技能策略(15 个动作联合训练)在完整域随机化下每条参考跑 10000 次 rollout。10 小时训练时完整方法平均成功率最高、下尾显著更好;20 小时时部分消融追平均值,但完整方法的最小值与 p10 仍最接近均值。逐项看:去掉课程仍能收敛,但 20 小时的表现只相当于完整方法 10 小时的水平;去掉自适应采样会系统性欠采样困难 bin;加入 20 步(0.4 s)历史或未来参考窗口反而拖慢乃至阻止收敛;去掉 critic 特权信息使价值估计变噪、更新变弱;绝对动作(不做残差)表现最差——因为回合始终从参考上初始化,早期的小输出策略在残差参数化下才有意义。
图4:10 小时训练后的消融成功率对比(论文 Figure 3e):柱为均值,须线为最小-最大,点为 p10。
与 MPC 基线的对比。论文把多技能 RL 策略与 Boston Dynamics 的全身 MPC 基线(代表当前模型派控制水平)在仿真中对撞。MPC 需要从参考中抽取接触时序(足地距离加速度启发式),对带脚滑的 ViCap 数据极易标错;且其接触模型只支持手脚,膝、躯干、前臂接触的动作(军体匍匐、前滚翻、四肢爬行)直接超出能力范围而被排除。
| 动作 | MAE(q) MPC | MAE(q) RL | MAD(R) MPC | MAD(R) RL |
|---|---|---|---|---|
| Walk | 0.0467 | 0.0554 | 0.0202 | 0.0280 |
| Jog | 0.1172 | 0.0757 | 0.1099 | 0.0621 |
| Handstand invert | 0.1466 | 0.1250 | — | — |
| Cartwheel | 0.2371 | 0.0882 | 0.0597 | 0.0628 |
| Roll on all fours | —(失败) | 0.0862 | —(失败) | 0.0914 |
| Dance snippet B | —(失败) | 0.0964 | —(失败) | 0.1503 |
表2:MPC 与多技能 RL 策略的仿真对比(论文 Table 2,rad)。"—"表示 MPC 无法执行。
结果模式清晰:行走这类接触干净、不出工作包络的动作上 MPC 与 RL 打平(MPC 略优);动作一动态起来(慢跑、侧手翻),MPC 受困于接触标注不一致与手臂力矩饱和,RL 全面占优;舞蹈 B 与四肢侧滚则只有 RL 能完成。学习式控制器不需要接触时序、对模型失配与接触时序误差更宽容、且天然支持任意身体部位接触——这是相对模型派路线的结构性优势。
局限性
作者自述三点局限。其一,多技能策略没有做过训练分布外的泛化测试:能否跟踪"接近但不同于"训练集的未见技能,检验的是策略学到的是可迁移控制原语还是对特定参考的过拟合,这被留给未来工作。其二,当前配方是纯本体感知的,假设地面平坦且不滑,对崎岖或柔顺地形的显式感知尚未纳入。其三,sim-to-real 依赖合理建模:论文给出了 PLA 建模与基于转动惯量选 PD 增益的实用流程,但全自动系统辨识仍是开放问题,复杂现象可能最终需要数据驱动方法。
从外部视角还可补充两点:每个技能仍是单独训练的专用策略(多技能策略只用于仿真分析),技能库扩展的边际成本没有完全消除;ViCap 管线依赖 MegaSaM+TRAM 的重建质量,极端光照、遮挡或快速相机运动下的适用边界论文未作系统刻画。
总结与展望
ZEST 的贡献可以概括为三层。第一,它给出了一份通用的动作模仿配方:单阶段训练消化三种带各种缺陷的参考源,不用接触标签、不用参考/观测窗口、不用状态估计器、不用繁重奖励整形、不用多阶段训练。第二,它刷新了硬件能力边界:Atlas 上首批全尺寸人形动态多接触行为(军体匍匐、霹雳舞),G1 上首次从视频直接迁移舞蹈与翻箱这类接触密集型技能。第三,同一策略结构与训练配方跨越了 Atlas、G1、Spot 三种截然不同的形态。
论文展望的方向包括:用紧凑动作嵌入或零/少样本适应跟踪未见动作,配合持续学习扩展技能库而不灾难性遗忘;从全参考控制走向部分条件化接口——先训一个吃完整参考的教师,再蒸馏成接受关键帧、姿态片段、场景关键帧或语言指令的学生;以及用生成式高层规划器把用户指令映射成动作计划,交给通用 RL 跟踪器执行,闭合行为合成与控制的回路。
金句
"ZEST establishes a scalable interface between biological movements and their robotic counterparts."(ZEST 建立了生物动作与其机器人对应物之间可扩展的接口。)
"Its training pipeline avoids contact labels, reference or observation windows, state estimators, and extensive reward shaping."(其训练管线不需要接触标签、不需要参考或观测窗口、不需要状态估计器、不需要繁重的奖励整形。)