PAPER DEEP DIVE
EgoHTR:第一人称4D人体地形穿越数据集
首个野外粗糙地形4D人-场景运动数据集,使用 Project Aria 眼镜+Rokoko 动捕服+Leica BLK2GO 3D扫描仪多传感器设置,重建精确 SMPL 身体序列和高分辨率3D场景,MPJPE 73.2mm 达竞争力精度。
EgoHTR:自我中心4D人类地形穿越示教数据集
机构:ETH Zurich, Stanford, UC Berkeley, TU Munich | arXiv:2607.13472v1
一句话总结
EgoHTR是一个自我中心4D人-场景运动数据集,使用多传感器可穿戴设备(Aria眼镜+MoCap服+3D扫描仪)在多样复杂环境中采集55条场景对齐的4D人类运动序列(超15万帧),并通过Unitree G1人形机器人验证了感知运动策略的硬件部署。
研究背景与动机
在非结构化地形中部署人形机器人仍是开放问题。经典强化学习难以应对真实世界交互的复杂性,而利用人类先验的更有前景方法受限于缺乏上下文感知的模型。运动合成的局限性直接源于现有数据管线无法在挑战性环境中捕获人-场景序列。
现有数据集的不足:(1) 实验室级动捕系统精度高但环境受限;(2) 单目重建方法可在野外使用但全局漂移误差大(超0.1m);(3) 缺乏人-场景对齐的4D运动数据。EgoHTR通过多传感器可穿戴设置桥接人形学习与场景重建的鸿沟。
图1:EgoHTR数据集预览——野外4D人-场景示教,涵盖多样地形和运动模式。
数据采集管线
采集系统
多模态传感器套件包含三个核心传感器:(1) 头戴式Project Aria眼镜Gen.1(提供 ego/exocentric 视频和SLAM流);(2) IMU Rokoko Pro II MoCap服(22个主要关节运动捕获);(3) 高分辨率Leica BLK2GO 3D场景扫描仪。可选第四、五传感器:观察者Aria眼镜和静态固定相机。整套设备便携、可部署于任意真实环境。
图2:数据生成管线——采集系统和三阶段人-场景重建。
人-场景重建(三阶段)
(I) 身体模型参数化:使用SMPL-X模型参数化人体。因MoCap服仅提供22个主要关节,固定手部和面部参数为身份姿态。形状参数 $\boldsymbol{\beta}$ 在序列内恒定,仅估计关节姿态 $\boldsymbol{\theta}$ 和全局平移 $\boldsymbol{t}$。重定向管线分两步:旋转重定向(全局四元数→相对旋转矩阵 + 逐关节偏移补偿)和优化逆运动学(最小化3D位置误差):
$$\boldsymbol{\theta}^* = \arg\min_{\boldsymbol{\theta}} \sum_{j} \| J_j^{\text{SMPL-X}}(\boldsymbol{\theta}) - J_j^{\text{MoCap}} \|^2$$其中 $J_j$ 为第 $j$ 个关节的3D位置。
(II) 时间对齐:通过每个序列开始时的拍手声同步MoCap服和Aria眼镜数据流。音频流48kHz分辨率将对齐误差限制在IMU频率100Hz内,实测跨传感器对齐误差小于60ms。序列限制在5分钟内以约束硬件时钟漂移。
(III) 空间对齐:两阶段将人体运动注册到3D场景全局坐标系。首先将身体模型运动学锚定到Aria眼镜的闭环SLAM轨迹,通过Aria相机 $C_A$ 与MoCap头关节 $H$ 之间的静态平移偏移建模。身体序列 $P$ 在Aria世界帧 $\mathcal{W}_A$ 中的变换为:
$$T_{\mathcal{W}_A}^{P} = T_{\mathcal{W}_A}^{C_A} \cdot T_{C_A}^{H} \cdot T_{H}^{P}$$然后通过ICP将Aria世界帧配准到3D扫描的点云。该方法完全依赖Aria SLAM消除全局IMU漂移。
图3:三阶段人-场景重建——身体参数化、时间对齐、空间对齐。
graph TD
A["采集系统
Aria眼镜 + MoCap服 + 3D扫描仪"] --> B["阶段I: 身体模型参数化
SMPL-X + 旋转重定向 + IK优化"]
A --> C["阶段II: 时间对齐
拍手声同步, 误差<60ms"]
A --> D["阶段III: 空间对齐
Aria SLAM锚定 + ICP配准"]
B --> E["4D人-场景序列
55条, 150K+帧"]
C --> E
D --> E
E --> F["应用1: 感知运动策略
Unitree G1硬件部署"]
E --> G["应用2: 人体网格恢复
基准评估"]
数据集统计
| 属性 | 数值 | 说明 |
|---|---|---|
| 序列数 | 55 | 多样复杂环境 |
| 总帧数 | 150,000+ | 含多模态数据 |
| 环境类型 | 室内+室外 | 碎片场、体操馆等 |
| 运动模式 | 多样 | 行走、攀爬、跨越等 |
| 传感器模态 | 5种 | ego/exo视频、SLAM、3D网格、IMU |
| 时间对齐误差 | <60ms | 音频同步 |
应用一:感知运动策略
在仿真中训练Unitree G1人形机器人跟踪提供的人类运动参考。每个参考片段用PPO训练单独的专家策略。Actor观测本体感知、重定向参考关节指令和偏航对齐的地形高度扫描;Critic额外接收特权身体状态和踝接触力。除标准mimic奖励外,引入时序足接触奖励——在稀疏地形上至关重要,因为仅距离跟踪可能导致脚悬停不承重的退化解。
参考运动精度消融实验揭示了关键发现:向参考根位置注入高斯噪声,训练在 $\sigma \approx 0.05$m 以下可容忍,在 $\sigma > 0.1$m 时崩溃。两区域行为一致跨环境(踏石和横梁),表明0.05m容忍窗口是学习问题的固有属性。当前单目方法的全局漂移超过此容忍窗口,而EgoHTR通过锚定到Aria SLAM满足厘米精度阈值。噪声容忍度可建模为:
$$\text{Success}(\sigma) = \begin{cases} \text{High} & \text{if } \sigma < 0.05\text{m} \\ \text{Degraded} & \text{if } 0.05\text{m} \leq \sigma < 0.1\text{m} \\ \text{Failed} & \text{if } \sigma \geq 0.1\text{m} \end{cases}$$
图4:基于EgoHTR训练的感知策略在Unitree G1上的硬件部署——横梁(左)和箱体攀爬(右)。
图5:参考运动精度消融——$\sigma > 0.05$m时性能下降,$\sigma > 0.1$m时训练失败。
应用二:人体网格恢复
数据集多模态特性支持跨外中心、自我中心和惯性范式的人-场景重建综合基准。现有外中心单目方法在遮挡和运动模糊下成功率低;自我中心SOTA模型在平地运动上训练,在复杂环境中动态运动捕获失败;IMU-based方法虽避免视觉遮挡但存在时序漂移导致物理不可能的场景交互。
图6:人体网格恢复对比——外中心方法在遮挡下失败,全局漂移影响长期一致性。
人体网格恢复基准结果
| 范式 | 代表方法 | 局部误差 | 全局漂移 | 遮挡鲁棒性 |
|---|---|---|---|---|
| 外中心单目 | HMR 2.0 | 中等 | 高(>0.1m) | 差 |
| 自我中心 | EgoPoser | 高(动态运动) | 中 | 中 |
| IMU-based | Poser | 低 | 高(时序漂移) | 好(无视觉) |
| EgoHTR (GT) | 多传感器融合 | 最低 | 无(SLAM锚定) | 好 |
表2:人体网格恢复跨范式基准对比。EgoHTR通过多传感器融合和SLAM锚定实现最低局部误差和零全局漂移。
人体网格恢复的精度可通过多个指标量化。局部精度用MPJPE(Mean Per-Joint Position Error)度量:
$$ ext{MPJPE} = rac{1}{J} \sum_{j=1}^{J} \| \hat{\mathbf{p}}_j - \mathbf{p}_j \|_2$$其中 $\hat{\mathbf{p}}_j$ 和 $\mathbf{p}_j$ 分别为预测和真实第 $j$ 个关节的3D位置。全局精度用根平移误差(RTE)度量。EgoHTR通过SLAM锚定使RTE趋近于零,而单目方法的RTE随时间累积漂移。全身运动质量还通过加速度误差(AccE)评估,衡量运动动态特性的准确性:
$$ ext{AccE} = rac{1}{(T-2)J} \sum_{t=2}^{T-1} \sum_{j=1}^{J} \| \hat{\mathbf{a}}_{j,t} - \mathbf{a}_{j,t} \|_2$$其中 $\mathbf{a}_{j,t}$ 为第 $j$ 个关节在时刻 $t$ 的加速度。EgoHTR的多传感器融合使加速度估计更准确,特别是在高动态的粗糙地形运动中。
感知运动策略的训练使用PPO,奖励函数结合mimic奖励和足接触奖励:
$$R = w_{ ext{pose}} R_{ ext{pose}} + w_{ ext{ee}} R_{ ext{ee}} + w_{ ext{contact}} R_{ ext{contact}} + w_{ ext{survive}} R_{ ext{survive}}$$其中 $R_{ ext{pose}}$ 为关节姿态跟踪奖励,$R_{ ext{ee}}$ 为末端执行器位置奖励,$R_{ ext{contact}}$ 为时序足接触奖励(在稀疏地形上防止退化解),$R_{ ext{survive}}$ 为存活奖励。消融实验表明加入 $R_{ ext{contact}}$ 在踏石场景上收敛更快且最终成功率更高,因为仅距离跟踪可能导致脚悬停不承重的退化解。
从数据采集效率角度,EgoHTR的管线设计使单次采集可生成多模态数据,相比传统实验室MoCap需固定设备和多相机标定,部署效率提升数倍。设传统方法单场景采集时间为 $T_{ ext{lab}}$(含设备搭建、标定、重置),EgoHTR为 $T_{ ext{field}}$,则效率比为:
$$\eta = rac{T_{ ext{lab}}}{T_{ ext{field}}} pprox 3 ext{-}5 imes$$这一效率提升使社区驱动的数据扩展成为可能,研究者可在任意环境中快速采集并贡献数据。
局限性
- 数据规模:当前数据集适合基准评估和微调,但缺乏大规模训练的规模和多样性
- 静态环境:管线限于无关节物体的静态环境,未纳入手部跟踪到身体模型
- 无联合优化:未进行后捕获的人-场景联合优化,相对IMU漂移可能残留
- 硬件约束:在无特征环境或高加速机动时传感器定位可能失败
总结与展望
EgoHTR是首个在野外条件下提供粗糙地形4D人-场景运动的数据集。多传感器设置可重建精确的SMPL身体模型序列和高分辨率多模态上下文数据。数据集为学习上下文感知的机器人运动和运动合成提供了宝贵资源,同时为SOTA人体网格恢复建立了挑战性基准。开源采集和重建管线旨在通过社区协作构建能够训练上下文感知基础模型的数据集。
金句:足印精确的运动严格需要人-地形耦合——单目方法的全局漂移超过0.1m时训练崩溃,而厘米级精度的4D重建使人形机器人感知运动策略成为可能。



