PAPER DEEP DIVE
Ego2Robot:从第一人称人类视频合成可扩展机器人数据
将第一人称人类操作视频通过动作重定向、机械臂视觉合成、多级质量筛选转化为机器人训练数据,产出 18,561 小时跨 15 种机器人形态的数据,提升 VLA 模型 OOD 泛化,并在真机验证。
一句话总结
Ego2Robot 构建了一条从第一人称人类操作视频到机器人训练数据的完整流水线——动作重定向、机械臂视觉合成、三级质量筛选——将约 1,940 小时的自我中心视频转化为跨 15 种机器人形态的 18,561 小时训练数据,并通过解耦评估协议证明该数据能持续提升 VLA 模型的分布外泛化能力。
研究背景与动机
视觉-语言-动作(VLA)模型在机器人操作领域取得了令人瞩目的进展,但其泛化能力从根本上受限于可用机器人数据的规模与多样性。尽管 Open X-Embodiment、DROID、AgibotWorld 等大规模数据集不断涌现,机器人遥操作数据的采集仍然昂贵、耗时且受限于硬件可用性。一条单臂机器人轨迹的采集成本远高于一段人类用手操作物体的视频——后者几乎可以在任何场景中零成本获取。
第一人称(自我中心)人类操作视频提供了一个诱人的替代方案。与机器人遥操作相比,人类手部交互可以在海量场景中以极高多样性被采集:不同物体、不同环境、不同任务变体。这些视频蕴含丰富的操作先验——物体如何被抓取、工具如何被使用、双手如何协同——这些是仅凭机器人数据难以获得的。然而,人类手部与机器人末端执行器之间存在巨大的具身差异,直接使用人类视频训练机器人策略并不可行。
已有工作探索了两条路径。第一条是联合训练:将人类视频与机器人数据混合训练,让模型隐式学习共享的视觉-语义表征。第二条是重定向-渲染:将人类手部动作映射到机器人运动学,再在视觉上用人形机械臂替换人类手臂。后者在单任务、小规模场景下已展现出可观效果。但一个关键问题始终未被回答:大规模 ego2robot 合成数据能否为 VLA 模型提供有效的预训练信号,尤其是否能提升分布外泛化?
Ego2Robot 正是对这一问题的系统性回答。作者的核心假设是:尽管具身形态不同,自我中心操作视频中包含可迁移的交互规律——物体接近的轨迹模式、抓取的时机选择、工具使用的手眼协调——如果通过适当的动作对齐和视觉对齐,这些规律可以补充机器人数据的不足。为此,他们构建了完整的端到端流水线,支持带标注和带标注两种输入路径,处理来自四个数据源约 1,940 小时的第一人称视频,渲染为 15 种机器人形态,最终产出 18,561 小时的合成训练数据。
预备知识
理解 Ego2Robot 需要掌握几个核心概念。首先是手部姿态估计:从 RGB 图像中恢复 21 个手部关键点的三维坐标。论文使用 WiLoR 进行逐帧重建,DynHaMR 进行时序优化。其次是逆运动学(IK):给定末端执行器的位姿,求解机器人关节角度使末端到达目标位置,论文使用 MuJoCo 的 IK 求解器。第三是相机坐标系相对动作:将末端执行器的位移表示在观察者(相机)坐标系中,而非世界坐标系中,这一设计使得来自不同相机设置和不同机器人形态的数据自然统一。
另一个关键概念是流匹配(Flow Matching),这是论文动作头的训练目标。与扩散模型类似,它通过学习从噪声到数据的向量场来生成动作序列,但使用线性插值路径而非随机微分方程,推理时仅需少量 Euler 步即可生成动作。
方法详解:Ego2Robot 流水线
Ego2Robot 流水线由三个阶段组成:动作对齐、视觉对齐、质量筛选。每条输入视频经过这三个阶段后,产出 15 种机器人形态的并行训练数据流。
流水线总览
flowchart TB
A[第一人称视频
~1940h] --> B{输入路径}
B -->|Path A: 带标注| C[已有手部姿态]
B -->|Path B: 无标注| D[WiLoR 逐帧重建
DynHaMR 时序优化
Qwen3.5 子任务分割]
C --> E[动作对齐]
D --> E
E --> E1[手到夹爪重定向]
E --> E2[时序平滑
Savitzky-Golay + SLERP]
E --> E3[动作速度对齐]
E1 --> F[视觉对齐]
E2 --> F
E3 --> F
F --> F1[SAM3 手臂分割]
F --> F2[ProPainter 去手修复]
F --> F3[机器人底座搜索
网格搜索 + IK可行性]
F --> F4[MuJoCo IK 逐帧求解]
F --> F5[深度感知合成]
F1 --> G[质量筛选]
F5 --> G
G --> G1[L1 管线内部]
G --> G2[L2 统计过滤]
G --> G3[L3 VLM 一致性审计]
G1 --> H[15 种形态并行输出
18561h 训练数据]
G2 --> H
G3 --> H
上图展示了完整的 Ego2Robot 流水线。输入视频首先经过手部姿态估计(Path B 无标注路径),然后依次通过动作对齐、视觉对齐、质量筛选三个阶段,最终为 15 种机器人形态各生成一条训练数据流。
1. 动作对齐
动作对齐阶段将人类手部姿态转换为平行夹爪的末端执行器轨迹。核心是从 21 个手部关键点中提取紧凑的夹爪表示。论文定义了一个虚拟指尖点,作为食指和中指尖的加权混合:
$$\mathbf{p}_{\text{vf}} = 0.7 \cdot \mathbf{p}_{\text{index}} + 0.3 \cdot \mathbf{p}_{\text{middle}}$$
这个虚拟指尖代表了夹爪的抓取中心。工具中心点(TCP)和夹爪开合宽度则由拇指指尖与虚拟指尖定义:
$$\mathbf{p}_{\text{tcp}} = \frac{\mathbf{p}_{\text{thumb}} + \mathbf{p}_{\text{vf}}}{2}, \quad w = \|\mathbf{p}_{\text{thumb}} - \mathbf{p}_{\text{vf}}\|$$
TCP 是拇指与虚拟指尖的中点,开合宽度则是两者间的欧氏距离。这个设计巧妙地将人类抓取的手部构型映射为平行夹爪的单一标量开合度。
抓取方向的计算更为精细。论文构建了一个右手正交坐标系 $\mathbf{R} = [\mathbf{x}\ \mathbf{y}\ \mathbf{z}]$,三个轴分别定义如下:抓取轴 $\mathbf{z}$ 沿拇指到虚拟指尖方向;腕到指尖方向 $\mathbf{d}$ 与 $\mathbf{z}$ 张成颌面,其法向为夹爪法向轴 $\mathbf{y}$;接近轴 $\mathbf{x}$ 完成正交系:
$$\mathbf{z} = \frac{s(\mathbf{p}_{\text{thumb}} - \mathbf{p}_{\text{vf}})}{w}, \quad \mathbf{y} = \frac{\mathbf{z} \times \mathbf{d}}{\|\mathbf{z} \times \mathbf{d}\|}, \quad \mathbf{x} = \mathbf{y} \times \mathbf{z}$$
其中 $s = +1$ 对应右手,$s = -1$ 对应左手,使 $\mathbf{z}$ 方向与手别无关,左右手映射到同一夹爪坐标系。这种设计保证了不同手的抓取姿态被统一表示。
时序平滑处理逐帧检测带来的高频噪声。论文对位置和宽度使用 Savitzky-Golay 滤波,对方向使用高斯加权 SLERP(球面线性插值),在保留运动结构的同时产生平滑轨迹。
动作速度对齐是容易被忽视但影响重大的设计。人类自我中心操作的动作速度远高于机器人遥操作。论文对每个数据源采用不同的帧率下采样:ANT 和 EgoDex 降至原始帧率的 60%(约 1.7 倍慢),EgoVerse 降至 45%(约 2.2 倍慢),ViTRA 降至 25%(约 4 倍慢)。这种逐源调校确保合成数据的速度分布与真实机器人数据匹配。
2. 视觉对齐
视觉对齐将原始视频中的人类手臂替换为渲染的机器人手臂,使视频从"人类操作"变为"机器人操作"。
手臂分割使用 SAM 3 对每帧中的人类手臂区域分割,提供时序一致的掩码。去手修复用 ProPainter 进行时序一致的视频修复,去除人类手臂并重建背景。
机器人底座搜索是整个视觉对齐中最具挑战性的步骤。与机器人到机器人迁移不同——后者有源机器人的底座位置可参考——自我中心手部轨迹是"无具身"的,没有物理机器人底座可参照。论文需要找到一个底座位姿 $\mathbf{T}_{\text{base}} = (\mathbf{t}, \mathbf{R}) \in SE(3)$,使重定向后的轨迹对目标机器人形态运动学可行。可行性通过在代表性关键帧上求解 IK 来评估:
$$\max_{\mathbf{T}_{\text{base}}} \sum_{k \in \mathcal{K}} \mathbb{1}\left[\text{IK}(\mathbf{T}_{\text{base}}^{-1}\mathbf{T}_{k}^{\text{ee}}) \text{ 可行}\right]$$
其中 $\mathcal{K}$ 是覆盖轨迹空间极值的代表性关键帧集合,$\text{IK}(\cdot)$ 是 MuJoCo 逆运动学求解器。候选底座放置通过围绕轨迹质心的网格搜索生成,受每种形态运动学可达范围 $r_{\text{max}}$ 约束。每种机器人形态独立执行此搜索,因为不同臂长和关节配置需要不同底座放置。
深度感知合成将渲染的机器人从原始相机视角合成到修复后的场景中,使用深度排序决定遮挡关系:
$$I_{\text{final}}(u,v) = \begin{cases} I_{\text{robot}}(u,v) & \text{if } D_{\text{robot}}(u,v) < D_{\text{scene}}(u,v) \land M_{\text{robot}}(u,v) = 1 \\ I_{\text{inpaint}}(u,v) & \text{otherwise} \end{cases}$$
其中 $D_{\text{scene}}$ 来自深度传感器或单目深度估计。这使得机器人手臂能正确遮挡或被场景中的物体遮挡。该过程对 15 种形态独立执行(Panda, UR5e, ARX-L5, xArm7, Sawyer, Kinova Gen3, IIWA, Jaco, FR3, UR10e, ViperX, WidowX, Piper, YAM, Aloha-Agilex)。
3. 质量筛选
质量筛选是三级过滤机制。L1(管线内部):在处理过程中标记 IK 失败、自碰撞、动作异常、工作空间覆盖不足的帧。L2(统计层):移除具有极端动作值、突变、或无效帧比例过高的轨迹。L3(VLM 一致性):使用视觉语言模型(Qwen3.5)审计合成视频,检查渲染的机器人动作与原始操作意图之间的语义一致性。这一层确保合成数据在语义层面也是合理的。
相机坐标系相对动作
由于自我中心视频使用多样且未知的相机放置,世界坐标系动作表示需要对每个视频进行标定,且不同源的动作空间不兼容。论文采用相机坐标系相对末端执行器动作。每个动作步为 7 维:3D 位置增量 $\Delta\mathbf{p}$、3D 旋转向量增量 $\Delta\boldsymbol{\omega}$、1D 夹爪。给定 EEF 到相机的变换 $\mathbf{T}_{ce} = \mathbf{T}_{wc}^{-1}\mathbf{T}_{we}$,基坐标系增量被转换到相机坐标系:
$$\Delta\mathbf{p}_{cc} = \mathbf{R}_{ce}\,\Delta\mathbf{p}_{ee}, \quad \Delta\mathbf{R}_{cc} = \mathbf{R}_{ce}\,\Delta\mathbf{R}_{ee}\,\mathbf{R}_{ce}^{\top}$$
这一变换自然统一了来自不同相机设置和机器人形态的数据,无需显式外参标定。
模型架构与训练目标
VLA 模型采用 Qwen3.5-4B 作为视觉语言骨干,配以 Diffusion Transformer(DiT)动作头。模型预测 32 步动作块,使用 8 个扩散步。动作头采用流匹配训练目标。给定干净动作 $\mathbf{a}_0$ 和噪声 $\boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0}, \mathbf{I})$,时刻 $t \in [0,1]$ 的噪声样本为:
$$\mathbf{a}_t = (1-t)\,\mathbf{a}_0 + t\,\boldsymbol{\epsilon}$$
训练目标是预测从噪声到数据的向量场:
$$\mathcal{L} = \mathbb{E}_{t,\mathbf{a}_0,\boldsymbol{\epsilon}} \left\|\mathbf{v}_\theta(\mathbf{a}_t, t, \mathbf{c}) - (\boldsymbol{\epsilon} - \mathbf{a}_0)\right\|^2$$
其中 $\mathbf{c}$ 是视觉-语言条件。推理使用 4 步 Euler 积分($\Delta t = 1/4$)。
评估框架
论文引入了一个解耦的评估协议来回答一个关键问题:合成数据在哪些泛化维度上有益,在哪些方面受限于域差距?现有基准(如 RoboTwin 2.0)将多种扰动因素同时施加,产生单一的聚合 OOD 指标,无法区分视觉、场景、具身、语义等不同来源的影响。
Ego2Robot 扩展了 RoboTwin 2.0,添加 11 个独立扰动设置和相机坐标系相对 EEF 支持,并补充了 EBench 基准(7 个精密桌面任务,更高位的相机更接近自我中心视角)。评估覆盖四个泛化维度:视觉外观(背景纹理、光照、机器人颜色)、场景布局(高度、杂乱、相机偏移)、具身形态(ARX、UR5、Franka)、任务语义(未见物体、释义指令)。
实验结果
主实验
论文比较四种预训练配置:纯机器人数据(DROID + AgibotWorld + InternData,约 6,565h),以及 Ego2R 与机器人数据以 1:3、3:1、1:1 比例混合。所有配置训练相同步数(200K 步),处理相同数量的训练样本(约 19.2M 帧),确保公平比较。
| 预训练 | Clean | Randomized | Visual | Scene | Embody | Task | EBench Avg |
|---|---|---|---|---|---|---|---|
| 纯机器人 | 62.2 | 50.9 | 61.4 | 52.9 | 23.8 | 46.2 | 39.6 |
| Ego2R+Robot (1:3) | 61.4 | 51.0 | 61.2 | 52.5 | 21.9 | 49.5 | 47.4 |
| Ego2R+Robot (3:1) | 64.1 | 49.2 | 62.7 | 54.3 | 28.2 | 51.6 | 51.7 |
| Ego2R+Robot (1:1) | 68.1 | 53.5 | 67.3 | 56.9 | 27.2 | 54.1 | 49.8 |
表1:RoboTwin2.0 和 EBench 上的成功率(%)。绿色表示相对纯机器人提升超过 5%。
1:1 混合在七项指标中的五项领先,Clean 达到 68.1%(+5.9),Randomized 达到 53.5%(+2.6)。3:1 比例在 EBench 上表现最佳(51.7%,+12.1)。1:3 比例提升微弱,说明合成数据需要达到一定比例才能产生实质收益。
逐扰动维度分析
| 扰动 | 纯机器人 | 1:3 | 3:1 | 1:1 |
|---|---|---|---|---|
| 背景纹理 | 66.6 | 65.0 | 65.5 | 70.3 |
| 光照 | 58.2 | 58.3 | 60.9 | 65.8 |
| 机器人颜色 | 59.4 | 60.3 | 61.8 | 65.8 |
| ARX 形态 | 44.1 | 43.7 | 47.6 | 51.2 |
| UR5 形态 | 20.2 | 17.6 | 31.4 | 25.0 |
| 未见物体 | 29.3 | 36.8 | 40.0 | 39.6 |
| 释义指令 | 63.1 | 62.2 | 63.1 | 68.5 |
表2:逐扰动成功率分解(%)。
视觉外观受益最大。1:1 混合在三项视觉因子上全面提升:背景 +4%、光照 +8%、机器人颜色 +6%。这归因于自我中心视频中的场景多样性,以及 15 种形态渲染带来的多色机器人外观。具身迁移从多形态数据中获益:ARX 从 44 提升到 51(1:1),UR5 在 3:1 时达到 31(+11.2)。但 Franka 始终低于 7%,反映了其与训练形态之间较大的运动学差距。任务语义一致提升:未见物体泛化从 29% 提升到 40%(3:1 时 +11),释义指令鲁棒性在 1:1 达到 69%(+5.4)。
消融研究
消融实验使用纯 ego 数据预训练(不含机器人数据),以隔离流水线本身的贡献。原始 ego 联合训练仅达 28.1%。经过流水线处理(单一形态 Ego2R)提升至 31.7%(+3.6),验证了视觉和动作对齐的价值。形态数量从 1 增加到 15,性能稳步提升(31.7 → 33.5)。加入原始 ego 数据作为"第 16 种形态"后进一步提升至 37.3%——原始 ego 数据因为视觉外观和动作分布略有不同,实际上起到了第 16 种形态的多样性增强效果。
真机实验
在 ARX ACone 双臂平台上评估五个长时程任务:放水果入篮、放积木入抽屉、折毛巾、清扫垃圾、插螺丝。三种配置对比:纯机器人预训练、Ego2R+Robot 1:1 预训练、以及微调阶段也加入 Ego2R Play 数据。Mix+Ego2R Play 在所有五个任务上取得最佳结果,其中放积木提升最大(+14)、插螺丝次之(+13),证明随意录制的第一人称视频可通过流水线转化为有效的训练信号。
局限分析
论文自述了三个局限。第一,重定向仅将手部姿态映射到平行夹爪,丢弃了精细的手指关节运动。扩展到灵巧多指手可以拓宽可迁移技能的范围。第二,视觉对齐依赖修复和深度感知合成,在重度遮挡或复杂光照下可能引入伪影。使用生成模型提升渲染保真度可以进一步缩小视觉域差距。第三,评估仅限于 RoboTwin2.0 的任务范围,扩展到更广泛的任务和具身配置将增强泛化性结论。
从独立判断角度,论文的另一个潜在局限在于语义一致性的依赖。L3 层使用 Qwen3.5 审计合成视频的语义一致性,但 VLM 本身的判断可能有误——如果 VLM 误判某段合成视频为语义一致而实际不一致,噪声数据将进入训练集。论文未报告 L3 层的假阳性率和假阴性率,这一层的质量控制效果缺乏定量评估。
此外,底座搜索的网格粒度可能影响数据质量。网格搜索的分辨率决定了底座放置的精度,过粗的网格可能导致次优放置,过细则计算开销过大。论文未详细讨论网格分辨率与数据质量之间的权衡关系。
总结与展望
Ego2Robot 证明了自我中心人类操作视频可以作为一种可扩展的机器人数据来源。通过动作对齐、视觉对齐、多级质量筛选的三阶段流水线,1,940 小时的第一人称视频被转化为跨 15 种机器人形态的 18,561 小时训练数据。解耦评估揭示了合成数据的价值主要体现在视觉鲁棒性、具身迁移和语义泛化上——这三者恰好是纯机器人数据最稀缺的维度。真机实验进一步验证了即使少量随意录制的自我中心视频,也能通过流水线转化为有效的训练信号。
这项工作为利用海量人类操作视频进行可扩展机器人学习开辟了道路。随着手部姿态估计、视频修复、生成式渲染等基础技术的持续进步,ego2robot 合成的数据质量有望进一步提升,机器人数据的规模瓶颈可能被彻底打破。



