PAPER DEEP DIVE
具身操作的数据金字塔
提出具身操作的数据金字塔框架,分析多数据源(耦合观测、物理状态与动作)对具身agent的差异化贡献,指导具身智能数据构建。
具身操作的数据金字塔
机构:北大, 南洋理工, 港科大, 新加坡国立, 港中文, 港大, Duke, UCB, 北邮, 南大, 上交等 | arXiv:2607.24744v1
一句话总结
本文将具身数据生态系统组织为五层"数据金字塔"——真实机器人数据、UMI数据、自我/他者中心数据、仿真数据、通用视觉语言数据,围绕可扩展性与机器人对齐性的核心张力,从质量、多样性、可复用性和物理保真度四个维度系统分析各层数据源,并审视具身基础模型的数据配方与六大开放挑战。
研究背景与动机
多模态基础模型通过在互联网规模数据上预训练获得了广泛的感知和语言能力。但具身智能体无法走此捷径——它们需要将观测与物理状态和动作耦合的数据。这些信号由多种数据源以不同程度提供。核心问题在于:应该用什么数据来训练具身基础模型?
现有模型(如Motus、GR00T)虽引入层次化数据视图,但通常围绕特定模型训练配方设计,对数据类别在采集可扩展性、本体依赖、物理保真度、迁移性和下游效用方面的差异分析有限。现有综述聚焦模型架构或特定子问题,缺乏从数据中心视角对具身数据生态系统的类别级系统化组织。
图1:论文三部分组织——数据金字塔介绍、具身基础模型数据应用、未来方向。
数据金字塔框架
金字塔围绕两个互补设计原则组织:
- 可扩展性(Scalability):数据源在硬件依赖、人力、环境重置、安全监督和边际生成成本方面的高效扩展能力
- 机器人对齐性(Robot Alignment):观测、表示和监督信号对物理机器人学习和执行的支持直接程度
两者常处于张力中:与真实机器人执行紧密对齐的数据通常昂贵且难以扩展,而高度可扩展的数据可能仅提供间接或不完美的物理交互监督。数据金字塔的可扩展性-对齐性权衡可形式化表达为:
$$\text{Utility}(s) = f(\text{Scalability}(s),\ \text{Alignment}(s),\ \text{Quality}(s),\ \text{Diversity}(s),\ \text{Reusability}(s),\ \text{Fidelity}(s))$$其中 $s$ 为数据源。补充四个类别级维度:质量(有效性/一致性/信息量)、多样性(任务/物体/场景/视角/本体覆盖)、可复用性(跨任务/环境/本体迁移)、物理保真度(真实交互动力学忠实度)。从顶点到基底,五层排序反映了从更强的物理接地和更直接可执行的动作监督,向更大的可获取性和可扩展性的系统性过渡。下降金字塔的过程本质上是一个系统性的权衡:
$$\text{Trade-off}(s) = \alpha \cdot \text{Scalability}(s) - \beta \cdot \text{Alignment}(s), \quad \alpha, \beta > 0$$即每下降一层,可扩展性提升但对齐性下降。每层放松了部分耦合以换取覆盖范围:真实机器人数据需要硬件、操作员和重置;UMI移除机器人但保留末端执行器监督;自我中心数据移除夹爪但保留真实物理和日常多样性;仿真恢复可执行动作和特权标签但近似物理;通用数据放弃机器人接地换取网络规模语义覆盖。
| 层级 | 数据源 | 可扩展性 | 机器人对齐 | 物理保真度 | 核心特点 |
|---|---|---|---|---|---|
| 顶点 | 真实机器人数据 | 低 | 最高 | 最高 | 动作直接可执行,需硬件/人力/重置 |
| 第2层 | UMI数据 | 中 | 高 | 高 | 移除机器人但保留末端执行器监督 |
| 第3层 | 自我/他者中心数据 | 中 | 中高 | 中高 | 移除夹爪但保留真实物理和日常多样性 |
| 第4层 | 仿真数据 | 高 | 中 | 近似 | 恢复可执行动作和特权标签但近似物理 |
| 基底 | 通用视觉语言数据 | 最高 | 低 | 无 | 放弃机器人接地,换取网络规模语义覆盖 |
图2:各层数据集规模的时间演进——仿真/UMI/机器人数据按演示数,自我中心数据按小时,通用数据按问答对。
各层数据源详解
第一层:真实机器人数据
采集范式包括脚本化(Script)、遥操作(Teleoperation)和人在环增强(Human-in-the-Loop Enhancement)。脚本化采集将人力转移到任务逻辑和执行条件设计上,支持以较低边际成本进行重复和并行采集。根据动作产生方式,可细分为基于规则的执行(有限状态机、启发式控制器)、轨迹回放(重执行先前记录的运动)和自主策略 rollout(使用学习或启发式策略与环境交互生成新轨迹)。遥操作通过人实时控制机器人,直接提供可执行动作和真实物理反馈,但受限于硬件成本、环境重置和安全监督。代表性数据集如Open X-Embodiment、DROID、RoboMIND等。真实机器人数据的价值密度可建模为:
$$V_{\text{real}} = \frac{D_{\text{action}} \cdot F_{\text{physics}}}{C_{\text{hardware}} + C_{\text{reset}} + C_{\text{safety}}}$$其中 $D_{\text{action}}$ 为动作直接可执行度,$F_{\text{physics}}$ 为物理保真度,分母为硬件、重置和安全成本。这解释了为何真实机器人数据虽最宝贵却最难规模化。
第二层:UMI数据
通用操作接口(UMI)在采集时移除机器人但保留末端执行器监督。使用手持夹爪集成腕部相机、位姿追踪和夹爪状态感知,在自然人机示教过程中捕获同步观测和动作。后续系统如FastUMI简化硬件和追踪流程以支持大规模采集,LEGATO提供跨平台一致的示教表示,FreeTacMan采用指戴式界面允许操作者用自然手指运动控制夹爪。
UMI的核心创新是相对轨迹动作表示。由于不直接操作目标机器人,UMI不含本体特定关节状态,而是结合腕部相机和视觉惯性SLAM估计手持夹爪的六自由度位姿轨迹。为减少对全局追踪帧的敏感性,未来末端执行器目标相对于当前位姿表示。这种相对轨迹表示保留了示教运动的空间结构,同时减少了执行期间的误差累积。相对轨迹可形式化为:
$$\mathbf{a}_t = T_{\text{rel}}(t) = T_{\text{current}}^{-1}(t) \cdot T_{\text{target}}(t+\Delta t)$$其中 $T_{\text{current}}(t)$ 为当前末端执行器位姿,$T_{\text{target}}(t+\Delta t)$ 为下一时刻目标位姿。该表示提供了与本体无关的动作空间,可通过标定、逆运动学和低层控制映射到不同机器人平台。UMI数据集已从单臂视觉轨迹扩展到移动操作、双手操作和灵巧手,观测空间也从单目腕部图像扩展到多视角、3D空间观测和触觉/力感知。
| 数据集 | 时间 | 臂类型 | 任务数 | 末端执行器 | 演示数 | 触觉 |
|---|---|---|---|---|---|---|
| UMI | 2024 | 单/双臂 | 5 | 夹爪 | 2.5K | ✗ |
| ManiWAV | 2024 | 单臂 | 5 | 夹爪 | 1.0K | ✗ |
| UMI on Legs | 2024 | 单臂 | 2 | 夹爪 | 514 | ✗ |
| FastUMI | 2024 | 单臂 | 2+ | 夹爪 | — | ✗ |
| FastUMI-100K | 2025 | 多本体 | 多 | 夹爪 | 100K+ | 部分 |
第三层:自我/他者中心数据
人类交互记录包含视觉感知、运动/姿态追踪和辅助交互传感。捕获基础设施包括视觉传感(第一人称/第三人称相机)、运动与姿态追踪(全身追踪、手部追踪)和辅助传感(可穿戴IMU、触觉贴片、力传感器、EMG)。监督构建分为语义监督(分割/识别)、几何监督(深度/姿态估计)、多模态监督和机器人导向监督。为手-物交互、可供性理解和任务分解提供可复用监督。该层的数据效用可表示为:
$$U_{\text{ego}}(s) = w_1 \cdot \text{Affordance}(s) + w_2 \cdot \text{ContactSeq}(s) + w_3 \cdot \text{Diversity}(s) - w_4 \cdot \text{RetargetGap}(s)$$其中 $\text{RetargetGap}$ 表示人-机器人重定向差距,是该层数据利用的核心瓶颈。人手与机器人手在关节拓扑、自由度、指尖几何、柔顺性、驱动和力限方面存在差异,几何上看似合理的重定向运动可能仍违反机器人特定约束或在真实硬件上无法产生稳定接触。
第四层:仿真数据
包含仿真基础设施(机器人本体/传感器、物体/场景资产、物理/渲染后端)、基准和数据集、合成演示生成,以及世界模型作为仿真器。仿真的核心优势是以可忽略的边际成本并行生成可执行动作和特权标签(接触、位姿、成功信号)。世界模型可作为策略训练的后训练工具、策略评估的仿真器,以及合成数据引擎。核心挑战是仿真到现实差距(sim-to-real gap),可建模为分布偏移:
$$\Delta_{\text{sim2real}} = \mathbb{E}_{s \sim P_{\text{sim}}}[L(f_{\text{sim}}(s))] - \mathbb{E}_{s \sim P_{\text{real}}}[L(f_{\text{real}}(s))]$$其中 $P_{\text{sim}}$ 和 $P_{\text{real}}$ 分别为仿真和真实环境的state分布,$f_{\text{sim}}$ 和 $f_{\text{real}}$ 为对应的前向动力学模型。仿真数据的价值在于可通过域随机化(domain randomization)和系统识别(system identification)部分弥合此差距。
第五层:通用视觉语言数据
包括视觉语言数据、分割/定位数据、3D数据、任务分解规划数据、视频/时序数据、物理/因果/失败推理数据、抓取数据。放弃机器人接地换取网络规模语义和推理覆盖。该层数据支持感知和推理而非动作,对接触或后果无所述。通用数据对具身模型的贡献可理解为提供语义先验:
$$P_{\text{embodied}} = P_{\text{action}} \cdot P_{\text{semantic}}(s | \text{general data})$$其中 $P_{\text{semantic}}$ 为通用数据提供的语义理解先验,$P_{\text{action}}$ 为动作接地。通用数据增强了 $P_{\text{semantic}}$ 但不直接提供 $P_{\text{action}}$。
图5:具身基础模型预训练数据源演进——从单一真实机器人数据到多源异构混合。
具身基础模型的数据应用
本文从数据中心视角分析三类具身基础模型的数据使用方式:
- 具身大脑模型(Embodied Brain):使用无动作数据增强具身理解能力,使用动作标注数据实现物理接地
- 视觉-语言-动作模型(VLA):动作标注数据用于动作生成,无动作数据用于感知和推理增强
- 世界-动作模型(World Action Model):动作标注数据用于世界预测与动作生成,无动作数据用于场景动态理解
数据配方的演进趋势清晰可见。例如 $\pi$ 系列从 $\pi_0$ 的纯真实机器人数据,扩展到 $\pi_{0.5}$ 的真实机器人+通用数据,再到 $\pi_{0.7}$ 进一步纳入自我中心数据。LingbotVA从真实机器人+UMI+仿真数据扩展到LingbotVA 2.0覆盖全部五层金字塔。然而最优数据配方仍是开放问题——以真实机器人数据为主的模型(如LingbotVLA、DreamZero)同样可获得强性能,现有证据不表明纳入更多数据源本质上更优。不同数据类型的互补能力可建模为加权组合:
$$\text{Capability}(M) = \sum_{i=1}^{5} w_i \cdot C_i(M, D_i), \quad \text{s.t.} \quad \sum_{i=1}^{5} w_i = 1$$其中 $C_i(M, D_i)$ 表示模型 $M$ 在第 $i$ 层数据 $D_i$ 上的能力增益,$w_i$ 为该层在训练配方中的权重。最优配方的目标是找到最大化总能力的权重分配。
图6:2023-2026年代表性VLA和WAM模型的数据源组成对比。
六大开放挑战
- 触觉数据:现有数据以RGB-D和本体感知为主,触觉感知尚未系统纳入。触觉数据提供视觉无法直接观测的接触力、滑动、局部变形、摩擦和抓取稳定性信息。RoboMIND 2.0和Humanoid Everyday已开始纳入触觉信号,但受限于传感器特定硬件、不一致信号格式和有限任务覆盖。
- 失败数据与恢复:现有数据集偏重成功示教,失败和次优轨迹常被丢弃。失败数据应被视为失败感知、因果诊断和恢复行为的重要监督源,而非低质量经验。未来数据集应提供更丰富的失败中心标注,包括失败前上下文、失败类别与原因、状态变化和恢复结果。
- 可扩展采集:自我中心数据采集正从第一人称RGB视频扩展到AR/MR设备(眼动、头部姿态、深度)、腕部相机、手部IMU、触觉贴片和EMG。但追踪仍受遮挡、运动模糊、漂移和有限视野影响,手套和触觉传感器需仔细标定和同步。
- 跨本体状态-动作对齐:统一数据格式不保证兼容监督。末端执行器位姿可能相对于机器人基座、相机、局部末端执行器或世界坐标系定义,导致相同物理运动对应不同数值表示。有效对齐需一致的几何语义,未来数据集应将坐标系约定、标定参数和控制器模式作为一等元数据记录。
- 灵巧操作的自我中心先验:人-机器人差距不仅是视觉的,还是运动学、形态学和物理的。有前景的方向是将自我中心数据视为结构化交互先验而非精确机器人动作标签——人机视频提供任务意图、物体可供性、抓取选择、接触序列和长时序操作结构,机器人数据则将这些先验接地到本体特定动作和接触动力学中。
- 数据配方:最优数据组成仍是开放问题。不同模型在数据源组合、采样比例和阶段分配策略上差异显著。计算匹配的系统性消融实验仍然有限,同一数据源在不同架构、动作表示和训练目标下的性能增益也不够明确。未来应研究架构感知和阶段依赖的数据配方,比较固定、课程化和自适应混合策略。
graph TD
A["数据金字塔"] --> B["顶点: 真实机器人数据
高对齐/低扩展/动作直接可执行"]
A --> C["第2层: UMI数据
移除机器人/保留末端执行器/相对轨迹"]
A --> D["第3层: 自我/他者中心数据
移除夹爪/保留真实物理/需重定向"]
A --> E["第4层: 仿真数据
恢复动作/特权标签/近似物理"]
A --> F["基底: 通用VL数据
放弃接地/网络规模语义覆盖"]
B --> G["具身基础模型"]
C --> G
D --> G
E --> G
F --> G
G --> H["具身大脑: 感知+推理+规划"]
G --> I["VLA模型: 动作生成+语义理解"]
G --> J["世界动作模型: 世界预测+动作生成"]
H --> K["六大挑战"]
I --> K
J --> K
K --> L["触觉数据/失败数据/可扩展采集/跨本体对齐/灵巧先验/数据配方"]
局限性
- 金字塔排序是对六个维度的综合而非每个属性严格单调递进,个别数据源可能在特定维度上偏离整体趋势。
- 数据配方分析基于已发表模型报告,可能未反映未公开的内部实验和消融结果。
- 数据源效用评估主要定性,缺乏大规模、计算匹配的定量消融对比。
- 触觉和失败数据等新兴模态的讨论受限于当前社区数据的稀疏性。
总结与展望
本文首次将具身数据生态系统系统组织为五层数据金字塔,围绕可扩展性与机器人对齐性的核心张力,从质量、多样性、可复用性和物理保真度四个维度系统刻画各层数据源。通过对具身大脑、VLA和世界动作模型三类基础模型的数据配方分析,揭示了从单一真实机器人数据到多源异构混合的演进趋势。六大开放挑战——触觉数据、失败数据、可扩展采集、跨本体对齐、灵巧先验和数据配方——为下一代具身系统的数据设计指明了方向。
金句:多模态基础模型通过消费整个互联网学会了看和说,但具身智能体无此捷径——它们需要将观测与物理状态和动作耦合的数据。



