Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

egocentric具身学习embodied learning

Open-AoE:开放具身操控数据集与工具链

开放社区导向的第一人称操控数据集和工具链,覆盖从手机采集到模型训练的全流程,为具身智能提供可扩展的低成本持续采集和操控级结构化标注。

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li2026年7月15日3 分钟阅读
EN
Zishuo Li, Bowen Yang, Changtao Miao, et al. (Ant Group · 浙江大学 · 港大 · 港科广 · NUS · BAAI · 西交大)
arXiv:2607.14183 · GitHub · HuggingFace

一句话总结

Open-AoE 是一个开源的第一人称操作数据集与工具链,覆盖从手机采集到模型训练的完整流程。首版含约 2000 小时第一人称操作视频,由 500+ 贡献者用 400+ 款智能手机在自然环境中采集,提供文本标注、MANO 手部姿态、相机轨迹和时序定位原子动作。配套工具链支持可视化、跨本体重定向、模型数据转换,以及 VLA 策略、世界动作模型(WAM)和世界模型(World Model)的训练方案。

Figure 1. Open-AoE 概览:手机采集、结构化处理、下游机器人学习

Figure 1 — Open-AoE 概览。提供智能手机采集、结构化数据处理、下游机器人学习三大独立模块,支持 2000 小时数据、500+ 贡献者、400+ 设备型号、400+ 场景、8000+ 任务。

1. 研究背景与动机

具身基础模型越来越受限于真实世界交互数据的规模与质量。与可从互联网文本学习的大语言模型不同,机器人学习需要物理演示——捕获人类如何感知场景、移动双手、接触物体、完成时序扩展任务。这类数据不仅需要大规模和多样性,还需在几何、时间和语义上结构化,以支撑操作学习。

第一人称视频是此问题的自然可扩展模态:从操作者视角记录,同一视觉流中同时捕获手、物体、场景和动作进展。相比第三人称视频,更接近机器人执行时的感知结构;相比遥操作,可在日常环境中更自然、连续、低成本地采集。

然而现有数据集各有短板:

数据集小时手部姿态语言相机轨迹采集设备重定向训练
Ego4D3,6707 相机
EPIC-KITCHENS1002 型号
EgoDex8291 型号
EgoLive1,6801 定制
EgoScale20,854混合
Open-AoE2,000✓ MANO400+ 型号

Open-AoE 是唯一同时具备低成本连续采集、操作级结构标注、跨本体重定向和下游训练方案的数据集。

2. 核心方法

Open-AoE 的完整流程分三大模块:

Figure 2. 数据处理流水线概览

Figure 2 — 数据处理流水线:从原始手机录像到结构化样本,经过时序动作分割、语义标注、手部重建和相机轨迹重建。

2.1 智能手机采集

500+ 贡献者用 400+ 款消费级智能手机在自然环境中采集,覆盖厨房(24.8%)、桌面/室内(23.3%)、办公室(17.8%)、卧室(9.1%)以及客厅、工坊、浴室、户外等场景。100 小时随机样本含 32,407 条自然语言动作描述、175 个动作动词、8,030 个物体字符串、135 个场景标签。贡献者分布长尾——中位贡献 2.6 分钟,前十贡献者合计仅占 13.7%,保证数据不被小群体主导。

Figure 3. 采集、传感器和语义多样性

Figure 3 — Open-AoE 的采集、传感器和语义多样性(100 小时随机样本)。嵌套环形图展示手机品牌和型号构成;中心面板展示采集场景和贡献者覆盖;词云展示原子动作动词、操作物体和任务语言。

2.2 结构化数据处理流水线

Figure 4. 数据处理模块

Figure 4 — 结构化数据处理模块:将原始录像转化为对齐的标注样本。

原始录像经过四步处理转化为结构化样本:

  • 时序动作分割:将连续视频分割为原子动作片段,时序覆盖率达 99.99%,平均片段 9.64 秒,标注密度 13.97 段/分钟。
  • 语义标注:自然语言动作描述、物体标签、场景标签。
  • 手部重建:基于 MANO 的双手 55D 姿态参数,拼接为 110D 表示:$2\times[\mathrm{valid}(1)+\mathrm{wrist\ translation}(3)+\mathrm{wrist\ axis\text{-}angle}(3)+\mathrm{velocity}(3)+\mathrm{MANO\ pose}(45)]$。平移和有限差分速度以米和米/秒表示在当前帧 OpenCV 相机坐标系中。
  • 相机轨迹重建:SLAM 估计的相机位姿,与手部运动同步对齐。

2.3 下游工具链:AoE-Training-Ready

Figure 5. AoE-Training-Ready 表示谱及下游模型连接

Figure 5 — AoE-Training-Ready:将同步的 AoE 段投射为不同监督密度和语义角色的动作表示,连接 VLA 策略、世界动作模型和世界模型。

提供多种动作表示接口,适配不同下游范式:

接口维度坐标系/单位下游消费者
110D 密集 MANO$2\times[1+3+3+3+45]$当前相机帧;m, rad, m/sLeRobot、世界动作方案
48D 腕-指尖$2\times[3+6+15]$SLAM 世界帧;m, rot6DH-RDT 适配器
62D Sharpa$L/R\ \mathrm{EEF}(9)+L/R\ \mathrm{joints}(22)$世界帧腕 + 关节 radGR00T N1.7 适配器
20D GR00T 夹爪$2\times[9+1]$世界帧 + 夹爪 [0,1]低自由度 GR00T N1.7
22D 状态 / 20-26D 自我动作$2\times[3+6+1]+2$ valid当前帧 + 相机增量SmolVLA、iVideoGPT、LAOM

多条路线覆盖具身学习全谱:

  • 策略学习与跨本体控制:VITRA、H-RDT、GR00T N1.7、SmolVLA、LeRobot($\pi_{0.5}$, ACT, Diffusion Policy)消费密集 MANO 或腕-指尖目标。
  • 世界动作与动作条件视频学习:DreamZero、LingBot-VA、Ctrl-World、iVideoGPT 用密集手状态或紧凑手+相机动作学习动作预测和视觉动态。
flowchart TB
    subgraph Capture["Smartphone Capture"]
        A[500+ contributors
400+ phone models] --> B[2000h raw video] end subgraph Process["Structured Processing"] B --> C[Temporal Action Segmentation
99.99% coverage] B --> D[Semantic Annotation
32K action desc] B --> E[Hand Reconstruction
MANO 110D] B --> F[Camera Trajectory
SLAM] C & D & E & F --> G[Aligned Structured Samples] end subgraph Downstream["AoE-Training-Ready"] G --> H1[VLA Policies
GR00T, SmolVLA, pi0.5] G --> H2[World Action Models
DreamZero, Ctrl-World] G --> H3[World Models
iVideoGPT, LAOM] end style G fill:#e0e7ff,stroke:#2563eb style E fill:#fef3c7,stroke:#d97706 style H1 fill:#dcfce7,stroke:#16a34a

3. 实验结果

论文从标注质量、训练样本产出和多模态完整性三个维度评估 Open-AoE。

3.1 标注一致性

用视觉-语言评估器对每帧采样打一致性分 $a_{q,t} \in [1,5]$,序列宏分数为:

$$S_{\mathrm{macro}} = \frac{1}{Q}\sum_{q=1}^{Q}\left(\frac{1}{T_q}\sum_{t=1}^{T_q} a_{q,t}\right)$$

帧级分数先在序列内平均,再跨序列平均,赋予每条序列等权,防止长录制主导数据集级估计。

数据集序列宏分数 (/5)≥4 分占比95% 置信区间
Open-AoE4.58385.4%[4.557, 4.608]
OpenEgo3.029
EgoDex2.916
EgoXtreme2.015

3.2 训练窗口产出与多模态完整性

Figure 9. 训练样本产出和多模态监督可用性

Figure 9 — 训练样本产出和多模态监督可用性跨数据集对比:(a) 每小时候选历史-未来窗口数及保持率;(b) 原生手信号可用性;(c) 动作标注、边界框、置信度、手部位姿、相机位姿的序列级可用性。

对时长 $L_q$ 的序列,用历史 $h=2$s、未来 $f=2$s、步长 $\Delta=2$s 构造候选窗口:

$$N_q = \max\!\left(0,\, \left\lfloor\frac{L_q - h - f}{\Delta}\right\rfloor + 1\right)$$

保持率 $\eta_{\mathrm{window}}$ 相对于无边界上限 $3600/\Delta = 1800$ 窗口/小时:

$$\eta_{\mathrm{window}} = \frac{Y_{\mathrm{window}}}{3600/\Delta}, \qquad Y_{\mathrm{window}} = \frac{\sum_q N_q}{\sum_q L_q / 3600}$$

Open-AoE 每小时产出约 1760 个候选窗口,保持率 97.8%——接近无边界上限,说明时序连续性好。手信号可用性:98.93% 的条目至少有一只手有效,98.02% 双手有效。是唯一五种监督模态(动作标注、边界框、标注置信度、手部位姿、相机位姿)都近全覆盖的版本。

4. 主要贡献

  • 低成本大规模社区采集:2000 小时、500+ 贡献者、400+ 手机型号——最广消费手机设备覆盖的第一人称操作数据集。
  • 完整结构化标注:MANO 手部姿态 + 文本 + 相机轨迹 + 时序原子动作,时序覆盖 99.99%,标注一致性 4.583/5 远超同类。
  • 跨本体重定向工具链:多接口动作表示(110D MANO、48D 腕-指尖、62D Sharpa、20D GR00T、22D 状态),适配 VLA/WAM/World Model 全谱下游范式。
  • 开源生态定位:非静态数据包,而是数据贡献者、高校、机器人开发者、模型团队共建的开放生态。

5.

类别概率归一化

$$ p_{s,j}=\frac{\lambda_{s,j}}{\sum_{r}\lambda_{s,r}} $$

有效响应度

$$ R_{\mathrm{eff}}^{(s)}=\exp\!\left(-\sum_{j}p_{s,j}\log p_{s,j}\right) $$

局限与展望

分析判断:

Open-AoE 的核心价值在于打通了从低成本手机采集到下游模型训练的完整链路。其 2000 小时虽不及 EgoScale 的 20854 小时,但在标注完整性(MANO + 相机轨迹 + 原子动作)和工具链可用性(跨本体重定向 + 训练方案)上是唯一的。相机域多样性(400+ 型号、多模 FOV)是天然传感器域随机化,可能提升向未见相机和机器人视角的迁移鲁棒性,但论文也诚实地指出其下游收益仍是训练侧假设而非已验证结论。

局限方面:当前版本不含机器人关节标签,跨本体迁移依赖重定向而非直接标注;评估主要是数据质量审计而非下游任务基准测试;2000 小时虽大但与 EgoScale 相比仍有差距。未来可探索社区扩展(增大到万小时级)、直接机器人关节标注(减少重定向误差)、以及下游任务的系统性基准。

6. 总结

Open-AoE 是一个开源的第一人称操作数据基础设施,将约 2000 小时真实世界视频与从采集到模型的完整路径耦合。在产出侧,采集和处理流水线将原始手机视频转化为跨视觉、语言、手部运动、相机轨迹和动作边界对齐的结构化样本;在消费侧,开源工具链支持同步可视化、4D 重建、跨本体重定向,以及 VLA 策略、世界动作模型和世界模型的训练表示。其广泛的场景、动作、物体、参与者、设备型号和视场覆盖,使该基础设施能连接低成本真实世界采集与多种具身学习范式。

Open-AoE 旨在成为具身智能最低门槛的第一人称数据基础设施——让任何人都能轻松采集和使用第一人称数据,使数据不再是具身基础模型的瓶颈。

用 400 部手机采集 2000 小时操作数据——让第一人称数据成为具身智能的公共基础设施。

相关论文