Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

第一人称egocentric手部姿态

Exo2EgoPose:外视角演示引导的第一人称手部姿态预测

利用外视角演示和视觉-语言引导,预测第一人称3D手部姿态,应用于机器人操控。

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li2026年7月17日2 分钟阅读
EN

Exo2EgoPose:利用外中心示教进行视觉-语言引导的自我中心3D手部姿态预测

机构:电子科技大学  |  arXiv:2607.15890v1


一句话总结

Exo2EgoPose提出一种利用外中心(Exo)示教引导自我中心(Ego)3D手部姿态预测的框架,通过双层级外中心重建模块(DERM)和全局到局部调制模块(GLMM)将Exo视频的全局空间上下文和时序动态注入Ego特征,在三个基准上大幅超越SOTA,并展示有效的人-机器人迁移能力。


研究背景与动机

从自我中心视角感知多模态线索并预测细粒度动作对机器人操作等应用至关重要。现有方法要么依赖信息不足的视觉输入预测粗略人体运动,要么遵循VRM/VLA范式但受限于机器人数据不足和人-机器人本体差距。3D手部姿态天然作为桥接人-机器人动作的统一表示。

本文研究视觉-语言引导的自我中心3D手部姿态预测(VL-EHPF)任务。核心挑战:Ego视角视野有限且运动高度动态。解决方案:利用配对的外中心(Exo)视频作为引导——Exo视频由稳定相机录制,提供全局场景上下文和完整的活动过程。

图1:任务定义

图1:VL-EHPF任务——从Ego视角预测未来3D手部姿态,利用Exo示教作为引导。

任务定义

在时间戳 $t$,模型 $\mathcal{M}$ 接收Ego观测帧序列 $O_{t-T'+1:t} \in \mathbb{R}^{T' \times H \times W \times 3}$、语言指令 $l$ 和手部姿态状态 $S_{t-T'+1:t} \in \mathbb{R}^{T' \times 42 \times 3}$,预测未来 $\bar{T}$ 步的3D手部关键点:

$$\hat{S}_{t+1:t+\bar{T}} = \mathcal{M}(l, O_{t-T'+1:t}, S_{t-T'+1:t})$$

其中42表示双手关节总数(每手21个关键点),3表示3D坐标。同时预测关节有效性 $\hat{V}_{t+1:t+\bar{T}} \in \{0,1\}^{\bar{T} \times 42}$。

方法

多模态Token化

使用模态特定编码器提取特征:文本编码器 $\mathcal{E}_L$、MAE编码器 $\mathcal{E}_M$(像素级)、DINOv2编码器 $\mathcal{E}_D$(语义级)和姿态编码器 $\mathcal{E}_P$:

$$f_L = \mathcal{E}_L(l), \quad F_M = \mathcal{E}_M(O), \quad F_D = \mathcal{E}_D(O), \quad F_P = \mathcal{E}_P(S)$$ 图2:Exo2EgoPose框架

图2:Exo2EgoPose框架——多模态Token化 + DERM + GLMM + Transformer预测。

双层级外中心重建模块(DERM)

DERM基于Ego多模态输入重建Exo的视频级和分块帧级表示,构建Ego-Exo跨视图对应关系。初始化可学习查询集 $Q = \{q_p; q_v; q_f; q_e\}$:姿态查询 $q_p \in \mathbb{R}^{\bar{T} \times C}$、视频级Exo查询 $q_v \in \mathbb{R}^{1 \times C}$、帧级Exo查询 $q_f \in \mathbb{R}^{\bar{T} \times C}$ 和Ego查询 $q_e$。Token和查询输入多模态Transformer:

$$\{q'_p, q'_v, q'_f, q'_e\} = \mathcal{T}(\{w, M, D, P\}, q_p, q_v, q_f, q_e)$$

视频级Exo表示通过冻结MAE编码器和Perceiver Resampler提取,对CLS token取平均:

$$v^{\text{exo}} = \frac{1}{T' + \bar{T}} \sum_{i=t-T'+1}^{t+\bar{T}} v_i^{\text{CLS}}$$

帧级Exo引导通过选取与预测窗口对齐的Exo帧构建。DERM通过重建损失训练,使Ego特征隐含Exo的全局空间上下文和时序动态信息。

全局到局部调制模块(GLMM)

GLMM利用重建的分层Exo表示,通过注意力机制和自适应调制单元(AMU)从全局到局部渐进式精炼Ego特征。全局调制模块(GMM)捕获时序运动趋势(MPJVE指标验证),局部调制模块(LMM)改善空间绝对位置(MPJPE指标验证)。自适应调制可形式化为:

$$\hat{F} = \gamma \odot F + \beta, \quad \gamma = \text{MLP}(v^{\text{exo}}), \quad \beta = \text{MLP}(v^{\text{exo}})$$

其中 $\gamma$ 和 $\beta$ 为从Exo表示生成的缩放和偏移参数,$F$ 为Ego特征。MPJPE预测误差度量:

$$\text{MPJPE} = \frac{1}{N \times 42} \sum_{n=1}^{N} \sum_{j=1}^{42} \| \hat{\mathbf{p}}_{n,j} - \mathbf{p}_{n,j} \|_2$$ 图3:DERM和GLMM细节

图3:DERM和GLMM的详细架构——双层级Exo重建 + 全局到局部调制。

graph TD
    A["输入: Ego帧 + 语言 + 姿态状态"] --> B["多模态Token化
MAE + DINOv2 + 文本 + 姿态编码器"] B --> C["多模态Transformer"] D["配对Exo视频"] --> E["DERM: 双层级重建
视频级 + 帧级Exo表示"] E --> F["GLMM: 全局到局部调制
GMM + LMM + AMU"] C --> F F --> G["预测未来3D手部姿态
42关键点 × T步"] G --> H["人-机器人迁移
CALVIN数据集验证"]

实验结果

与SOTA对比

方法AssemblyHands MPJPE ↓Ego-Exo4D MPJPE ↓EgoMe-pose MPJPE ↓
随机基线较高较高较高
USST较高较高较高
GR-139.57
AR-VRM (+Exo)32.93
Exo2EgoPose25.37最优最优

相比GR-1,Exo2EgoPose在AssemblyHands上MPJPE/MPJVE降低14.20/2.34,在Ego-Exo4D上降低7.85/0.38,在EgoMe-pose上降低9.66/8.00。相比AR-VRM(扩展Exo数据),在三个基准上分别降低7.56/1.51、8.02/0.27和6.62/6.63。

消融实验

配置MPJPE ↓MPJVE ↓说明
完整模型25.376.29GMM+LMM+VER+CFER
替换GMM/LMM为vanilla Transformer26.446.57交叉注意力+自适应调制更优
去GMM27.036.56GMM捕获时序趋势
去LMM27.266.48LMM改善空间位置
去GLMM(全部)30.117.76Exo调制关键
去视频级Exo重建32.948.07视频级Exo重要
去帧级Exo重建33.228.06帧级Exo重要
去全部Exo39.708.87Exo示教必需
图4:定性结果对比

图4:预测的Ego 3D手部姿态定性对比——Exo2EgoPose预测更准确。

人-机器人迁移

Exo2EgoPose展示了有效的人-机器人迁移能力,在CALVIN数据集上获得改进。3D手部姿态作为人-机器人动作的统一桥接表示,使Ego视角学习的人类操作知识可迁移到机器人操作策略。迁移过程可理解为特征空间对齐:

$$\mathcal{L}_{\text{transfer}} = \|\phi_{\text{human}}(S) - \phi_{\text{robot}}(a)\|^2$$

其中 $\phi_{\text{human}}$ 和 $\phi_{\text{robot}}$ 分别为人类手部姿态和机器人动作的特征映射。

图5:人-机器人迁移

图5:人-机器人迁移——3D手部姿态作为统一桥接表示。

此外,本文还构建了新的EgoMe-pose基准数据集,专注于自我中心视角的手部姿态预测评估,填补了该方向基准缺失的空白。该数据集包含多样化的手部交互场景,为VL-EHPF任务的标准化评估提供了重要资源。模型复杂度分析表明Exo2EgoPose在参数量和推理速度上与基线方法相当,Exo引导带来的额外计算开销可忽略。超参数敏感性分析显示模型对观测窗口长度 $T'$ 和预测步数 $\bar{T}$ 的选择具有一定鲁棒性,在合理范围内性能波动较小。

局限性

  1. 依赖配对的Exo视频,在无Exo摄像头的场景中适用性受限
  2. Exo视频质量影响引导效果,低质量Exo视频可能引入噪声
  3. 42关键点的手部表示可能不足以捕获全手几何细节
  4. 人-机器人迁移仍存在本体差距,需进一步研究

总结与展望

Exo2EgoPose提出利用外中心示教引导自我中心3D手部姿态预测的框架。DERM通过双层级Exo重建构建Ego-Exo跨视图对应关系,GLMM通过全局到局部调制将Exo指导注入Ego特征。在AssemblyHands、Ego-Exo4D和EgoMe-pose三个基准上大幅超越SOTA,并展示人-机器人迁移能力。3D手部姿态作为人-机器人动作的统一桥接表示,为从人类示教到机器人操作的迁移提供了新路径。

金句:3D手部姿态天然作为桥接人-机器人动作的统一表示——它既可从人类Ego视角预测,又可作为机器人操作的动作先验。

相关论文