EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知Token路由框架
使用头戴立体相机进行长时程人形机器人VLA控制时,现有方法常丢弃互补的立体证据或在不保持主视图通路的情况下融合辅助信息。本文提出EATR-Stereo——一个具身感知的token路由框架,保留主视图token并通过查询同步的辅助视图序列构建主视图对齐的跨视图辅助token(CVAT)。身体分段本体感受编码器进一步根据机器人配置历史条件化逐token辅助使用。在33自由度物理人形机器人上评估9种配置,EATR-Stereo实现60%完整任务成功率、100%抓取成功率和80%阶段成功率。在严重非对称遮挡下,恢复率从CVAT单独的30%提升至80%。
Songwei Wu, Rui Zhao, Fan Yang·2026年8月18日
视觉语言动作模型立体视觉token routing2026年8月18日