PAPER DEEP DIVE
EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知Token路由框架
使用头戴立体相机进行长时程人形机器人VLA控制时,现有方法常丢弃互补的立体证据或在不保持主视图通路的情况下融合辅助信息。本文提出EATR-Stereo——一个具身感知的token路由框架,保留主视图token并通过查询同步的辅助视图序列构建主视图对齐的跨视图辅助token(CVAT)。身体分段本体感受编码器进一步根据机器人配置历史条件化逐token辅助使用。在33自由度物理人形机器人上评估9种配置,EATR-Stereo实现60%完整任务成功率、100%抓取成功率和80%阶段成功率。在严重非对称遮挡下,恢复率从CVAT单独的30%提升至80%。
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control |
| 作者 | Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Jian Hu, Yang Liu, Hong Liu |
| 机构 | 哈尔滨工业大学 · 荣耀(Honor) |
| arXiv | 2608.17453 (2026年8月) |
| 平台 | HONOR Omega 1.0 人形机器人(33-DoF),GR00T 1.7 骨干,Cosmos VLM |
| 项目 | GitHub: Isaac-GR00T · Cosmos-Reason2-2B |
一句话总结
EATR-Stereo 通过构建主视图对齐的跨视图辅助 token(CVAT)和身体分段本体感受路由,将同步立体证据选择性注入冻结的预训练 VLA,在 33 自由度人形机器人上实现 60% 完整任务成功率和 100% 抓取成功率。
研究背景与动机
视觉-语言-动作(VLA)模型将大规模视觉-语言表征迁移到语言条件控制,近期系统已将其扩展到连续动作和全身人形行为。然而,双足部署将感知与全身运动耦合:步态和躯干扰动传导到头戴相机,头部和腰部运动持续改变视角,移动的手臂和手产生依赖于配置的自遮挡。在长时程任务中,某一阶段遗漏的证据会传播到后续所有阶段。
同步立体视觉为这一场景提供了互补证据。两个相机从固定基线观察同一时刻,支持对应和视差的同时提供跨视图的互补可见性——在一个视图中被遮挡的内容在另一个视图中可能仍然可见。这与任意多视图图像不同——后者不需要共享时序、基线或场景内容。有用的信号是配对关系,而非仅仅第二张图像。

图1:配对立体视觉在人形 VLA 控制中的动机。(A) 固定相机机械臂设置不捕捉双足全身运动的头戴相机动态。(B) 全身运动使头戴视觉证据依赖配置且在长时程中产生后果。(C) 同步立体在此动态下提供配对几何和可见性线索。
当前 VLA 界面仅利用了这个信号的一部分。单目输入既没有双目视差也没有被遮挡区域的替代观察;独立 token 拼接保留了两幅图像但不强制跨视图一致的空间推理。StereoPolicy 显式关联两个视图,但其 VLA 变体用融合的立体表征替换原始图像 token,丢弃了预训练的单目 token 结构。SpatialVLA 从每个 RGB 观测预测深度并反投影到 3D,但其物理评估使用的是静态或三脚架相机的机械臂——不覆盖头戴双足感知。现有的视觉-本体感受融合也没有将身体分段的本体感受路由应用于配对视图 token。
EATR-Stereo 的出发点因此很明确:保留主视图 token(保持预训练表征不变),通过让主视图 token 查询同步辅助视图来构建主视图对齐的跨视图辅助 token(CVAT),并基于近期状态历史和跨视图关系应用身体分段本体感受路由。路由后的辅助流增强原始语言和主视图上下文,而视觉-语言模型保持冻结。这是一种轻量级的表示接口——不重新设计预训练视觉-语言骨干,而是选择性注入互补的立体证据。
预备知识
现代 VLA 模型的发展从将动作投射到 token 空间(如 RT-2、OpenVLA),到解耦语义感知与连续动作生成——通过条件化扩散或流匹配动作专家于 VLM 特征(如 $\pi_0$、CogACT、GR00T N1)。EATR-Stereo 基于后者范式:VLM 提供语义感知特征,流匹配动作专家生成连续动作块。
立体视觉在机器人学习中的应用方式多样。几何方法操作点云或 3D 渲染视图;深度方法用单目几何先验增强 2D 表征;多视图策略利用跨观测的互补证据。StereoPolicy 最接近本工作——它用共享 2D 编码器和跨视图注意力处理同步立体图像。但 EATR-Stereo 将主视图对齐的辅助流放置在原生图像 token 通路旁,实现对跨视图证据的选择性使用。
方法详解
问题公式化
将长时程人形操作公式化为基于同步立体观测、语言指令和本体感受历史预测连续动作块。在时刻 $t$,策略观测为:
$$o_t = (I_t^L, I_t^R, \ell_t, S_t), \quad S_t = (s_{t-K+1}, \ldots, s_t)$$
其中 $(I_t^L, I_t^R)$ 是同步立体对,$\ell_t$ 是当前语言指令,$s_t$ 是单步本体感受状态,$S_t$ 包含最近 $K$ 个本体感受观测。策略预测 $H$ 步连续动作块:
$$\widehat{\mathcal{Y}}_t = (\hat{\mathbf{a}}_t, \ldots, \hat{\mathbf{a}}_{t+H-1}) = \pi_\theta(I_t^L, I_t^R, \ell_t, S_t)$$
从每个同步对中,指定一个图像为主视图 $I_t^p$,另一个为辅助视图 $I_t^a$,此分配在训练和部署期间固定不变。主视图提供辅助 CVAT 流的参考索引。
跨视图辅助 token 构建
CVAT 模块构建主视图索引的辅助视觉流。同步立体对和语言指令输入冻结的 Cosmos VLM,产生主视图和辅助视图视觉序列:
$$M_t = E_C(I_t^p), \quad A_t = E_C(I_t^a)$$
其中 $E_C$ 是 VLM 的图像处理模块。然后通过主视图查询跨视图注意力构建 CVAT——主视图 token 作为 query,辅助视图 token 作为 key 和 value:
$$C_t = \text{CrossAttn}(Q=M_t, K=A_t, V=A_t)$$
关键在于:CVAT 是一个独立于主视图 token 的辅助流——主视图 token $M_t$ 本身不被修改,它们保持预训练表征的完整性。CVAT 仅提供"辅助补充信息",何时使用、使用多少由后续的路由模块决定。

图2:EATR-Stereo 架构概览。(A) 冻结的预训练 VLM 编码同步主视图和辅助视图。主视图查询跨视图注意力构建独立的 CVAT 流同时保留原生主视图 token。身体分段本体感受路由条件化逐 token 的 CVAT 使用,然后共享流匹配动作头预测动作块。
身体分段本体感受路由
路由模块是 EATR-Stereo 的核心创新——它根据机器人配置历史条件化每个 CVAT token 的使用。本体感受状态按身体分段(如左臂、右臂、躯干、头部等 $G$ 个段)编码。每段的状态历史通过独立的轻量级 MLP 和学习到的段类型嵌入处理:
$$z_{t,g} = f_g(\text{LN}_g(\text{Flatten}(s_{t-K+1:t,g}))) + e_g, \quad g = 1, \ldots, G$$
段表征通过注意力加权和均值池化聚合:
$$\alpha_{t,g} = \frac{\exp(f_{\text{attn}}(z_{t,g}))}{\sum_{j=1}^G \exp(f_{\text{attn}}(z_{t,j}))}$$
$$h_t^s = f_{\text{fuse}}\left([\sum_{g=1}^G \alpha_{t,g} z_{t,g}; \frac{1}{G}\sum_{g=1}^G z_{t,g}]\right)$$
对于每个 token 索引 $i$,路由器联合使用主视图 token $M_{t,i}$、对应 CVAT token $C_{t,i}$、它们的逐元素特征关系和共享本体感受条件 $h_t^s$。路由描述符 $q_{t,i}$ 包含层归一化后的主视图和 CVAT token、它们的绝对差异和逐元素积,以及本体感受条件:
$$q_{t,i} = [\bar{M}_{t,i}; \bar{C}_{t,i}; |\bar{M}_{t,i} - \bar{C}_{t,i}|; \bar{M}_{t,i} \odot \bar{C}_{t,i}; h_t^s]$$
轻量级路由 MLP 为每个 CVAT token 预测一个标量门:
$$r_{t,i} = \sigma(f_r(q_{t,i})), \quad \widetilde{C}_{t,i} = r_{t,i} C_{t,i}$$
其中 $r_{t,i} \in (0,1)$ 是 sigmoid 门控值,$\widetilde{C}_{t,i}$ 是路由后的辅助 token。路由器只缩放 CVAT 流——主视图 token $M_t$ 参与路由描述符但不被修改。路由后的辅助 token 和主视图 token 仅在供给动作专家的上下文中相遇。
VLA 集成与训练
路由后的辅助 token 被追加到语言 token 序列和保留的主视图 token 序列之后:
$$E_t^{\text{VLA}} = [L_t; M_t; \widetilde{C}_t]$$
该上下文与原始机器人状态条件 $S_t$ 一起供给 GR00T 1.7 动作专家。动作专家通过流匹配目标训练:
$$\mathcal{L}_{\text{FM}} = \mathbb{E}_{t,\tau}\left[\left\|v_\theta(\mathcal{Y}_t^\tau, \tau \mid E_t^{\text{VLA}}, S_t) - u_\tau\right\|_2^2\right]$$
其中 $\mathcal{Y}_t^\tau$ 是目标动作块在流时间 $\tau$ 的插值状态,$u_\tau$ 是目标速度场,$v_\theta$ 是预测场。Cosmos VLM 保持冻结,CVAT 模块、分段状态编码器、token 路由器和 GR00T 动作专家被联合优化。
graph TD
A["同步立体对
(I_L, I_R)"] --> B["冻结 Cosmos VLM"]
B --> C["主视图 token M"]
B --> D["辅助视图 token A"]
C --> E["跨视图注意力
CVAT = CrossAttn(Q=M, K=A, V=A)"]
D --> E
F["本体感受历史 S_t"] --> G["身体分段编码
z_g = f_g(LN(Flatten(s_g))) + e_g"]
G --> H["聚合 h_s
注意力加权+均值池化"]
C --> I["路由器
q = [M̄; C̄; |M̄-C̄|; M̄⊙C̄; h_s]"]
E --> I
H --> I
I --> J["门控 r = σ(f_r(q))
C̃ = r · C"]
J --> K["VLA上下文
E = [L; M; C̃]"]
K --> L["GR00T 1.7
流匹配动作专家"]
L --> M_out["连续动作块
â_t...â_{t+H-1}"]
实验结果
实验设置
物理人形实验在 33 自由度 HONOR Omega 1.0 人形平台上进行,由 BeyondMimic 全身控制器控制。37 维本体感受状态包含 33 个关节维度和 4 维基座方向四元数。头戴立体装置提供同步 240×320 图像。策略在 NVIDIA RTX 4090 上以 10 Hz 运行,预测 30 步动作块。每个完整任务持续超过 100 秒,包括瓶子搜索、接近、抓取、语言条件放置到指定颜色篮子和返回初始位置。共进行 180 次物理试验,每种配置 20 次,均匀分为示范覆盖(ID)和未见(OOD)瓶子位置。

图3:真实人形机器人长时程评估。(A) HONOR Omega 1.0 平台和头戴同步立体相机。(B) 搜索-接近-抓取-放置-返回任务,持续超过 100 秒。(C) ID 和 OOD 瓶子位置。(D) 严重非对称遮挡分析:瓶子在主视图中完全隐藏但在辅助视图中部分可见。
主要对比结果
九种配置在相同 GR00T 1.7 骨干、1000 段任务示范和相同优化设置下比较。EATR-Stereo 实现 60.0% 完整任务成功率、100.0% 抓取成功率和 80.0% 阶段成功率。相比之下,默认 GR00T(双图像 token 拼接)为 40.0% 完整任务,StereoPolicy 适配版为 40.0%。GR00T1.7-Mono(单目)仅 30.0%,GR00T-Wide 为 20.0%。
| 方法 | 完整任务 (%) | 抓取 (%) | 阶段 (%) |
|---|---|---|---|
| GR00T1.7-Mono | 30.0 | 60.0 | 45.0 |
| GR00T-Wide | 20.0 | 50.0 | 35.0 |
| GR00T(默认双图拼接) | 40.0 | 80.0 | 57.5 |
| StereoPolicy | 40.0 | 70.0 | 55.0 |
| Main-XAttn | 30.0 | 70.0 | 50.0 |
| CVAT | 50.0 | 80.0 | 65.0 |
| CVAT-Flat | 50.0 | 90.0 | 70.0 |
| Stereo-Route | 40.0 | 70.0 | 55.0 |
| EATR-Stereo | 60.0 | 100.0 | 80.0 |
表1:物理人形机器人主要对比(20 试验/方法)。完整任务成功率是主要物理世界指标。
位置泛化与语义合规
EATR-Stereo 是唯一在 ID 和 OOD 位置上均达到 100% 抓取成功率的方法。其 OOD 抓取率超过 CVAT-Flat 20.0 pp,超过 StereoPolicy 30.0 pp,超过 CVAT 和 GR00T 40.0 pp。ID-OOD 之间零差距表明抓取性能在示范中未见的瓶子位置上仍然保持。在语义合规方面,EATR-Stereo 对左/右指令达到 100% 合规,对颜色指令达到 80%,与最佳方法持平同时提供更高的 OOD 抓取成功率。
| 方法 | ID 抓取 (%) | OOD 抓取 (%) | 差距 (pp) | 左/右 (%) | 颜色 (%) |
|---|---|---|---|---|---|
| GR00T1.7-Mono | 70 | 40 | 30 | 100 | 80 |
| GR00T | 100 | 60 | 40 | 100 | 80 |
| StereoPolicy | 100 | 70 | 30 | 60 | 0 |
| CVAT | 100 | 60 | 40 | 100 | 80 |
| CVAT-Flat | 100 | 80 | 20 | 100 | 80 |
| EATR-Stereo | 100 | 100 | 0 | 100 | 80 |
表2:位置泛化和语义合规。差距为 ID 到 OOD 的抓取成功率下降。
严重遮挡恢复
在严重非对称遮挡协议中,瓶子在主视图中被机器人手完全遮挡但在辅助视图中部分可见。EATR-Stereo 在 80% 的试验中恢复(8/10),相比 CVAT-Flat 的 60%(6/10)和 CVAT 的 30%(3/10)。其 22.4 秒的平均恢复时间比 CVAT-Flat 低 46.3%,比 CVAT 低至少 59.3%。这证明身体分段本体感受路由在最具挑战性的部分可观测场景中提供了更快更可靠的闭环恢复。
| 方法 | 恢复成功率 | 平均恢复时间 (s) |
|---|---|---|
| CVAT | 30% (3/10) | >55.0 |
| CVAT-Flat | 60% (6/10) | 41.7 |
| EATR-Stereo | 80% (8/10) | 22.4 |
表3:严重非对称遮挡恢复。平均时间仅使用成功试验;所有试验使用 90 秒超时。
训练成本对比
EATR-Stereo 以 10.95 小时训练达到 80.0% 阶段成功率,仅比 GR00T 的 10.35 小时多 0.60 小时(5.8%)。估计深度 VLA(微调 4 层 VLM)也达到 80.0% 阶段成功率但需要 41.8 小时——是 GR00T 的 4.04 倍、EATR-Stereo 的 3.82 倍。这表明 EATR-Stereo 以远低于显式深度估计适配的训练开销达到了相同的阶段级性能。
| 方法 | VLM 适配 | 训练时间 (h) | 相对成本 | 阶段成功率 (%) |
|---|---|---|---|---|
| GR00T | 冻结 | 10.35 | 1.00× | 57.5 |
| EATR-Stereo | 冻结 | 10.95 | 1.06× | 80.0 |
| 估计深度 VLA | 4 层 | 41.80 | 4.04× | 80.0 |
表4:系统级训练成本和物理任务性能。EATR-Stereo 以仅 5.8% 的额外训练开销实现与估计深度方法相同的阶段成功率。
CVAT 模块的设计有一个微妙但关键的细节:它使用主视图 token 作为查询(query),辅助视图 token 作为键和值。这意味着 CVAT 的每个 token 都"以主视图的位置和语义为中心"去查看辅助视图中的信息——结果是一个与主视图空间对齐的辅助流。如果反过来用辅助视图查询主视图,得到的将是辅助视图对齐的流,无法与主视图 token 自然拼接。这个设计选择保证了 CVAT 可以"附加"到主视图上下文而不破坏其结构。
身体分段本体感受路由的直觉来自一个简单观察:人形机器人的不同身体部分在不同时刻对视觉证据的需求不同。例如,当手臂正在接近物体时,手臂段的状态特征会驱动路由器更依赖跨视图辅助 token 来获取深度和遮挡信息;而当机器人正在行走时,躯干和腿部段的状态可能表明视觉系统正在受步态扰动,路由器可以适当降低对辅助 token 的依赖以避免噪声传播。这种"按需使用"的机制比固定的全 token 拼接更灵活,也比全局门控更精细。
路由描述符 $q_{t,i}$ 的设计也值得注意。它不仅包含主视图和 CVAT token 本身,还包含它们的绝对差异 $|ar{M}_{t,i} - ar{C}_{t,i}|$ 和逐元素积 $ar{M}_{t,i} \odot ar{C}_{t,i}$。绝对差异捕获两个视图中"哪些地方不同"——差异大的区域可能对应遮挡或深度变化;逐元素积捕获"哪些地方同时激活"——高乘积表示两个视图在相同语义上一致。加上本体感受条件,路由器拥有足够的信息来判断:当前这个位置的辅助证据是否有用、是否可靠、是否应该使用。
部署阶段的 B-Spline 拼接机制解决了流匹配动作块预测中的一个实际问题。策略以 10 Hz 运行,每次预测 30 步动作块(3 秒),但不是等到整个块执行完才预测下一个——新预测可以在旧块执行中途到来。直接切换到新预测会在切换点产生位置跳变。三次 B-Spline 拼接保留已提交轨迹的前缀,在局部窗口内用样条曲线平滑过渡到新块,匹配切换边界的动作和速度,然后从新块继承终值。这种设计保证了连续动作的平滑性,对于需要精细控制的人形机器人至关重要。
慢时间尺度外部 VLM 循环的设计也有深意。EATR-Stereo 的策略本身不决定何时切换子任务——这个判断由一个独立的外部 VLM 基于视觉观察做出。这种分离使低级动作策略专注于运动控制,而语义判断交给更高级的语言理解系统。这类似于人类中"做什么"和"怎么做"的分离——前者是规划层面的,后者是执行层面的。虽然这种分离增加了一个外部依赖,但它简化了策略训练:不需要在动作预测中同时学习子任务切换的语义。
局限性
第一,评估范围有限。作者承认当前评估集中在 Omega 人形平台和互补的机械臂仿真基准上。未来工作将扩展到更大规模试验、多样化具身和更具挑战性的立体条件。当前 180 次物理试验虽然对于人形机器人研究来说已经不少,但统计功效仍有限。
第二,安全辅助协议允许每次试验最多两次干预。这意味着完整任务成功率可能受到人为干预的影响——某些"成功"可能实际上包含了人为纠偏。作者使用了统一的安全协议来确保公平比较,但这是一个实际部署中需要考虑的限制。
第三,外部 VLM 用于子任务完成检测和指令切换。这个慢时间尺度模块不参与低级动作生成,但整个系统的成功依赖于其正确判断。如果外部 VLM 错误判断子任务完成,指令切换可能过早或过晚,影响后续策略推理。
第四,校准的不确定性建模和显式深度表征仍然是未探索的方向。EATR-Stereo 选择通过 token 路由而非显式几何重建来利用立体证据,这在某些需要精确深度信息的场景中可能不如显式方法。
总结与展望
EATR-Stereo 证明了同步立体观测可以通过轻量级表示接口有效集成到预训练 VLA 中,而无需重新设计视觉-语言骨干。通过主视图对齐的 CVAT 通路和身体分段本体感受路由,选择性注入互补立体证据,在 33 自由度人形机器人上实现了 60.0% 完整任务成功率、100.0% 抓取成功率和 80.0% 阶段成功率——任务持续超过 100 秒。在严重非对称遮挡下恢复率达 80%,平均恢复时间 22.4 秒。
这项工作对具身 AI 领域有多重启示。首先,它展示了"冻结骨干 + 轻量适配"范式在立体视觉集成中的有效性——仅训练 CVAT 模块、路由器和动作专家(占参数的极小部分),以 1.06× 训练成本达到 4.04× 估计深度方法的性能。其次,身体分段本体感受路由的概念——根据机器人身体配置选择性使用视觉证据——可能推广到其他多模态融合场景。最后,对于人形机器人的实际部署,头戴立体视觉提供了比单目更可靠的感知来源,EATR-Stereo 提供了将其有效利用的实用框架。
金句
"选择性路由的配对立体证据支持长时程人形 VLA 任务中更可靠的空间锚定控制。"
"有用的信号是配对关系,而非仅仅第二张图像。"
"立体观测可以通过轻量级表示接口有效集成到现有 VLA 系统中,而无需重新设计预训练视觉-语言骨干。"



