Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

模仿学习视觉注意力OOD

GuidedAttention:面向OOD鲁棒机器人操作的可解释可纠正视觉注意力

GuidedAttention提出可解释且可纠正的视觉注意力机制,用于模仿学习中面对分布外(OOD)场景的鲁棒机器人操作。

Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae2026年7月23日3 分钟阅读
EN

GuidedAttention:面向分布外鲁棒机器人操作的可解释可校正视觉注意力

论文:GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning
作者:Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai 等(AIST / CNRS-AIST JRL)
链接:arXiv:2607.21049 | 项目页:mmurooka.github.io/guided-attention-project-page | 框架:RoboManipBaselines

一句话总结:在扩散策略的感知与动作之间插入一层人类可检查、可校正的注意力关键点,只需在 rollout 首帧点一下就能纠正机器人在分布外场景中的视觉漂移,成功率提升 20-30 个百分点。

研究背景与动机

端到端视觉运动策略直接从高维感官输入生成动作,消除了手工特征工程的负担,但在执行过程中几乎不给人任何理解或纠正策略视觉注意力的机会。即使人类能轻易识别任务相关物体或位置,策略仍需自行发现这些视觉线索。当策略因缺少一个简单但关键的视觉提示而失败时,人类只能旁观而无法介入——这在分布外(OOD)环境中尤为突出。

已有的视觉提示方法存在不同层次的局限。RT-Sketch 要求每次操作命令都画一幅目标场景草图,用户负担不可忽略。Robotic Visual Instruction(RoVI)允许用户在图像上书写语义指令,但视觉提示本身代表任务意图,而非辅助注意力。直接在输入图像上叠加标记框(Marker Overlay Prompting)虽然提供类似的空间线索,但策略缺乏对标记与任务结构关联的显式学习,在 OOD 下效果不佳。这些方法的共同问题是:视觉提示要么是每次执行都需要的持续输入,要么无法与策略内部注意力机制深度耦合。

GuidedAttention 的核心洞察是:将视觉注意力作为感知与动作之间的显式中间表示,使人类可以在需要时检查和校正它,但不需要持续监督。注意力以任务相关关键点形式存在,训练时只需标注每段演示的首帧,其余帧由跟踪模块自动传播。执行时策略自主预测关键点和动作;当自主预测在 OOD 下不可靠时,用户可在 rollout 初始化时校正选定的关键点,校正后由跟踪模块自动传播到整个执行过程。

方法详解

1. 整体策略架构(DP-GA)

DP-GA(Diffusion Policy with GuidedAttention)以多视角 RGB 观测和本体感知关节状态为输入。对每个相机图像,视觉注意力编码器(AttnEnc)预测任务相关注意力关键点并提取对应的注意力特征。这些特征与本体感知特征拼接后,用于条件化基于 U-Net 骨干的 CNN 去噪扩散策略。与传统直接用 CNN 全局视觉特征条件化动作生成的扩散策略不同,DP-GA 在感知和动作之间引入了可解释、可校正的注意力表示。

策略架构总览

图2:策略架构总览。(A) 去噪扩散过程以注意力特征和本体感知状态为条件。(B) ResNet+Transformer 编码器-解码器预测像素级关键点。(C) rollout 时用户可选择性校正关键点。

2. 视觉注意力编码器

AttnEnc 采用 DETR 风格架构,由 Transformer 编码器和解码器组成,但不预测边界框,而是预测注意力关键点的 2D 坐标。RGB 图像先经 ResNet-18 骨干网络提取 patch 特征,加上位置编码后输入 Transformer 编码器。解码器接收可学习的查询(对应预定义数量的关键点),输出注意力特征。坐标头是一个线性层,将每个注意力特征映射为 2D 坐标:

$$p_{i}=h_{\theta}(f_{i})=A\,f_{i}+b$$

其中 $p_{i}\in\mathbb{R}^{2}$ 是第 $i$ 个关键点的坐标,$f_{i}\in\mathbb{R}^{d_f}$ 是其注意力特征。每个图像输出 $N_k$ 个注意力特征 $\{f_{i}\}_{i=1}^{N_k}$。训练时同时优化动作预测和关键点预测。关键点损失为预测与标注坐标之间的均方误差:

$$\mathcal{L}_{kp}=\frac{1}{N_{k}}\sum_{i=1}^{N_{k}}\lVert p_{i}-p_{i}^{gt}\rVert_{2}^{2}$$

通过关键点监督来条件化扩散过程,策略学会聚焦于对操作至关重要的空间位置。

3. 关键点覆盖机制

当预测注意力在 OOD 下不可靠时,用户可校正部分关键点坐标。校正后的坐标通过 $h_{\theta}(\cdot)$ 的逆映射转换为注意力特征,替换对应的预测特征进入最终条件化集合:

$$z_{i}=\begin{cases}f_{i} & \text{(预测路径)}\\[4pt]h_{\theta}^{-1}(p_{i}^{gt}) & \text{(覆盖路径)}\end{cases}$$

为确保覆盖机制一致可靠,引入三项技术:

前向-逆向权重共享:由于 $h_{\theta}$ 是从 $d_f$ 维到 2D 的线性映射,其解析逆无需额外参数:

$$h_{\theta}^{-1}(p_{i})=A^{+}(p_{i}-b)$$

其中 $A^{+}$ 是 Moore-Penrose 伪逆。权重共享促使前向预测和逆向恢复相互一致。

特征空间对齐损失:当 $d_f>2$ 时逆映射是欠定的,多个特征向量可能对应同一坐标。为确保前向预测特征和逆向恢复特征保持对齐,引入一致性损失:

$$\mathcal{L}_{feat}=\frac{1}{N_{k}}\sum_{i=1}^{N_{k}}\left\lVert f_{i}-h_{\theta}^{-1}(p_{i}^{gt})\right\rVert_{2}^{2}$$

随机特征路由:训练时随机选择每个关键点特征 $z_i$ 来自预测路径还是覆盖路径,避免扩散模型依赖单一路径,在预测关键点尚不准确的早期训练阶段稳定学习。

graph LR
  A[RGB图像] --> B[ResNet-18 骨干]
  B --> C[Transformer 编码器-解码器]
  C --> D[注意力特征 f_i]
  C --> E[坐标头 h_theta]
  E --> F[关键点坐标 p_i]
  D --> G{随机路由}
  H[用户校正坐标] --> I[逆映射 h_theta^-1]
  I --> G
  G --> J[条件特征 z_i]
  J --> K[扩散策略 U-Net]
  K --> L[机器人动作]
  style G fill:#f5a623,stroke:#b97316,color:#fff
  style H fill:#e74c3c,stroke:#a93226,color:#fff
  style K fill:#4a90d9,stroke:#2c5f8a,color:#fff

4. 关键点标注与跟踪

训练时,人类在每段演示的首帧点击关键点位置,后续帧的标注通过跟踪模块自动获取:

$$p_{i}^{gt}[t]=G(p_{i}^{gt}[t-1],\,I[t],\,I[t-1])$$

其中 $G(\cdot)$ 是 Co-Tracker 跟踪模块,$I[t]$ 是时刻 $t$ 的 RGB 图像。已知静态的关键点(如桌面上杆子的底座)在整个轨迹中保持固定。这种设计使标注成本极低——每段演示仅标注一帧。

特征路由消融

消融实验验证了关键引导注意力组件的贡献。禁用特征路由(训练时禁用预测路径和覆盖路径之间的随机化路由,扩散模型仅以预测的注意力特征为条件)后,启用注意力纠正时性能急剧下降近 60 个百分点——这表明训练期间正确集成基于覆盖的特征对于在 rollout 中利用人类注意力纠正至关重要。如果策略从未在训练中见过被覆盖的注意力特征,它在部署时就无法正确利用人类纠正的输入。

注意力监督消融

移除关键点损失 $\mathcal{L}_{kp}$ 和特征对齐损失 $\mathcal{L}_{feat}$ 后,无论是否启用注意力纠正,性能均显著退化(分别约 65 和 30 个百分点下降)。这表明鲁棒性要求注意力特征与任务相关结构对齐——没有监督约束,注意力特征可能漂移到与任务无关的区域。这些结果确认鲁棒性并非简单源于 transformer 特征条件化的扩散策略架构本身,而是关键依赖于将人类纠正的注意力正确集成到策略条件化中。

跟踪与标注精度鲁棒性

图 4 展示了向跟踪和用户指定的关键点添加噪声的影响。方法在中等噪声下保持稳定并逐渐退化,同时在 OOD 条件下相对基线策略保持明显优势。这表明 DP-GA 对跟踪误差具有一定的容忍度——少量关键点位置偏移不会导致策略崩溃,因为扩散策略从注意力特征中提取的是任务相关区域的空间线索而非精确坐标。

与标记叠加提示的对比

表 III 对比了通过直接在输入图像上叠加边界框或点标记提供视觉提示的基线方法。虽然这些方法提供了类似的空间线索,但效果较差——ID 条件下 DP-GA 达 86.7% 而 MOP-Box 和 MOP-Point 分别为 60% 和 50%,OOD 条件下差距更大(83.3% vs 33.3% 和 3.3%)。这表明将注意力集成到策略特征空间中比简单的视觉叠加更有效,因为策略学会了从注意力特征中提取任务相关的空间表征而非仅依赖像素级标记。

关键点与相机数量分析

只要选择任务相关的关键点,无需增加关键点数量或相机视角即可实现强性能。关键点和相机均可被部分覆盖,实现灵活的人类纠正而无需完全重新指定。这种部分覆盖能力降低了用户纠正的认知负担——用户只需纠正预测错误的关键点,正确预测的保持自主。

实验结果

仿真实验

在 MuJoCo 中使用 UR5e 机械臂评估三个操作任务:Cable(柔性线缆穿过杆间缝隙)、Ring(将环套到杆上)、Particle(用勺状工具将颗粒舀入盒子)。每个任务收集 30 段遥操作演示,评估四种条件:ID、位置 OOD、外观 OOD、位置+外观 OOD。

仿真任务 Cable

图5:仿真操作任务。每个任务使用两个注意力关键点:动态关键点(附在被操作物体上)和静态关键点(定义在目标物体或环境上)。

策略校正ID位置OOD外观OOD位置+外观OOD
DP-GA (default)83.3%55.6%45.6%34.4%
DP-GA (default)启用84.4%70.0%76.7%67.8%
DP(扩散策略基线)67.8%45.6%54.4%28.9%
ACT53.3%28.9%6.7%8.9%

完全自主执行时,DP-GA 在 ID 条件下比 DP 提升约 15 个百分点,在多数 OOD 条件下提升约 10 个百分点。启用注意力校正后,DP-GA 在 OOD 条件下比自主执行进一步提升 15-30 个百分点,比 DP 基线高出 20-30 个百分点。

消融实验

变体校正ID(相对 default 变化)
无特征路由81.1%(-2.2pp)
无特征路由启用25.5%(-58.9pp)
无注意力监督52.2%(-31.1pp)
无注意力监督启用17.8%(-66.7pp)

禁用特征路由在启用校正时导致近 60pp 的暴跌,说明训练时正确整合覆盖路径特征对于利用人类校正至关重要。移除注意力监督在有/无校正时分别下降约 65pp 和 30pp,表明鲁棒性要求注意力特征与任务相关结构对齐。

与标记叠加提示对比

与直接在输入图像上叠加标记框(MOP-Box/MOP-Point)对比,DP-GA 在 ID 和 OOD 条件下均高出 20pp 以上。简单地在输入图像上叠加标记不足以可靠利用任务相关信息,而显式预测注意力点并利用辅助监督的方法更为有效。

GuidedAttention 框架总览

图1:GuidedAttention 框架总览。遥操作演示仅在首帧标注注意力关键点,作为可解释可校正的中间表示。rollout 时用户可选择性地校正关键点一次,随后自动跟踪传播。

真实世界实验设置与任务

所有真实世界实验使用 Universal Robots UR5e 机械臂和并行夹爪,两台 Intel RealSense D435 RGB 相机(一台俯视、一台侧视对角)仅以 RGB 流作为视觉输入。评估三个需要视觉精度和泛化性的操作任务:杯插入(抓取橙色杯放入稍大的蓝色杯,关注两杯杯沿)、链拾取放置(抓取塑料链放入杯中,关注链尖和杯沿)、毛巾折叠(抓取毛巾一角折叠,关注毛巾角)。在 ID 条件下 DP-GA 默认变体相对 ACT 提升 15-30 个百分点,相对 DP 提升 5-15 个百分点。OOD 条件下人类纠正使成功率提升 20-80 个百分点,特别是在外观 OOD 的毛巾折叠任务中(大量彩色方块干扰物引入显著视觉杂乱),准确的关键点仅在初始帧提供后通过自动跟踪持续使用,确保可靠抓取毛巾角并成功折叠。

局限性

作者自述:在涉及严重形变的任务场景中观察到跟踪失败,这可能限制方法的适用性。虽然静态关键点不受跟踪模块影响,且框架可与改进的跟踪模块集成,但跟踪质量仍是性能的部分瓶颈。

分析判断:人类校正仅限于 rollout 首帧,无法在执行中途介入——如果中途出现注意力漂移(如物体被遮挡后重新出现),用户无法再次校正。关键点数量预定义为固定值,不适配任务中注意力焦点数量动态变化的场景。所有仿真任务仅使用单相机俯视视角,多视角的交互校正体验未被充分评估。线性坐标头 $h_{\theta}$ 的逆映射在 $d_f>2$ 时欠定,虽用伪逆和对齐损失缓解,但理论上可能丢失高维特征中的信息。

总结与展望

GuidedAttention 的核心贡献在于将视觉注意力从端到端策略的隐式内部状态提升为显式、可检查、可校正的中间表示。通过 DETR 风格的关键点预测器、线性坐标头的前向-逆映射一致性、随机特征路由三项技术,人类仅需在首帧点选即可纠正 OOD 下的注意力漂移。消融实验证明鲁棒性并非来自 Transformer 架构本身,而是来自正确整合人类校正注意力的训练机制。与标记叠加提示的对比表明,显式注意力预测加辅助监督远优于简单像素级叠加。

最好的可解释性不是让人看懂黑盒在想什么,而是让人能在黑盒走神时轻轻拽一把它的注意力。

总体而言,GuidedAttention 通过将视觉注意力外化为可检查、可纠正的显式关键点,在不牺牲自主性的前提下为分布外泛化提供了实用的人类干预接口,为可解释视觉运动策略的设计提供了新思路。

相关论文