PAPER DEEP DIVE
像机器人一样看:面向VLA模型的机器人中心点图
本文通过引入机器人中心点图(pointmap)解决VLA模型中相机帧观测与机器人帧动作之间的坐标系不匹配问题。点图的像素存储场景点在机器人坐标系下的3D坐标,在保留图像结构的同时提供机器人帧3D几何,使策略能跨不同相机设置泛化。
论文元信息
标题:See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
作者:Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo
机构:KAIST AI, Holiday Robotics
论文链接:arXiv:2607.11498
项目主页:davian-robotics.github.io/pointmap
一句话总结
本文提出机器人中心点图(robot-centric pointmap),将每个像素的3D坐标从相机帧转换到机器人坐标系并重新中心化到末端执行器,以图像形式注入预训练VLA,在最小架构改动下显著提升了跨视角泛化能力。
研究背景与动机
视觉-语言-动作(VLA)模型从大规模数据集中学习机器人操作策略,根据视觉观测和语言指令预测动作。这些动作通常定义在机器人自身的3D坐标系中(例如机器人基座坐标系下的末端执行器任务空间指令),因此可靠操作要求策略推理目标物体相对于机器人的度量3D坐标。
然而,大多数VLA在相机帧中接收观测——无论是RGB图像还是深度图。这造成了坐标系不匹配:策略在相机帧中观测场景,却在机器人帧中预测动作。在固定相机视角下,所有观测共享同一视角,策略可以记忆单一的观测-动作映射。但当大规模数据集跨机构聚合不同相机设置的演示时,策略必须将这一映射跨视角泛化,而非仅记忆一个。
现有方法分三类应对视角变化。第一类在策略输入为相机视图图像的基础上提供视角信息(Plücker射线或相机帧动作重参数化),但视觉输入始终是相机视图图像,场景从未在机器人帧中表达。第二类合成视图扩展训练覆盖或规范化测试视图,但依赖生成模型,远离训练视图时合成质量下降。第三类构建共享3D场景表示,但这些表示不再保留预训练VLA期望的图像结构。
本文的出发点:能否在保留预训练VLA期望的密集 $H \times W$ 图像网格的同时,将观测直接表达为机器人坐标系下的3D几何?答案是机器人中心点图——一种像素存储机器人帧3D坐标的图像表示。
图1:机器人中心点图提供与机器人帧动作对齐的3D几何。大规模训练数据从不同相机视角采集,点图保留预训练2D VLA期望的密集 H×W 网格,同时提供机器人中心3D几何。
预备知识
VLA模型接收RGB图像(可能含深度)和语言指令,输出机器人动作(如末端执行器位移)。本文使用 $\pi_{0.5}$ 和 SmolVLA 两种预训练VLA骨干,它们在PaliGemma视觉编码器基础上构建。关键在于:VLA的视觉编码器期望接收 $H \times W$ 网格输入,因此任何3D增强必须保留这一结构才能复用预训练权重。
点图(Pointmap)是现代3D视觉中的标准表示,是一种与RGB图像同分辨率的图像,但每个像素存储3D坐标而非颜色。点图保留了图像的空间结构,因此可以直接通过标准2D卷积/Transformer编码器处理。本文的贡献在于将点图引入预训练VLA,并系统研究应将点图表达在哪个坐标系中。
方法详解
整体架构
DAAAM的方法分两步:(1) 将RGB-D观测提升为机器人中心点图,(2) 将点图token与RGB token融合后送入VLA。整个过程不需要点云专用编码器、体素化模块或额外token序列。
机器人中心点图构建
考虑相机 $c$ 捕获的 $H \times W$ 分辨率RGB图像,已知相机内参 $K_c$、相机到机器人基座帧的旋转 $R_c$ 和平移 $t_c$、以及逐像素深度 $D_c$。首先将每个像素提升为相机帧3D点:
$$P_c^{\text{cam}}(u,v) = D_c(u,v) \cdot K_c^{-1} [u, v, 1]^{\top}$$
然后施加相机到机器人变换,将点表达在机器人基座帧:
$$P_c^{\text{R}}(u,v) = R_c \cdot P_c^{\text{cam}}(u,v) + t_c$$
机器人帧点图 $P_c^{\text{R}}$ 与RGB图像具有相同的 $H \times W$ 网格,每像素一个3D坐标。关键性质:同一物理场景点无论从哪个相机视角观测,都获得相同的机器人帧坐标,尽管它出现在图像中的像素位置 $(u,v)$ 可能变化。
图3:RGB-D观测被提升为相机帧点图,再变换为机器人帧点图。同一场景点在不同视角下获得相同机器人帧坐标。
末端执行器中心化
在机器人基座帧基础上,进一步将点图重新中心化到当前末端执行器位置:
$$P_c^{\text{EE}}(u,v) = P_c^{\text{R}}(u,v) - t_{\text{EE}}$$
其中 $t_{\text{EE}}$ 是末端执行器在机器人基座帧中的位置。这一中心化使场景几何相对于当前末端执行器位置表达。因为动作定义为该末端执行器的运动,观测和动作空间现在共享同一原点。消融实验表明,末端执行器中心化比机器人基座帧中心化在随机评估视角下更鲁棒(下降仅0.3分 vs 2.0分)。
点图-RGB融合
因为点图保留了与RGB图像相同的 $H \times W$ 网格,使用与VLA的RGB编码器相同架构的独立点图编码器 $g_\phi$(从RGB编码器 $f_\theta$ 初始化)将 $P_c^{\text{EE}}$ 映射为与RGB token相同形状的token,然后逐元素相加:
$$z_c = f_\theta(I_c) + g_\phi(P_c^{\text{EE}}) \in \mathbb{R}^{N_{\text{tok}} \times d}$$
融合后的token $z_c$ 替代原始RGB token作为VLA的视觉输入。这种设计的关键优势:不需要点云专用编码器、不需要体素化模块、不引入额外token序列,预训练VLA的视觉通路直接吸收机器人帧3D几何。
flowchart TB
A[RGB-D Input] --> B[Camera-frame Pointmap]
B --> C[Robot-frame Transform]
C --> D[EE-centered Pointmap]
A --> E[RGB Encoder f_theta]
D --> F[Pointmap Encoder g_phi]
E --> G[RGB Tokens]
F --> H[Pointmap Tokens]
G --> I[Element-wise Add]
H --> I
I --> J[Fused Visual Tokens]
J --> K[VLA Backbone]
K --> L[Robot Actions]
设计选择分析
机器人帧点图优于相机信息条件化
实验对比四种输入:RGB(无深度无标定)、RGB+Plücker射线(相机射线信息)、RGB+相机帧点图、RGB+机器人帧点图。结果表明,将相机到机器人变换预计算到观测中(机器人帧点图)比让策略从原始相机信息推断更有效。Plücker射线提供6D射线编码,但仍停留在相机帧中,策略仍需学习跨视角映射。
图像形式点图优于点云
对比图像形式点图与点云表示:点图保留 $H \times W$ 网格可复用预训练视觉权重,点云需要专用编码器和体素化。在RoboCasa上点图表现更优,验证了保留图像结构的重要性。
末端执行器中心化的优势
末端执行器中心化使交互目标在工作空间帧中广泛分布的坐标坍缩到末端执行器原点附近。两个不同任务中,目标在机器人基座帧中坐标不同,但在末端执行器中心化帧中在抓取时都接近 $(0,0,0)$。这给策略提供了一致的局部几何表示。
图5:末端执行器中心化将交互目标集中到共同原点附近。(a)目标坐标在基座帧中分散,在末端执行器帧中聚集到原点。(b)两个任务中不同基座坐标的目标在抓取时都接近末端执行器原点。
对训练视角变化的鲁棒性
在No variation(固定训练视角)、Low(标准随机化)和High(扩大随机化范围)三个设置下,RGB-only性能从34.5%下降到24.9%(降9.6分),而RGB+点图仅从37.6%降到35.8%(降1.8分)。这支持了核心假设:机器人帧几何使策略对训练时视角变化保持鲁棒。
图6/10:训练时相机视角变化的影响。RGB性能随视角变化增大而下降,RGB+点图保持稳定。
实验结果
仿真实验(RoboCasa)
在RoboCasa上跨5类24个任务评估,每个任务50个人类演示和50个评估回合。对比三组基线:相机感知VLA(KYC、OC-VLA)、3D增强VLA(GeoVLA、PointVLA)和点云策略(FP3)。
| 方法 | 均值 | 门 | 抽屉 | 咖啡 | 拾取放置 | 翻转物体 |
|---|---|---|---|---|---|---|
| FP3(点云策略) | 42.8 | 79.0 | 74.0 | 54.7 | 21.8 | 32.0 |
| OC-VLA | 56.3 | 80.0 | 80.0 | 42.0 | 50.5 | 48.9 |
| KYC | 59.1 | 86.5 | 86.0 | 51.3 | 48.2 | 51.4 |
| GeoVLA | 57.1 | 81.0 | 80.0 | 45.3 | 49.8 | 50.3 |
| PointVLA | 57.3 | 87.5 | 85.0 | 44.0 | 46.3 | 50.3 |
| $\pi_{0.5}$(RGB) | 55.3 | 79.5 | 83.0 | 40.7 | 46.0 | 50.6 |
| $\pi_{0.5}$ + 点图 | 62.9 | 90.0 | 90.0 | 58.0 | 52.8 | 53.4 |
| SmolVLA(RGB) | 37.2 | 68.0 | 63.0 | 39.3 | 6.5 | 46.6 |
| SmolVLA + 点图 | 41.4 | 80.0 | 77.0 | 38.0 | 12.8 | 43.4 |
添加点图使 $\pi_{0.5}$ 提升+7.6分(55.3→62.9),SmolVLA提升+4.2分(37.2→41.4),且在所有5类任务上均有提升。最强相机感知基线KYC(59.1)和最强3D增强基线PointVLA(57.3)均低于点图方法(62.9),说明将几何表达在机器人帧并融合到RGB网格上比条件化相机参数或附加3D模块更有效。
真实世界实验
使用Franka Research 3机器人,配备腕部D405和外部D435i两台RealSense相机。数据采集时外部相机放置在3个训练位置,评估时使用已见和未见位置。
| 评估相机 | 模型 | 均值 | 拾取放置 | 堆叠方块 | 开抽屉 | 关抽屉 |
|---|---|---|---|---|---|---|
| 已见 | DP3 | 63.3 | 60.0 | 40.0 | 60.0 | 93.3 |
| 已见 | $\pi_{0.5}$(RGB) | 73.3 | 80.0 | 53.3 | 73.3 | 86.7 |
| 已见 | $\pi_{0.5}$+点图 | 78.3 | 86.7 | 60.0 | 73.3 | 93.3 |
| 未见 | DP3 | 48.3 | 33.3 | 33.3 | 40.0 | 86.7 |
| 未见 | $\pi_{0.5}$(RGB) | 55.0 | 40.0 | 26.7 | 66.7 | 86.7 |
| 未见 | $\pi_{0.5}$+点图 | 66.7 | 53.3 | 46.7 | 73.3 | 93.3 |
在已见位置,点图提升$\pi_{0.5}$ +5.0分(73.3→78.3)。在未见位置,优势进一步扩大:RGB-only从73.3降到55.0(降18.3分),而点图仅从78.3降到66.7(降11.6分),相对RGB的优势从+5.0扩大到+11.7。这直接验证了点图在跨视角泛化上的核心价值。
图7:真实机器人设置。(a) Franka Research 3配腕部相机和外部相机,外部相机在3个训练位置(红)和1个测试位置(蓝)。(b) 任务:拾取放置、堆叠方块、开关抽屉。
局限性分析
作者自述局限一:未消融点图注入相对于动作专家的方式,也未研究它与预训练配方的交互,因此最佳组合方式仍不确定。与点云的对比使用了单一采样预算,更大的预算可能缩小报告的差距。
作者自述局限二:点图要求在训练和测试时都有标定的相机内外参,这将其限制在有标定的设置中。此外,相机变化结果聚焦于相机位置和外参变化,尚未覆盖相机数量或视场变化。
独立判断:方法依赖RGB-D输入(需要深度传感器),这在某些部署场景中可能不可用——特别是仅有RGB相机的系统。论文未讨论仅有RGB时如何获取深度(如单目深度估计)的效果。此外,点图编码器从RGB编码器初始化但独立训练,两路编码器的参数量和推理成本增加未被讨论。
总结与展望
本文研究了当演示在不同相机视角下采集时VLA应如何使用3D观测。核心发现是:与其让策略从RGB、深度和标定输入中推断相机到机器人的关系,不如将每个观测场景点直接在机器人帧中表达为机器人中心点图。点图保留密集 $H \times W$ 图像网格,使机器人帧3D坐标通过预训练VLA的现有视觉通路与RGB token融合。实验指向一个简单有效的输入:机器人帧、图像形式、末端执行器中心化的点图。
这些结果提出了3D感知VLA的一般原则:当标定可用时,在机器人执行动作的坐标系中表达观测,再传递给策略。机器人中心点图实现了这一原则,同时保留了预训练VLA已使用的图像形式结构。
"不要让策略猜测相机到机器人的变换——直接在机器人执行动作的坐标系中给它几何,剩下的交给预训练视觉通路。"
来源:arXiv:2607.11498 · 项目主页



