Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLApointmap机器人感知

像机器人一样看:面向VLA模型的机器人中心点图

本文通过引入机器人中心点图(pointmap)解决VLA模型中相机帧观测与机器人帧动作之间的坐标系不匹配问题。点图的像素存储场景点在机器人坐标系下的3D坐标,在保留图像结构的同时提供机器人帧3D几何,使策略能跨不同相机设置泛化。

Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo2026年7月13日2 分钟阅读
EN

论文元信息

标题:See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
作者:Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo
机构:KAIST AI, Holiday Robotics
论文链接arXiv:2607.11498
项目主页davian-robotics.github.io/pointmap

一句话总结

本文提出机器人中心点图(robot-centric pointmap),将每个像素的3D坐标从相机帧转换到机器人坐标系并重新中心化到末端执行器,以图像形式注入预训练VLA,在最小架构改动下显著提升了跨视角泛化能力。

研究背景与动机

视觉-语言-动作(VLA)模型从大规模数据集中学习机器人操作策略,根据视觉观测和语言指令预测动作。这些动作通常定义在机器人自身的3D坐标系中(例如机器人基座坐标系下的末端执行器任务空间指令),因此可靠操作要求策略推理目标物体相对于机器人的度量3D坐标。

然而,大多数VLA在相机帧中接收观测——无论是RGB图像还是深度图。这造成了坐标系不匹配:策略在相机帧中观测场景,却在机器人帧中预测动作。在固定相机视角下,所有观测共享同一视角,策略可以记忆单一的观测-动作映射。但当大规模数据集跨机构聚合不同相机设置的演示时,策略必须将这一映射跨视角泛化,而非仅记忆一个。

现有方法分三类应对视角变化。第一类在策略输入为相机视图图像的基础上提供视角信息(Plücker射线或相机帧动作重参数化),但视觉输入始终是相机视图图像,场景从未在机器人帧中表达。第二类合成视图扩展训练覆盖或规范化测试视图,但依赖生成模型,远离训练视图时合成质量下降。第三类构建共享3D场景表示,但这些表示不再保留预训练VLA期望的图像结构。

本文的出发点:能否在保留预训练VLA期望的密集 $H \times W$ 图像网格的同时,将观测直接表达为机器人坐标系下的3D几何?答案是机器人中心点图——一种像素存储机器人帧3D坐标的图像表示。

机器人中心点图概览

图1:机器人中心点图提供与机器人帧动作对齐的3D几何。大规模训练数据从不同相机视角采集,点图保留预训练2D VLA期望的密集 H×W 网格,同时提供机器人中心3D几何。

预备知识

VLA模型接收RGB图像(可能含深度)和语言指令,输出机器人动作(如末端执行器位移)。本文使用 $\pi_{0.5}$ 和 SmolVLA 两种预训练VLA骨干,它们在PaliGemma视觉编码器基础上构建。关键在于:VLA的视觉编码器期望接收 $H \times W$ 网格输入,因此任何3D增强必须保留这一结构才能复用预训练权重。

点图(Pointmap)是现代3D视觉中的标准表示,是一种与RGB图像同分辨率的图像,但每个像素存储3D坐标而非颜色。点图保留了图像的空间结构,因此可以直接通过标准2D卷积/Transformer编码器处理。本文的贡献在于将点图引入预训练VLA,并系统研究应将点图表达在哪个坐标系中。

方法详解

整体架构

DAAAM的方法分两步:(1) 将RGB-D观测提升为机器人中心点图,(2) 将点图token与RGB token融合后送入VLA。整个过程不需要点云专用编码器、体素化模块或额外token序列。

机器人中心点图构建

考虑相机 $c$ 捕获的 $H \times W$ 分辨率RGB图像,已知相机内参 $K_c$、相机到机器人基座帧的旋转 $R_c$ 和平移 $t_c$、以及逐像素深度 $D_c$。首先将每个像素提升为相机帧3D点:

$$P_c^{\text{cam}}(u,v) = D_c(u,v) \cdot K_c^{-1} [u, v, 1]^{\top}$$

然后施加相机到机器人变换,将点表达在机器人基座帧:

$$P_c^{\text{R}}(u,v) = R_c \cdot P_c^{\text{cam}}(u,v) + t_c$$

机器人帧点图 $P_c^{\text{R}}$ 与RGB图像具有相同的 $H \times W$ 网格,每像素一个3D坐标。关键性质:同一物理场景点无论从哪个相机视角观测,都获得相同的机器人帧坐标,尽管它出现在图像中的像素位置 $(u,v)$ 可能变化。

RGB-D提升为点图

图3:RGB-D观测被提升为相机帧点图,再变换为机器人帧点图。同一场景点在不同视角下获得相同机器人帧坐标。

末端执行器中心化

在机器人基座帧基础上,进一步将点图重新中心化到当前末端执行器位置:

$$P_c^{\text{EE}}(u,v) = P_c^{\text{R}}(u,v) - t_{\text{EE}}$$

其中 $t_{\text{EE}}$ 是末端执行器在机器人基座帧中的位置。这一中心化使场景几何相对于当前末端执行器位置表达。因为动作定义为该末端执行器的运动,观测和动作空间现在共享同一原点。消融实验表明,末端执行器中心化比机器人基座帧中心化在随机评估视角下更鲁棒(下降仅0.3分 vs 2.0分)。

点图-RGB融合

因为点图保留了与RGB图像相同的 $H \times W$ 网格,使用与VLA的RGB编码器相同架构的独立点图编码器 $g_\phi$(从RGB编码器 $f_\theta$ 初始化)将 $P_c^{\text{EE}}$ 映射为与RGB token相同形状的token,然后逐元素相加:

$$z_c = f_\theta(I_c) + g_\phi(P_c^{\text{EE}}) \in \mathbb{R}^{N_{\text{tok}} \times d}$$

融合后的token $z_c$ 替代原始RGB token作为VLA的视觉输入。这种设计的关键优势:不需要点云专用编码器、不需要体素化模块、不引入额外token序列,预训练VLA的视觉通路直接吸收机器人帧3D几何。

flowchart TB
    A[RGB-D Input] --> B[Camera-frame Pointmap]
    B --> C[Robot-frame Transform]
    C --> D[EE-centered Pointmap]
    A --> E[RGB Encoder f_theta]
    D --> F[Pointmap Encoder g_phi]
    E --> G[RGB Tokens]
    F --> H[Pointmap Tokens]
    G --> I[Element-wise Add]
    H --> I
    I --> J[Fused Visual Tokens]
    J --> K[VLA Backbone]
    K --> L[Robot Actions]

设计选择分析

机器人帧点图优于相机信息条件化

实验对比四种输入:RGB(无深度无标定)、RGB+Plücker射线(相机射线信息)、RGB+相机帧点图、RGB+机器人帧点图。结果表明,将相机到机器人变换预计算到观测中(机器人帧点图)比让策略从原始相机信息推断更有效。Plücker射线提供6D射线编码,但仍停留在相机帧中,策略仍需学习跨视角映射。

图像形式点图优于点云

对比图像形式点图与点云表示:点图保留 $H \times W$ 网格可复用预训练视觉权重,点云需要专用编码器和体素化。在RoboCasa上点图表现更优,验证了保留图像结构的重要性。

末端执行器中心化的优势

末端执行器中心化使交互目标在工作空间帧中广泛分布的坐标坍缩到末端执行器原点附近。两个不同任务中,目标在机器人基座帧中坐标不同,但在末端执行器中心化帧中在抓取时都接近 $(0,0,0)$。这给策略提供了一致的局部几何表示。

末端执行器中心化

图5:末端执行器中心化将交互目标集中到共同原点附近。(a)目标坐标在基座帧中分散,在末端执行器帧中聚集到原点。(b)两个任务中不同基座坐标的目标在抓取时都接近末端执行器原点。

对训练视角变化的鲁棒性

在No variation(固定训练视角)、Low(标准随机化)和High(扩大随机化范围)三个设置下,RGB-only性能从34.5%下降到24.9%(降9.6分),而RGB+点图仅从37.6%降到35.8%(降1.8分)。这支持了核心假设:机器人帧几何使策略对训练时视角变化保持鲁棒。

训练视角变化影响

图6/10:训练时相机视角变化的影响。RGB性能随视角变化增大而下降,RGB+点图保持稳定。

实验结果

仿真实验(RoboCasa)

在RoboCasa上跨5类24个任务评估,每个任务50个人类演示和50个评估回合。对比三组基线:相机感知VLA(KYC、OC-VLA)、3D增强VLA(GeoVLA、PointVLA)和点云策略(FP3)。

方法均值抽屉咖啡拾取放置翻转物体
FP3(点云策略)42.879.074.054.721.832.0
OC-VLA56.380.080.042.050.548.9
KYC59.186.586.051.348.251.4
GeoVLA57.181.080.045.349.850.3
PointVLA57.387.585.044.046.350.3
$\pi_{0.5}$(RGB)55.379.583.040.746.050.6
$\pi_{0.5}$ + 点图62.990.090.058.052.853.4
SmolVLA(RGB)37.268.063.039.36.546.6
SmolVLA + 点图41.480.077.038.012.843.4

添加点图使 $\pi_{0.5}$ 提升+7.6分(55.3→62.9),SmolVLA提升+4.2分(37.2→41.4),且在所有5类任务上均有提升。最强相机感知基线KYC(59.1)和最强3D增强基线PointVLA(57.3)均低于点图方法(62.9),说明将几何表达在机器人帧并融合到RGB网格上比条件化相机参数或附加3D模块更有效。

真实世界实验

使用Franka Research 3机器人,配备腕部D405和外部D435i两台RealSense相机。数据采集时外部相机放置在3个训练位置,评估时使用已见和未见位置。

评估相机模型均值拾取放置堆叠方块开抽屉关抽屉
已见DP363.360.040.060.093.3
已见$\pi_{0.5}$(RGB)73.380.053.373.386.7
已见$\pi_{0.5}$+点图78.386.760.073.393.3
未见DP348.333.333.340.086.7
未见$\pi_{0.5}$(RGB)55.040.026.766.786.7
未见$\pi_{0.5}$+点图66.753.346.773.393.3

在已见位置,点图提升$\pi_{0.5}$ +5.0分(73.3→78.3)。在未见位置,优势进一步扩大:RGB-only从73.3降到55.0(降18.3分),而点图仅从78.3降到66.7(降11.6分),相对RGB的优势从+5.0扩大到+11.7。这直接验证了点图在跨视角泛化上的核心价值。

真实机器人设置

图7:真实机器人设置。(a) Franka Research 3配腕部相机和外部相机,外部相机在3个训练位置(红)和1个测试位置(蓝)。(b) 任务:拾取放置、堆叠方块、开关抽屉。

局限性分析

作者自述局限一:未消融点图注入相对于动作专家的方式,也未研究它与预训练配方的交互,因此最佳组合方式仍不确定。与点云的对比使用了单一采样预算,更大的预算可能缩小报告的差距。

作者自述局限二:点图要求在训练和测试时都有标定的相机内外参,这将其限制在有标定的设置中。此外,相机变化结果聚焦于相机位置和外参变化,尚未覆盖相机数量或视场变化。

独立判断:方法依赖RGB-D输入(需要深度传感器),这在某些部署场景中可能不可用——特别是仅有RGB相机的系统。论文未讨论仅有RGB时如何获取深度(如单目深度估计)的效果。此外,点图编码器从RGB编码器初始化但独立训练,两路编码器的参数量和推理成本增加未被讨论。

总结与展望

本文研究了当演示在不同相机视角下采集时VLA应如何使用3D观测。核心发现是:与其让策略从RGB、深度和标定输入中推断相机到机器人的关系,不如将每个观测场景点直接在机器人帧中表达为机器人中心点图。点图保留密集 $H \times W$ 图像网格,使机器人帧3D坐标通过预训练VLA的现有视觉通路与RGB token融合。实验指向一个简单有效的输入:机器人帧、图像形式、末端执行器中心化的点图。

这些结果提出了3D感知VLA的一般原则:当标定可用时,在机器人执行动作的坐标系中表达观测,再传递给策略。机器人中心点图实现了这一原则,同时保留了预训练VLA已使用的图像形式结构。

"不要让策略猜测相机到机器人的变换——直接在机器人执行动作的坐标系中给它几何,剩下的交给预训练视觉通路。"


来源:arXiv:2607.11498 · 项目主页

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日