像机器人一样看:面向VLA模型的机器人中心点图本文通过引入机器人中心点图(pointmap)解决VLA模型中相机帧观测与机器人帧动作之间的坐标系不匹配问题。点图的像素存储场景点在机器人坐标系下的3D坐标,在保留图像结构的同时提供机器人帧3D几何,使策略能跨不同相机设置泛化。Byungkun Lee, Dongyoon Hwang, Dongjin Kim·2026年7月13日视觉语言动作模型Pointmapcross-viewpoint2026年7月13日