Physical Intelligence 提出可操控的机器人基础模型 π0.7:通过语言指令、子目标图像与任务元数据等多模态上下文条件化,在未见环境多阶段任务、零样本跨本体泛化中开箱即用,性能比肩 RL 微调专用策略,并展现涌现能力。
本文通过引入机器人中心点图(pointmap)解决VLA模型中相机帧观测与机器人帧动作之间的坐标系不匹配问题。点图的像素存储场景点在机器人坐标系下的3D坐标,在保留图像结构的同时提供机器人帧3D几何,使策略能跨不同相机设置泛化。