ReferTrack:面向身体化VLA的指代跟踪ReferTrack提出先指代再跟踪的范式用于身体化VLA模型,结合自然语言指代和视觉跟踪实现机器人对目标的精准操作。Hanjing Ye, Tianle Zeng, Jiazhao Zhang·2026年7月22日视觉语言动作模型目标跟踪指代2026年7月22日
CosFly-VLA:空间感知的无人机跟踪视觉-语言-动作模型面向复杂城市环境无人机动态目标跟踪,提出空间感知VLA模型,在目标被建筑遮挡时仍能维持跟踪,超越现有方法。Ruilong Ren, Songsheng Cheng, Yunpeng Zhou·2026年7月16日UAV视觉语言动作模型跟踪2026年7月16日