Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLA目标跟踪指代

ReferTrack:面向身体化VLA的指代跟踪

ReferTrack提出先指代再跟踪的范式用于身体化VLA模型,结合自然语言指代和视觉跟踪实现机器人对目标的精准操作。

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang2026年7月22日2 分钟阅读
EN

ReferTrack:先指代再跟踪的具身视觉跟踪

论文:ReferTrack: Referring Then Tracking for Embodied Visual Tracking

作者:Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

机构:南方科技大学RCV实验室、腾讯Robotics X、北京大学

链接arXiv:2607.20061 | 代码GitHub


一句话总结

ReferTrack 提出先指代再跟踪的范式,通过从索引边界框目录中选择目标再解码跟踪航点,将目标识别从抽象空间潜变量对齐到图像空间检测,配合TVBI令牌注入历史目标几何特征,在EVT-Bench单视角下达到89.4%/73.3%/74.1%成功率,超越多个多相机基线。


研究背景与动机

具身视觉跟踪(EVT)要求移动智能体仅用机载视觉持续跟随自然语言描述的特定目标。现有VLA策略将目标识别和轨迹规划统一到单一策略中,但其思维链(CoT)推理在抽象空间潜变量中操作,难以监督且与图像空间检测弱对齐。TrackVLA++引入空间感知CoT令牌,但纯抽象推理仍缺乏可解释性和可监督性。

ReferTrack概念

图1:ReferTrack将EVT表述为先指代再跟踪:前视检测组织为索引bbox,单个Refer-CoT令牌选择目标后再预测轨迹。


方法详解

1. 问题定义

EVT给定语言指令$\mathcal{L}$和前视RGB流$\mathcal{O}_{1:T}$,目标是输出跟踪航点序列$\mathbf{a}_{1:A}$。关键创新是将目标识别从抽象潜空间移到图像空间——从索引边界框目录中选择匹配$\mathcal{L}$的条目。

2. 观测编码

双编码器架构提取SigLIP和DINOv2视觉特征,网格池化生成精细令牌$V^{\text{fine}} \in \mathbb{R}^{64 \times C}$和粗略令牌$V^{\text{coarse}} \in \mathbb{R}^{4 \times C}$。滑动窗口$H$帧组织视觉流$\mathcal{V}_T = \{V_{T-H}^{\text{coarse}}, \ldots, V_{T-1}^{\text{coarse}}, V_T^{\text{fine}}\}$。

视觉流通过MLP投影器$\mathcal{P}_{ ext{vision}}$映射到LLM潜空间:

$$ E_{1:T}^V = \mathcal{P}_{ ext{vision}}(\mathcal{V}_T) $$

候选目录中每个条目的bbox令牌通过共享MLP编码:

$$ E_{ ext{bbox}}^{(k)} = \mathcal{P}_{ ext{bbox}}(b_T^{(k)}) $$

时间-视角-bbox指示(TVBI)令牌将历史目标几何注入视觉历史:

$$ E_{\text{TVBI}}(t) = E_{\text{TVI}}(t) + \mathcal{P}_{\text{bbox}}(b_t) $$

其中$b_t \in [0,1]^4$为归一化边界框,$\mathcal{P}_{\text{bbox}}$为两层MLP。目标不可见时$b_t = [0,0,0,0]$作为缺席哨兵。

ReferTrack架构

图2:ReferTrack总览。先从当前检测中选择索引bbox,再基于Refer-CoT决策预测航点。

3. 候选目录与指代

实时检测器在当前帧上运行,检测结果排序为索引目录$\mathcal{C}_T = \{\langle ped_1 \rangle, \ldots, \langle ped_K \rangle, \langle \text{NO\_EXIST} \rangle\}$。每个条目由标识符令牌和bbox令牌组成。LLM输出单个Refer-CoT令牌选择匹配目标,$\langle \text{NO\_EXIST} \rangle$处理目标不在视野的情况。

4. 航点解码与训练

选定目标后,LLM基于图像接地决策解码跟踪航点。训练使用1.3M导航样本+1.3M Refer-QA样本(1:1混合)SFT。Refer-QA数据集增强目标识别能力,要求模型根据描述选择正确的bbox条目。

flowchart TD
    A["前视RGB流 O_1:T"] --> B["双编码器: SigLIP+DINOv2"]
    B --> C["网格池化: V_fine(64)+V_coarse(4)"]
    C --> D["滑动窗口H帧视觉流"]
    D --> E["TVBI令牌注入
历史目标bbox几何特征"] E --> F["LLM输入: 视觉+语言指令+候选目录"] F --> G["实时检测器: YOLO11+ByteTrack"] G --> H["索引bbox目录 C_T"] H --> I["Refer-CoT: 选择目标bbox"] I --> J["航点解码: 跟踪轨迹"] J --> K["跟踪输出+目标记忆更新"] style E fill:#e1f5fe style I fill:#fff3e0 style K fill:#e8f5e9

实验结果

EVT-Bench定量对比

表1:EVT-Bench性能(SR↑/TR↑/CR↓),单前视相机
方法参数量STT SR↑DT SR↑AT SR↑
EVT (GroundingDINO)24.43.217.4
Uni-NaVid*7B53.331.915.8
TrackVLA7B85.157.650.2
TrackVLA++7B86.066.551.2
CoMaTrack* (3相机)3B92.174.257.5
ReferTrack (Ours)4B89.473.374.1

ReferTrack以4B参数在单视角下达到89.4% STT成功率(超越7B TrackVLA++的86.0%),DT 73.3%接近3相机CoMaTrack的74.2%,AT 74.1%大幅超越所有方法(TrackVLA++仅51.2%,CoMaTrack仅57.5%)。

消融实验

表2:EVT-Bench DT消融实验
配置SR↑TR↑
无TVBI68.576.2
无Refer-QA70.178.5
Oracle TVBI75.883.2
完整ReferTrack73.381.8
EVT-Bench结果

表1:EVT-Bench完整定量结果。

消融实验

表2/图3:消融实验和真实世界定性结果。

真实世界部署

图3:真实世界定性结果。左:Unitree Go2跟随目标行人;右:人形机器人部署。

专家数据

图4:专家跟踪数据示例。


航点解码

选定目标后,LLM自回归解码$A$步跟踪航点$\mathbf{a}_{1:A}$。每个航点表示为相对于当前机器人位姿的极坐标位移$(\Delta x, \Delta heta)$,离散化为导航词汇表中的令牌。航点解码的条件概率为:

$$ P(\mathbf{a}_{1:A} \mid \mathcal{L}, \mathcal{V}_T, \mathcal{C}_T, ext{Refer-CoT}) = \prod_{i=1}^{A} P(a_i \mid a_{<i}, \mathcal{L}, \mathcal{V}_T, \mathcal{C}_T, ext{Refer-CoT}) $$

其中$ ext{Refer-CoT}$为选定的目标bbox索引令牌。这种条件解码确保航点预测直接受图像空间目标选择约束,而非依赖抽象潜空间推理。

训练目标

导航和Refer-QA任务联合训练,SFT损失为标准next-token预测:

$$ \mathcal{L}_{ ext{SFT}} = -\sum_{t=1}^{L} \log P(y_t \mid y_{<t}, \mathbf{x}) $$

其中$y_t$为目标令牌,$\mathbf{x}$为输入序列(视觉+语言+目录)。导航样本的$y$包含Refer-CoT令牌和航点令牌;Refer-QA样本的$y$仅包含选定的bbox索引令牌。1:1混合比例确保识别和跟踪能力均衡发展。

TVBI的消融分析

TVBI令牌的设计有几个关键决策:(1)当前帧不注入bbox——迫使模型利用历史TVBI线索和原始视觉特征进行空间时间接地,而非依赖当前检测的"作弊"信号;(2)缺席哨兵$[0,0,0,0]$——明确区分目标可见与不可见的历史帧,而非用零向量模糊处理;(3)共享$\mathcal{P}_{ ext{bbox}}$编码器——目录编码和历史注入使用同一MLP,确保bbox几何特征在两种上下文中表示一致。消融实验显示移除TVBI使DT成功率从73.3%降至68.5%(降低4.8个百分点),Oracle TVBI(使用真值bbox)提升至75.8%,说明TVBI的质量上限仍有提升空间。

实现细节

ReferTrack基于Qwen3-4B LLM骨干,使用SigLIP和DINOv2双视觉编码器。索引bbox目录由YOLO11+ByteTrack构建,最多$K$个候选(按bbox面积排序)。滑动窗口$H$帧,grid pooling生成64个精细令牌和4个粗略令牌。训练在8×A100 80GB GPU上进行,学习率$2 imes 10^{-5}$,batch size 128,3个epoch。推理时单帧延迟约150ms(包含检测+LLM前向),满足实时跟踪需求。真实世界部署在Unitree Go2腿式机器人和人形机器人上验证,在光照变化、遮挡和行人干扰条件下展现鲁棒的sim-to-real迁移。

局限性

  1. 依赖外部检测器:目标识别依赖YOLO11+ByteTrack的检测结果质量,检测失败时候选目录可能遗漏目标。
  2. 单视角限制:仅使用前视相机,侧后方目标不可见时跟踪中断,需依赖历史记忆而非实时感知。
  3. 候选数量上限:索引目录限制为$K$个候选(按bbox面积排序),拥挤场景中小目标可能被遗漏。

总结与展望

ReferTrack通过先指代再跟踪范式将EVT的目标识别从抽象潜空间对齐到图像空间检测,TVBI令牌保留目标运动线索,Refer-QA共训练增强识别能力。以4B参数在单视角下超越7B基线并在歧义跟踪上大幅领先,腿式和人形机器人真实部署验证了sim-to-real迁移能力。

金句:「将目标识别从抽象空间潜变量移到图像空间——从索引边界框目录中选择一个令牌——使推理可监督、可解释,且与VLM的接地机制天然对齐。」

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日