Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

巡检机器人语言引导抓取移动操作

面向野外巡检与维护中移动操作的语言引导部分观测抓取

海上巡检和维护越来越多地使用腿式机器人进行例行传感,但许多有用的干预仍需要与工具、容器和任务相关物体进行物理交互。让机器人执行这些任务可以减少人员暴露在危险环境中。我们研究如何在巡检和维护场景中实现移动操作,重点是在部分观测条件下通过语言指令引导的抓取。该方法结合感知、规划和控制,使腿式移动机器人能够在非结构化环境中根据自然语言指令定位并抓取目标物体。我们在真实的海上平台场景中验证了系统的有效性,展示了腿式机器人在巡检场景中进行物理交互操作的潜力。

Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker2026年3月9日3 分钟阅读
EN

语言引导的局部观测下移动抓取:面向现场巡检与维护的腿式移动操作

论文:Language-Guided Grasping under Partial Observation for Mobile Manipulation in Field Inspection and Maintenance
作者:Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker
机构:圣保罗大学、联邦乌贝兰迪亚大学、东北大学、以色列阿尔伯特爱因斯坦医院
资助:巴西石油公司(Petrobras)ANP R&D 条款
链接arXiv:2603.07866GitHub 代码

一句话总结

本文提出了一套面向腿式移动操作机器人的语言引导抓取流水线:操作员用自然语言指定目标,系统通过 GroundingDINO 开放词汇检测 + SAM 2 分割追踪获取目标掩码,从 RGB-D 提取物体中心点云并经深度补偿、MGPC 和 PoinTr 两级补全恢复完整几何,再通过含碰撞/间隙/可达性/接近约束的执行感知代价函数从 1000 个候选抓取中选出最优抓取,在 Boston Dynamics Spot 平台上实现了 9/10 的抓取成功率,相比视角依赖基线的 3/10 提升了 6 倍。

研究背景与动机

海上油气平台、核设施、隧道和灾后工业现场等关键基础设施的巡检与干预,是安全保安救援机器人的核心应用场景。腿式平台因能通过楼梯、格栅、狭窄通道和杂乱路径而备受青睐,同时可携带视觉、热成像、声学或气体传感器。然而,许多有价值的干预操作仍需要物理交互——拾取松散物体、操作工具、打开面板、采集样品或清除障碍——以减少操作人员在受限、高处或潜在爆炸性区域的暴露风险。

当前巡检机器人的能力主要停留在感知与观测层面,在物理操作方面存在明显短板。一个典型场景是:操作员远程指定"蓝色瓶子"或"电钻",机器人需要在杂乱环境中找到该物体、估计其三维几何、规划并执行可靠抓取。这涉及三个核心挑战:第一,目标物体常被遮挡,仅部分可见;第二,RGB-D 传感器在杂乱场景中产生的深度图存在大量空洞、飞点像素和缺失回波;第三,抓取不仅要几何可行,还需考虑机械臂可达性、碰撞约束和接近间隙。

现有抓取方法大多假设完整物体几何或固定视角,在实际部署中难以应对部分观测和视角受限的场景。基于物理仿真的方法需要精确的 CAD 模型,在野外环境中不现实。基于学习的方法(如 Contact-GraspNet、AnyGrasp)虽然在仿真数据上训练,但对部分观测的鲁棒性有限。更重要的是,大多数方法将感知和执行割裂——先生成抓取再检查是否可行,而非将执行约束纳入选 grasp 的过程。

本文的核心洞察是:通过物体中心的多帧点云累积 + 双级点云补全(MGPC + PoinTr)恢复完整几何,同时将碰撞、间隙、可达性和接近方向约束融入抓取选择代价函数,并允许机器人基座重新定位以满足臂的可达性,可以显著提升杂乱场景下语言引导抓取的可靠性。整个流水线在 ROS 2 中实现,基于 Spot 四足机器人 + 6-DoF 臂 + 夹爪硬件平台验证。

方法详解

系统流水线由四个模块组成:A)检测与分割,B)点云生成与估计,C)抓取位姿生成与选择,D)抓取执行与运动控制。输入为机器人前部 RGB-D 相机的图像流,输出为对语言指定目标的物理抓取。

图1:系统概览。自然语言目标提示经 GroundingDINO 检测和 SAM 2 分割后,从 RGB-D 提取物体中心点云,经深度补偿、MGPC 和 PoinTr 补全后输入抓取位姿生成器,最终由执行感知选择和移动基座协同完成抓取。

检测与分割。操作员通过自然语言命令(如"蓝色瓶子")指定目标物体。系统使用开放词汇检测器 GroundingDINO 对文本查询返回候选边界框及置信度分数,选取最高分框 $B^{\star}$ 初始化 SAM 2 进行实例分割和视频追踪。SAM 2 在后续帧中维持目标掩码,仅当追踪失败时才重新调用 GroundingDINO。为抑制掩码边界向邻近杂物的泄漏,对掩码 $M$ 施加轻量级形态学腐蚀操作,提升 3D 提取的鲁棒性。

物体中心点云提取。利用 Isaac ROS nvblox 进行 GPU 加速的深度处理和点云提取。对每帧 RGB-D 数据,nvblox 将深度图反投影生成机器人坐标系下的场景点云,再施加实例掩码 $M$ 仅保留投影在目标区域内的点,得到物体中心部分点云 $P_{\text{partial}}$。为提升部分视角下的鲁棒性,利用机器人状态估计在公共参考系中多帧累积掩码点云,增加表面覆盖率。

深度补偿。杂乱场景的深度图常含空洞、不连续处飞点像素以及薄/镜面结构的缺失回波。在提取 $P_{\text{partial}}$ 之前,在 nvblox 管线中施加反投影深度补偿:利用图像平面上的局部邻域一致性填充小深度空洞并衰减离群点,生成更稠密稳定的物体中心点云,无需体积距离图。

MGPC 点云补全。即使多帧累积和深度补偿后,$P_{\text{partial}}$ 因自遮挡和背面表面仍不完整。应用 MGPC(多模态可泛化点云补全网络)利用多模态上下文(提示、RGB、部分点云)估计缺失几何。MGPC 要求固定大小输入,将 $P_{\text{partial}}$ 子采样至 2048 点,推断 8192 点的合成点集 $P_{\text{mgpc}}$,合并得到中间点云:

$$P_{\text{mid}}=P_{\text{partial}}\cup P_{\text{mgpc}}$$

对 $N$ 个观测点,此步骤产生 $N+8192$ 个点。

PoinTr 精修与致密化。由于抓取位姿生成器(GPG)对法线估计质量敏感,使用 PoinTr 进一步致密化物体几何。PoinTr 要求固定输入大小,将 $P_{\text{mid}}$ 用 KD-tree 邻域查询分解为 2048 点的重叠局部块,各块独立补全生成额外点精修局部表面结构,合并得到最终致密点云 $P_{\text{complete}}$,点数从约 2k 增至约 10k 以上。

图2:Spot 前左立体相机注册深度图(左)与 RGB 图像(右)。图像展示了传感器噪声和有限分辨率,说明深度补偿和点云补全的必要性。

抓取位姿生成。给定完整物体点云 $P_{\text{complete}}$,采样 1000 个候选 6-DoF 抓取。抓取集合定义为 $\mathcal{G}=\{g_{i}\}$,其中每个抓取 $g_{i}=(\mathbf{p}_{i},\mathbf{R}_{i})$,$\mathbf{p}_{i}$ 为位置,$\mathbf{R}_{i}$ 为旋转矩阵。致密化 $P_{\text{complete}}$ 改善法线稳定性,增加可行抓取假设的多样性。

碰撞过滤。对每个候选抓取 $g_i$ 检查末端执行器与场景障碍物的碰撞,过滤后得到无碰撞子集 $\mathcal{G}_{\text{free}}\subseteq\mathcal{G}$。

执行感知启发式排序。对无碰撞抓取集 $\mathcal{G}_{\text{free}}$ 中的每个抓取,计算综合代价:

$$\mathcal{C}(g_{i})=w_{\theta}\,|\Delta\theta_{i}|+w_{\phi}\,\phi_{i}+w_{c}\,\|\mathbf{p}_{i}-\mathbf{c}\|+\mathcal{P}(r_{i})$$

其中 $|\Delta\theta_{i}|$ 为末端执行器接近方向与当前臂构型的角度偏差,$\phi_{i}$ 为抓取方向与桌面法线的夹角,$\|\mathbf{p}_{i}-\mathbf{c}\|$ 为抓取点到工作空间中心的距离,$r_{i}=\|\mathbf{p}_{i}-\mathbf{p}_{\text{base}}\|$ 为抓取点到基座的距离。可达性惩罚函数定义为:

$$\mathcal{P}(r_{i})=\begin{cases}0,&r_{i}\leq r_{\max}\\M,&r_{i}>r_{\max}\end{cases}$$

当抓取点超出最大臂展 $r_{\max}$ 时施加常数惩罚 $M$。权重 $(w_{\theta},w_{\phi},w_{c})$ 和阈值 $r_{\max}$ 在代码仓库中记录。最优抓取通过最小化代价选择:

$$g^{\star}=\arg\min_{g_{i}\in\mathcal{G}_{\text{free}}}\;\mathcal{C}(g_{i})$$

flowchart TD
  A[操作员自然语言指令] --> B[GroundingDINO 开放词汇检测]
  B --> C[SAM 2 分割与追踪]
  C --> D[实例掩码 M]
  D --> E[nvblox 深度反投影]
  E --> F[物体中心点云提取]
  F --> G[深度补偿]
  G --> H[MGPC 补全
2048→8192 点] H --> I[PoinTr 局部块精修] I --> J[完整点云 P_complete] J --> K[GPG 采样 1000 候选抓取] K --> L[碰撞过滤 → G_free] L --> M[执行感知代价排序] M --> N[最优抓取 g*] N --> O{可达性检查} O -->|不可达| P[基座重新定位] P --> N O -->|可达| Q[预抓取接近] Q --> R[笛卡尔插入与夹爪闭合]

抓取执行与运动控制。选定最优抓取 $g^{\star}$ 后,系统先检查基座可达性:若抓取点超出臂的工作范围,则驱动机器人基座重新定位。然后执行预抓取位姿,沿抓取接近方向偏移安全距离 $\ell=5\,\text{cm}$:

$$g_{\text{pre}}=g^{\star}\oplus(\delta\,\hat{\mathbf{x}})$$

其中 $\hat{\mathbf{x}}$ 为接近方向单位向量。末端执行器移动到预抓取位姿后,执行短距离笛卡尔插入至目标抓取位姿,闭合夹爪固定物体。整个执行过程通过状态机控制,与 RGB-D 流同步。

实验设置

实验在 Boston Dynamics Spot 四足机器人上进行,配备 Spot Arm(6-DoF)和夹爪,使用机器人前左和前右 RGB-D 相机。RGB 图像以 $640\times480$ VGA 分辨率在 $15\,\text{Hz}$ 下采集,立体深度图为 $424\times240$ 像素。外部工作站配备两块 NVIDIA RTX A2000 GPU(12 GB)、125 GB 内存和 Intel Xeon w3-2435 CPU(16 核),运行 GroundingDINO、SAM 2、MGPC 和点云处理。系统基于 ROS 2 Humble/Jazzy 以 Docker 容器部署。

图3:实验场景。设置 A(左):目标为被箱子和电子元件遮挡的电钻;设置 B(右):目标为位于不同箱子后方的蓝色瓶子。

两个杂乱桌面场景用于评估:设置 A 的目标为被箱子和电子元件遮挡的手持电钻,设置 B 的目标为位于不同箱子后方的蓝色瓶子。每个场景 10 次试验(本文方法 5 次 + 基线 5 次),采用配对协议:同一初始位姿先执行本文方法再执行基线,跨配对改变初始位置。基线(视角依赖)使用相同感知前端和 GPG 抓取生成,但直接在单视角部分点云上规划抓取,不进行多帧累积或点云补全,且不从初始站位移动基座。

实验结果

场景运行目标本文方法基线(视角依赖)
A1电钻✗(可达性失败)
A2电钻✗(接近碰撞-杂物)
A3电钻✗(接近碰撞-杂物)
A4电钻✗(可达性失败)✗(可达性失败)
A5电钻✗(接近碰撞-杂物)
B1蓝瓶✗(接近碰撞-目标)
B2蓝瓶
B3蓝瓶✗(接近碰撞-杂物)
B4蓝瓶
B5蓝瓶
总成功率9/10(90%)3/10(30%)

本文方法在两个场景中均显著优于基线。设置 A(电钻场景)中,本文方法 4/5 成功而基线全部失败(0/5),基线的主要失败模式是接近碰撞(5 次中有 3 次因杂物碰撞失败)和可达性失败。设置 B(蓝瓶场景)中,本文方法 5/5 全部成功而基线仅 3/5 成功。总体成功率从基线的 30% 提升至 90%。

指标本文方法视角依赖基线提升
总成功率9/10(90%)3/10(30%)+60pp
设置 A 成功率4/5(80%)0/5(0%)+80pp
设置 B 成功率5/5(100%)3/5(60%)+40pp
接近碰撞失败次数05−5
可达性失败次数12−1

失败模式分析

本文方法唯一的失败发生在设置 A 第 4 次试验,原因是可达性失败——即使在基座重新定位后,目标电钻仍超出臂的工作范围。基线的失败模式则更为多样:设置 A 中 3 次因接近碰撞(杂物)失败、1 次可达性失败、1 次可达性失败;设置 B 中 1 次因接近碰撞(目标本身)失败、1 次因接近碰撞(杂物)失败。这表明基线在部分观测下生成的抓取候选质量低,频繁导致末端执行器与障碍物碰撞。

局限性

目标可见性与 VLM 接地。系统要求目标物体至少部分可见,若完全被遮挡则无法工作。GroundingDINO 的开放词汇检测能力受限于训练数据分布,对非常规物体名称可能产生误检或漏检。VLM 语义理解的可靠性直接影响后续流水线,但本文未深入分析语义失败传播。

深度质量仍是瓶颈。Spot 的立体深度传感器分辨率有限($424\times240$),噪声较大,对薄、镜面或透明物体的深度估计尤其困难。虽然深度补偿和点云补全缓解了部分问题,但补全网络可能在未见过的物体形状上产生不准确的几何估计,进而影响抓取质量。试验规模(10 次/2 场景/2 物体)较小,统计显著性有限。

关键观察

第一,物体中心点云补全(MGPC + PoinTr)是性能提升的核心驱动力——基线在单视角部分点云上生成的抓取候选质量差,频繁导致碰撞,而补全后的完整几何使 GPG 能生成更稳定、更多样化的可行抓取。第二,执行感知的抓取选择通过将接近方向偏差、桌面夹角、工作空间中心距离和可达性惩罚组合为统一代价函数,有效避免了不可达或高碰撞风险的抓取。第三,基座重新定位使系统能够处理初始视角下不可达的目标,这是固定基座方法无法实现的。

对巡检与维护的启示

本文的方法直接面向海上油气平台等巡检场景,核心价值在于将操作员的语言指令转化为可执行的物理操作。从"蓝色瓶子"到稳定抓取的完整流水线,填补了巡检机器人"能看不能做"的能力缺口。代码开源于 GitHub,基于 ROS 2 和 Docker 部署,为实际工程应用提供了可复现的基线。然而,当前验证仅限于受控桌面场景,距离实际海上部署还需解决动态场景、崎岖地形、认证安全和在线重规划等挑战。

与现有方法的对比分析

本文方法与传统抓取流水线的核心区别在于三个层面。在感知层面,大多数现有系统直接在单帧深度图上生成抓取候选,忽略了物体背面的几何信息。本文通过多帧累积和双级补全(MGPC + PoinTr)恢复完整物体几何,使 GPG 能够在更准确的法线估计基础上生成更多样化的可行抓取假设。实验数据表明,基线在设置 A 中 5 次试验全部失败,其中 3 次因接近碰撞(杂物)失败,这说明单视角部分点云上生成的抓取候选在接近执行时频繁与障碍物发生碰撞。

在决策层面,现有方法通常先生成抓取再检查可行性,属于"先选后筛"策略。本文将碰撞、间隙、可达性和接近方向约束统一编码为代价函数 $\mathcal{C}(g_i)$,采用"边选边筛"的执行感知策略,从 1000 个候选中直接选出综合代价最低的抓取。这种方式避免了先生成不可行抓取再过滤的计算浪费,也确保选出的抓取在执行层面具有更高的成功率。

在执行层面,基座重新定位是本文方法的独特优势。当最优抓取点 $g^{\star}$ 超出臂的工作范围 $r_{\max}$ 时,系统驱动机器人基座重新定位后重新评估可达性。这种移动操作(loco-manipulation)能力使系统能够处理固定基座方法无法触及的目标,这也是设置 B 中本文方法达到 5/5 全成功而基线仅 3/5 的重要原因之一。

值得注意的是,本文的 MGPC 补全网络需要将部分点云子采样至固定的 2048 点输入,输出 8192 点的合成点集。这一固定分辨率限制可能对大尺寸物体或细节丰富的物体造成信息损失。PoinTr 的分块补全策略部分缓解了这一问题,但分块大小和重叠率的选取仍需在计算效率和补全质量之间权衡。

总结

本文提出了一套面向腿式移动操作的语言引导抓取流水线,从操作员自然语言到物理抓取形成完整闭环。系统通过 GroundingDINO + SAM 2 实现语义接地,通过 nvblox 深度补偿 + MGPC + PoinTr 双级补全恢复完整物体几何,通过含碰撞/间隙/可达性/接近约束的执行感知代价函数选择最优抓取,并允许基座重新定位。在 Spot 平台的两个杂乱场景中,本文方法实现 9/10 成功率,相比视角依赖基线的 3/10 显著提升,验证了部分观测几何估计和执行感知抓取选择对杂乱环境下可靠抓取的关键作用。