PAPER DEEP DIVE
优化腿式机器人的抓取:移动操作的深度学习方法
本文提出了一种深度学习框架,旨在增强四足机器人配备操作臂后的抓取能力,以实现移动操作。该方法利用深度学习模型从感知数据中预测最优抓取策略,使机器人能够在行走过程中识别和抓取目标物体。框架结合了视觉感知、抓取规划和运动控制,形成端到端的移动操作系统。通过仿真和真实世界实验,验证了该方法在多种物体形状和场景下的抓取成功率和鲁棒性。结果表明,深度学习方法能够有效提升腿式机器人在移动操作场景中的抓取性能。
优化足式机器人抓取:面向操作-移动的深度学习方法
论文:Optimizing Grasping in Legged Robots: A Deep Learning Approach to Loco-Manipulation
作者:Dilermando Almeida, Guilherme Lazzarini, Juliano Negri, Thiago H. Segreto, Ricardo V. Godoy, Marcelo Becker
机构:巴西乌贝兰迪亚联邦大学机械工程学院;圣保罗大学机械工程系
链接:arXiv:2508.17466
一句话总结
本文提出一种基于深度学习的四足机器人抓取框架,利用 Genesis 仿真环境生成合成抓取数据集,训练 U-Net 架构 CNN 从 RGB-D 多模态输入(RGB图像、深度图、分割掩膜、表面法线图)预测像素级抓取质量热力图,在 Boston Dynamics Spot 机器人上完成从自主导航到目标物体、感知、预测最优抓取点位姿并执行精确抓取的完整操作-移动任务。
研究背景与动机
四足机器人已成为高效且通用的平台,在传统轮式机器人可能失败复杂和非结构化地形上表现出色。为这些机器人配备操作臂解锁了操作-移动(loco-manipulation)能力,使其能在工业自动化到搜救任务等领域执行复杂的物理交互任务。然而,在这种动态场景中实现精确且自适应的抓取仍是重大挑战,往往受限于对大量真实世界校准和预编程抓取配置的需求。
传统方法依赖预定义抓取配置或密集的手工校准,限制了灵活性。深度学习通过让机器人从数据中学习泛化的抓取策略显示出前景。本文受此启发,提出专为四足机器人设计的新型深度学习框架,目标是训练一个能从 RGB-D 数据识别物体并确定最优抓取点的模型。不同于大多数返回末端执行器开度、朝向和抓取质量的机器学习算法,本文构建了一个集成预训练目标检测模型、监督学习最优抓取点分类模型和法线估计模型的流水线。
核心创新包括:(1) 在 Genesis 仿真器上开发仿真训练流水线,支持大规模并行数据采集且无需真实数据;(2) 引入 D2NT 等先进感知方法提升基于深度的抓取精度并降低 ML 执行计算成本;(3) 开发能集成高层控制 API 和缺乏底层访问的商业机器人的灵活框架;(4) 在物理机器人上验证方法的有效性。
合成数据集生成
训练数据完全在 Genesis 仿真环境中从连续抓取尝试中生成。Genesis 是为物理 AI/机器人/具身智能设计的仿真平台,主要优势是能高效仿真并行环境并提供 RGB 和深度相机。选择水瓶 3D 模型作为抓取目标。
第一步:虚拟相机数据采集。将物品固定在原点,在由 X 轴 100 点和 Z 轴 10 点(均在 -0.5m 到 0.5m 之间)组成的二维网格上采样相机位置,Y 轴固定在 $y = 0.5$ m。这产生 1000 个不同位置,每个相机看向 X、Y 坐标(-0.03m 到 0.03m)和 Z 坐标(0m 到 0.09m)的略微随机点。由此生成 1000 个不同视角,每个视角包含 RGB、深度、分割掩膜和法线图信息。
第二步:抓取标注。对每张图像中物体的每个像素生成抓取位姿并标注成功或失败。利用仿真器分割掩膜,为物体分割掩膜中每个选定像素分配一个末端执行器尝试抓取。像素坐标转换为仿真环境全局坐标系,连同该点的法线。末端执行器初始位于距物体 1.0m 处,朝向平行于地面指向物体,然后尝试在距物体表面 0.35m 处按法线对齐抓取。抓取成功判据为:夹爪所有给定点与瓶子碰撞且无其他外部碰撞(如接触地面)。生成抓取掩膜:成功像素标记1,失败标记0,物体分割掩膜外区域标记-1(不确定)。
图1:数据集地面真值可视化。绿色像素表示成功抓取区域,红色表示失败区域,分割掩膜外为不确定区域。
CNN 模型架构
设计了一个全卷积编码器-解码器架构(类似 U-Net)执行语义分割,从多通道 RGB-D 传感器数据中识别最优抓取点。编码器基于 MobileNetV2 系统性地提取特征并降低空间分辨率。解码器使用转置卷积上采样,并通过跳跃连接合并编码器的细粒度特征——这对精确定位至关重要。模型约 544 万可训练参数,解码器使用 GroupNorm 提升训练稳定性。最终 1×1 卷积产生单通道输出图,最高值像素表示最佳预测抓取点。
模型在 Genesis 仿真环境中完全生成的合成数据集上训练,虚拟 RGB-D 相机分辨率为 480×640,与物理传感器规格一致。地面真值为同分辨率的抓取质量图,每像素基于仿真抓取结果标注:成功为1,失败为0,不确定区域为-1。
图2:模型预测最优抓取点。输入(法线图、深度图、分割掩膜、RGB图像)经CNN处理生成最优抓取点热力图,红点表示最优抓取点。
抓取流水线部署
在 Boston Dynamics Spot 平台上部署完整流水线。Spot 配备 6 自由度操作臂和爪式夹爪,末端执行器上安装 RGB 相机和深度传感器。使用 YOLOv11 预训练视觉模型进行目标检测和分割,生成边界框和精确二值掩膜。
flowchart TD A["机器人识别物体并导航至1m处"] --> B["初始化夹爪为打开状态"] B --> C["RGB-D相机采集同步图像
480x640分辨率"] C --> D["YOLOv11目标检测分割"] C --> E["D2NT法线图估计
从深度梯度计算表面法线"] D --> F["数据预处理
归一化/对齐/单位法线"] E --> F F --> G["CNN预测抓取质量热力图"] G --> H["选取最优像素并计算3D坐标"] H --> I["法线转四元数
生成抓取位姿"] I --> J["SDK发送抓取命令
力限控制闭合夹爪"]
3D 坐标计算。从选定的最优像素 $(u, v)$ 和其深度值 $z$,利用相机内参计算 3D 坐标:
$$x = \frac{(u - u_0) \, z}{f_x}, \quad y = \frac{(v - v_0) \, z}{f_y}, \quad z = \text{depth}$$其中焦距 , f_y pprox 554.26$ 像素,主点 $ 为图像中心。该针孔相机模型将 2D 像素坐标反向投影到 3D 空间,是抓取位姿计算的基础。法线向量转换为欧拉角再转为四元数以便操作臂控制。深度图通过 D2NT 算法转换为法线图,该算法基于深度梯度估计表面法线。
D2NT 法线估计原理。D2NT 算法直接从深度图计算表面法线,无需先构建完整 3D 点云。对于像素 $ 处的深度值 $,其 3D 点为 = (x, y, z)$。法线通过深度图的局部梯度计算——取相邻像素的 3D 点差分构建切平面,法线为切平面的法向量。法线向量 $\mathbf{n} = (n_x, n_y, n_z)$ 归一化为单位长度后用于确定夹爪朝向,使夹爪与物体表面对齐。归一化公式为:
$$\hat{\mathbf{n}} = rac{\mathbf{n}}{\|\mathbf{n}\|} = rac{(n_x, n_y, n_z)}{\sqrt{n_x^2 + n_y^2 + n_z^2}}$$
U-Net 损失函数。CNN 模型训练使用像素级交叉熵损失。对于预测的抓取质量图 $\hat{Y}$ 和地面真值 $(成功为1、失败为0、不确定为-1),损失函数定义为:
$$\mathcal{L} = -rac{1}{|\Omega|} \sum_{i \in \Omega} \left[ Y_i \log(\hat{Y}_i) + (1-Y_i) \log(1-\hat{Y}_i) ight]$$
其中 $\Omega$ 为物体分割掩膜内的有效像素集合(排除不确定区域),$|\Omega|$ 为有效像素数。该损失促使模型在物体区域内区分可抓取和不可抓取像素。
抓取成功率指标。仿真数据集中,抓取成功判据基于碰撞信息。设夹爪接触点集合为 $\mathcal{G}$,物体碰撞几何为 $\mathcal{O}$,地面碰撞几何为 $\mathcal{E}$,成功判据可形式化为:
$$ ext{success}(u,v) = egin{cases} 1 & ext{if } orall g \in \mathcal{G}, \, g \cap \mathcal{O} eq \emptyset \, \land \, \mathcal{G} \cap \mathcal{E} = \emptyset \ 0 & ext{otherwise} \end{cases}$$
即所有夹爪接触点均与物体碰撞且无地面等其他碰撞时判定成功。这一严格判据确保了合成数据的标注质量。
MobileNetV2 编码器设计。编码器基于 MobileNetV2,采用深度可分离卷积大幅降低参数量和计算量。深度可分离卷积将标准卷积分解为逐通道卷积和逐点卷积,计算量为:
$$C_{DSConv} = D_K^2 \cdot M \cdot D_F^2 + M \cdot N \cdot D_F^2$$
其中 $ 为卷积核尺寸,$ 为输入通道数,$ 为输出通道数,$ 为特征图尺寸。相比标准卷积 {std} = D_K^2 \cdot M \cdot N \cdot D_F^2$,计算量降低约 /N + 1/D_K^2$ 倍,使 544 万参数的模型能在机器人端高效推理。
YOLOv11 分割与 D2NT 并行处理。流水线中 YOLOv11 目标分割和 D2NT 法线估计并行执行,降低延迟。YOLOv11 在 RGB 图像上运行生成物体二值掩膜 {seg}$,D2NT 在深度图上运行生成法线图 {map}$。两者结果在预处理阶段对齐——掩膜用于约束 CNN 预测仅关注物体区域,法线图提供夹爪朝向信息。这种并行设计将感知延迟从串行的 {YOLO} + t_{D2NT}$ 降低到 $\max(t_{YOLO}, t_{D2NT})$。
其中焦距 , f_y \approx 554.26$ 像素为焦距,$(u_0=320, v_0=240)$ 为主点。法线向量转换为欧拉角再转为四元数以便操作臂控制。深度图通过 D2NT 算法转换为法线图,该算法基于深度梯度估计表面法线,使用近似相机内参计算 3D 点云和法线。
力限控制。通过 SDK 实现力限控制——末端执行器接触时检测力,检测到物体阻力后停止施加额外力,适应外力并保持稳定抓持。最大力矩 3.0 Nm,降低滑动或过度施力风险,适应瓶子表面的轻微错位或不规则。
图3:抓取流水线方案。机器人寻找并走向物体→初始化RGB-D采集→并行处理目标分割和法线图生成→预测抓取点→计算抓取参数→执行抓取。
| 数据集参数 | 值 | 说明 |
|---|---|---|
| 相机视角数 | 1000 | 100x10网格采样 |
| 相机距离 | 0.5m | Y轴固定 |
| 抓取距离 | 0.35m | 距物体表面 |
| 图像分辨率 | 480x640 | 与物理传感器一致 |
| 标注类别 | 3类(1/0/-1) | 成功/失败/不确定 |
仿真到现实的迁移策略。本文的 sim-to-real 策略核心在于:仿真中使用的虚拟相机规格与 Spot 末端执行器上的物理 RGB-D 传感器完全一致(480x640 分辨率),确保训练数据分布与推理时输入分布对齐。然而实际部署中仍存在差距——物理深度传感器的噪声和精度限制导致深度图质量低于仿真。D2NT 法线估计对深度噪声敏感,低质量深度图会导致法线估计偏差进而影响夹爪朝向。作者通过在预处理阶段归一化像素强度(RGB和深度到[0,1])和确保法线向量单位长度来部分缓解此问题。未来通过深度图去噪可进一步提升 sim-to-real 一致性。
力限控制的工程意义。Spot SDK 提供的力限控制通过检测末端执行器接触力实现自适应抓取。当夹爪检测到物体阻力时停止施加额外力,避免过度挤压损坏物体或夹爪。3.0 Nm 的最大力矩限制是针对保温瓶等刚性物体的合理设置——足以稳定夹持但不会变形。这种力限策略比固定力矩闭合更安全,尤其对表面光滑的圆柱物体可适应轻微错位。然而力限控制的效果受 SDK 响应延迟影响,低层力控可能提供更精确的力调节。
实验结果
系统在真实环境中成功执行了完整的操作-移动任务:自主导航至目标保温瓶、用传感器感知、用模型预测最优抓取位姿、执行精确抓取。保温瓶具有圆柱几何和平滑表面,适合评估抓取性能。
| 组件 | 技术 | 规格 |
|---|---|---|
| 机器人平台 | Boston Dynamics Spot | 四足 + 6DOF臂 + 爪式夹爪 |
| 目标检测 | YOLOv11 | 实时检测+分割 |
| 法线估计 | D2NT | 从深度梯度计算 |
| 抓取预测 | U-Net CNN | 5.44M参数,MobileNetV2编码器 |
| 仿真平台 | Genesis | 1000视角并行采集 |
| 相机分辨率 | RGB-D | 480×640像素 |
| 最大力矩 | 力限控制 | 3.0 Nm |
图4:真实场景中夹爪RGB-D相机采集的处理数据。(a)RGB图像 (b)深度图 (c)YOLOv11分割掩膜 (d)D2NT法线图 (e)抓取概率热力图 (f)最优抓取区域。
并行仿真数据生成的优势。Genesis 仿真器的并行环境能力是本文数据生成的关键优势。传统仿真中逐个尝试抓取位姿耗时巨大——1000个视角每个包含数百像素的抓取尝试,串行执行需要数天。Genesis 支持同时运行多个并行环境,如图2所示5个夹爪同时执行抓取尝试,大幅缩短数据生成时间。这种可扩展性意味着新增物体类别只需在仿真中导入新3D模型并重复数据生成流程,无需真实机器人采集,极大降低了扩展成本。
与 GraspNet 等方法的对比。与 GraspNet 等生成大量候选抓取并过滤的方法不同,本文直接学习像素到抓取质量的映射,端到端输出最优抓取点。这种方法的优势在于推理速度快——单次前向传播即可获得抓取热力图,无需多阶段过滤。但劣势是泛化性受限于训练数据中物体的多样性——当前仅训练水瓶模型,而 GraspNet 对未见物体具有更好的泛化性。未来扩展训练数据集可弥补这一差距。
跳跃连接的定位作用。U-Net 架构中的跳跃连接将编码器各层的细粒度特征直接传递到解码器对应层,这对于精确的像素级抓取点定位至关重要。编码器在下采样过程中丢失的空间细节通过跳跃连接在解码器中恢复,使模型既能利用深层语义信息判断抓取可行性,又能保持高分辨率的定位精度。没有跳跃连接,模型可能知道抓取区域的大致位置但无法精确定位到具体像素,这对需要毫米级精度的机器人抓取是致命的。
GroupNorm 在解码器中的使用避免了小 batch 下 BatchNorm 的不稳定问题,确保训练收敛。
这一设计选择体现了在有限计算资源下平衡精度与效率的工程考量。
局限性与未来方向
局限一:模型泛化能力有限。 ML 模型的泛化受限于物体几何和纹理变化,仅对具有特定特征的物体有效。训练数据集仅包含水瓶模型,对其他形状、尺寸和纹理的物体泛化性不足。作者明确指出需扩展数据集包含更多样化物体并使用数据增强技术。
局限二:深度图噪声问题。 实时 RGB-D 数据集成存在困难——末端执行器深度传感器质量低导致深度图噪声,分割掩膜需调整大小偶尔影响预处理一致性。这降低了 D2NT 法线估计和像素到 3D 坐标转换的精度。作者建议使用平滑滤波器或专用 ML 模型进行深度图去噪。
局限三:依赖机器人 SDK 限制。 当前流水线依赖 Boston Dynamics SDK 提供的工具进行移动和操作控制,缺乏低层访问能力限制了在动态场景中的鲁棒性。未来将探索超越 SDK 的移动和操作策略。
未来方向包括:扩展训练数据集覆盖更多物体形状/尺寸/纹理并使用数据增强、深度图去噪(平滑滤波或专用ML模型)、探索超越SDK的移动操作策略、在多物体和不规则表面的更复杂环境中测试。
总结
本文提出了一种创新的四足机器人操作-移动流水线,集成深度学习目标分割模型与表面法线估计方法。核心技术路线是:利用 Genesis 仿真环境的并行仿真能力,从 1000 个视角生成完全合成的抓取标注数据集(无需真实数据);训练基于 MobileNetV2 编码器的 U-Net 架构 CNN(544万参数),从 RGB-D 多模态输入预测像素级抓取质量热力图;部署时集成 YOLOv11 目标检测、D2NT 法线估计和 CNN 抓取预测,通过针孔相机模型将最优像素转换为 3D 坐标和四元数位姿,力限控制执行抓取。在 Spot 机器人上成功验证了从导航到抓取的完整操作-移动任务。该工作证明了仿真训练加先进感知的 sim-to-real 方法在四足机器人物体处理中的可扩展性和有效性,为搜救、物流和家居交互等实际应用提供了可行方案。


