PAPER DEEP DIVE
具有任务级交互的四足机器人自主抓取
四足机器人因其高机动性和穿越复杂地形的能力而在各种应用中越来越多地被使用。然而,在四足机器人上实现自主抓取仍面临挑战,特别是在需要任务级交互的场景中。本文研究了四足机器人在任务级交互下的自主抓取问题,提出了一种结合感知、规划和控制的框架,使四足机器人能够在非结构化环境中自主识别、接近并抓取目标物体。该方法考虑了行走与操作之间的协调,使机器人能够在保持平衡的同时执行精确的抓取操作。实验验证了该方法在多种物体和场景下的有效性和鲁棒性。
面向四足机器人的任务级交互自主抓取
论文:Autonomous Grasping On Quadruped Robot With Task Level Interaction
作者:Muhtadin, Mochammad Hilmi Rusydiansyah, Mauridhi Hery Purnomo, I Ketut Eddy Purnama, Chastine Fatichah
机构:印度尼西亚泗水十一月理工学院(ITS)电气工程系/计算机工程系/信息学系
链接:arXiv:2512.01052
一句话总结
本文在 DeepRobotics Lite3 四足机器人上集成 OpenManipulator-X 机械臂与夹爪,通过分层 ROS 架构和有限状态机实现任务级人机交互——操作员只需在 Web 界面上选择目标房间并点击目标物体,机器人即自主完成导航、YOLOv8 目标检测、GraspNet 抓取位姿规划与执行。系统采用三级过滤策略从大量候选抓取中选取最优位姿,并在 12 次真实场景试验中取得 75% 的抓取成功率。
研究背景与动机
四足机器人因其高机动性和多样地形适应能力,在复杂环境中受到越来越多的关注。四足结构比双足更稳定,比轮式在不平地形上机动性更强,能够模拟狗或马等动物的运动方式。然而,大多数商业四足机器人缺乏操作能力——它们仅作为移动平台用于监控或探索,配备感知系统用于导航和环境感知,但不包含机械臂或夹爪等执行器用于物理交互。这极大地限制了四足机器人作为服务机器人的应用潜力。
将操作器集成到四足机器人上引入了显著的控制挑战,尤其在远程操作场景中。操作员必须同时管理机器人移动和精确的臂运动来实现有效操作。这种复杂性因操作员与机器人周围环境的视角差异而加剧——操作员通过有限的视觉反馈判断物体位置和朝向容易出错,通信延迟进一步降低控制有效性。因此,集成操作器的四足机器人需要更先进的自动化控制系统来确保直观、高效、可靠的环境交互。
本文的核心设计理念是任务级交互——操作员不直接控制机器人关节或运动速度,而是给出高层任务指令(如"去卧室""抓那个充电器"),机器人自主分解和执行。这种设计将操作员从低级控制中解放,使其聚焦于任务目标而非运动细节,显著降低了远程操作的认知负荷和出错率。该理念借鉴了 Zhang 等人的任务级人机交互系统和 Wanyan 等人的 YOLO-GraspNet 架构,但在此基础上构建了从导航到抓取的完整自主流水线。
系统硬件设计
系统由两个子系统构成,通过中央感知主机协调。四足侧采用 DeepRobotics Lite3 平台,配备 ARM RK3588 处理器的运动主机管理腿电机驱动和传感器通信。传感器配置包括:广角相机用于环境探索、Intel RealSense D435i 深度相机用于深度导航、超声波雷达通过 UART 接口进行近距感知、LiDAR 通过 Ethernet 接口进行 360° 建图和避障。臂侧采用 OpenManipulator-X 机械臂,该臂为模块化设计,由 Dynamixel 智能执行器驱动,提供高精度集成位置控制和串行通信能力,由 OpenCR 板控制。臂末端同样配备 Intel RealSense D435i 深度相机用于操作阶段的 3D 视觉感知。两个子系统由 NVIDIA Jetson Orin NX 感知主机统一协调——该模块专为边缘 AI 应用设计,支持深度学习推理和实时机器人控制。安装支架使用 Onshape CAD 软件设计并 3D 打印完成。
图1:硬件系统架构图。感知主机(Jetson Orin NX)居中协调四足侧(Lite3 + RK3588)和臂侧(OpenManipulator-X + OpenCR)两个子系统。
用户接口设计
用户界面基于 ROS WebSocket 桥接实现 Web 仪表板,无需安装专用软件即可操作。界面提供双路实时视频流:四足前置相机(左侧)和臂末端夹爪相机(右侧)。顶部切换开关激活 YOLOv8 目标检测,在检测到的物体上实时叠加边界框。状态面板显示机器人当前状态(扫描、跟踪、抓取等)。下部分为三个功能块:左侧块通过下拉菜单选择目标房间并点击"Go"启动导航;中间块显示机器人当前位置并提供"Begin Scan"和"Stop"按钮控制环形搜索;右侧块提供实时操作状态,指示机器人是否正在搜索、已检测到目标物体或正在执行特定任务。这种布局确保了与任务级架构一致的直观控制和监控。
图2:Web 界面。用户可选择目标房间、监控位置、控制搜索动作、查看实时视频流和操作状态。
有限状态机工作流
系统通过有限状态机(FSM)将完整任务分解为结构化阶段,模块化协调导航和操作动作,同时在各状态保持用户交互灵活性。FSM 结构使机器人遵循系统化的顺序工作流,同时在关键阶段保持用户控制,既简化了系统协调,又为复杂动态的真实场景提供了适应性。具体执行步骤为:(1) 机器人从初始点自主导航至用户选择的目标房间;(2) 机器人扫描房间检测物体,用户选择一个后机器人接近并坐在物体旁;(3) 使用臂上相机,用户选择特定物体进行抓取,触发臂执行抓取操作;(4) 机器人将抓取的物体运回初始点并放置在指定位置。
flowchart TD A["初始位置"] --> B["自主导航至目标房间
(LiDAR SLAM + Nav Stack)"] B --> C["环形扫描检测物体
(YOLOv8n)"] C --> D["用户选择目标物体"] D --> E["接近物体并坐下
(PID 控制器 + CSRT 跟踪)"] E --> F["臂相机检测物体
(YOLOv8n)"] F --> G["用户点击选择物体"] G --> H["GraspNet 生成候选抓取"] H --> I["三级过滤选最优抓取"] I --> J["坐标系变换
(相机帧→机器人基座帧)"] J --> K["运动规划执行抓取"] K --> L["运输物体返回初始点"] L --> M["放置物体"]
导航系统
建图和定位使用 Koide 等人提出的 hdl_graph_slam 和 hdl_localization,基于 LiDAR 点云数据。导航系统集成目标检测和跟踪作为移动决策的基础。目标检测使用 YOLOv8n 模型,从 RGB 相机帧中实时识别多个物体。用户可通过点击或拖拽选择目标物体(拖拽选择用于应对检测不一致的情况),之后系统从检测模式切换到跟踪模式,使用 cv2.TrackerCSRT_create() 跟踪器——该跟踪器对尺度变化和部分遮挡具有鲁棒性。实时路径规划和避障由 ROS Navigation Stack 管理,而 PID 控制器根据跟踪器的视觉反馈(x 和距离误差)调整线速度和角速度。导航过程的输出是机器人定位在选定物体附近并处于坐姿,该位置被认为最适合执行操作任务。
PID 控制器的控制律为:
$$v(t) = K_p \, e(t) + K_i \int_0^t e(\tau)\,d\tau + K_d \frac{de(t)}{dt}$$其中 $e(t)$ 为当前帧中目标物体中心与图像中心的横向偏差和距离误差,$K_p$、$K_i$、$K_d$ 分别为比例、积分、微分增益。线速度和角速度根据该控制律实时调整,使机器人朝目标物体移动并保持在适当距离。
操作(抓取)系统
当四足机器人完成导航任务并在目标物体附近处于坐姿后,操作流程启动。机械臂首先移动到最高可达位置,以获得更宽的相机视野。然后臂载相机流式传输 RGB 视频,在其上应用 YOLOv8n 模型检测周围物体。检测到的物体被边界框包围,用户可通过直接点击选择特定物体进行操作。系统还提供拖拽选择功能——用户可在目标物体周围绘制矩形区域,系统通过弹出通知确认选择,用户可重试直到目标物体被准确高亮。
确认选择后,系统捕获并存储三个必要的输入文件:RGB 彩色帧、对齐的深度帧和相机内参矩阵。这些输入是使用 GraspNet 框架生成抓取候选的先决条件。值得注意的是,GraspNet 对物体身份和位置是不可知的——它对整个输入场景生成抓取位姿。为确保抓取位姿仅在选定物体周围生成,应用了掩膜处理:仅保留选定边界框内的像素,使 GraspNet 专注于目标物体。随后,彩色帧、深度帧和相机矩阵传入 GraspNet,框架输出一组抓取候选,每个候选包含位姿参数和抓取质量度量。
图3:抓取位姿过滤过程。GraspNet 生成大量候选抓取位姿,通过三级过滤策略选取最优执行位姿。
三级抓取位姿过滤策略
从 GraspNet 生成的大量抓取位姿中,仅选取一个最优抓取执行。这需要一个过滤过程来识别机械臂最可行和最可靠的抓取配置。
第一级——置信度评分。置信度评分反映了基于物体几何结构和 GraspNet 深度学习模型预测输出的抓取执行成功概率。评分越高表示夹爪能够稳定抓取物体而不滑落、错过或不稳定的概率越大。此阶段选择置信度评分最高的前 20 个抓取位姿,有效消除可能导致失败的低置信度候选。GraspNet 的置信度评分可表示为:
$$S_{grasp} = f_\theta\!\left(P_{scene},\, D_{aligned}\right)$$其中 $f_\theta$ 为 GraspNet 深度学习模型,$P_{scene}$ 为场景点云,$D_{aligned}$ 为对齐深度图。模型输出每个候选抓取的置信度评分 $S_{grasp} \in [0,1]$。
第二级——距离物体中心。在精密抓取中,偏离物体质心较远的位姿可能导致不平衡或不稳定的抓取。在剩余候选中,选择最接近物体中心点的位姿,确保在目标物体上更物理安全和对称的抓取位置。距离度量为:
$$d = \left\| \mathbf{p}_{grasp} - \mathbf{p}_{center} \right\|_2$$其中 $\mathbf{p}_{grasp}$ 为候选抓取位姿的位置,$\mathbf{p}_{center}$ 为选定物体的中心点(由边界框计算)。选择 $d$ 最小的候选。
第三级——朝向调整。尽管 GraspNet 输出完整的 6-DOF 位姿,但由于机械臂的运动学限制或关节配置,该朝向可能无法直接执行。因此,对选定的抓取位姿矩阵施加旋转,将其转换为可达且可执行的朝向,避免极端关节角度或运动不连续。旋转矩阵变换为:
$$\mathbf{T}_{adjusted} = \mathbf{R}_{adj} \cdot \mathbf{T}_{grasp}$$其中 $\mathbf{T}_{grasp}$ 为 GraspNet 输出的原始抓取位姿(4×4 齐次变换矩阵),$\mathbf{R}_{adj}$ 为根据机械臂运动学约束计算的调整旋转矩阵。通过三级过滤,系统确定一个高置信度、物理可行且在抓取稳定性方面最优的单一抓取位姿。
坐标系变换
GraspNet 估计的抓取位姿定义在相机坐标系中,而非机器人坐标系。位置和朝向(包含平移和旋转值)以相机坐标系提供——原点在相机镜头处,坐标轴对齐相机朝向。这种表示虽然便于从相机视角解释物体的空间属性,但不足以直接用于机器人运动执行。要实现机器人操作,需要将抓取位姿从相机坐标系变换到机器人基座(世界)坐标系:
$$\mathbf{T}_{base}^{grasp} = \mathbf{T}_{base}^{camera} \cdot \mathbf{T}_{camera}^{grasp}$$其中 $\mathbf{T}_{camera}^{grasp}$ 为 GraspNet 输出的抓取位姿(相机坐标系下),$\mathbf{T}_{base}^{camera}$ 为相机相对于机器人基座的位姿(由机械臂运动学模型确定)。该变换同时包含平移和旋转,准确表示相机相对于机器人的位置和朝向。变换后的位姿数据传递给运动规划模块,生成机械臂到达并执行抓取任务的轨迹。
实验结果
为验证所提系统并评估其在真实场景中的性能,进行了一系列涉及导航和物体操作的实验。实验设计展示集成系统——包括目标检测、自主导航、视觉跟踪、抓取规划和运动执行——如何从用户指令到物体交付协同完成任务。
在接近物体的运动评估中,物体相对于机器人的位置虽有变化但保持在较近范围内,确保成功操作。测量的最终位置值表明,物体通常位于机器人前方略偏右,坐标范围为 (24 cm, 5 cm) 到 (27 cm, 16 cm)。机器人到物体的距离由最终 (x, y) 位置计算,范围在 24.52 cm 到 33.42 cm 之间。
| 试验 | 物体 | 选择方式 | 耗时 | 抓取结果 |
|---|---|---|---|---|
| 1 | 充电器 | 拖拽 | 64 秒 | 成功 |
| 2 | 充电器 | 拖拽 | 61 秒 | 成功 |
| 3 | 充电器 | 点击 | 60 秒 | 成功 |
| 4 | 充电器 | 点击 | 58 秒 | 成功 |
| 5 | 高尔夫球 | 点击 | 20 秒 | 失败 |
| 6 | 高尔夫球 | 点击 | 55 秒 | 成功 |
| 7 | 高尔夫球 | 点击 | 59 秒 | 成功 |
| 8 | 高尔夫球 | 点击 | 17 秒 | 失败 |
| 9 | 电池 | 点击 | 63 秒 | 成功 |
| 10 | 电池 | 点击 | 57 秒 | 成功 |
| 11 | 电池 | 点击 | 24 秒 | 失败 |
| 12 | 电池 | 点击 | 61 秒 | 成功 |
抓取测试取得了令人鼓舞的结果,机器人在 12 次试验中达到 75% 的成功率。充电器等稳定物体表现出高成功率。然而,系统在处理高尔夫球等小而滑的物体和电池等较重物品时遇到了显著挑战。这些发现表明需要在抓取力和夹爪可靠性方面进一步改进。
| 物体类型 | 试验次数 | 成功次数 | 成功率 | 失败原因 |
|---|---|---|---|---|
| 充电器 | 4 | 4 | 100% | — |
| 高尔夫球 | 4 | 2 | 50% | 球形物体滑动/滚落 |
| 电池 | 4 | 3 | 75% | 重量过大导致夹爪不稳 |
| 总计 | 12 | 9 | 75% | — |
图4:机器人执行抓取动作的实拍。机械臂根据过滤后的最优抓取位姿完成物体抓取。
失败案例分析
在失败的试验中,根据物体特征和抓取条件识别出具体挑战。第 5 次试验中,高尔夫球抓取失败是因为球在抓取过程中滑落——球形的几何形状比盒形充电器提供的表面稳定性更小,容易滑动。第 8 次试验中,高尔夫球在夹爪轻微碰触后滚走,再次凸显了处理球形物体的固有困难——它们被扰动时不会保持静止。第 11 次试验中,电池抓取失败是因为电池比其他测试物体更重,不适当的抓取力矩不足以稳定抓持。这些失败案例为未来改进提供了明确方向:需要力感知夹爪、自适应抓取力控制以及针对小尺寸/球形物体的专用策略。
局限性与未来方向
局限一:物体形状和尺寸适应性不足。 系统对球形物体(如高尔夫球)的抓取成功率仅 50%,因为现有夹爪缺乏足够的摩擦力和包络度来稳定抓持曲面物体。对于较重物体(如电池),夹爪的负载能力也构成瓶颈。这限制了系统在多样化物体场景中的通用性。
局限二:抓取力缺乏力反馈控制。 当前系统使用开环抓取力——夹爪以预设力度闭合,无法根据物体重量和材质实时调整。这导致了重物抓取不稳和轻物过度用力的问题。引入力/触觉传感器形成闭环力控将显著提升抓取可靠性。
局限三:环境结构化程度要求高。 导航和建图依赖 LiDAR 在结构化室内环境中的表现,对于高度动态或非结构化环境(如户外、杂物堆积场景)的适应性尚未验证。YOLOv8n 的检测精度也受光照和遮挡影响。
未来工作方向包括:集成力/触觉传感器实现闭环抓取力控制、扩展物体检测模型支持更多类别和材质、探索基于学习的自适应抓取策略以替代固定三级过滤、以及在更多样化的真实场景中验证系统鲁棒性。
总结
本文提出了一种在四足机器人上实现自主抓取的任务级交互系统。系统通过硬件集成(Lite3 + OpenManipulator-X + Jetson Orin NX)、分层 ROS 架构和有限状态机,将操作员的高层任务指令(选择房间、点击物体)自主分解为导航、检测、跟踪、抓取规划和执行的完整流水线。核心技术贡献包括:基于 GraspNet 的三级过滤策略(置信度评分→距离中心→朝向调整)确保选取最优可行抓取位姿;坐标系变换将相机帧下的抓取位姿准确映射到机器人基座帧;PID 控制器结合 CSRT 跟踪器实现可靠的接近运动。12 次真实场景试验中 75% 的成功率验证了系统的有效性,同时失败案例揭示了在物体形状适应性和力反馈控制方面的改进空间。该工作展示了四足机器人作为服务机器人在真实环境中执行物理交互任务的潜力,为后续在更复杂场景中的应用奠定了基础。



