PAPER DEEP DIVE
VTAP夹爪:协同指尖传感与视觉触觉主动掌面实现灵巧手内操作
VTAP夹爪将指尖触觉传感与视觉触觉主动掌面协同,实现灵巧的手内操作,融合感知与主动控制。
一句话总结:本文提出 VTAP 夹爪——集成视觉-触觉双模态主动手掌与配备触觉阵列传感器的柔性可重构手指,通过手指-手掌协同和多模态感知实现鲁棒抓取与精细操作,无需高自由度拟人化设计即可完成注射器重定向、物体分离和轴孔装配等挑战性任务。
1. 研究背景与动机
机器人正从结构化工业场景转向面向消费者的服务场景,需要在动态、半结构化的人类环境中操作。工业环境中的操作通常是受控工作单元内的预定义拾放操作,而真实人类环境涉及多样物体、杂乱和变化的接触条件,要求机器人执行手内重定向、精确对齐等抓后操作。
平行夹爪因机械简单、易于控制而广泛使用,但其有限的重构能力限制了灵巧任务。拟人化手虽具高灵巧性,但体积大、昂贵且难以控制。多指夹爪旨在平衡驱动复杂度与灵巧性,尤其通过触觉反馈增强后,但仍面临两大挑战:
- 手掌交互被忽视:现有夹爪的感知和驱动主要集中在手指上,手掌-物体接触在许多抓取和操作任务中至关重要却常被忽略。主动手掌通过实现可控的物体操作解决这一问题,尤其在手内操作场景中,手指和手掌间的协调接触再分配至关重要。
- 单一感知模态不足:仅依赖视觉或仅依赖触觉的单一模态往往不足以实现全面的环境感知。将触觉和视觉感知整合到统一框架中可有效缓解遮挡问题并增强感知鲁棒性,但紧凑地将指尖触觉、手掌触觉和视觉感知集成到单一夹爪设计中仍具挑战性。
2. 硬件设计
2.1 手指运动学
VTAP 夹爪采用三指结构,每根手指基于 Fin-Ray 柔性原理设计,配备四个关节 $q_1$ 至 $q_4$。手指正向运动学通过一系列齐次变换矩阵描述:
$$\begin{cases}{}^{1}_{\mathcal{O}}\mathbf{T}=\mathbf{D}_{\mathbf{p}_1}\mathbf{R}_Z(\phi)\mathbf{R}_Y\left(\frac{\pi}{2}\right)\mathbf{R}_X(-q_1)\\ {}^{2}_{1}\mathbf{T}=\mathbf{D}_{\mathbf{l}_1}\mathbf{R}_Z\left(-\frac{\pi}{2}\right)\mathbf{R}_X\left(\frac{\pi}{2}+q_2\right)\\ {}^{3}_{2}\mathbf{T}=\mathbf{D}_{\mathbf{l}_2}\mathbf{R}_Z\left(-\frac{\pi}{2}\right)\mathbf{R}_X(-q_3)\\ {}^{4}_{3}\mathbf{T}=\mathbf{D}_{\mathbf{l}_3}\mathbf{R}_Z\left(\frac{\pi}{2}\right)\mathbf{R}_X(q_4)\\ {}^{\mathcal{E}}_{4}\mathbf{T}=\mathbf{D}_{\mathbf{l}_4}\end{cases}$$
其中 $\mathbf{D}_{\mathbf{l}_i}$ 表示沿连杆向量 $\mathbf{l}_i$ 的平移,$\mathbf{R}_X$、$\mathbf{R}_Y$、$\mathbf{R}_Z$ 表示绕对应坐标轴的旋转,$\mathbf{p}_1$ 为基座偏移,$\phi$ 为每根手指第一关节绕基座坐标系的初始方位角。三根手指围绕手掌排列,各自跨越 120° 扇区:$[-60°, 60°]$、$[60°, 180°]$、$[180°, 300°]$。
基于正向运动学,通过蒙特卡洛采样(每关节5000个随机配置)估算夹爪可达工作空间。工作空间沿 X 轴约 469mm、Y 轴约 477mm、Z 轴约 311mm,展示了围绕基座坐标系的广泛有效空间覆盖。三根手指的对称 120° 分布确保了各方向的均匀可达性,而 Fin-Ray 柔性结构使手指在接触物体时自动包络适应物体几何。
2.2 多模态感知
指尖触觉阵列:集成薄型压阻式 FlexiTac 传感器,在 $66 \times 25\,\text{mm}^2$ 的有效感知面积上提供 $32 \times 12$ 触觉单元阵列,有效空间分辨率约 $2 \times 2\,\text{mm}^2$。压力变化引起电阻变化,将机械刺激转换为可测电信号。高分辨率触觉阵列使指尖能够在接触瞬间感知压力分布,实现力控抓取和滑动检测。
视觉-触觉双模态手掌:手掌感知模块采用 USB 摄像头(GC0307, GalaxyCore),视场角 50°,经实验验证可在实现大景深的同时观察近场触觉形变和远场环境。摄像头封装在 50mm 直径圆柱壳体内,远端安装可拆卸传感盒,提供 40mm 直径感知面积。
传感盒由 4mm 厚亚克力基底和 5mm 厚硅胶弹性体层组成。透明硅胶外表面涂有镜面效果涂层并覆盖薄保护硅胶层。LED 环(红、绿、蓝、白)提供基于漫反射的可控内部照明。当 LED 关闭时模块保持透明用于外部场景成像;当 LED 激活时,照明反射到可形变表面,使模块转变为光学触觉传感器捕获表面形变。这一机制无需机械重构即可在视觉感知和触觉感知之间无缝切换。
3. 三指夹爪重定向框架
非拟人化夹爪面临显著的具身差异,无法直接使用人到机器人的重定向方法。VTAP 提出分阶段、手势条件化的重定向框架,通过 VR 设备(Meta Quest 3)捕获人手运动并映射到三指结构。
3.1 子空间缩减与手势条件化
框架选择抓取先验约束桡尺偏转,将配置空间缩减为三种代表性原语:cage(笼式)、power(力量式)和 pinch(捏式)抓取。左手手掌开合手势通过更新每根手指的第一关节 $q_1$ 在这些预定义模式间切换。外展/内收自由度被固定以避免运动学歧义。为解决基坐标系问题,引入中间坐标系 $\mathcal{I}$,通过对 VR 捕获的人手腕坐标系 $\mathcal{W}$ 施加常量 $SE(3)$ 变换定义。
3.2 优化目标
子空间缩减后,每根手指的 MCP 和 PIP 自由度通过优化求解。定义三个主要目标:
指尖位置损失——利用中间基坐标系减轻异构具身的几何差异:
$$\mathcal{L}_{\text{pos}}=\sum_{i=1}^{3}\left\|\mathbf{v}_{i}^{g}-\mathbf{v}_{i}^{I}\right\|_{2}^{2}$$
其中 $\mathbf{v}_{i}^{g}$ 为从夹爪基坐标系 $\mathcal{O}$ 到第 $i$ 个指尖的向量,$\mathbf{v}_{i}^{I}$ 为从中间坐标系 $\mathcal{I}$ 到人手第 $i$ 个指尖的向量。
指尖朝向损失——使用 PIP 关节到指尖的向量定义朝向:
$$\mathcal{L}_{\text{rot}}=\sum_{i=1}^{3}\left\|\mathbf{r}_{i}^{g}-\mathbf{r}_{i}^{I}\right\|_{2}^{2}$$
平滑度正则项:
$$\mathcal{L}_{\text{vel}}=\sum_{j=1}^{6}w_{j}\left\|q_{j}^{t}-q_{j}^{t-1}\right\|_{2}^{2}$$
总目标函数:
$$\mathcal{L}=\lambda_{1}\mathcal{L}_{\text{pos}}+\lambda_{2}\mathcal{L}_{\text{rot}}+\mathcal{L}_{\text{vel}}$$
在每个时间步求解受关节极限约束的优化问题:
$$\mathbf{q}_{t}^{*}=\arg\min\mathcal{L}(\mathbf{q}_{t}),\quad\text{s.t.}\quad\mathbf{q}_{\min}\leq\mathbf{q}_{t}\leq\mathbf{q}_{\max}$$
为提高对跟踪噪声的数值稳定性同时保持对小跟踪误差的敏感性,所有内部子项采用 Huber 型鲁棒惩罚函数。VR 捕获频率约 25Hz,关节配置通过插值时间上采样至 100Hz 控制流。
3.3 分离操作重定向
分离任务要求从聚类物体中隔离单个物体,需要精确调节指尖间距和相对朝向。框架利用可重构捏式模式,仅将人手拇指和食指映射到两个主动夹爪手指。监控两个几何线索:拇指尖-MCP 向量与食指尖-PIP 向量间的角度,以及拇指和食指尖间的欧氏距离。当向量接近平行且指尖距离低于阈值时,控制器转入分离模式。人手指尖距离线性映射为两个 $q_3$ 关节的等幅反向驱动,相对角度决定运动方向符号。MCP 关节 $q_2$ 的弯曲通过拇指-中指距离的线性映射调节,实现沿弯曲方向的微调,使每根手指协调控制两个主动自由度。
4. 触觉反应式抓取
夹爪安装在 UR5e 机械臂上。采用基于阈值的触觉停止准则实现自适应抓取:
$$Q=\sum_{i=1}^{3}\left[\alpha\,\Delta C_{f}+(1-\alpha)\sum_{m,n}S_{f}(m,n)\right],\quad Q>T_{\text{th}}$$
其中 $\Delta C_{f}$ 为非零接触像素变化量,$\sum_{m,n}S_{f}(m,n)$ 为第 $i$ 根手指触觉阵列单元的累积信号幅度,$\alpha \in [0,1]$ 平衡接触面积与信号强度。抓取时每根手指持续弯曲直到 $Q$ 超过经验选取的终止阈值 $T_{\text{th}}$。手掌摄像头通过形态学处理和 Canny 边缘检测估计物体朝向,使末端执行器姿态调整到朝向对齐的抓取姿态后,触觉反应控制器激活执行抓取和提升。
| 物体 | 足球 | 棒球 | 绳子 | 盒子 | 电钻 | 锤子 | 薯片 | 灯泡 | 草莓 |
|---|---|---|---|---|---|---|---|---|---|
| 成功 | 10/10 | 10/10 | 10/10 | 9/10 | 5/10 | 10/10 | 10/10 | 10/10 | 10/10 |
在 YCB 物体集和日常物体上测试,总抓取成功率 93.3%。指尖触觉传感器实现了对灯泡、薯片等易碎物体的无损抓取,力量模式和主动手掌支持了对锤子等大型、宽大和薄圆柱形物体的稳定操作。手内操作实验中,40mm 直径球体通过协调手指运动绕 X、Y、Z 轴旋转,分别达到约 ±15°(X/Y 轴)和 ±20°(Z 轴),展示了多轴手内重定向能力。
5. 注射器重定向与柱塞驱动
该任务灵感来自实验室移液场景:从支架中取出注射器并压下柱塞将液体转入烧杯。桡尺自由度配置为捏式抓取,拇指和食指闭合时执行两指捏抓。触觉阵列捕获接触分布和手内朝向。中指收缩触发灵巧手内重定向,将注射器出口朝下对齐。小指收缩驱动主动手掌压下柱塞完成液体转移。20次连续遥操作试验成功率 65%(13/20),平均完成时间 $33.4 \pm 5.43$ 秒。该任务展示了多阶段手内操作的连续动作序列能力,从抓取到重定向再到驱动,全程保持物体稳定握持。
6. 手内分离与轴孔装配
手内分离:要求从聚类物体中隔离单个物体,最小可达 3mm 直径。框架利用捏式模式和拇指-食指协调的滚动/剪切运动,持续调节指尖间距和角度对齐。人手指尖距离线性映射为等幅反向的 $q_3$ 关节驱动,实现精确的间距控制。这一任务对指尖触觉分辨率和协调控制提出了极高要求,VTAP 的 $2 \times 2\,\text{mm}^2$ 触觉分辨率足以区分并分离毫米级物体。
视觉-触觉轴孔装配:结合手掌视觉模态进行远距离定位和姿态估计,利用指尖触觉反馈在接触阶段进行精细对齐。手掌相机通过形态学处理和 Canny 边缘检测估计物体朝向,使末端执行器姿态调整到朝向对齐的抓取姿态;触觉反应控制器在接触阶段提供闭环力反馈,确保装配过程中的精确对中和力控插入。
| 实验任务 | 关键能力 | 性能指标 | 验证模态 |
|---|---|---|---|
| YCB/易碎物抓取 | 触觉反应停止 | 93.3% 成功率 | 视觉+触觉 |
| 球体手内旋转 | 多轴协调 | ±15°–20° | 关节控制 |
| 注射器移液 | 重定向+驱动 | 65% (13/20) | 触觉+VR遥操作 |
| 物体分离 | 指尖间距控制 | 最小 3mm | 触觉阵列 |
| 轴孔装配 | 视觉定位+触觉对齐 | 成功验证 | 视觉+触觉 |
7. 方法流程图
8. 局限性
- 遥操作依赖:系统当前通过 VR 遥操作驱动,非自主操作。虽然为基于学习的方法提供了数据采集架构,但自主灵巧操作仍需额外的策略学习。
- 注射器任务成功率有限:65% 的成功率表明多阶段手内操作仍具挑战性,尤其涉及重定向和柱塞驱动的连续动作序列。
- 电钻抓取困难:电钻仅 5/10 成功率,反映了对特定几何形状(长柄+大头部)物体抓取策略的不足。
- 旋转范围有限:手内重定向仅约 ±15°–20°,远未达到大角度重定向,限制了连续旋转操作场景。
9. 结论
VTAP 夹爪通过视觉-触觉双模态主动手掌与配备触觉阵列的柔性可重构手指的协同,在不依赖高自由度拟人化设计的情况下实现了高灵巧操作性能。分阶段手势条件化重定向框架有效弥合了人手与三指异构结构间的具身差异。实验验证涵盖 YCB 和易碎物体反应式抓取(93.3% 成功率)、注射器手内重定向与柱塞驱动、小至 3mm 聚类物体分离、视觉-触觉轴孔装配等任务。VTAP 夹爪及其重定向框架为灵巧夹爪设计、操作和接触丰富的数据采集提供了实用参考架构,支持基于学习的方法。

