Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

触觉感知tactile视觉

VTLoc:视觉点云中的触觉接触定位

提出视觉-触觉接触定位方法,融合视觉全局上下文和触觉局部信息,预测触摸点在物体表面的位置。

Zhiyuan Wu, Zhuo Chen, Shan Luo2026年7月17日3 分钟阅读
EN

VTLoc:基于学习的视觉点云中的触觉接触定位

论文:VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds
作者:Zhiyuan Wu, Zhuo Chen, Shan Luo(伦敦国王学院)
链接:arXiv:2607.16146 | 代码:georgewuzy.github.io/vtloc-website/ | 传感器:GelSight

一句话总结:从 2D 触觉图像预测 3D 物体表面接触位置,通过几何多模态对齐模块重建伪点云对齐视觉点云,再用迭代定位更新器逐步精化接触坐标,在 100 个真实物体基准上超越所有基线。

研究背景与动机

视觉和触觉是机器人感知与操作的两种互补模态。视觉提供全局物体上下文(形状、纹理、空间关系),触觉提供接触点处的精确局部信息(表面几何、接触力)。给定物体的视觉表示(网格或点云),从触觉读数预测接触发生在表面上的位置——即接触定位——对精确的物体识别、操作和交互至关重要。单次触觉接触定位为多触觉和序贯触觉定位框架提供初始估计。

现有接触定位方法分为同维匹配和跨维匹配。同维方法中输入输出空间维度相同(如 2D 触觉图像映射到 2D 视觉图像中的接触点,或 3D 触觉点云与 3D 物体表面对齐)。跨维匹配更具挑战性——需要学习跨不同空间维度的映射,如将 2D 触觉图像定位到 3D 场景中。先前跨维工作依赖强数据先验或约束,如 MidasTouch 从每个物体网格上 50,000 个随机化传感器位姿构建大型触觉码本,限制了真实世界可扩展性。且其仅有 10 个物体、每物体 5 条轨迹。

VTLoc 的核心思路:直接从 2D 触觉图像和 3D 点云学习预测接触位置,不依赖密集的物体特定采样。受人类感知启发——人类通过感官反馈形成并迭代精化内部物体表示——引入几何多模态对齐(GMA)模块和迭代定位更新器(ILU)。

方法详解

1. 问题设定

系统接收两个输入:(1) 触觉图像 $\boldsymbol{T}\in\mathbb{R}^{H\times W\times 3}$;(2) 物体 3D 点云 $\boldsymbol{P}\subset\mathbb{R}^{3}$,含 $N^p$ 个点,每个点 $\boldsymbol{p}=(x,y,z)$ 附带法向量 $(n_x,n_y,n_z)$。接触点定义为触觉传感器中心沿表面法线在网格上的投影点。目标是预测接触坐标 $\boldsymbol{c}^p$ 和 3D 接触概率图 $\boldsymbol{P}^s=\{(\boldsymbol{p},s_{\boldsymbol{p}})\mid\boldsymbol{p}\in\boldsymbol{P}\}$,其中 $s_{\boldsymbol{p}}$ 是点 $\boldsymbol{p}$ 为实际接触位置的预测似然。

2. 网络总览

触觉输入经 ResNet-18 加展平 MLP 编码为触觉特征向量 $\boldsymbol{F}^t\in\mathbb{R}^{C}$;点云经 PointNet++ 编码为视觉特征向量 $\boldsymbol{F}^p\in\mathbb{R}^{C}$。两特征融合后进入 GMA 模块和 ILU 模块。GMA 在 3D 空间中对齐融合特征以强制跨模态几何一致性,ILU 执行迭代回归精化接触位置 $\boldsymbol{c}^p$。

VTLoc 工作流程

图3:VTLoc 工作流程。GMA 模块通过最小化伪点云与原始点云间的 Chamfer 距离增强几何一致性。ILU 执行迭代精化预测接触位置。

3. 几何多模态对齐(GMA)

受人类接触定位范式启发——先在脑中重建物体,再用触觉记忆迭代匹配触摸区域。GMA 模块从融合特征 $\boldsymbol{F}^f=[\boldsymbol{F}^t,\boldsymbol{F}^p]$ 重建伪点云 $\boldsymbol{P}^d$,通过学习权重 $\boldsymbol{W}^d\in\mathbb{R}^{N^d\times 2C\times C^d}$ 进行特征解耦:

$$\boldsymbol{F}^{d}(j,l)=\sum\boldsymbol{F}^{f}(i)\cdot\boldsymbol{W}^{d}(i,j,l)$$

MLP 将 $\boldsymbol{F}^d$ 中每个特征向量解码为带法向量的 3D 点 $\boldsymbol{p}^d=[x^d,y^d,z^d,n_x^d,n_y^d,n_z^d]$。通过最小化 Chamfer 距离优化重建损失:

$$\mathcal{L}^{recon}=\sum_{\boldsymbol{p}^{d}\in\boldsymbol{P}^{d}}\min_{\boldsymbol{p}\in\boldsymbol{P}}\|\boldsymbol{p}^{d}-\boldsymbol{p}\|^{2}+\sum_{\boldsymbol{p}\in\boldsymbol{P}}\min_{\boldsymbol{p}^{d}\in\boldsymbol{P}^{d}}\|\boldsymbol{p}-\boldsymbol{p}^{d}\|^{2}$$

这一过程在空间坐标和表面法向量上同时强制触觉和点云模态的空间对齐,增强融合模态的 3D 几何理解。

4. 迭代定位更新器(ILU)

受人类通过比较当前感官反馈与存储的触觉记忆来迭代精化接触定位的机制启发。ILU 从初始估计 $\hat{\boldsymbol{c}}_0=\boldsymbol{0}$ 开始,在 $N$ 次迭代中预测接触位置序列。每步 $k$ 计算更新方向 $\Delta\hat{\boldsymbol{c}}$:

$$\hat{\boldsymbol{c}}_{k+1}=\hat{\boldsymbol{c}}_{k}+\Delta\hat{\boldsymbol{c}}$$

ILU 使用线性 GRU 实现。初始隐藏状态 $\boldsymbol{h}_0=\mathcal{T}(\boldsymbol{F}^t)$(tanh 激活)。每步隐藏状态更新:

$$\boldsymbol{h}_{k+1}=(\boldsymbol{1}-\boldsymbol{z}_{k})\odot\boldsymbol{h}_{k}+\boldsymbol{z}_{k}\odot\boldsymbol{q}_{k}$$

其中更新门 $\boldsymbol{z}_k=\sigma(\text{Linear}^z([\boldsymbol{h}_k,\boldsymbol{x}]))$,候选状态 $\boldsymbol{q}_k=\mathcal{T}(\text{Linear}^q([\boldsymbol{r}_k\odot\boldsymbol{h}_k,\boldsymbol{x}]))$,重置门 $\boldsymbol{r}_k=\sigma(\text{Linear}^r([\boldsymbol{h}_k,\boldsymbol{x}]))$,输入 $\boldsymbol{x}=[\boldsymbol{F}^p,\text{ReLU}(\boldsymbol{F}^t)]$。序列损失使用指数递增权重:

$$\mathcal{L}^{seq}=\sum_{i=1}^{N}\gamma^{N-i}\left\|\boldsymbol{c}^{gt}-\boldsymbol{c}_{i}\right\|$$

其中 $\gamma=0.9$,使后期迭代获得更高权重。总损失 $\mathcal{L}=\mathcal{L}^{seq}+\lambda\mathcal{L}^{recon}$,$\lambda=1$。

graph TD
  A[触觉图像 T] --> B[ResNet-18 + MLP]
  B --> C[触觉特征 F_t]
  D[点云 P] --> E[PointNet++]
  E --> F[视觉特征 F_p]
  C --> G[融合特征 F_f]
  F --> G
  G --> H[GMA: 重建伪点云 P_d]
  H --> I[Chamfer距离对齐 P]
  C --> J[ILU: 迭代GRU]
  F --> J
  J --> K[接触位置 c_p]
  K --> L[Top-K候选匹配]
  L --> M[3D概率热力图]
  style H fill:#f5a623,stroke:#b97316,color:#fff
  style J fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style M fill:#7ed321,stroke:#4a8a14,color:#fff

5. 接触概率计算

对接触集 $\boldsymbol{S}^c$ 中每个候选点计算接触分数 $S_{\boldsymbol{c}^*_i}=\|\boldsymbol{c}^p-\boldsymbol{c}^*_i\|^2$,取 Top-K 最优候选。对点云中每个点 $\boldsymbol{p}$,找最近候选并计算加权分数:

$$s_{\boldsymbol{p}}=\frac{1}{w}e^{-\left\|\boldsymbol{p}-\boldsymbol{c}^{*}_{w}\right\|}$$

归一化后得到 3D 概率热力图 $\hat{\boldsymbol{P}}$。

GMA 模块的有效性

消融实验在表面曲率变化不均匀的物体子集上评估 GMA 模块。无 GMA 的基线在添加法向量到坐标时无改善,部分指标甚至退化——因为基线缺乏对多模态点云的强分析能力。相比之下,带 GMA 的 VTLoc 相对仅用坐标在 ND 上提升 1.19%,Top-1 准确率提升 4.87%,Top-5 准确率提升 1.94%,MPE 提升 6.8%。添加法向量进一步增强性能,因为法向量提供了更丰富的几何信息。这证明 GMA 的伪点云重建和对齐机制是有效融合多模态几何信息的关键——没有它,网络无法从法向量中提取有用的空间推理信号。

ILU 迭代次数的影响

ILU 迭代次数 $N$ 的消融显示,相对基线($N=0$),$N=16$ 将 ND 从 22.97% 降至 20.17%,Top-1 准确率从 29.56% 提升至 44.65%,Top-5 从 79.87% 提升至 86.16%,MPE 从 0.1129 降至 0.1037。性能随 $N$ 增加持续提升并在 $N=16$ 达到峰值,但超过此点后因过度迭代导致过拟合而退化($N=32$ 时 Top-1 降至 40.88%,$N=64$ 降至 36.48%)。值得注意的是,VTLoc 总参数量仅 124.28 MiB,$N=16$ 时平均推理时间 128.05ms——增加迭代对参数量无影响,仅比基线多 4.49ms。这种高效性使方法适用于真实机器人应用的实时约束。

对称物体消歧

图 6 展示了具有旋转对称先验的碗的接触概率热图,证明 VTLoc 能解决接触定位固有的对称歧义。对称轴从已知物体几何手动指定。对称物体的接触定位本质上是多模态的——对称位置产生几乎相同的触觉图像,使定位变得歧义。VTLoc 通过视觉点云提供的全局几何上下文和 GMA 的空间一致性约束,成功区分对称位置,这是仅靠触觉无法实现的。

未知物体泛化

在物体级别 7:3 划分训练测试集的实验中,VTLoc 对未知物体表现出优越性能——在 Top-1 和 Top-5 准确率上显著提升,同时保持最低 MPE。这种泛化能力源于框架学习的是触觉特征与视觉几何之间的通用空间对应关系,而非记忆特定物体的触觉模式。GMA 的几何对齐和 ILU 的迭代精化都促进了这种泛化——前者建立模态间的空间一致性先验,后者通过特征匹配逐步收敛到正确接触位置。

实验结果

基准数据集

基于 ObjectFolder Real 构建 100 个真实物体基准。每个物体 30-50 个接触位置,7:3 训练测试划分。点云从 3D 网格随机采样 1024 点(含坐标和法向量)。触觉数据用 Franka Emika Panda + GelSight 传感器采集(感应区 $32\times24$ mm²),安全穿透深度 ~1.0mm。物体按法向量变化分为"非均匀"子集(16 个,如梳子、勺子、叉子、扳手)和"均匀"子集(84 个)。

基准数据示例

图4:基准数据示例。100 个日常物体,重采样得到位置和法向量点云,每物体 30-50 个接触位置。

非均匀子集对比

方法坐标法向量mm误差↓ND(%)↓Top-1准确率(%)↑Top-5准确率(%)↑MPE↓
Point Filtering71.8135.7811.3254.090.2788
MCR46.8224.0227.0478.620.1441
MidasTouch50.0126.7436.4876.730.1594
VTLoc(本文)39.2420.9137.7484.280.1117
VTLoc(本文)37.5720.1744.6586.160.1037

VTLoc 相比 Point Filtering 的 ND 降低 14.87%,相比最优基线 MCR 降低 3.11%。Top-5 准确率相比 Point Filtering 提升 30.19%,相比 MCR 提升 5.66%。加入法向量后进一步提升:Top-1 准确率从 37.74% 升至 44.65%。

子集物体数特点法向量效果
非均匀16曲率变化显著(梳子、勺子等)提升性能
均匀84曲率变化均匀降低性能

均匀子集对比

在均匀表面物体上 VTLoc 同样显著改善:ND 相比 Point Filtering 降低 12.11%,相比 MCR 降低 10.01%。Top-5 准确率相比 MidasTouch 提升 9.16%。但均匀子集整体性能低于非均匀子集,因固有的几何歧义。值得注意的是,加入法向量在均匀子集上反而降低性能——均匀物体的几何信息无法为触觉定位提供有意义的线索。

接触概率定性结果

图5:接触概率定性结果。VTLoc 在天鹅等复杂几何物体上仍能鲁棒地连接视觉和触觉模态。

基准构建与数据采集

基准基于 ObjectFolder Real 构建,选取 100 个真实世界日常物体,重采样位置和法向量点云,每物体 30-50 个接触位置,数据级 7:3 划分训练测试集。从测试集每物体选 9-15 个代表性点作为离散接触候选。使用 EinScan Pro HD 2020 手持 3D 扫描仪在受控暗环境中捕获高质量 3D 网格和颜色纹理。从每个 3D 网格随机采样 1024 个点获取空间坐标和法向量。触觉数据用 Franka Emika Panda 机械臂配备 GelSight 触觉传感器(感应区 $32\times 24$ mm²)采集——机械臂沿每个目标点的表面法向量做位置控制运动,在预定操作阈值(约 1.0mm 穿透约 2mm 厚硅胶层)停止以确保硬件安全和数据可复现。四台 RealSense 相机通过 ICP 算法实现接触点与物体网格的对齐。这一精细的采集流程保证了基准数据的质量和可复现性。

局限性

作者自述:在均匀表面物体上,VTLoc 的性能相对较低,这是由于均匀物体固有的几何歧义——多个接触点可能产生相似的触觉读数。加入法向量在均匀子集上反而降低性能,因为均匀物体的几何信息无法为触觉定位提供有意义的线索。

分析判断:数据集仅 100 个物体,与 MidasTouch 的 10 个物体相比虽有提升但规模仍有限。触觉数据采集使用固定 ~1.0mm 穿透深度,不同深度的触觉读数差异未被探索。GMA 模块的伪点云重建使用固定 $N^d$ 个点,其与输入点云 1024 点的数量关系对性能的影响未讨论。ILU 的迭代次数 $N$ 是固定值,自适应停止机制可能提升效率。所有实验基于 GelSight 传感器,对其他类型触觉传感器(如 DIGIT、BioTac)的泛化能力未验证。

总结与展望

VTLoc 的核心贡献在于将跨维接触定位从依赖大规模物体特定码本转变为直接从 2D 触觉图像和 3D 点云学习的端到端框架。GMA 模块通过伪点云重建和 Chamfer 距离对齐,在 3D 空间中强制触觉和视觉模态的几何一致性——这一设计受人类"先在脑中重建物体再匹配触摸区域"的感知范式启发。ILU 模块用 GRU 实现迭代精化,序列损失中指数递增权重使后期迭代更受重视。在非均匀物体上法向量带来提升、在均匀物体上反而有害的发现,揭示了触觉定位中几何信息有用性的条件性。100 个真实物体基准为该领域提供了标准化评估平台。

触觉定位的本质不是记住每次触摸的图像,而是理解"这个触感对应物体上哪个形状"——几何对齐让机器像人一样先在脑中重建物体再匹配触摸。

相关论文