Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

灵巧操作工业基准测试

工业灵巧度基准:面向工业灵巧操作的软硬件基准平台

本文提出工业灵巧度基准,一个面向工业灵巧操作的软硬件基准平台,系统性评估机器人在工业场景的灵巧操作能力。

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast2026年7月15日3 分钟阅读
EN

工业灵巧性基准:工业灵巧操作软硬件基准平台

论文:Industrial Dexterity Benchmark: A Hardware–Software Benchmarking Platform for Industrial Dexterous Manipulation

作者:Honglu He, Jacob Laufer, Zhiwu Zheng 等(Analog Devices, Inc.)

链接arXiv:2607.14021


一句话总结

本文提出工业灵巧性基准(IDB)——一套模拟数据中心线缆管理、汽车线束和变速箱装配的硬件基准板,配合 DAG-ROS 模仿学习框架和多模态扩散策略 AG-iDP3(融合 RGB、点云、关节位置和腕部力矩),在数据中心线缆清理任务上多视角 RGB 配置达到 78% 成功率,远超单相机 RGB 基线的 36%。


研究背景与动机

灵巧操作仍是工业自动化的关键瓶颈——线缆布线、连接器插入和精密装配仍严重依赖人工。数据中心线缆管理要求正常运行时间超过 $99.99\%$,密集机架布局和热约束限制了物理访问空间。

数据中心线缆管理挑战

图1:数据中心密集排列的机架交换机——亚毫米级线缆间距和锐角路由。

传统视觉-运动管线存在几个问题:对光照条件敏感、难以估计手中连接器位姿、即使任务空间微小变化也需大量重新校准。现有扩散策略研究的局限包括:通常仅使用单一图像模态,未在紧间隙工业装配中测试,且未将力/扭矩传感作为策略输入。


工业灵巧性基准(IDB)设计

IDB 包含三种基准板设计,遵循 NIST 装配任务板理念,总成本在数百美元内。

IDB板1设计

图4:IDB Board #1——数据中心线缆管理基准板,含三个 3D 打印配线架。

Board #1(数据中心线缆):铝型材框架($\sim 270\,\mathrm{mm}$ 高,$250 \times 340\,\mathrm{mm}$ 底面),三个 3D 打印配线架(RJ45、SC 单工、LC 双工光纤)。定义两个任务:线缆端口交换和光纤线缆维护,共 6 个子任务。难度可通过改变板上已有线缆数量来调节。

IDB板2设计

图5:IDB Board #2——汽车线束基准板,含 8 个 LED 验证连接器。

Board #2(汽车线束):三层激光切割亚克力板,模拟汽车总装的约束电气连接。8 个连接器(两个 6 针、六个 2 针)分布在不同高度和朝向,2 针连接器配 LED 验证。

IDB板3设计

图6:IDB Board #3——变速箱装配基准板,含行星齿轮箱组件。

Board #3(变速箱装配):测试行星齿轮箱装配/拆卸的精细操作技能,包括齿轮啮合对齐和螺栓紧固序列。


DAG-ROS:模仿学习基础设施

DAG-ROS 提供可扩展的模仿学习数据采集和部署框架。使用 Ubuntu 24.04 RT 内核主机 + ROS2 Control 驱动 FR3 机械臂、Robotiq 2F-85 夹爪和腕部 RealSense D405。所有数据以 MCAP 格式记录,转换为 Zarr 训练格式。


AG-iDP3:多模态扩散策略

AG-iDP3 融合四类传感输入:腕部 RGB(D405)、场景 RGB(D435i)、场景点云(D435i 或 ToF)、本体感知(关节位置 + 腕部力矩)。RGB 经 R3M(ResNet18)编码,点云经多级 PointNet 编码,本体感知直接拼接。所有向量合并为单一观测向量 $\mathbf{o}$ 输入扩散 U-Net:

$$ \mathbf{o} = [\,f_{\mathrm{R3M}}(\mathbf{I}_{\mathrm{wrist}}),\; f_{\mathrm{R3M}}(\mathbf{I}_{\mathrm{scene}}),\; f_{\mathrm{PN}}(\mathbf{P}_{\mathrm{scene}}),\; \mathbf{q}_{\mathrm{joint}},\; \mathbf{w}_{\mathrm{wrist}}\,] $$

扩散 U-Net 在训练时学习逆转噪声过程。给定干净动作 $\mathbf{a}_0$,前向加噪过程为:

$$ q(\mathbf{a}_t | \mathbf{a}_0) = \mathcal{N}(\mathbf{a}_t;\, \sqrt{ar{lpha}_t}\,\mathbf{a}_0,\, (1-ar{lpha}_t)\mathbf{I}) $$

策略网络 $\epsilon_ heta$ 学习预测添加的噪声,推理时从 $\mathbf{a}_T \sim \mathcal{N}(\mathbf{0}, \mathbf{I})$ 逐步去噪生成 $T=15$ 步动作块。每次推理仅执行前 $N=3$ 步。

每次推理仅执行前 $N=3$ 步,其余与下次推理的预测通过时间集成融合。

经典视觉管线

图2:经典视觉管线——FoundationPose + FoundationStereo 进行 6-DOF 连接器位姿估计。

每相位力矩门控:力矩输入仅在接触丰富的插入相位有益,在抓取和清洁相位门控关闭。

时间集成:连续推理产生重叠预测,用指数加权平均融合:

$$ \bar{a}^{(t)}=\frac{\sum_{i}w_{i}\,a_{i}^{(t)}}{\sum_{i}w_{i}},\qquad w_{i}=\exp(-k\cdot\mathrm{age}_{i}) $$

其中 $k=0.01$ 控制旧预测衰减速度,$a_i^{(t)}$ 为第 $i$ 次推理对执行时刻 $t$ 的预测动作,$\mathrm{age}_i$ 为自第 $i$ 次推理以来经过的时间。

动作分块执行:每次推理输出 $T$ 步动作,仅前 $N$ 步提交执行,设 $a_i^{(t)}$ 为第 $i$ 次推理对时刻 $t$ 的预测,执行动作为:

$$ a_{\mathrm{exec}}^{(t)} = a_{i^*}^{(t)}, \quad i^* = rg\min_{i} \mathrm{age}_i \quad ext{s.t.} \quad t \in [t_i, t_i + N] $$

轨迹平滑:策略以 $15\,\mathrm{Hz}$ 推理频率预测动作,但阻抗控制器需要 $50\,\mathrm{Hz}$ 设定点。三次样条插值在最后执行动作和未来 $N$ 个航点间拟合平滑轨迹,以 $50\,\mathrm{Hz}$ 采样:

$$ \mathbf{s}(u) = \mathbf{a}_{\mathrm{last}} + \sum_{j=0}^{3} \mathbf{c}_j \, B_j(u), \quad u \in [0, N/\Delta t] $$

其中 $\mathbf{c}_j$ 为样条系数,$B_j$ 为三次基函数。这产生约 $3\times$ 更密的命令流,遵守速度和加速度限制,同时消除动作块边界的振荡。

flowchart LR
    A["腕部 RGB
D405"] --> E["R3M 编码
ResNet18"] B["场景 RGB
D435i"] --> E C["场景点云
ToF/立体"] --> F["PointNet 编码"] D["关节位置
+腕部力矩"] --> G["直接拼接"] E --> H["观测向量 o"] F --> H G --> H H --> I["扩散 U-Net
输出 T=15 动作块"] I --> J["时间集成
+ 三次样条插值"] J --> K["50Hz 阻抗控制"] style I fill:#e1f5fe style K fill:#e8f5e9

实验结果

在数据中心线缆清理任务上,6 种配置各 48 次试验。清洁相位在所有配置中 $100\%$ 成功。关键发现:

  • 有 3D 上下文(点云或双 RGB)时,抓取成功率 $88\%$-$98\%$;单 RGB 仅 $48\%$
  • 插入相位是区分总分的关键——跨配置插入分数差异 $48$ 个百分点
  • 最佳总分 $78\%$ 由多视角 RGB 配合 R3M 取得
  • ToF 场景相机比 RealSense D435i 高 $7$ 个百分点
  • 所有多模态配置均超过单 RGB 基线($36\%$)
经典管线中间表示
表1:各配置成功率(48 次试验/配置)
配置传感输入抓取(%)插入(%)总分(%)
1RGB腕 + ToF场景906559
2RGB腕 + RGB场景(D435i)967572
3RGB腕 + 点云(D435i)885448
4RGB腕 + 点云(ToF)945653
5仅点云(iDP3)985452
6仅RGB腕(DP基线)484036
最佳RGB腕+RGB场景(R3M)968178
表2:各模型变体参数量
配置PC编码器R3M编码器U-Net总计
iDP3(仅PC)0.27M68.5M68.8M
DP(1×RGB)11.2M78.1M89.3M
DP(2×RGB)22.4M92.6M114.9M
COMB-iDP3(PC+RGB)0.27M11.2M83.2M94.6M

局限性

  1. 点云分辨率不足:两种场景相机的点云分辨率(PointNet 进一步下采样)不足以分辨紧间隙插入所需的插座特征,这可能是双 RGB 配置优于 RGB+PC 配置的原因。但在光照不恒定、设备老化和空气颗粒物常见的工业环境中,ToF 传感可能比被动立体更可靠。
  2. 学习策略对视觉变化脆弱:观察到对微小场景视觉变化的敏感性——线缆从手中滑落和插入位姿偏差导致连接失败。每相位比较中 RGB 基线的低抓取成功率过滤了大量插入尝试,直接比较需谨慎。

总结

本文从经典模块化机器人管线推进到端到端多模态模仿学习框架。IDB 基准板提供了可重复的工业灵巧操作评估平台,AG-iDP3 通过融合多模态传感输入实现了 $78\%$ 的线缆清理成功率——每个任务相位仅需约 $100$ 次遥操作演示,相比经典管线需数千张标注图像和大量参数调优,显著降低了新任务部署成本。

金句:「正确的学习策略在鲁棒性、泛化性和部署效率上可以超越经典视觉和控制方法,证明了向可扩展机器人自动化转变的合理性。」多视角 RGB 配置将成功率从 $36\%$ 提升至 $78\%$,揭示了 3D 上下文对于工业级紧间隙操作的不可替代性。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
G0.5:单一自回归流统一机器人推理与动作

G0.5:单一自回归流统一机器人推理与动作

G0.5 用单一 Transformer 解码器在统一目标下同时生成推理与动作 token,配合跨本体动作分词器、原生思维链流与视觉记忆模块,在真机微调、BEHAVIOR、DROID、LIBERO 等 7 项基准上超越 π0.5 与 GR00T-N1.7。

VLA具身智能自回归2026年8月12日
跨具身灵巧手操作:统一手部动作空间

跨具身灵巧手操作:统一手部动作空间

提出规范球面形变的统一手部动作空间,用级联逆运动学把同一策略映射到多款灵巧手,并在仿真与真实手完成手内立方体转位。

灵巧操作Dexterous Manipulation统一动作空间2026年7月3日
CoorDex:协调身体与手部先验实现连续灵巧人形行走操作

CoorDex:协调身体与手部先验实现连续灵巧人形行走操作

人形机器人行走操作常被简化为走走停停——走到物体前停下操作。CoorDex 提出协调身体与手部先验的框架,实现行走与操作同时进行的连续灵巧 loco-manipulation,无需停顿即可在移动中抓取和操控物体。

人形机器人loco-manipulation灵巧操作2026年6月22日