PAPER DEEP DIVE
KAI:面向数据高效铰接物体操作的运动学感知接口
提出KAI运动学感知接口,通过运动学先验提升铰接物体操作的数据效率,降低机器人操作策略的样本需求。
1. 论文概览:运动学感知的铰接物体操作接口
KAI(Kinematic-Aware Articulation Interface)于 2026 年 7 月提出,是一种结构化中间表征,将铰接物体的运动学结构显式编码到策略学习中。通过将可解释的几何和运动学先验嵌入策略学习,KAI 提供了与铰接运动底层结构对齐的强归纳偏置,有效提升样本效率——在六项仿真任务上平均成功率达 82.9%,仅用一半演示数据即可匹配或超越基线性能。该方法还展现出对未见背景和视觉干扰的鲁棒泛化能力,从单一干净训练环境迁移到杂乱真实场景。KAI 的动作无关设计进一步支持与人类交互视频的协同训练:在多样视觉干扰下,协同训练后平均成功率超 70%。
2. 核心问题:铰接物体操作的运动学结构缺失
铰接物体——门、抽屉、笔记本电脑、微波炉——在人类环境中无处不在。尽管外观和功能多样,它们共享一个基本属性:运动由运动学约束支配。门绕固定铰链旋转,抽屉沿约束导轨平移。可靠操作因此需要理解物体的哪部分移动及方向。端到端模仿学习方法学习直接的感知到动作映射,不显式建模运动学结构,迫使策略从数据隐式推断关节力学。在有限演示下,这导致依赖表面视觉线索,在背景或物体外观变化时泛化脆弱。已有中间表征如 affordance map、point flow 和 grasp pose 描述"在哪交互"或"应产生什么运动",而非直接编码物体底层运动学结构。KAI 的核心洞见:铰接物体操作最有效的归纳偏置是捕获铰接关节运动学约束的接口——显式表征运动学结构本身。
3. 方法:KAI 框架
3.1 运动学感知铰接接口
KAI 通过运动部分上的 $K$ 个交互关键点表征铰接物体运动学结构。对每个关键点 $i \in \{1,\ldots,K\}$,给定时间步 $t$ 的观测,KAI 预测未来位置序列 $\mathbf{l}_{t+1}^i, \ldots, \mathbf{l}_{t+N}^i$ 及对应位移 $\mathbf{d}_t^i, \ldots, \mathbf{d}_{t+N-1}^i$,其中 $\mathbf{d}_{t+\delta}^i = \mathbf{l}_{t+\delta+1}^i - \mathbf{l}_{t+\delta}^i$,$\delta \in \{0,\ldots,N-1\}$。为确保预测关键点尊重铰接运动的运动学约束,用几何损失正则化关键点集 $\mathcal{K}$:
$$\mathcal{L}_{\text{geo}} = \lambda_s \mathcal{L}_{\text{struct}} + \lambda_m \mathcal{L}_{\text{motion}} \tag{1}$$其中 $\mathcal{L}_{\text{struct}}$ 强制等距约束以保持关键点间距离不变,$\mathcal{L}_{\text{motion}}$ 按关节类型正则化位移。
结构损失惩罚关键点间相对距离的变化,防止非物理变形:
$$\mathcal{L}_{\text{struct}} = \sum_{\delta=0}^{N-1} \sum_{i,j \in \mathcal{K}} \left|\|\mathbf{l}_{t+\delta+1}^i - \mathbf{l}_{t+\delta+1}^j\|_2 - \|\mathbf{l}_t^i - \mathbf{l}_t^j\|_2\right|^2 \tag{2}$$
3.2 关节类型运动约束
移动关节运动约束为纯平移,通过最小化位移向量方差实现平移不变先验:
$$\mathcal{L}_{\text{motion}}^{\text{pris}} = \sum_{\delta=0}^{N-1} \sum_{i \in \mathcal{K}} \|\mathbf{d}_{t+\delta}^i - \bar{\mathbf{d}}_{t+\delta}\|_2^2 \tag{3}$$其中 $\bar{\mathbf{d}}_{t+\delta} = \frac{1}{|\mathcal{K}|} \sum_{j \in \mathcal{K}} \mathbf{d}_{t+\delta}^j$ 为平均位移。转动关节运动建模为约束旋转,将关键点分为旋转轴上的静止锚点 $\mathcal{K}_a$ 和其余移动点 $\mathcal{K}_m$:
$$\mathcal{L}_{\text{motion}}^{\text{rev}} = \sum_{\delta=0}^{N-1} \left(\sum_{a \in \mathcal{K}_a} \|\mathbf{d}_{t+\delta}^a\|_2^2 + \sum_{i \in \mathcal{K}_m} \|\text{proj}(\mathbf{l}_{t+\delta+1}^i) - \text{proj}(\mathbf{l}_{t+\delta}^i)\|_2^2\right) \tag{4}$$其中 $\text{proj}(\cdot)$ 为点到旋转轴的正交投影。锚点位移被惩罚为零,移动点在轴上的投影保持不变。
3.3 分阶段推理架构与协同训练
模型采用"感知-KAI-动作"分阶段推理架构。感知阶段融合 2D 语义特征(DINOv2 提取 RGB 语义特征投影到点云)与 3D 几何特征(稀疏 3D 编码器处理点云),经空间对齐器融合为统一视觉令牌。语言指令由 CLIP 文本编码器分词,机器人状态由 MLP 嵌入。KAI 令牌仅注意感知令牌预测关键点位置和位移,无动作信息访问;然后与感知令牌组合馈入动作解码器生成动作。单向注意力掩码强制信息流。模型总训练损失为 KAI 几何损失与动作模仿损失之和: $$\mathcal{L}_{ ext{total}} = \mathcal{L}_{ ext{action}} + \lambda_s \mathcal{L}_{ ext{struct}} + \lambda_m \mathcal{L}_{ ext{motion}} \tag{5}$$
协同训练策略利用人类交互视频(HOI4D 数据集)增强真实世界鲁棒性——KAI 的动作无关设计使其可从无机器人动作标签的人类视频中学习感知和运动学表征。
4. 实验
4.1 仿真结果
在 Isaac Sim 中评估六项任务(开抽屉、开门、开笔记本、关抽屉、关门、关笔记本),每任务 200 试验。KAI 无视频协同训练平均成功率达 82.9%,超越所有基线;协同训练后达 84.6%。
| 方法 | 均值 SR | 开抽屉 | 开门 | 开笔记本 | 关抽屉 | 关门 | 关笔记本 |
|---|---|---|---|---|---|---|---|
| ACT | 58.5 | 44.5 | 52.5 | 67.5 | 39.0 | 54.0 | 93.5 |
| Seer | 73.4 | 84.8 | 67.2 | 67.7 | 68.1 | 63.7 | 89.2 |
| DP3 | 37.3 | 25.0 | 12.5 | 25.5 | 2.0 | 97.0 | 62.0 |
| KAI | 82.9 | 86.7 | 54.5 | 81.7 | 82.3 | 92.5 | 100.0 |
| KAI (w/ video) | 84.6 | 86.8 | 66.0 | 85.0 | 81.8 | 88.8 | 99.2 |
4.2 数据效率与泛化分析
在不同训练数据量(100/200/400/800 演示)下评估。KAI 在所有数据规模上始终优于 Seer 和 DP3。100 演示低数据场景下优势最显著。泛化测试中,无视频协同训练在背景干扰下平均 SR 66.7%,物体干扰下 62.2%;协同训练后分别提升至 +6.6%/+11.1%/+13.4%(无/背景/物体干扰),总超 70%。DP3 在背景变化下从 33.3% 降至 20.0%,而 KAI 仅降 4.5 个百分点。
| 数据量 | DP3 | Seer | KAI |
|---|---|---|---|
| 100 demos | — | — | 最高 |
| 200 demos | 低 | 中 | 高 |
| 400 demos | 中 | 高 | 最高 |
| 800 demos | 中 | 高 | 最高 |
5. 局限性
- 短时序任务:评估聚焦短时序操作任务,将 KAI 扩展到长时序序列任务是未来方向。
- 单一机器人平台:真机实验仅用单一机器人平台,跨不同机器人平台的验证有待完成。
- 关节类型覆盖:当前仅覆盖移动和转动关节,更复杂关节类型(如球关节)的扩展有待探索。
6. 总结
KAI 通过将运动学先验嵌入策略学习,为铰接物体操作提供了一种结构化中间表征。它通过运动部分上的 $K$ 个交互关键点预测未来位置和位移,并用等距约束和关节类型运动约束(移动/转动)正则化,显式编码铰接物体的运动学结构。分阶段推理架构确保 KAI 作为感知与动作间的结构化桥梁。仿真中 82.9% 平均成功率匹配基线但仅用一半数据;真机中从单一干净训练环境鲁棒迁移到未见背景和干扰。动作无关设计支持与人类交互视频协同训练,在视觉干扰下超 70% 成功率。核心洞见是:铰接物体操作的关键不在"学动作"而在"懂结构"——KAI 将"门绕铰链转、抽屉沿导轨移"这些物理常识显式编码为几何约束,让策略从数据驱动的猜测升级为结构驱动的推理。
flowchart TD
A["RGB-D 图像 + 语言指令 + 机器人状态"] --> B["感知模块: DINOv2 语义 + 3D 点云几何"]
B --> C["空间对齐器融合 → 统一视觉令牌"]
C --> D["KAI 预测: K 个关键点未来位置 + 位移"]
D --> E["几何正则化: 等距约束 + 关节运动约束"]
E --> F{"关节类型?"}
F -->|移动关节| G["平移不变: 位移方差最小化"]
F -->|转动关节| H["旋转约束: 锚点不动 + 投影不变"]
G --> I["KAI 令牌"]
H --> I
I --> J["动作解码器: 生成机器人动作"]
C --> J
K["人类交互视频 HOI4D"] --> L["协同训练: 动作无关设计"]
L --> D



