Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

PaperSimulation仿真

KAI:面向数据高效铰接物体操作的运动学感知接口

提出KAI运动学感知接口,通过运动学先验提升铰接物体操作的数据效率,降低机器人操作策略的样本需求。

Yaping Li, Zhaxizhuoma, Qiaojun Yu, Jia Zeng, Dahua Lin, Jiangmiao Pang2026年7月27日2 分钟阅读
EN

1. 论文概览:运动学感知的铰接物体操作接口

KAI(Kinematic-Aware Articulation Interface)于 2026 年 7 月提出,是一种结构化中间表征,将铰接物体的运动学结构显式编码到策略学习中。通过将可解释的几何和运动学先验嵌入策略学习,KAI 提供了与铰接运动底层结构对齐的强归纳偏置,有效提升样本效率——在六项仿真任务上平均成功率达 82.9%,仅用一半演示数据即可匹配或超越基线性能。该方法还展现出对未见背景和视觉干扰的鲁棒泛化能力,从单一干净训练环境迁移到杂乱真实场景。KAI 的动作无关设计进一步支持与人类交互视频的协同训练:在多样视觉干扰下,协同训练后平均成功率超 70%。

KAI 概览

2. 核心问题:铰接物体操作的运动学结构缺失

铰接物体——门、抽屉、笔记本电脑、微波炉——在人类环境中无处不在。尽管外观和功能多样,它们共享一个基本属性:运动由运动学约束支配。门绕固定铰链旋转,抽屉沿约束导轨平移。可靠操作因此需要理解物体的哪部分移动及方向。端到端模仿学习方法学习直接的感知到动作映射,不显式建模运动学结构,迫使策略从数据隐式推断关节力学。在有限演示下,这导致依赖表面视觉线索,在背景或物体外观变化时泛化脆弱。已有中间表征如 affordance map、point flow 和 grasp pose 描述"在哪交互"或"应产生什么运动",而非直接编码物体底层运动学结构。KAI 的核心洞见:铰接物体操作最有效的归纳偏置是捕获铰接关节运动学约束的接口——显式表征运动学结构本身。

3. 方法:KAI 框架

3.1 运动学感知铰接接口

KAI 通过运动部分上的 $K$ 个交互关键点表征铰接物体运动学结构。对每个关键点 $i \in \{1,\ldots,K\}$,给定时间步 $t$ 的观测,KAI 预测未来位置序列 $\mathbf{l}_{t+1}^i, \ldots, \mathbf{l}_{t+N}^i$ 及对应位移 $\mathbf{d}_t^i, \ldots, \mathbf{d}_{t+N-1}^i$,其中 $\mathbf{d}_{t+\delta}^i = \mathbf{l}_{t+\delta+1}^i - \mathbf{l}_{t+\delta}^i$,$\delta \in \{0,\ldots,N-1\}$。为确保预测关键点尊重铰接运动的运动学约束,用几何损失正则化关键点集 $\mathcal{K}$:

$$\mathcal{L}_{\text{geo}} = \lambda_s \mathcal{L}_{\text{struct}} + \lambda_m \mathcal{L}_{\text{motion}} \tag{1}$$

其中 $\mathcal{L}_{\text{struct}}$ 强制等距约束以保持关键点间距离不变,$\mathcal{L}_{\text{motion}}$ 按关节类型正则化位移。

结构损失惩罚关键点间相对距离的变化,防止非物理变形:

$$\mathcal{L}_{\text{struct}} = \sum_{\delta=0}^{N-1} \sum_{i,j \in \mathcal{K}} \left|\|\mathbf{l}_{t+\delta+1}^i - \mathbf{l}_{t+\delta+1}^j\|_2 - \|\mathbf{l}_t^i - \mathbf{l}_t^j\|_2\right|^2 \tag{2}$$ KAI 方法架构

3.2 关节类型运动约束

移动关节运动约束为纯平移,通过最小化位移向量方差实现平移不变先验:

$$\mathcal{L}_{\text{motion}}^{\text{pris}} = \sum_{\delta=0}^{N-1} \sum_{i \in \mathcal{K}} \|\mathbf{d}_{t+\delta}^i - \bar{\mathbf{d}}_{t+\delta}\|_2^2 \tag{3}$$

其中 $\bar{\mathbf{d}}_{t+\delta} = \frac{1}{|\mathcal{K}|} \sum_{j \in \mathcal{K}} \mathbf{d}_{t+\delta}^j$ 为平均位移。转动关节运动建模为约束旋转,将关键点分为旋转轴上的静止锚点 $\mathcal{K}_a$ 和其余移动点 $\mathcal{K}_m$:

$$\mathcal{L}_{\text{motion}}^{\text{rev}} = \sum_{\delta=0}^{N-1} \left(\sum_{a \in \mathcal{K}_a} \|\mathbf{d}_{t+\delta}^a\|_2^2 + \sum_{i \in \mathcal{K}_m} \|\text{proj}(\mathbf{l}_{t+\delta+1}^i) - \text{proj}(\mathbf{l}_{t+\delta}^i)\|_2^2\right) \tag{4}$$

其中 $\text{proj}(\cdot)$ 为点到旋转轴的正交投影。锚点位移被惩罚为零,移动点在轴上的投影保持不变。

KAI 接口实例化

3.3 分阶段推理架构与协同训练

模型采用"感知-KAI-动作"分阶段推理架构。感知阶段融合 2D 语义特征(DINOv2 提取 RGB 语义特征投影到点云)与 3D 几何特征(稀疏 3D 编码器处理点云),经空间对齐器融合为统一视觉令牌。语言指令由 CLIP 文本编码器分词,机器人状态由 MLP 嵌入。KAI 令牌仅注意感知令牌预测关键点位置和位移,无动作信息访问;然后与感知令牌组合馈入动作解码器生成动作。单向注意力掩码强制信息流。模型总训练损失为 KAI 几何损失与动作模仿损失之和: $$\mathcal{L}_{ ext{total}} = \mathcal{L}_{ ext{action}} + \lambda_s \mathcal{L}_{ ext{struct}} + \lambda_m \mathcal{L}_{ ext{motion}} \tag{5}$$

协同训练策略利用人类交互视频(HOI4D 数据集)增强真实世界鲁棒性——KAI 的动作无关设计使其可从无机器人动作标签的人类视频中学习感知和运动学表征。

4. 实验

4.1 仿真结果

在 Isaac Sim 中评估六项任务(开抽屉、开门、开笔记本、关抽屉、关门、关笔记本),每任务 200 试验。KAI 无视频协同训练平均成功率达 82.9%,超越所有基线;协同训练后达 84.6%。

方法均值 SR开抽屉开门开笔记本关抽屉关门关笔记本
ACT58.544.552.567.539.054.093.5
Seer73.484.867.267.768.163.789.2
DP337.325.012.525.52.097.062.0
KAI82.986.754.581.782.392.5100.0
KAI (w/ video)84.686.866.085.081.888.899.2
仿真实验结果表

4.2 数据效率与泛化分析

在不同训练数据量(100/200/400/800 演示)下评估。KAI 在所有数据规模上始终优于 Seer 和 DP3。100 演示低数据场景下优势最显著。泛化测试中,无视频协同训练在背景干扰下平均 SR 66.7%,物体干扰下 62.2%;协同训练后分别提升至 +6.6%/+11.1%/+13.4%(无/背景/物体干扰),总超 70%。DP3 在背景变化下从 33.3% 降至 20.0%,而 KAI 仅降 4.5 个百分点。

数据量DP3SeerKAI
100 demos最高
200 demos
400 demos最高
800 demos最高
数据效率对比 真机实验设置

5. 局限性

  • 短时序任务:评估聚焦短时序操作任务,将 KAI 扩展到长时序序列任务是未来方向。
  • 单一机器人平台:真机实验仅用单一机器人平台,跨不同机器人平台的验证有待完成。
  • 关节类型覆盖:当前仅覆盖移动和转动关节,更复杂关节类型(如球关节)的扩展有待探索。

6. 总结

KAI 通过将运动学先验嵌入策略学习,为铰接物体操作提供了一种结构化中间表征。它通过运动部分上的 $K$ 个交互关键点预测未来位置和位移,并用等距约束和关节类型运动约束(移动/转动)正则化,显式编码铰接物体的运动学结构。分阶段推理架构确保 KAI 作为感知与动作间的结构化桥梁。仿真中 82.9% 平均成功率匹配基线但仅用一半数据;真机中从单一干净训练环境鲁棒迁移到未见背景和干扰。动作无关设计支持与人类交互视频协同训练,在视觉干扰下超 70% 成功率。核心洞见是:铰接物体操作的关键不在"学动作"而在"懂结构"——KAI 将"门绕铰链转、抽屉沿导轨移"这些物理常识显式编码为几何约束,让策略从数据驱动的猜测升级为结构驱动的推理。

flowchart TD
    A["RGB-D 图像 + 语言指令 + 机器人状态"] --> B["感知模块: DINOv2 语义 + 3D 点云几何"]
    B --> C["空间对齐器融合 → 统一视觉令牌"]
    C --> D["KAI 预测: K 个关键点未来位置 + 位移"]
    D --> E["几何正则化: 等距约束 + 关节运动约束"]
    E --> F{"关节类型?"}
    F -->|移动关节| G["平移不变: 位移方差最小化"]
    F -->|转动关节| H["旋转约束: 锚点不动 + 投影不变"]
    G --> I["KAI 令牌"]
    H --> I
    I --> J["动作解码器: 生成机器人动作"]
    C --> J
    K["人类交互视频 HOI4D"] --> L["协同训练: 动作无关设计"]
    L --> D
铰接物体操作的关键不在"学动作"而在"懂结构"——KAI 将"门绕铰链转、抽屉沿导轨移"这些物理常识显式编码为几何约束,让策略从数据驱动的猜测升级为结构驱动的推理。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日