PAPER DEEP DIVE
FeelWorld:面向分层接触预测与规划的视触觉世界模型
提出FeelWorld视触觉世界模型,实现分层接触预测与规划,服务于contact-rich操作的视触觉感知。
1. 论文概览:视触觉世界模型与分层接触预测规划
FeelWorld 由中科院自动化所、Imprintx Robotics 与北京智源人工智能研究院的 Wenxuan Ma、Chaofan Zhang 等于 2026 年 7 月提出,是一个分层视触觉世界模型,联合预测未来视觉潜在与三种触觉状态。人类通过想象候选动作的结果来规划物理交互,但现有视觉世界模型主要捕获外观动力学而忽略支配接触丰富交互的触觉状态,可能产生视觉合理但违反物理动力学的想象未来。FeelWorld 将触觉状态分层组织为:接触状态、编码力相关信息的 3D 触觉潜在、滑移状态,由共享潜在动力学模型联合预测并显式监督。为防止自由空间运动期间无关触觉信号退化视觉预测,引入接触门控非对称注意力——接触前维持纯视觉预测路径、接触时启用联合视触觉动力学预测。模型还用自回归 rollout 与上下文噪声注入训练以提升对复合误差的鲁棒性。预测的接触与滑移状态支持接触感知 CEM 规划。在芯片抓取、水果抓取、USB 插入上,FeelWorld 将 10 步 LPIPS 从 0.084 降至 0.058,80 步自回归 rollout 后 LPIPS 比视觉基线低 61%,零样本规划成功率均值 81.7%。
2. 核心问题:视觉世界模型忽视触觉动力学
接触丰富操作要求机器人推理物理交互。视觉提供全局场景上下文但仅间接反映接触物理;触觉直接测量力分布、局部变形与初始滑移,常捕获视觉遗漏的事件。现有视觉世界模型主要捕获外观动力学而忽略触觉状态,可能产生视觉合理但违反物理动力学的想象未来。挑战在于:如何将触觉纳入世界模型而不让自由空间运动期间的无关触觉信号退化视觉预测?以及如何用触觉预测指导规划而不在接触前过早优化不可达的触觉目标?
3. 方法:FeelWorld 架构
3.1 问题形式化
FeelWorld 学习动作条件动力学模型,联合预测未来视觉潜在与三种触觉状态。视觉输入为 $V$ 视角图像 $I_t$,冻结视觉编码器产生 $o_t = E_v(I_t)$,冻结触觉编码器产生 $h_t = E_\tau(P_t)$。触觉状态元组 $\tau_t = (c_t, h_t, s_t)$ 含接触状态、3D 触觉潜在与滑移状态。融合视触觉潜在 $z_t = [z_t^o; z_t^\tau]$,接触门 $g_t$ 控制触觉到视觉的调制。给定本体感受 $q_t$ 与 7 维动作 $a_t$,动力学模型预测:
$$\hat{z}_{t+1} = [\hat{z}_{t+1}^o; \hat{z}_{t+1}^\tau] = \mathcal{W}_\theta(z_t, g_t, q_t, a_t) \tag{1}$$视觉分量解码为 $\hat{o}_{t+1}$,触觉分量解码为 $\hat{\tau}_{t+1} = (\hat{c}_{t+1}, \hat{h}_{t+1}, \hat{s}_{t+1})$,其中 $\hat{c}, \hat{s} \in [0,1]$。
3.2 分层触觉建模
3D 触觉点云 $P_t$ 由预训练编码器编码:$h_t = E_\tau(P_t) \in \mathbb{R}^{d_\tau}$(公式2),编码接触面积、压力分布与主形变方向(省略 LayerNorm 以保留接触强度幅值)。触觉预测头解码:$\hat{h}_{t+1} = H_\tau(\hat{z}_{t+1}^\tau)$(公式3)。
Level 1 接触状态:两层 MLP 接触头预测二值接触概率 $\hat{c}_{t+1} = H_c(\hat{z}_{t+1}^\tau) \in [0,1]$(公式4),用 BCE 损失监督:
$$\mathcal{L}_{\text{contact}} = \mathrm{BCE}(\hat{c}_{t+1}, c_{t+1}) \tag{5}$$预测接触概率控制视触觉融合并激活规划时的触觉目标。Level 2 3D 触觉潜在:$\hat{h}_{t+1}$ 编码局部接触几何与表面形变,直接对触觉编码器的 stop-gradient 目标监督:$\mathcal{L}_{\text{tis}} = \|\hat{h}_{t+1} - \text{sg}(h_{t+1})\|$。Level 3 滑移状态:滑移头预测 $\hat{s}_{t+1} \in [0,1]$。
3.3 接触门控视触觉注意力
朴素拼接会让自由空间运动期间的噪声触觉干扰视觉令牌。引入接触门控非对称注意力:触觉令牌先注意视觉令牌(将局部触觉观测锚定于全局场景):
$$\hat{z}_t^\tau = z_t^\tau + \mathrm{CrossAttn}(z_t^\tau, z_t^o, z_t^o) \tag{11}$$视觉令牌是否注意触觉特征由二值接触门 $g_t$ 决定:
$$\hat{z}_t^o = z_t^o + g_t\, \mathrm{CrossAttn}(z_t^o, \hat{z}_t^\tau, \hat{z}_t^\tau) \tag{12}$$视觉分量保留纯视觉预测路径,仅在接触时纳入触觉证据。训练时 $g_t = c_t$(真值),推理时 $g_t = \mathbb{I}[\hat{c}_t \geq 0.5]$。
3.4 Rollout 训练与上下文噪声注入
教师强制训练后,用自回归 rollout 训练以提升对复合误差的鲁棒性,并注入上下文噪声。总训练损失为各分量加权和:
$$\mathcal{L}_{ ext{total}} = \lambda_o \mathcal{L}_{ ext{vis}} + \lambda_c \mathcal{L}_{ ext{contact}} + \lambda_h \mathcal{L}_{ ext{tis}} + \lambda_s \mathcal{L}_{ ext{slip}} ag{13}$$其中 $\mathcal{L}_{ ext{vis}}$ 为视觉潜在预测的 LPIPS 感知损失,$\mathcal{L}_{ ext{slip}} = \mathrm{BCE}(\hat{s}_{t+1}, s_{t+1})$ 为滑移分类损失,$\lambda_o, \lambda_c, \lambda_h, \lambda_s$ 为平衡权重。自回归 rollout 时逐步用模型自身预测替代真值输入,上下文噪声注入对编码器输出施加高斯扰动以模拟分布偏移。
3.5 接触感知 CEM 规划
预测的接触与滑移状态支持接触感知 CEM。每重规划周期,CEM 采样 400 候选动作序列于 $H_p=6$ 想象步,执行最优序列前两动作再重规划。接触前仅优化视觉目标,接触后才激活联合视触觉优化。
4. 实验
4.1 机器人平台与数据集
Imeta-Y1 机器人配备三个 RGB 相机与触觉传感器,在芯片抓取、水果抓取、USB 插入三项接触丰富任务上评估。
4.2 视觉预测评估
FeelWorld 将 10 步 LPIPS 从 0.084 降至 0.058,80 步自回归 rollout 后 LPIPS 比视觉基线低 61%。
| 模型 | 10 步 LPIPS ↓ | 80 步 LPIPS ↓ | 相对视觉基线改善 |
|---|---|---|---|
| V-JEPA 2(视觉基线) | 0.084 | 0.149 | — |
| Naive 视触觉融合 | 0.072 | 0.094 | −37% |
| FeelWorld(本文) | 0.058 | 0.058 | −61% |
FeelWorld 在 80 步长时序 rollout 后仍保持与 10 步几乎相同的 LPIPS(0.058),而视觉基线从 0.084 恶化至 0.149,表明接触门控使视觉预测在长程 rollout 中免受触觉噪声侵蚀。
4.3 零样本规划结果
| 任务 | V-JEPA 2(视觉基线) | Naive 视触觉 CEM | FeelWorld(本文) |
|---|---|---|---|
| 芯片抓取 | 40.0% | 47.5% | 82.5% |
| 水果抓取 | 70.0% | 75.0% | 87.5% |
| USB 插入 | 37.5% | 50.0% | 75.0% |
| 均值 | 49.2% | 57.5% | 81.7% |
视觉 CEM 可引导至视觉合理目标但无法保证稳定接触或成功插入;朴素视触觉 CEM 改善接触期优化但在接触前优化不可达触觉目标干扰自由空间接近;接触门控 CEM 接触前靠视觉、接触后才激活联合视触觉优化。USB 插入从 37.5% 提升至 75.0%。
5. 局限性
- 触觉编码器依赖:3D 触觉潜在依赖预训练触觉编码器,其表征质量影响下游预测。
- 接触门阈值固定:$g_t = \mathbb{I}[\hat{c}_t \geq 0.5]$ 的 0.5 阈值为硬编码,不同任务可能需自适应。
- 规划视野有限:CEM 规划视野 $H_p=6$ 步,更长时序任务的规划能力待验证。
- 三项任务评估:仅芯片/水果/USB 三任务,更多接触丰富场景的泛化能力待扩展。
- 触觉传感器硬件依赖:需配备触觉传感器,无触觉传感器的机器人无法使用。
6. 总结
FeelWorld 是一个分层视触觉世界模型,将触觉状态分层为接触、3D 触觉潜在与滑移,由共享动力学模型联合预测并显式监督。接触门控非对称注意力在接触前保护视觉预测、接触时启用联合视触觉动力学,解决了自由空间无关触觉退化视觉预测的难题。自回归 rollout 与上下文噪声注入提升对复合误差的鲁棒性。预测的接触与滑移状态支持接触感知 CEM 规划——接触前靠视觉引导、接触后才激活联合视触觉优化。10 步 LPIPS 从 0.084 降至 0.058,零样本规划均值 81.7%。核心洞见是:触觉应在接触时才被"听进去"——过早纳入触觉如同在自由空间里追逐幻影,接触门控让世界模型在视觉与触觉之间按物理时序切换。
flowchart TD
A["多视角图像 I_t"] --> B["冻结视觉编码器 → o_t"]
C["3D 触觉点云 P_t"] --> D["冻结触觉编码器 → h_t"]
B --> E["视觉令牌 z_t^o"]
D --> F["触觉令牌 z_t^τ"]
F --> G["触觉注意视觉: ĉ_t^τ"]
E --> H{"接触门 g_t?"}
G --> H
H -->|否 自由空间| I["纯视觉预测路径"]
H -->|是 接触| J["联合视触觉动力学"]
I --> K["融合潜在 ẑ_t"]
J --> K
L["本体感受 q_t + 动作 a_t"] --> M["动力学模型 W_θ"]
K --> M
M --> N["ẑ_t+1 = [ẑ^o; ẑ^τ]"]
N --> O["解码: ô_t+1 + (ĉ,ĥ,ŝ)"]
O --> P["接触感知 CEM 规划"]



