Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper世界模型World Model

FeelWorld:面向分层接触预测与规划的视触觉世界模型

提出FeelWorld视触觉世界模型,实现分层接触预测与规划,服务于contact-rich操作的视触觉感知。

Wenxuan Ma, Chaofan Zhang, Chao Xue, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang2026年7月27日3 分钟阅读
EN

1. 论文概览:视触觉世界模型与分层接触预测规划

FeelWorld 由中科院自动化所、Imprintx Robotics 与北京智源人工智能研究院的 Wenxuan Ma、Chaofan Zhang 等于 2026 年 7 月提出,是一个分层视触觉世界模型,联合预测未来视觉潜在与三种触觉状态。人类通过想象候选动作的结果来规划物理交互,但现有视觉世界模型主要捕获外观动力学而忽略支配接触丰富交互的触觉状态,可能产生视觉合理但违反物理动力学的想象未来。FeelWorld 将触觉状态分层组织为:接触状态、编码力相关信息的 3D 触觉潜在、滑移状态,由共享潜在动力学模型联合预测并显式监督。为防止自由空间运动期间无关触觉信号退化视觉预测,引入接触门控非对称注意力——接触前维持纯视觉预测路径、接触时启用联合视触觉动力学预测。模型还用自回归 rollout 与上下文噪声注入训练以提升对复合误差的鲁棒性。预测的接触与滑移状态支持接触感知 CEM 规划。在芯片抓取、水果抓取、USB 插入上,FeelWorld 将 10 步 LPIPS 从 0.084 降至 0.058,80 步自回归 rollout 后 LPIPS 比视觉基线低 61%,零样本规划成功率均值 81.7%。

FeelWorld 总览

2. 核心问题:视觉世界模型忽视触觉动力学

接触丰富操作要求机器人推理物理交互。视觉提供全局场景上下文但仅间接反映接触物理;触觉直接测量力分布、局部变形与初始滑移,常捕获视觉遗漏的事件。现有视觉世界模型主要捕获外观动力学而忽略触觉状态,可能产生视觉合理但违反物理动力学的想象未来。挑战在于:如何将触觉纳入世界模型而不让自由空间运动期间的无关触觉信号退化视觉预测?以及如何用触觉预测指导规划而不在接触前过早优化不可达的触觉目标?

3. 方法:FeelWorld 架构

3.1 问题形式化

FeelWorld 学习动作条件动力学模型,联合预测未来视觉潜在与三种触觉状态。视觉输入为 $V$ 视角图像 $I_t$,冻结视觉编码器产生 $o_t = E_v(I_t)$,冻结触觉编码器产生 $h_t = E_\tau(P_t)$。触觉状态元组 $\tau_t = (c_t, h_t, s_t)$ 含接触状态、3D 触觉潜在与滑移状态。融合视触觉潜在 $z_t = [z_t^o; z_t^\tau]$,接触门 $g_t$ 控制触觉到视觉的调制。给定本体感受 $q_t$ 与 7 维动作 $a_t$,动力学模型预测:

$$\hat{z}_{t+1} = [\hat{z}_{t+1}^o; \hat{z}_{t+1}^\tau] = \mathcal{W}_\theta(z_t, g_t, q_t, a_t) \tag{1}$$

视觉分量解码为 $\hat{o}_{t+1}$,触觉分量解码为 $\hat{\tau}_{t+1} = (\hat{c}_{t+1}, \hat{h}_{t+1}, \hat{s}_{t+1})$,其中 $\hat{c}, \hat{s} \in [0,1]$。

FeelWorld 架构

3.2 分层触觉建模

3D 触觉点云 $P_t$ 由预训练编码器编码:$h_t = E_\tau(P_t) \in \mathbb{R}^{d_\tau}$(公式2),编码接触面积、压力分布与主形变方向(省略 LayerNorm 以保留接触强度幅值)。触觉预测头解码:$\hat{h}_{t+1} = H_\tau(\hat{z}_{t+1}^\tau)$(公式3)。

Level 1 接触状态:两层 MLP 接触头预测二值接触概率 $\hat{c}_{t+1} = H_c(\hat{z}_{t+1}^\tau) \in [0,1]$(公式4),用 BCE 损失监督:

$$\mathcal{L}_{\text{contact}} = \mathrm{BCE}(\hat{c}_{t+1}, c_{t+1}) \tag{5}$$

预测接触概率控制视触觉融合并激活规划时的触觉目标。Level 2 3D 触觉潜在:$\hat{h}_{t+1}$ 编码局部接触几何与表面形变,直接对触觉编码器的 stop-gradient 目标监督:$\mathcal{L}_{\text{tis}} = \|\hat{h}_{t+1} - \text{sg}(h_{t+1})\|$。Level 3 滑移状态:滑移头预测 $\hat{s}_{t+1} \in [0,1]$。

3.3 接触门控视触觉注意力

朴素拼接会让自由空间运动期间的噪声触觉干扰视觉令牌。引入接触门控非对称注意力:触觉令牌先注意视觉令牌(将局部触觉观测锚定于全局场景):

$$\hat{z}_t^\tau = z_t^\tau + \mathrm{CrossAttn}(z_t^\tau, z_t^o, z_t^o) \tag{11}$$

视觉令牌是否注意触觉特征由二值接触门 $g_t$ 决定:

$$\hat{z}_t^o = z_t^o + g_t\, \mathrm{CrossAttn}(z_t^o, \hat{z}_t^\tau, \hat{z}_t^\tau) \tag{12}$$

视觉分量保留纯视觉预测路径,仅在接触时纳入触觉证据。训练时 $g_t = c_t$(真值),推理时 $g_t = \mathbb{I}[\hat{c}_t \geq 0.5]$。

3.4 Rollout 训练与上下文噪声注入

教师强制训练后,用自回归 rollout 训练以提升对复合误差的鲁棒性,并注入上下文噪声。总训练损失为各分量加权和:

$$\mathcal{L}_{ ext{total}} = \lambda_o \mathcal{L}_{ ext{vis}} + \lambda_c \mathcal{L}_{ ext{contact}} + \lambda_h \mathcal{L}_{ ext{tis}} + \lambda_s \mathcal{L}_{ ext{slip}} ag{13}$$

其中 $\mathcal{L}_{ ext{vis}}$ 为视觉潜在预测的 LPIPS 感知损失,$\mathcal{L}_{ ext{slip}} = \mathrm{BCE}(\hat{s}_{t+1}, s_{t+1})$ 为滑移分类损失,$\lambda_o, \lambda_c, \lambda_h, \lambda_s$ 为平衡权重。自回归 rollout 时逐步用模型自身预测替代真值输入,上下文噪声注入对编码器输出施加高斯扰动以模拟分布偏移。

3.5 接触感知 CEM 规划

预测的接触与滑移状态支持接触感知 CEM。每重规划周期,CEM 采样 400 候选动作序列于 $H_p=6$ 想象步,执行最优序列前两动作再重规划。接触前仅优化视觉目标,接触后才激活联合视触觉优化。

接触感知 CEM 规划算法

4. 实验

4.1 机器人平台与数据集

Imeta-Y1 机器人配备三个 RGB 相机与触觉传感器,在芯片抓取、水果抓取、USB 插入三项接触丰富任务上评估。

Imeta-Y1 机器人平台

4.2 视觉预测评估

FeelWorld 将 10 步 LPIPS 从 0.084 降至 0.058,80 步自回归 rollout 后 LPIPS 比视觉基线低 61%。

模型10 步 LPIPS ↓80 步 LPIPS ↓相对视觉基线改善
V-JEPA 2(视觉基线)0.0840.149
Naive 视触觉融合0.0720.094−37%
FeelWorld(本文)0.0580.058−61%

FeelWorld 在 80 步长时序 rollout 后仍保持与 10 步几乎相同的 LPIPS(0.058),而视觉基线从 0.084 恶化至 0.149,表明接触门控使视觉预测在长程 rollout 中免受触觉噪声侵蚀。

10 步 rollout 质量对比表 FeelWorld 定性可视化

4.3 零样本规划结果

任务V-JEPA 2(视觉基线)Naive 视触觉 CEMFeelWorld(本文)
芯片抓取40.0%47.5%82.5%
水果抓取70.0%75.0%87.5%
USB 插入37.5%50.0%75.0%
均值49.2%57.5%81.7%

视觉 CEM 可引导至视觉合理目标但无法保证稳定接触或成功插入;朴素视触觉 CEM 改善接触期优化但在接触前优化不可达触觉目标干扰自由空间接近;接触门控 CEM 接触前靠视觉、接触后才激活联合视触觉优化。USB 插入从 37.5% 提升至 75.0%。

5. 局限性

  • 触觉编码器依赖:3D 触觉潜在依赖预训练触觉编码器,其表征质量影响下游预测。
  • 接触门阈值固定:$g_t = \mathbb{I}[\hat{c}_t \geq 0.5]$ 的 0.5 阈值为硬编码,不同任务可能需自适应。
  • 规划视野有限:CEM 规划视野 $H_p=6$ 步,更长时序任务的规划能力待验证。
  • 三项任务评估:仅芯片/水果/USB 三任务,更多接触丰富场景的泛化能力待扩展。
  • 触觉传感器硬件依赖:需配备触觉传感器,无触觉传感器的机器人无法使用。

6. 总结

FeelWorld 是一个分层视触觉世界模型,将触觉状态分层为接触、3D 触觉潜在与滑移,由共享动力学模型联合预测并显式监督。接触门控非对称注意力在接触前保护视觉预测、接触时启用联合视触觉动力学,解决了自由空间无关触觉退化视觉预测的难题。自回归 rollout 与上下文噪声注入提升对复合误差的鲁棒性。预测的接触与滑移状态支持接触感知 CEM 规划——接触前靠视觉引导、接触后才激活联合视触觉优化。10 步 LPIPS 从 0.084 降至 0.058,零样本规划均值 81.7%。核心洞见是:触觉应在接触时才被"听进去"——过早纳入触觉如同在自由空间里追逐幻影,接触门控让世界模型在视觉与触觉之间按物理时序切换。

flowchart TD
    A["多视角图像 I_t"] --> B["冻结视觉编码器 → o_t"]
    C["3D 触觉点云 P_t"] --> D["冻结触觉编码器 → h_t"]
    B --> E["视觉令牌 z_t^o"]
    D --> F["触觉令牌 z_t^τ"]
    F --> G["触觉注意视觉: ĉ_t^τ"]
    E --> H{"接触门 g_t?"}
    G --> H
    H -->|否 自由空间| I["纯视觉预测路径"]
    H -->|是 接触| J["联合视触觉动力学"]
    I --> K["融合潜在 ẑ_t"]
    J --> K
    L["本体感受 q_t + 动作 a_t"] --> M["动力学模型 W_θ"]
    K --> M
    M --> N["ẑ_t+1 = [ẑ^o; ẑ^τ]"]
    N --> O["解码: ô_t+1 + (ĉ,ĥ,ŝ)"]
    O --> P["接触感知 CEM 规划"]
触觉应在接触时才被"听进去"——过早纳入触觉如同在自由空间里追逐幻影,接触门控让世界模型在视觉与触觉之间按物理时序切换。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日