Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型World Model视触觉

ViTacWorld:面向接触密集型机器人操作的视触觉世界模型

接触密集型机器人操作需要物理交互,ViTacWorld 扩展视触觉世界模型以支持此类操作。

Yunao Huang, Shiyu Sang, Haotao Lu, Suting Ni, Shijie Wu, Ziyang Guo, Ye Shi, Jingya Wang2026年7月24日2 分钟阅读
EN

ViTacWorld:面向接触丰富机器人操作的视触觉世界模型缩放

论文:ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation

作者:Yunao Huang, Shiyu Sang, Haotao Lu, Suting Ni, Shijie Wu, Ziyang Guo, Ye Shi, Jingya Wang

机构:上海科技大学

链接arXiv:2607.22530 · 项目主页


一句话总结

ViTacWorld 是首个用于机器人视触觉动作轨迹生成和策略评估的动作条件视触觉世界模型——利用公共真实触觉数据集和构建的仿真环境缩放视触觉动作数据,通过流感知调制和跨流交换的 DiT 生成时间对齐的视觉和触觉观测,先大规模预训练再真实策略 rollout 微调,在充电器插拔、黄瓜削皮、U块插入和长方体插入四个接触丰富任务上将触觉策略平均成功率从 42.5% 提升至 67.5%。


研究背景与动机

接触丰富操作任务(如插入、削皮、插拔)对真实世界机器人操作至关重要,但由于遮挡、受限接口和微妙的力依赖动态,仅靠视觉难以完成。触觉感知直接捕获接触处的物理交互,是关键模态而非补充信号。然而缩放视触觉机器人学习仍然困难:任务相关的视触觉动作轨迹难以大规模获取。真实机器人遥操作提供忠实数据但昂贵缓慢——GelSight 类视觉触觉传感器成本高、重复接触下寿命有限,接触丰富演示难以可靠收集。

现有视触觉学习方法主要依赖真实机器人遥操作收集数据,受限于传感器成本、寿命和任务多样性。TacSL、TacEx 和 UniVTAC 等仿真系统虽能生成触觉数据,但如何有效结合真实和仿真数据缩放视触觉世界模型仍是开放问题。ViTacWorld 的核心洞察是:触觉信号直接扎根于物理接触,相比纯视觉可能展现更小的仿真到真实差距。仿真提供可扩展替代方案。相比纯视觉观测,触觉信号更直接地扎根于局部接触几何和力响应,可能展现比纯视觉更小的仿真到真实差距。ViTacWorld 利用这一洞察,结合公共真实触觉数据集和任务对齐的仿真环境来缩放视触觉动作数据。

ViTacWorld概览图1:ViTacWorld 概览。右侧展示缩放训练管线,左侧展示视触觉 rollout 生成和策略评估。


方法详解

1. 问题形式化

给定当前观测 $o_t$(包含主相机、腕部相机和触觉图像)和动作序列 $u_{t:t+H-1}$,世界模型预测未来视触觉 rollout。每个观测流由 VAE 编码器编码为潜在 token,组装为统一视触觉序列。

2. 流感知 DiT 与跨流交换

ViTacWorld 扩展预训练的动作条件机器人视频世界模型至视触觉生成。引入流身份嵌入 $e^v$ 区分视觉和触觉流,投影到 AdaLN 调制路径。每个块 $b$ 先在流内进行流感知自注意力:

$$ \tilde{Z}_{b}^{v}=\mathrm{SelfAttn}_{v}\left(\mathrm{AdaLN}(Z_{b-1}^{v};c_{b}+P(e^{v}))\right),\quad v\in\mathcal{V} $$

然后通过显式跨视角注意力模块跨流交换信息:

$$ Z_{b}^{v}=\mathrm{CrossViewAttn}_{v}\left(\tilde{Z}_{b}^{v},\{\tilde{Z}_{b}^{v'}\}_{v'\neq v}\right),\quad v\in\mathcal{V} $$

这避免了普通自注意力中相机和触觉 token 的不受控混合,同时允许触觉流与视觉流交换接触信息。触觉作为一等观测流生成,与视觉 rollout 保持时间对齐。

3. 训练目标

ViTacWorld 使用潜在去噪目标训练,应用于未来视觉和触觉潜在:

$$ \mathcal{L}_{\mathrm{wm}}=\mathrm{E}_{z_{0},\sigma}\left[\left\|D_{\theta}(z_{\sigma},\sigma,o_{t},u_{t:t+H-1},m)-z_{0}\right\|_{2}^{2}\right] $$

其中 $z_0$ 为目标潜在 rollout,$z_\sigma$ 为噪声版本,$m$ 为视角存在掩码。动作序列通过继承的动作条件路径嵌入,经 AdaLN 调制注入 DiT。动作条件在视觉和触觉流的对应潜在时间步上重复: $$ c_b = \text{Embed}(u_{t:t+H-1}) + \text{PosEmb}(t), \quad c_b^v = c_b + P(e^v) $$ 其中 $c_b$ 为时间步-动作条件,$P(e^v)$ 为流身份投影。损失仅应用于未来预测帧和有效流。

4. 预训练与微调

先用大规模真实和仿真视触觉轨迹预训练,再用真实策略 rollout 微调以更好匹配下游操作行为。生成的 rollout 经任务成功和视触觉合理性过滤,选取 200 个高质量成功 rollout 与专家演示合并形成增强训练集。增强数据集为: $$ \mathcal{D}_{\text{aug}} = \mathcal{D}_{\text{expert}} \cup \{\tau_i \in \mathcal{D}_{\text{gen}} \mid \text{success}(\tau_i) \land \text{plausible}(\tau_i)\}_{i=1}^{200} $$ 其中 $\mathcal{D}_{\text{expert}}$ 为 300 条专家演示,$\mathcal{D}_{\text{gen}}$ 为生成 rollout 集合。下游策略在 $\mathcal{D}_{\text{aug}}$ 上训练。

flowchart TD
    A["公共真实触觉数据集"] --> C["大规模预训练
真实+仿真视触觉轨迹"] B["任务对齐仿真环境"] --> C C --> D["ViTacWorld 世界模型
流感知DiT + 跨流交换"] E["真实策略 rollout"] --> F["微调
匹配下游行为"] D --> F F --> G["生成视触觉 rollout"] G --> H["过滤: 任务成功 + 合理性"] H --> I["200个高质量rollout"] I --> J["与专家演示合并"] J --> K["增强训练下游策略"] K --> L["策略评估
动作条件视触觉预测"] style D fill:#e1f5fe style F fill:#fff3e0 style K fill:#e8f5e9

实验结果

策略改进

成功率表图2:真实机器人成功率表。ViTacWorld rollout 增强一致提升接触丰富操作性能。

表1:真实机器人成功率(%)——ViTacWorld rollout 增强一致提升性能
数据来源方法充电器插拔黄瓜削皮U块插入长方体插入平均
仅专家ACT+触觉00303015.0
仅专家π0.51030604035.0
仅专家π0.5+触觉2040704042.5
专家+ViTacWorldACT+触觉1020404027.5
专家+ViTacWorldπ0.53060604047.5
专家+ViTacWorldπ0.5+触觉4080807067.5

ViTacWorld rollout 增强将触觉 π0.5 策略平均成功率从 42.5% 提升至 67.5%(+25pp)。增益跨视觉基线和触觉策略一致出现。触觉策略更强改善表明生成的触觉观测包含接触相关信息。定性上,增强后策略展现更好的抓取定位和对初始位姿变化的鲁棒性,触觉策略在接触阶段执行小校正运动利用接触反馈重新对齐。

定性对比图3:使用相同 π0.5+触觉策略的真实机器人 rollout 定性对比。上:仅专家;下:专家+ViTacWorld。

世界模型质量分析

表2:留出验证片段上的世界模型预测质量——预训练和任务对齐仿真均改善生成
视角变体PSNR↑SSIM↑LPIPS↓
主相机w/o 预训练22.7180.78590.0781
主相机w/o 任务对齐仿真23.1280.80110.0687
主相机完整ViTacWorld24.2580.82860.0513
触觉w/o 预训练34.9670.92040.0211
触觉完整ViTacWorld35.2250.93180.0157
定性预测图4:留出验证片段上的定性世界模型预测。完整模型产生更清晰的 rollout,更好保持物体几何。

策略评估图5:使用 ViTacWorld 的策略评估表。


局限性

  1. 仿真到真实差距:虽然触觉信号的仿真到真实差距较小,但仿真触觉仍可能不完全匹配真实传感器的噪声和形变特性,影响生成数据的真实性。
  2. 任务对齐仿真依赖:任务对齐仿真环境需要针对每个真实场景手动构建,限制了完全自动化扩展到新任务的能力。
  3. 生成数据过滤成本:生成 rollout 的过滤(任务成功和视触觉合理性)需要额外评估管线,且过滤标准可能引入偏差。

总结与展望

ViTacWorld 是首个用于机器人视触觉动作轨迹生成和策略评估的动作条件视触觉世界模型。通过流感知 DiT 和跨流交换生成时间对齐的视觉和触觉观测,利用公共真实数据和任务对齐仿真缩放训练数据。在四个接触丰富任务上将触觉策略平均成功率从 42.5% 提升至 67.5%,并支持动作条件策略评估。这表明视触觉世界模型可以生成策略改进的接触丰富数据。

金句:「触觉信号直接扎根于物理接触,相比纯视觉观测可能展现更小的仿真到真实差距——这使得仿真触觉数据成为缩放视触觉机器人学习的可行途径。」

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日