Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

具身智能PaperEmbodied AI

N0-TWAM:面向接触丰富操作的触觉原生世界-动作模型缩放

提出N0-TWAM,首个大规模触觉原生世界-动作模型,同时预测未来视觉与未来接触,在contact-rich操作上展现强能力。

NeoteAI Team, Fudan TEAI Team2026年7月26日5 分钟阅读
EN

1. 论文概览:让世界-动作模型原生拥有触觉

触觉原生世界-动作模型 𝒩₀-TWAM(Tactile-Native World Action Model)由 NeoteAI 与复旦 TEAI 团队于 2026 年 7 月发布,是首个大规模训练的触觉世界-动作模型。它不再把视觉和触觉当作两种割裂的输入,而是在一个统一的生成模型里同时预测"机器人即将看到什么、感受到什么、以及执行什么动作"三股耦合的流。模型在六种本体、450 个任务、数万小时真实机器人数据上预训练,并在 UniVTAC 公共触觉仿真基准、自建 NeoSim 套件以及八项真实接触丰富任务上系统评估,全面超越现有视觉-语言-动作(VLA)策略和纯视觉世界-动作模型。

N0-TWAM 总览

总览图揭示了 𝒩₀-TWAM 的设计哲学:以一个非对称的 Mixture-of-Transformers(MoT)骨干,将视频专家保持全宽以承载强大的视觉与动力学先验,而动作与触觉专家以窄宽度从零训练,通过共享自注意力从视频先验中获益。触觉并非旁路输入,而是与视频同等重要、在共享注意力中直接可比的潜在令牌。

2. 核心问题:接触丰富操作为何需要触觉与预见

论文开篇点出一个朴素却关键的观察:在拧螺丝、从堆叠杯子中剥离一个、抓取柔软物体这类接触丰富场景里,操作的成功与否更少取决于场景的全局布局,更多取决于指尖正在发生什么——而摄像头往往无法分辨这种局部接触细节,力/触觉传感器却能直接报告。因此,一个要在这些场景中表现良好的策略,需要两样纯视觉运动回归所天然不具备的东西:

  • 触觉的访问:直接获取接触、滑移、压力信号;
  • 对交互近未来的预见能力:不是仅对当前帧反应,而是预测接下来的交互将如何展开。

𝒩₀-TWAM 正是为同时满足这两点而生:它既是世界模型(预测未来视觉与触觉),又是动作模型(从预测的未来中读出动作),让策略在一个"已预见的未来"上行动。

3. 方法:三模态生成式世界-动作模型

3.1 问题设定与联合分布

给定观测历史与语言指令 $c$,𝒩₀-TWAM 预测每个 chunk 的未来视频 $x_k^v$、触觉 $x_k^t$ 与动作 $x_k^a$,并以自回归方式在 chunk 上建模其联合分布:

$$p_{\theta}(x_{1:K}^v, x_{1:K}^t, x_{1:K}^a \mid c) = \prod_{k=1}^{K} \underbrace{p_{\theta}(x_k^v, x_k^t \mid X_{<k}, c)}_{\text{预测}} \cdot \underbrace{p_{\theta}(x_k^a \mid x_k^v, x_k^t, X_{<k}, c)}_{\text{动作}} \tag{1}$$

其中 $X_{<k}=(x_{<k}^v, x_{<k}^t, x_{<k}^a)$ 收集过去的视频、触觉与动作。关键设计是:动作令牌是在刚预测出的 $x_k^v$ 与 $x_k^t$ 条件下去噪的,因此策略是在"已预见的未来"上行动,而非仅对当前帧被动反应。视觉与触觉被同等对待、联合预测。

3.2 条件流匹配目标

模型采用流匹配(Flow Matching)回归从干净目标 $x$ 到高斯噪声 $\epsilon \sim \mathcal{N}(0,I)$ 的直线路径速度。设 $x_{k,j}^m$ 为 chunk $k$ 中模态 $m \in \{v,a,t\}$ 的时间组 $j$(视频/触觉为 VAE 潜在帧,动作为对齐的动作步),且 $J_v=J_t=J_a=2$。每个组独立采样噪声层级 $\sigma_{k,j}^m \sim p(\sigma)$ 与噪声 $\epsilon_{k,j}^m$:

$$\hat{x}_{k,j}^m = (1-\sigma_{k,j}^m)\, x_{k,j}^m + \sigma_{k,j}^m\, \epsilon_{k,j}^m, \qquad u_{k,j}^m = \epsilon_{k,j}^m - x_{k,j}^m \tag{2}$$

多模态流匹配损失为:

$$\mathcal{L} = \sum_{m \in \{v,a,t\}} \frac{\lambda_m}{J_m} \sum_{j=1}^{J_m} \mathbb{E}\left[\left\| \sqrt{w_{k,j}^m} \odot \left(f_{\theta,k,j}^m(\hat{X},\Sigma,c;\mathcal{M}) - u_{k,j}^m\right) \right\|_2^2 \right] \tag{3}$$

其中 $w_{k,j}^m \geq 0$ 结合了 SNR 加权与动作有效性掩码(在单臂本体上丢弃缺失臂)。三模态权重为 $1{:}1{:}1$ 等权。

3.3 Mixture-of-Transformers 骨干

遵循 MoT 设计,骨干被拆分为三个专家(视频、动作、触觉),每层只共享一个自注意力。在第 $\ell$ 层,专家 $m$ 归一化自身隐状态、施加自身时间步调制,并投影到公共注意力宽度 $d$:

$$Q^m, K^m, V^m = \mathrm{Proj}_\ell^m\!\left(\mathrm{AdaLN}_\ell^m(h^m)\right), \qquad m \in \{v,a,t\} \tag{4}$$

各专家的 Q/K/V 以固定顺序 $[v \mid a \mid t]$ 拼接,经过一次带掩码的自注意力:

$$[O^v \mid O^a \mid O^t] = \mathrm{Attn}\!\left([Q^v|Q^a|Q^t], [K^v|K^a|K^t], [V^v|V^a|V^t]; \mathcal{M}\right) \tag{5}$$

之后各专家施加各自的门控输出投影与前馈网络。

MoT 骨干架构

3.4 参数高效专家:非对称设计

朴素的三专家骨干会将最大组件的成本变为三倍。𝒩₀-TWAM 反其道而行:只让共享注意力保持全宽 $d$,每个专家运行更窄的私有残差/FFN 宽度 $d_m$。全宽视频专家从一个预训练的非 MoT 共享骨干世界-动作模型热启动,从而继承强大的视觉与动力学先验;而窄动作与触觉专家以 $d_a = d_t = 1024$ 运行(对比视频专家 $d_v = 3072$),从零训练,仅通过共享注意力获得视觉先验。共享自注意力在 $d=3072$($24 \times 128$ 头)上跨层运行。

组件宽度初始化说明
视频专家$d_v=3072$热启动约占骨干 70%,继承视觉先验
动作专家$d_a=1024$从零通过共享注意力获益
触觉专家$d_t=1024$从零事件驱动,独立权重
共享注意力$d=3072$24×128 头,跨层共享

因为视频专家约占骨干 70%,将两个新模态做窄而非做宽,大致使可训练参数减半。

3.5 扩散强制级联

共享注意力由因果掩码 $\mathcal{M}$ 治理,在一个前向传播内实现公式 (1) 的因式分解。每个令牌有两个索引:潜在帧位置与噪声状态。在一个 chunk 内,其两个潜在帧取连续位置,同一帧的视频与触觉令牌共享一个位置,动作跟随其条件化的预测帧。在状态上,每个令牌继承其潜在帧组的噪声层级——生成时为噪声态,成为历史后为干净态。训练时干净历史令牌是真实过去(教师强制),推理时则由模型自回归生成。这便是扩散强制(diffusion-forcing)级联:先去噪未来视频与触觉潜在,再在刚预测的量上去噪动作。

自注意力掩码级联

3.6 动作表示:为何选 delta 而非绝对位姿

每个臂贡献 10 维每帧动作(3D 末端位置、6D 朝向、1D 夹爪命令),双臂为 20 维。遵循 $\pi_{0.5}$,回归 delta 末端目标而非绝对位姿,锚定于 chunk 起始位姿:

$$\Delta p = p_t - p_a, \qquad \Delta r = r_t - r_a$$

选择坐标逐元素减法而非相对旋转 $R_a^\top R_t$,因为当位姿近静止时相对旋转是一个非零常数,小预测误差会累积为持续的朝向偏移;而减法使静止态为零向量 $\Delta r = 0$,这是回归器的自然目标。夹爪命令保持绝对,这 20 维空间是跨所有本体的统一动作接口。

4. 双路径触觉设计:预测与观测

触觉在 𝒩₀-TWAM 内沿两条路径建模,各自匹配其角色:

  • 预测路径(预见性):未来接触以 VAE 潜在表示生成,与视频联合去噪,作为动作生成的条件流入级联。因为必须被生成,它生活在 VAE 潜在空间中。
  • 观测路径(条件性):当前真实触觉通过 NeoForce 编码器读入,以力空间表示条件化动作生成。
双路径触觉设计

简言之:𝒩₀-TWAM 在潜在空间预测触觉,在力空间观测触觉。观测-触觉编码器 $E_{\mathrm{obs}}$ 与表示无关,可按域实例化;以零初始化接入,使其起始为精确无操作,可嫁接到预训练模型上而不扰动它。

4.1 预测未来触觉:残差形式

每个触觉流经 VAE 编码,以与视频潜在相同的 $(1,2,2)$ 块进行分块,因此触觉以普通潜在令牌进入骨干。一个可学习的传感器 id 嵌入(最多四传感器)让一个专家无差别服务单臂与双臂数据。与视频共享潜在空间使共享注意力有意义——视觉与触觉令牌变得直接可比。但触觉保持私有权重:触觉统计是稀疏且事件驱动的,将此类令牌注入视觉动力学模型会退化视频与动作预测。在权重层面而非注意力层面隔离触觉,让视觉与触觉保持相互注意的同时拥有独立容量。触觉专家将预测触觉潜在作为生成目标,使其提前一个 chunk 预测未来接触,而非仅读取当前触觉信号。预测采用残差形式:

$$\Delta_i^t = x_i^t - x_0^t, \qquad x_i^t = x_0^t + \Delta_i^t$$

4.2 观测触觉:NeoForce 力空间表示

观测路径的编码器是 NeoForce——𝒩₀-Foundation 的触觉表示模型。NeoForce 接收同步的 RGB 观测块与触觉力图,返回力空间的触觉表示。其触觉输入不是原始 gel 图像,而是一个稠密的三轴表面力图:

$$\hat{F} = g_\theta(T) \in \mathbb{R}^{H \times W \times 3}$$

由可学习估计器 $g_\theta$ 产生。面内分量 $[f_x, f_y]$ 承载驱动滑移与抓取的剪切,法向分量 $f_z$ 承载按压压力,另加二值接触掩码标记表面何处被触碰——对并行夹爪共六通道。因为这些单位是物理的而非绑定于特定 gel 外观,一个编码器可服务不同传感器。𝒩₀-TWAM 中估计器 $g_\theta$ 作为标定的传感器-物理转换器保持冻结,梯度止于力图;NeoForce 编码器热启动 $E_{\mathrm{obs}}$ 并以动作损失微调,使策略将从大规模学到的接触先验专门化到正在学习的行为上。

4.3 分阶段训练:预测先行,观测后启

两个角色被分离到两个训练阶段:预训练仅用预测流,观测路径关闭——其任务是大规模学习生成式世界模型,预测触觉潜在作为生成目标契合该目标,迫使模型与未来场景联合预测未来接触、学习接触动力学。观测流不适合该目标:它是条件输入而非生成目标,依赖预训练 NeoForce 编码器与配对当前触觉读数,且若在预训练期给予策略真实当前接触,会使其依赖该信号而欠训练本应互补的预见。后训练再开启观测路径,叠加到已学会预测未来接触的模型之上。

5. 触觉感知执行:三时间尺度闭环

推理时 𝒩₀-TWAM 在 chunk 上自回归运行:每个 chunk 内遵循级联——先去噪未来视频与触觉潜在,再在刚预测的量上去噪动作,解码并执行后滑动前进。触觉进入闭环有三个时间尺度

  • 传感器速率的反射(公式 7 的观测路径);
  • chunk 速率的预测(与视频并行去噪的触觉预见);
  • 事件速率的任务时钟(触觉标点调度器)。

5.1 流式部署与实时推理

滚动缓存以训练的帧 id 因果顺序提交,注意窗口与训练窗口对齐。观测-触觉路径位于去噪循环之外,故其条件可在 chunk 级重新预测之间以传感器速率刷新。一旦视频与触觉被预测,其注意力键值被缓存,因此每个动作去噪步骤只重跑轻量动作专家而非全宽视频专家——这是实时效率的关键。

5.2 长时序执行的触觉标点

在长时序任务中,单一 episode 级指令不告诉模型机器人当前处于任务的哪个阶段。中途观测常常阶段模糊(泡茶一半的桌子与倒茶前很像),注意窗口不跨越整个 episode,而恒定提示不携带当前阶段信息——文本路径在任务内闲置,策略会停滞、重复或跳步。缺失的结构其实已存在于触觉流中:子任务由接触事件界定(抓取始于接触起、止于释放;倾倒始于容器加载、止于放下),其间触觉平稳,而接触事件处急剧变化。触觉流天然是标点式的。

触觉标点长时序执行

训练时分割:用触觉"标点"分割长时序演示,主要从触觉信号变化检测接触起与释放事件,必要时以夹爪孔径作回退。同一触觉读数还能区分成功抓取与空夹(夹爪可在不加载任何力的情况下闭合,故失败抓取显示孔径下降但无触觉上升)——因此一个信号既分割演示又验证任务成功。用 Gemini 3.5 Flash 为每个 clip 生成简短子任务指令并人工抽查。推理时推进:轻量调度器维护子任务队列,当前子任务完成时推进到下一提示。完成结合模型的两个触觉角色:预测未来触觉信号提前一步触发推进,观测流中相应的释放或接触起事件再确认它,提交切换。

6. 数据:六本体、450 任务的数万小时

预训练在数万小时操作数据上进行,来自多机器人语料:跨六种本体(ARX5、UR、Flexiv、Franka、PiPER 和手工采集的 UMI)的真实机器人演示。每个 clip 提供多视角 RGB(以 Wan2.2 VAE 在 $4\times$ 时间、$16\times$ 空间压缩下预编码)、同步的预测触觉流以及 20 维双臂 delta 末端动作。训练遵循两阶段课程:先在真实机器人数据上预训练至收敛,然后从该检查点继续混入 UMI 数据(约占批次 60%)。视频专家在两个阶段均热启动自同一预训练视频模型。

7. 实验:仿真与真实世界全面领先

7.1 评估协议

在三个套件上评估:UniVTAC(公共触觉操作仿真基准,八任务);NeoSim(自建仿真套件,十二任务,四单臂八双臂);以及八任务真实机器人套件(双臂 PiPER 四项、单臂 Flexiv 四项,其中六项取自 NeoReal)。报告任务成功率(%)及其任务平均(宏观平均,每任务等权)。仿真每任务 100 次试验、真实每任务 20 次试验,每次试验从随机初始构型开始。所有方法在异步滚动视野协议下闭环评估,每个控制周期策略消耗当前多视角 RGB、滚动历史缓存与当前观测触觉潜在,运行一次级联预测未来场景与接触,并去噪单个动作 chunk——16 步 20 维双臂 delta 末端动作。

7.2 UniVTAC 仿真结果

方法Insert HDMIInsert HoleInsert TubeGrasp ClassifyLift CanLift BottlePull-out KeyPut Bottle平均
$\pi_{0.5}$(VLA)82574496100353441.4
StarVLA-$\alpha$245269686532518856.1
InternVLA-A1129395869058663767.1
Xiaomi-Robotics-0699698451321801254.3
GigaWorld-Policy(WAM)012920038322116.5
LingBot-VA384296170058031.4
FastWAM19669872021733548.0
𝒩₀-TWAM(本文)689998949358798784.5

𝒩₀-TWAM 以 84.5% 的平均成功率大幅领先,比次优的 InternVLA-A1(67.1%)高出 17.4 个百分点,比最强的纯视觉世界-动作模型 FastWAM(48.0%)高出 36.5 个百分点。在 Insert HDMI、Grasp Classify、Lift Can、Pull-out Key 等高度依赖接触感知的任务上优势尤为显著。

7.3 真实世界结果

真实任务$\pi_{0.5}$LingBot-VAFastWAM𝒩₀-TWAM
Fruit Collection20406080
Hanoi Tower1525040
Bottle Standing020070
Socket Plugging60102070
Making Lemon Tea50015
Cup Stacking50302545
Bag Packing20101515
Board Wiping40403555
宏观平均30.021.914.446.3

𝒩₀-TWAM 以 46.3% 的宏观平均领先,对比最强 VLA 基线 $\pi_{0.5}$ 的 30.0%、纯视觉世界-动作模型 LingBot-VA 的 21.9% 与 FastWAM 的 14.4%。在 Bottle Standing(70% vs 0/20/0)、Socket Plugging(70% vs 60/10/20)、Hanoi Tower(40% vs 15/25/0)等接触丰富的精细操作上优势尤为突出。NeoSim 仿真上 𝒩₀-TWAM 达 49.4%。

8. 消融与分析:触觉两条路径都不可或缺

消融实验将增益归因于触觉的两种角色:移除预测预见目标移除观测条件化都会使成功率退化——证明两条路径各自贡献。在分布偏移下,𝒩₀-TWAM 比纯视觉世界-动作基线退化得更优雅。分析还考察了 delta 与绝对末端动作的差异、仿真触觉图像的真实性、在 gel 渲染触觉上的预训练力编码器、以及触觉预见等。后训练采用 LeRobot 数据集格式,真实机器人配置使用三个 RGB 相机与最多四个触觉流。目标以等权 $1{:}1{:}1$ 汇总视频潜在、预测触觉与掩码动作去噪损失。用 AdamW,学习率 $10^{-4}$,权重衰减 0.1,bf16 混合精度,梯度裁剪 2.0;任务特定运行每 GPU 一样本、四步梯度累积、1000 优化步。

9. 局限性

  • 触觉预见仍有提升空间:在 Making Lemon Tea 等多阶段长时序真实任务上绝对成功率仍偏低(15%),触觉标点调度在任务结构高度复杂时可能仍不足。
  • 硬件依赖:观测路径依赖 NeoForce 力空间表示与标定的传感器-物理转换器 $g_\theta$,对未标定或非力式触觉传感器的泛化能力有待验证。
  • 仿真与现实差距:仿真触觉图像的真实性被列为分析项之一,说明生成触觉与真实触觉间仍存在差距,可能影响仿真训练策略迁移。
  • 计算成本:尽管非对称 MoT 大致减半可训练参数,全宽视频专家($d_v=3072$)仍占骨干约 70%,大规模预训练的计算开销显著。
  • 子任务指令依赖 LLM 生成:演示分割后的子任务指令由 Gemini 3.5 Flash 生成并人工抽查,存在 LLM 幻觉风险与标注成本。

10. 总结

𝒩₀-TWAM 是首个大规模训练的触觉原生世界-动作模型,将触觉作为 MoT 骨干的原生模态而非旁路输入。其四大贡献环环相扣:原生触觉世界-动作模型使触觉与视频在共享注意力中直接可比;双路径预测/观测触觉设计让模型既预见未来接触又感知当前接触;触觉标点子任务系统用同一信号结构化训练与推理的长时序;强实证结果在仿真与真实接触丰富任务上全面领先。核心洞察是:接触丰富操作的成功由指尖决定,而一个能在生成式世界模型内同时预见视觉、触觉与动作的策略,比仅对当前帧反应的策略更稳健。代码库与模型检查点将公开发布。

flowchart LR
    A["多视角 RGB + 触觉力图 + 指令"] --> B["VAE 编码视频/触觉潜在"]
    B --> C["MoT 骨干: 全宽视频专家 + 窄动作/触觉专家"]
    C --> D{"扩散强制级联"}
    D --> E["预测未来视频潜在"]
    D --> F["预测未来触觉潜在
(残差形式)"] E --> G["条件化动作去噪"] F --> G G --> H["解码 16 步 delta 动作"] H --> I["执行 + 滑动前进"] I --> J{"触觉标点调度"} J -->|"预测触觉触发"| K["推进下一子任务"] J -->|"观测触觉确认"| K K --> C
当策略不再仅是对当前帧的反应,而是对已预见的未来的执行,接触丰富操作的可靠性便从指尖的直觉上升为模型的预见。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
ABot-N1:通用视觉语言导航基础模型

ABot-N1:通用视觉语言导航基础模型

高德ABot-N1是一个慢快双系统视觉语言导航基础模型:4B慢系统输出思维链与Target/Affordance双像素目标,2B快系统经QFormer动作查询解码连续SE(2)轨迹点,用统一像素接口覆盖坐标点、物体、POI、指令跟随与人员跟随五类任务。3000万样本预训练+GRPO安全感知后训练,并发布ABotN-PointBench与ABotN-POIBench两个闭环基准。五基准全部SOTA:POI入口到达77.3%(+35.0个百分点),室外/室内坐标点导航92.9%/95.4%,并部署于途途四足机器人Jetson AGX Orin。

视觉语言导航VLN导航基础模型2026年7月11日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日