Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

触觉感知视触表示学习灵巧操作

N₀-Foundation:迈向触觉智能时代的触觉具身操作基础(传感器、3万小时数据集、统一力表示与基准)

论文提出面向触觉具身操作的一体化范式 N₀-Foundation,覆盖硬件、数据、表示与评测四层:自研相机式触觉传感器与无机器人采集设备 N₀-TacUMI,构建超 3 万小时、6 种本体、450+ 任务的视触同步数据集 NeoData 并开源 5000 小时子集 OpenNeoData;提出以三轴稠密力场为统一监督的视触表示模型 NeoForce,实现跨传感器可迁移触觉表示;并给出真机 NeoReal(10 任务)与仿真 NeoSim(12 任务)双基准。实验表明策略收益来自物理接触状态而非触觉信号的设备外观,NeoForce 条件化使 π₀.₅ 在 NeoReal 的平均渐进分从 38.1% 提升至 47.5%。

NeoteAI Team, Fudan TEAI Team2026年8月30日4 分钟阅读
EN

一、论文信息

  • 标题:$\mathcal{N}_0$-Foundation: Towards the Age of Tactile Intelligence(N₀-Foundation:迈向触觉智能时代)
  • 团队:NeoteAI Team 与复旦大学 TEAI Team(Touch Embodied AI),近百名采集员参与
  • arXiv2608.29601(2026 年 8 月 30 日提交,cs.RO / cs.CV / cs.LG)
  • 项目主页research.neoteai.com/n0-foundation
  • 开放数据HuggingFace NeoteAIEmbodied/OpenNeoData(5000 小时开源子集,CC BY-NC-SA 4.0,gated 访问)
  • 代码状态:截至精读时未见公开代码仓库;论文声明发布数据集、表示模型与基准,其中 OpenNeoData 数据集已在 HuggingFace 上线。

二、一句话总结

这篇报告用「触觉传感硬件 → 3 万小时视触数据集 NeoData → 硬件无关的统一力场表示 NeoForce → NeoReal/NeoSim 双基准」的四件套闭环,为触觉使能的具身操作打下地基,并用实验证明:策略真正受益的是物理接触状态本身,而非触觉信号的设备外观。

图 1:$\mathcal{N}_0$-Foundation 总览——以触觉为中心的具身操作基础,统一硬件、数据、表示与评测四个层面(论文 Figure 1)。

三、研究背景与动机

过去三年,通用操作策略的进步几乎完全建立在视觉语料之上:BridgeData V2、Open X-Embodiment、DROID 等数据集把数据规模与本体多样性确立为机器人学习的两大核心要素。但这些语料的观测通道始终以视觉与本体感知为主,一个结构性缺口被反复暴露:接触状态、局部作用力与初始滑移(incipient slip)几乎无法从纯视觉中观测,而这些恰恰是可变形物体操作、精密装配、精细力控与持续表面交互的决定性信息。视觉可以告诉策略「手正在靠近杯子」,却无法告诉它「抓取是否已经稳固、是否可以在提升前松一口气」。

第二个困境来自触觉硬件本身的碎片化。光学凝胶传感器、电容阵列与压阻皮肤在单位、分辨率与感知几何上各不相同,任何建立在单一信号形态之上的表示与模型都天然绑定到产生它的那台设备,无法迁移到别的传感器。这意味着触觉领域即便积累了数据,也难以像视觉那样形成可共享、可累积的规模效应——每换一个传感器,模型几乎要从头再来。

论文用一张对比表(Table 1)系统梳理了现有数据集的缺口:BridgeData V2(60k 轨迹 / 13 任务)、Open X-Embodiment(1M+ 轨迹 / 22 种本体)、DROID(76k 轨迹 / 350 小时)均无触觉通道;RH20T 虽然提供视觉、力、音频与动作的多模态同步,但其七种配置中只有一种带指尖触觉;AgiBot World 以 100 多台同构移动双臂机器人积累了逾百万条轨迹(217 任务、2976.4 小时),但平台单一;便携式视触采集数据集(Touch in the Wild、FreeTacMan、ViTaMIn-B、TacUMI、exUMI 等)把接触传感装上手持设备,规模却停留在 $10^2$–$10^4$ 条演示,且触觉编码互不兼容——从低分辨率 taxel 阵列到相机式 RGB 流;TacVerse 与 Daimon-Infinity 扩大了无机器人采集的规模与时长,却完全没有真机平台的演示;最接近的 OmniVTA 拥有 21879 条视触动作轨迹 / 86 任务 / 126 物体,是唯一同时包含机器人与手持两种采集方式的语料,但缺少逐条质量验证。

由此,作者把触觉具身智能的瓶颈归纳为四个相互咬合的缺口:其一,缺少可扩展的采集基础设施(既要真机遥操作的可执行性,又要手持采集的规模效率);其二,缺少大规模、跨本体、带质量验证的视触统一语料;其三,缺少硬件无关、可被任意下游策略消费的触觉表示;其四,缺少针对接触密集操作的真机加仿真标准化评测。$\mathcal{N}_0$-Foundation 逐一回应这四个缺口,其贡献对应为四层:触觉采集基础设施、NeoData 跨本体视触数据集、NeoForce 统一力表示模型、NeoReal + NeoSim 标准化评测协议。

这种定位值得强调:在视觉操作领域,「数据基础设施」(如 Open X-Embodiment)与「策略模型」(如 $\pi_0$ 系列)的分工已经清晰;而在触觉领域,由于硬件碎片化,基础设施本身就尚未成型。本文因此更接近于「给触觉操作领域铺设第一条高速公路」,其价值要通过后续在其上训练的策略来兑现。

四、触觉采集基础设施:传感器与 $\mathcal{N}_0$-TacUMI

整套基础设施的起点是一枚基于相机的视触传感器(camera-based visuo-tactile sensor)。它沿用 GelSight/DIGIT 一脉的光学原理:接触信息通过可变形感知表面的光学畸变恢复。具体是一个分层组装结构——最外层是耐磨玻璃面板,保护接触面在反复交互中不被磨蚀;其下是弹性感知层,表面带有纹理图案,受载变形时纹理位移编码了施加的力;主体内嵌一枚 RGB 相机观察感知层背面,配合一块紧凑的控制板负责照明、成像与数据传输。

当手指接触物体时,局部压力与剪切力使感知层变形,相机捕获纹理位移,得到触觉图像 $T_t \in \mathbb{R}^{H \times W \times 3}$。论文用一个简洁的算子复合刻画这一成像过程:

$$T_t = \mathcal{C}\big(\Phi(F_t)\big)$$

其中 $\Phi$ 是弹性体的力-形变传递函数,把空间力分布 $F$ 映射为形变场;$\mathcal{C}$ 是内部相机的成像过程。这个公式的深意在于:从触觉图像 $T_t$ 恢复底层力场 $F_t$,本质上是求复合算子 $\mathcal{C} \circ \Phi$ 的逆映射——这正是后文力场转换模型 $g_\theta$ 的理论动机,也为「触觉图像只是设备外观、力场才是物理本质」的论点埋下伏笔。

图 2:$\mathcal{N}_0$-TacUMI 手持采集设备:鱼眼相机提供广角腕部视角,两枚视触传感器记录指尖接触,红外追踪器给出低漂移六自由度位姿,磁编码器经齿轮齿条传动读取夹爪开度;插图展示触觉传感器的分层结构(论文 Figure 2)。

在传感器之上,团队构建了 $\mathcal{N}_0$-TacUMI 手持采集设备,用于无机器人(robot-free)数据采集。设备由一个配备两枚触觉传感器的平行夹爪、一枚 $160^\circ$ 视场鱼眼相机(广角腕部视角)、一套红外追踪系统(在全局追踪坐标系中提供低漂移的六自由度夹爪位姿)以及一枚磁编码器(通过齿轮齿条传动读取瞬时指距)组成。它同步记录腕部图像、左右触觉图像、夹爪开度与相对末端运动。

动作定义沿用 UMI 惯例:以末端执行器位姿与夹爪宽度表示动作,而非特定机器人的关节指令。这一选择使演示不再绑定具体机器人基坐标系,手持轨迹与真机遥操作数据天然兼容——这是后文把两种采集模式融合进同一个语料库的前提。同时,系统还支持五种真机平台(ARX X5、UR5e、Flexiv Rizon 4s、Piper、Franka Research 3)的遥操作采集,每条演示都以末端执行器位姿、夹爪宽度与同步触觉流统一记录,为跨本体训练铺平格式基础。

五、NeoData:3 万小时视触语料与其治理流水线

在这套基础设施之上构建的 NeoData,是迄今最大规模的触觉使能真机操作数据集之一:超过 30000 小时交互、140 万条 episode、33 亿个时间步,80 亿 RGB 帧与 100 亿触觉帧配对;覆盖六种本体(手持 $\mathcal{N}_0$-TacUMI 与五种机器人平台),由近百名人类操作员采集。每条 episode 都包含同步的视觉与触觉流,接触信号贯穿整个操作过程,而非只在离散抓取事件上可用。为促进开放研究,团队另发布 OpenNeoData——5000 小时的开源子集,覆盖六种本体、250+ 任务、200+ 技能。

数据构成上,$\mathcal{N}_0$-TacUMI 贡献了 57% 的轨迹,体现手持采集在灵巧与重复性任务上的规模效率;五种真机本体贡献其余部分,锚定语料的可执行性。任务分布刻意偏向触觉相关操作:折叠、拾放、擦拭清洁、堆叠、装配、插入、倾倒、开关、分类等高频类别,覆盖可变形物体操作、精密配合、精细抓取、持续表面接触与视觉歧义下的操作。场景涵盖桌面、工作台、洗衣、厨房、实验室与仓储环境;物体横跨容器、工具、可变形物、厨具、电子件与实验器材。episode 时长峰值在 80 秒附近,并带有多步交互的长尾,同时支持短接触原语与长任务序列的学习。

把真机遥操作与手持式 UMI 两种异质来源融合成可训练语料,需要一条严格的清洗流水线。论文设计了五阶段质量关卡:第一,数据完整性——凡缺失视觉、触觉、动作或元数据任何一路流的 episode 一律剔除;第二,运动质量——沿轨迹估计平滑度,标记突变的跟踪脉冲与丢失段,被这类伪影主导的片段直接丢弃;第三,episode 质量——对每个任务计算时长中位数 $m$ 与四分位距 $r = q_{75} - q_{25}$,只保留时长落在 $[m-3r,\, m+3r]$ 内的演示,同时剔除未完成任务就终止的片段,完成节奏归一化;第四,视频质量——排查损坏、严重模糊、丢帧与异常光照,把异步记录的多模态对齐到统一时间线并保证视频、触觉、动作帧严格一一对应,相机映射错位、左右臂标反、末端位姿异常等问题能修则修(重映射相机或用正运动学恢复位姿),不能修则丢弃,最后裁掉近似静止段,避免推理时模型在不一致动作上无谓停顿;第五,可迁移性——由于大部分数据是无机器人采集的,记录的动作不保证能在目标机型上物理实现,因此对每条轨迹跑逆运动学,拒绝无法求解或超出关节与工作空间限制的位姿。通过全部五道关卡的 episode 才构成发布语料。

NeoData 清洗流水线

图 3:NeoData 数据清洗流水线(论文 Figure 5)——原始演示需依次通过完整性、运动质量、episode 质量、视频质量与可迁移性五道关卡才能进入发布语料。

标注侧同样工程化。论文提出四级层次标注:任务(L3)、子任务(L2)、动作(L1)、原子段(L0),把语义结构与时间定位解耦——模板定义任务里应该发生什么,基于信号的分段决定事件在具体某条演示中何时发生。流水线分两阶段:先由视觉语言模型从代表性 episode 归纳出与时间无关的任务模板(任务目标、有序语义阶段、动作级子步骤),人工专家审核消除语义歧义后才推广到整个任务类别;再对每条 episode 融合动作边界与视觉事件边界做分段,模型按模板给固定区间打标签,确定性代码组装 L0–L3 的时间范围。这样时间端点始终锚定在实测信号上,语言模型只负责语义标注,缓解长操作视频上的时间漂移,也为长时程、多阶段、多任务策略训练提供时间结构。

NeoData 层次标注流水线

图 4:NeoData 层次标注流水线(论文 Figure 6)——VLM 先提出任务模板并经人工审核,episode 再按信号边界分段并映射到 L0–L3 四级标签。

六、NeoForce:以力为锚的统一触觉表示

数据就位之后,核心问题变成:触觉信息以什么形式作用于操作策略?论文的回答是把每个触觉观测都描述为感知表面上的稠密三轴力场,用物理量而非某台设备的外观来表达接触。设计遵循三条原则:物理接地——表示应锚定触觉物理上传递的东西(末端执行器作用于物体的效果由接触界面的本征属性完全描述),而非外观级代理;跨传感器统一——任何传感器经适当标定后都应映射进同一目标空间,使异质触觉数据可直接比较、可联合训练;空间富语义——复杂接触具有空间结构,接触斑的位置、形状、范围与内部强度分布区分了完整抓取与边缘接触、稳定持握与初始滑移,表示必须保留这种分布而不是把它压缩成标量。

按这三条原则,论文选择力作为触觉表示编码的物理属性:在感知表面的每个点记录局部力的两个面内切向分量(驱动滑动与抓握的剪切)与一个法向分量(按压时的压力),在高分辨率网格上采样得到稠密力场。形式化地,一个触觉传感器在时刻 $t$ 的力场为:

$$F_t \in \mathbb{R}^{H \times W \times 3}, \qquad F_t(u,v) = \big(f_x(u,v),\; f_y(u,v),\; f_z(u,v)\big)$$

其中每个空间位置 $(u,v)$ 携带沿 $x$、$y$ 轴的切向分量 $f_x, f_y$(编码剪切)与沿 $z$ 轴的法向分量 $f_z$(编码压力)。对平行夹爪,左右触觉场分别记为 $F_t^l$ 与 $F_t^r$,可拼接为六通道张量。这个定义给下游具身模型提供了物理可解释、与凝胶外观无关的触觉输入。

力场由原始视触图像直接学出。设 $T_t$ 为单传感器原始触觉图像,学习一个稠密映射:

$$\hat{F}_t = g_\theta(T_t), \qquad g_\theta : \mathbb{R}^{H \times W \times 3} \rightarrow \mathbb{R}^{H \times W \times 3}$$

这正是第四节成像公式的逆问题:$g_\theta$ 在配对的视触数据上训练,学习反演 $\mathcal{C} \circ \Phi$。标定硬件、数据划分、模型结构与预处理参数见论文附录 D(含真实力标定数据与触觉仿真增广)。得到的力场即该传感器的触觉表示,同时也是 NeoForce 在其上构建时序特征的训练目标。

NeoForce 本体在力场之上学习带时间结构的视触表示。模型接收同步的 RGB 观测块与触觉力场块,两个模态各自 patchify 成 token,由共享 transformer 骨干融合并在输入块上聚合时序上下文——表示因此编码的不仅是当前接触状态,还有接触的近期演化。监督由两部分组成:力空间的重建目标,与隐空间的预测目标。

重建头从融合 token 预测力场与接触掩码。设 $\hat{F}$、$\hat{M}$ 为预测,$F$、$M$ 为目标,重建损失为:

$$\mathcal{L}_{\mathrm{recons}} = \lambda_f \big\|(\hat{F} - F) \odot M\big\|_{\mathrm{H}} + \lambda_g \big\|\bar{\hat{F}} - \bar{F}\big\|_{\mathrm{H}} + \lambda_m \mathcal{L}_{\mathrm{mask}}(\hat{M}, M)$$

其中 $\|\cdot\|_{\mathrm{H}}$ 是 Huber 范数,$\bar{\cdot}$ 表示空间均值(约束全局力水平),$\mathcal{L}_{\mathrm{mask}}$ 监督接触分割。

隐空间预测头采用教师-学生结构:教师看到完整输入并在隐空间产生目标,学生接收被遮蔽的输入去预测这些目标,从而学习触觉信号在块内的时序相关。设 $Z_\tau$ 为教师隐输出、$\hat{Z}_s$ 为学生预测,损失为:

$$\mathcal{L}_{\mathrm{pred}} = H\!\left(Z_\tau^v, \hat{Z}_s^v\right) + H\!\left(Z_\tau^t, \hat{Z}_s^t\right) + \lambda_x H\!\left(Z_\tau^{v \leftrightarrow t}, \hat{Z}_s^{v \leftrightarrow t}\right) + \lambda_p H\!\left(Z_{\tau,\mathrm{patch}}, \hat{Z}_{s,\mathrm{patch}}\right)$$

$Z^v$、$Z^t$ 分别是视觉与触觉隐变量;跨模态项 $Z^{v \leftrightarrow t}$ 要求从视觉上下文预测触觉隐变量、反向亦然,以此对齐两个模态;patch 项监督被遮蔽的 patch 级隐变量,鼓励遮蔽条件下的局部接触预测。完整目标再叠加视觉-触觉嵌入的对比对齐项 $\mathcal{L}_{\mathrm{con}}$:

$$\mathcal{L} = \mathcal{L}_{\mathrm{recons}} + \mathcal{L}_{\mathrm{pred}} + \lambda_c \mathcal{L}_{\mathrm{con}}$$

graph TD
    A[RGB observation chunk] --> P1[Patchify visual tokens]
    B[Tactile force field chunk] --> P2[Patchify tactile tokens]
    P1 --> T[Shared transformer backbone
temporal context over chunk] P2 --> T T --> R[Reconstruction head
force field + contact mask] T --> L[Latent prediction head
student predicts masked teacher latents] R --> L1[L_recons: Huber on masked force
global mean + mask loss] L --> L2[L_pred: visual + tactile
cross-modal + patch latents] L1 --> O[Total L = L_recons + L_pred + lambda_c L_con] L2 --> O O --> D[Transferable tactile representation
for downstream manipulation policies]

图 5:NeoForce 数据流——RGB 与力场块经 patchify 进入共享 transformer,重建头与隐预测头联合监督(依据论文 Figure 7 与公式 8–10 绘制)。

七、实验一:NeoForce 表示学习消融

NeoForce 的评估围绕两个问题:力场表示能否编码空间与时间上的接触强度;学到的力空间分布是否会随操作任务变化而漂移。消融以纯重建目标为基线,在留出接触上比较力场重建的 MAE、RMSE 与接触区域 mIoU:

训练目标MAE ↓RMSE ↓mIoU ↑
仅重建0.0700.0950.968
+ 隐空间预测0.0660.0890.966

表 1:NeoForce 训练目标消融(论文 Table 2)。

结果说明两点。其一,增益集中在力值幅度而非接触定位——mIoU 基本持平(0.968 → 0.966),MAE 从 0.070 降到 0.066、RMSE 从 0.095 降到 0.089。预测被遮蔽的 patch 级与跨模态隐变量时,模型必须从未观测位置推断接触,而周围接触区域、块内相邻帧与同一区域的视觉上下文共同约束了这个缺失位置,迫使表示传达接触强度在时空上如何分布。其二,NeoData 的大规模训练给了共享骨干很强的物体几何与材质视觉先验,跨模态预测把该先验带进触觉 token,使触觉分支在已知接触区域的前提下更精确地估计强度。

NeoForce 力场重建可视化

图 6:NeoForce 在按压、扭转、抓握、提起、保持五种接触行为上的力场重建(论文 Figure 8)。每列从上到下:RGB 帧、真值力场、NeoForce 重建;颜色条编码归一化力幅。

跨技能可视化进一步给出第二个发现:按压、扭转、抓握呈现边界锐利的局域峰值、周围近零;提起与保持呈现更宽、更持久的分布;重建场在宽动态范围内始终贴合真值的细粒度强度。论文把这种一致性归因于表示空间的选择——以力为锚点,等于把不同技能的接触效应放进一个由物理而非器件或行为定义的空间,一致性来自表示设计而非对每个技能的单独拟合。

八、实验二:NeoReal 真机评测与触觉接入方式消融

NeoReal 是物理评测主战场:十个任务选自 NeoData 中高频且触觉相关的技能,在装有触觉手指的真机上执行,覆盖可变形物体塑形、力引导配合、精细抓取、持续表面接触、绕线、堆叠、插入与双臂折叠——纸箱折叠、袋子打包、线缆缠绕、板面擦拭、叠杯、插座插拔、板件插入、瓶子立放、水果收集、毛巾折叠。每任务规定标准化初始状态分布、重置协议与二元成功判据,评测报告 20 次随机化试验的二元成功率与按里程碑加权的渐进分数。

NeoReal 任务套件

图 7:NeoReal 十个接触密集真机任务(论文 Figure 9)。

评测覆盖模仿学习(ACT、Diffusion Policy)、VLA($\pi_{0.5}$、Xiaomi-Robotics-0、InternVLA-A1、StarVLA-$\alpha$)、世界动作模型(Fast-WAM、GigaWorld Policy)与 VA 基线(LingBot-VA),所有策略先在 NeoData 上预训练再按任务微调。真实接触动力学下任务明显比仿真更难:$\pi_{0.5}$ 以平均 26.5% 成功率领跑,在板面擦拭、叠杯、插座插拔这类持续接触与力引导任务上表现最好;LingBot-VA 与 Fast-WAM 落后,只能解出子集。渐进分数始终高于成功率,且差距在接触密集任务上扩大——插座插拔上 $\pi_{0.5}$ 从 60% 升到 73.5%,袋子打包从 20% 升到 43.0%——说明策略经常在任务失败时仍达成抓取、对齐等中间里程碑。缺口最大之处恰是触觉需要充当阶段性反馈的环节:提起前确认抓稳、释放前确认插到位。

触觉接入方式($\pi_{0.5}$ 骨干)BoxBagWipeCupsSocketTowelAvg 成功率 / 渐进分
无触觉5/19.020/43.040/55.250/66.060/73.540/56.826.5/38.1
触觉图像拼接5/17.015/38.045/58.245/61.060/71.045/59.527.5/41.4
触觉图像条件化动作专家5/19.025/48.045/60.755/70.055/70.050/64.530.0/44.3
NeoForce 表示条件化动作专家15/34.525/48.050/63.255/70.065/76.050/66.532.5/47.5

表 2:触觉接入方式消融(论文 Table 3,选取六个代表任务列;Box=纸箱折叠、Bag=袋子打包、Wipe=板面擦拭、Cups=叠杯、Socket=插座插拔、Towel=毛巾折叠,其余四任务见原表)。

触觉接入方式消融是全文信息量最高的一组实验。以 $\pi_{0.5}$ 为固定骨干比较四种变体:无触觉、原始触觉图像拼接、触觉图像条件化动作专家、NeoForce 力表示条件化动作专家。四个层级给出清晰的单调结论:所有带触觉的变体都优于纯视觉,确认接触密集任务受益于力与接触状态信息;把触觉送入生成动作的动作专家比简单拼接更有效,因为接触信号直接供给了动作生成模块;NeoForce 表示又进一步超过原始触觉图像,因为它把接触表达为紧凑的力场而非设备外观。平均渐进分数从纯视觉的 38.1% 一路升到 NeoForce 条件化的 47.5%,且增益也体现在更完整的里程碑进度上,而不只是额外的二元成功。个别任务有波动——原始触觉变体在袋子打包与叠杯上先跌后由力表示拉回——但总体排序稳定:策略受益的是物理接触状态,而不是触觉信号的设备级外观

九、实验三:NeoSim 仿真评测暴露双臂接触瓶颈

NeoSim 按 UniVTAC 构建,渲染与真实触觉数据同构的三轴力场(同样的 $x$、$y$、$z$ 格式),使消费力表示的策略能在仿真里用与真机相同的表示被评测。套件含 12 个接触密集任务:4 个单臂(倒球、拔插充电器、插 USB、捏取芯片,考验倾倒、插入与精细抓取的力调节)与 8 个双臂(拧螺丝、放齿轮、拆碗、杯交接、叠杯、叠盘、叠碗、拆杯,进一步要求双臂协调、稳定接触维持、交接与嵌套),每任务 100 次随机化 rollouts 报告成功率。

策略单臂平均双臂平均总平均
$\pi_{0.5}$68.834.345.8
LingBot-VA36.330.032.1
Xiaomi-Robotics-042.014.123.4
StarVLA-$\alpha$49.310.123.2
GigaWorld Policy27.02.610.8
InternVLA-A123.81.08.6
Fast-WAM0.00.00.0

表 3:NeoSim 单臂/双臂平均成功率(由论文 Table 4 的 12 任务原始值按 4 单臂、8 双臂分组计算)。

几个值得玩味的现象。第一,双臂任务对所有策略都显著更难:StarVLA-$\alpha$ 从 49.3% 掉到 10.1%,Xiaomi-Robotics-0 从 42.0% 掉到 14.1%,InternVLA-A1 从 23.8% 掉到 1.0%;只有 $\pi_{0.5}$ 与 LingBot-VA 保留可观的双臂能力(34.3% / 30.0%),且几乎全靠叠盘、叠碗这类两臂可松散耦合的任务。第二,需要持续相互接触的任务基本无人能解:放齿轮最高 18%、杯交接最高 25%,每个任务最多只有两个策略能成功。第三,Fast-WAM 在 NeoReal 上是三强之一,在 NeoSim 却 12 题全败,说明它的能力无法迁移到仿真接触动力学。论文的解读是:纯视觉与本体的策略看不清抓取是否稳固、接触是否维持,而这恰恰是双臂接触密集操作的失败点,反过来论证了为机器人配触觉硬件、让策略消费触觉表示的必要性。

NeoSim 任务演示

图 8:NeoSim 12 任务演示(论文 Figure 11),左侧为仿真 RGB 场景,右侧为触觉传感器渲染的凝胶粒子图像。

十、局限性

作者自述的开放方向有三:统一力表示目前只覆盖平行夹爪视触手指,扩展到灵巧手与非相机类换能器(压阻、电容等)才能扩大适用面;策略学习尚未扩展到完整多模态语料;NeoSim 与真实部署之间的联系还需收紧。除作者自述外,还有几处值得注意:其一,真机绝对成功率仍低——最强 $\pi_{0.5}$ 在 NeoReal 平均仅 26.5%,板件插入、瓶子立放两个任务所有触觉接入方式都只有个位数成功率,说明即便有了力表示,精密装配仍是硬骨头;其二,触觉接入消融只在 $\pi_{0.5}$ 单一骨干上做,「力表示优于原始触觉图像」的结论能否推广到其他策略家族未经验证;其三,跨传感器统一目前在同一相机式传感器家族内验证,对压阻、电容阵列的真正统一尚缺实证,力场转换对真实标定数据与仿真增广的依赖(附录 D)也提示其迁移成本不可忽略。

十一、总结与展望

$\mathcal{N}_0$-Foundation 把触觉智能的四块拼图——传感硬件、数据、表示、评测——拼成了一个自洽闭环。它给出的核心实证结论有三:触觉反馈确实提升接触密集操作;隐空间监督改进时序触觉表示学习;力表示为原始触觉图像提供了紧凑的物理替代。配合 5000 小时开源的 OpenNeoData,这篇工作实际上为触觉具身智能提供了一个可复现的起点:任何人都可以下载数据、按统一力场格式训练、在 NeoReal/NeoSim 上对照。下一步的自然延伸是把统一表示推向灵巧手与更多传感器类型、把策略训练规模拉到全量语料、把仿真与真机的落差补上。

十二、金句

策略受益的是物理接触状态,而不是触觉信号的设备级外观;与传感器无关的力场,正是传递这种表示的通用接口。

接触状态、局部力与初始滑移几乎无法从视觉中观测,而它们恰恰是可变形物体操作、精密装配、精细力控与持续表面交互的关键。

参考来源:arXiv:2608.29601 · 项目页 research.neoteai.com/n0-foundation · 数据集 huggingface.co/datasets/NeoteAIEmbodied/OpenNeoData

相关论文