Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

机器人交互表示学习中间表示

RoboInter1.5:面向机器人交互的整体中间表示

RoboInter1.5提出面向机器人交互的整体中间表示方法,提升机器人对复杂交互的理解和执行能力。

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu2026年7月21日3 分钟阅读
EN

1. 概述

随着基础模型(foundation model)的快速发展,视觉-语言-动作(VLA, Vision-Language-Action)策略和具身世界模型(embodied world model)都取得了显著进展。然而现有机器人数据集仍存在采集成本高、与特定本体绑定(embodiment-specific)、缺乏细粒度中间表示(intermediate representation)标注等问题。

RoboInter1.5 在前作 RoboInter1.0 基础上扩展,提供一套完整的中间表示工具套件,涵盖数据、基准测试和模型。核心思想是将中间表示视为连接语义理解、物理执行和未来模拟的双向接口(bidirectional interface),既正则化低层动作空间,又约束开放世界物理模拟器的潜在展开(latent rollout)。

💡 核心理念:中间表示不仅是可解释的信号,更是连接语义推理、物理执行和世界模拟的通用双向接口。
RoboInter1.5 套件总览

2. 数据集:RoboInter-Data

RoboInter-Data 包含超过 23万条操控回合(episode),覆盖 571个场景,提供超过 10种密集逐帧中间表示标注。

RoboInter-Data 与 RoboInter-VQA 总览

数据来源包括 In-the-Wild(多样化室内场景,来自 Droid、RH20T、OXE)和 Table-Top(桌面交互场景,来自 RH20T)。通过 RoboInter-Tool 半自动标注工具完成以下标注:

  • 任务分解与关键帧:15种预定义原语技能(primitive skill),ChatGPT 生成初步语言标注,人工校验
  • 操控物体识别:SAM2 分割与跟踪,异步审核
  • 末端执行器定位:标定矩阵 + 夹爪检测 + 点跟踪,2D轨迹重构
  • 抓取标注:接触帧处推导抓取仿射框(affordance box)和接触点
  • 放置标注:子任务结束时物体位置作为目标放置
  • 夹爪标注:锚点 3D→2D 投影形成夹爪边界框

统计:约 6100万帧物体标注、7000万帧夹爪轨迹、19万个仿射框与放置提案、76万条语言片段标注。

具身标注数据集对比
数据集视频数场景数密集标注类型标注方式
LLARVA311-Trace自动
ECoT60k12CoT+部分自动
ShareRobot51k102部分人工+自动
RoboInter-Data230k57110+种全类型人工+自动

3. RoboInter-VQA

将标注转化为具身视觉问答(VQA, Visual Question Answering)任务来训练和评估 VLM,沿两条轴线组织:

  • 空间 VQA:理解(3个选择+1个判断任务)和生成(5个预测任务:物体框、抓取位姿、放置提案、关键点、夹爪框)
  • 时间 VQA:理解(5个选择+4个判断任务)和生成(轨迹生成、多步规划,不同上下文完整度下预测后续步骤)

统计:约 100万空间生成条目、17.2万空间理解条目、13.1万时间生成条目、93.5万时间理解条目。7246个视频作为评估池。

4. 方法

4.1 RoboInter-VLM Planner

基于基础 VLM(Qwen2.5-VL-3B/7B、LLaVA-OneVision-7B)在 RoboInter-VQA 上微调,生成功能链式思维(F-CoT, Functional Chain-of-Thought)内容,灵活组合子任务、技能、物体框、仿射框、运动轨迹等。

4.2 RoboInter-VLA:Plan-Then-Execute

RoboInter-VLA 框架

支持三种范式:

  • RoboInter-IC-E2E:VLM 生成 F-CoT 内容,直接被 DiT 头消费(隐式集成)
  • RoboInter-EC-E2E:联合优化动作预测和 CoT 生成(显式联合)
  • RoboInter-Modular:Planner 生成 F-CoT,Executor 条件化于其上(模块化),支持文本(Te-Modular)和视觉提示(Im-Modular)两种 F-CoT 形式

4.3 RoboInter-World:受控想象

将中间表示作为结构化条件信号用于可控的未来世界状态预测。去噪模型公式:

$$f_{\theta}(x_{t},t\mid z^{\mathrm{hist}},c,a,u)$$

其中 $z^{\mathrm{hist}}$ 为观测历史潜在表示,$x_{t}$ 为扩散时间步 $t$ 的噪声未来潜在表示,$c$ 为语言指令,$a$ 为机器人动作序列,$u$ 为中间表示渲染的控制视频。

优化目标:

$$\mathcal{L}_{\mathrm{world}}=\mathbb{E}_{y,\epsilon,t}\left[\left\|v_{t}-f_{\theta}(x_{t},t\mid z^{\mathrm{hist}},c,a,u)\right\|_{2}^{2}\right]$$

其中 $v_{t}$ 为从噪声潜在 $x_{t}$ 到干净潜在 $y$ 的流匹配(flow-matching)目标。

RoboInter-World 架构

关键设计:控制视频通过将物体采样点和夹爪轨迹渲染到空白画布上构建,利用预训练视觉模型的空间先验加速收敛。引入掩码潜在(mask latent)区分历史/未来内容。训练时对中间表示引入随机扰动以增强对推理时不完美控制信号的鲁棒性。

5. 整体架构

flowchart TB
    subgraph 数据层
        RD[RoboInter-Data
230k episodes, 10+标注类型] RVQA[RoboInter-VQA
空间+时间 VQA] RCV[RoboInter-CV
控制视频数据集] end RD --> RVQA RD --> RCV subgraph 模型层 VLM[RoboInter-VLM
Planner 生成 F-CoT] VLA[RoboInter-VLA
IC-E2E / EC-E2E / Modular] WM[RoboInter-World
受控世界模型] end RVQA --> VLM VLM -->|F-CoT| VLA RCV --> WM WM -->|预测未来潜在特征| VLA style RD fill:#4f9eff,color:#fff style VLM fill:#ff6b6b,color:#fff style WM fill:#51cf66,color:#fff

6. 实验结果

6.1 Planner 基准测试

第三方基准测试性能对比

在 Where2Place、RoboRefIt、RoboVQA 等第三方基准上,RoboInter-VLM 大幅超越基础模型。3B 规模上 RoboInter-Qwen-3B 在 RoboRefIt 上比 RoboBrain2.0 提升 49.1%,在 RoboVQA 上提升 12.7%。7B 规模分别提升 76.8% 和 42.8%。

模型Where2Place ↑RoboRefIt ↑RoboVQA ↑
QwenVL2.5-7B18.9%75.8%38.4
RoboBrain2.0-7B63.6%8.8%31.6
RoboInter-Qwen-7B65.8%85.6%74.4
RoboInter-LLaVAOV-7B66.3%89.3%74.5

6.2 中间表示消融

在开环 Oracle+Executor 设置下消融不同中间表示。粗粒度表示(子任务、原语技能)仅带来边际改善;空间接地表示(物体框、夹爪框、仿射框)带来更大提升;轨迹(Trace)引入密集时间信息,提升最显著。

变体OLS@0.1OLS@0.05OLS@0.03OLS@0.01
Vanilla0.67930.36080.17530.0189
+Subtask0.69650.36760.17700.0171
+Object Box0.70250.38490.19880.0294
+Gripper Box+Affordance0.72450.40830.21140.0297
+Trace (All)0.75110.46400.27050.0587

6.3 真机闭环评估

在 Franka Research-3 机械臂上设计4个任务(物体收集、杯子堆叠、毛巾折叠、杂乱清理),每个15次 ID + 15次 OOD 试验。RoboInter-IC-E2E 的 ID 成功率 77.3%(vs Vanilla 65.0%),OOD 成功率 58.3%(vs 38.3%)。EC-E2E 的 ID→OOD 退化仅 8.3%(vs IC-E2E 的 19%),展现出更强泛化。

6.4 世界模型基准测试

用中间表示(Seg+Trace)替代原始动作控制,14B 模型 PSNR 从 18.26 提升至 21.05,LPIPS 从 0.171 降至 0.102。历史上下文有限(H1P3)时提升更大(+1.50 PSNR),长预测范围(H4P16)提升最显著(+2.79 PSNR),说明中间表示在长程预测中优势更明显。

模型/控制H/PPSNR ↑SSIM ↑LPIPS ↓
Baseline Action4/324.870.8780.054
Seg+Trace4/325.000.8810.049
Baseline Action4/1618.260.7500.171
Seg+Trace4/1621.050.8100.102

6.5 世界模型引导 VLA

用 RoboInter-World 预测的潜在特征引导 VLA 执行器,在所有评估阈值上取得一致且显著的提升,逼近 Oracle 上界。标准世界模型基线(I2V-Baseline)的预测特征甚至有害(在严格阈值下降低性能),说明非结构化预测特征会引入噪声。

7.

世界模型训练损失

$$ \mathcal{L}_{\mathrm{world}}=\mathbb{E}_{y,\epsilon,t}\left[\left\|v_{t}-f_{\theta}(x_{t},t\mid z^{\mathrm{hist}},c,a,u)\right\|_{2}^{2}\right] $$

上下文特征拼接

$$ h^{\mathrm{ctx}}=\left[\phi_{\mathrm{text}}(c);\phi_{\mathrm{act}}(a)\right] $$

策略动作输出

$$ \mathbf{a}_{t}=f_{a}\bigl(f_{r}\bigl(f_{v}(\mathbf{o}_{t}),\ell\bigr)\bigr) $$

总结

RoboInter1.5 提供了统一的中间表示平台:RoboInter-Data 以 23万条回合的密集逐帧标注设定了新标准;RoboInter-VQA 系统性评估 VLM 的具身理解与生成能力;RoboInter-VLA 将几何先验集成到模块化和端到端控制框架中;RoboInter-World 利用这些表示准确预测未来环境动态。实验证明中间表示——尤其是密集时间轨迹——在推理、执行和世界建模三个层面都带来显著提升,且三者可相互增益。

💡 这项工作的贡献在于建立了一个"中间表示"驱动的统一范式:数据标注→VLM 推理→VLA 执行→世界模型预测,四者共享同一套中间表示语言,形成闭环飞轮。