PAPER DEEP DIVE
XR-2:1500小时双臂家庭操作缩放实验
PrimeBot等发布1500小时双臂家庭操作数据,训练5B VLA模型XR-2;叠衣任务上专家数据把成功率从34%推到84%后饱和,三轮DAgger在策略纠正再从58%提至93%。
论文元信息
标题:Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections
作者:Jiafeng Xu、Qi Li、Yan Shen、Yiyu Ren、Travis Davies、Shaowen He、Ze Wang、Yifan Yang、Ran Cheng、Hao Dong(PrimeBot 研究院、北京大学计算机学院、Crobotia)
链接:arXiv:2609.03591(https://arxiv.org/abs/2609.03591 ,v1,2026 年 9 月 3 日);数据集 https://huggingface.co/datasets/challenge-2026/challenge_data
代码与数据状态:论文未开放独立代码仓库;完整语料与 X2W 的 URDF 以 LeRobot 格式开源在 HuggingFace(license 为 CC-BY-SA-4.0),并配套 IROS 2026 家庭双臂操作挑战赛,数据下载量已超过二十万次。
图1:X2W 硬件配置。整机 25 自由度,配备 RealSense D435i、ZED X Mini 与 ZED-XONE GS 相机、IMU 与异构计算单元,支撑家庭双臂操作任务。
一句话总结
这篇论文用 1,500 小时双臂家庭操作数据(531.7 小时真机遥操作加约 1,000 小时野外 UMI)训练 5B 参数的 VLA 模型 XR-2,并在叠衣任务上给出两条互相衔接的缩放曲线:专家数据把成功率从 34% 推到 84% 后饱和,三轮 DAgger 在策略纠正再把同一检查点从 58% 抬到 93%。
研究背景与动机
双臂操作是机器人学习里最难的阵地之一:两条手臂要在接触丰富的环境里分工与协同,任务往往横跨几十个子步骤,任何一次物体姿态或布料形态的变化都要求策略在线重规划。近年来 VLA 模型的进展让「数据缩放」成为通用操作策略的主线,Open X-Embodiment、DROID、AgiBot World、RoboMIND 等语料把规模从几百小时推到上千小时。但当数据集越来越大,社区的问题也在转移:从「还要采多少数据」变成「哪些数据更值得采」。
离线专家示范与在策略纠正数据是两种互补的信息源。前者告诉策略一条成功轨迹长什么样,状态分布干净、可控、可复用;后者产生于策略真实 rollout 并犯错的时刻,覆盖的恰恰是专家分布里没有的失败状态。缺了前者,策略没有稳定的行为底座;缺了后者,策略一旦滑出专家分布就会连环崩溃,且再多的离线数据也补不上这些状态。
对双臂而言这个问题更尖锐:公开的大规模操作语料长期以单臂或固定基座为主,野外的、双手协同的家庭数据极为稀缺,以至于双臂策略的缩放规律缺乏实证基础。没有人能回答专家数据在什么规模上开始饱和,也没有人能量化饱和之后在策略纠正还能买回多少成功率。
本文用一个工程化的数据体系回答这两个问题。作者先搭建 1,500 小时的双臂家庭操作语料:真机部分 32,518 条遥操作轨迹、5,740 万帧、531.7 小时交互,覆盖折叠站、洗衣机、沙发、洗衣篮四类家庭场景与 12 种以上日常任务;UMI 部分约 1,000 小时、来自两百多个家庭的野外双手叠衣示范。在此之上训练 5B 参数的 VLA 模型 XR-2,并系统研究两条缩放轴:专家示范数据的量,以及在策略 DAgger 纠正数据的量。
实验结论高度一致:在叠衣任务上,专家数据从 10 小时扩到 120 小时时成功率单调上升,再往上就饱和;而饱和点之后,三轮 DAgger 纠正把成功率从 58% 一路推到 93%。专家示范与在策略纠正因此是缩放的互补杠杆,而不是互相竞争的技术路线。语料连同时间对齐的子任务语言标注一起开源,供社区研究双臂操作的数据中心缩放。
预备知识
条件流匹配。XR-2 的动作头不输出离散分布,也不做单步回归,而是学习一个速度场:在噪声动作与真实动作之间定义线性插值路径 $\mathbf{a}_{t}=(1-t)\epsilon+t\mathbf{a}$,其中 $\epsilon\sim\mathcal{N}(\mathbf{0},\mathbf{I})$,模型回归目标流 $(\mathbf{a}-\epsilon)$。推理时从纯噪声出发做少步欧拉积分即可采样出整段动作块,兼顾多模态动作分布与实时性。
DAgger。Dataset Aggregation 的经典思想是让专家在策略自己访问到的状态上继续给标签,使训练分布逐步逼近部署分布。在真机场景里「专家打标签」落地为人类接管:策略出错时操作员接手把当前子任务纠正或做完,这段接管轨迹就是带状态与动作监督的纠正样本。
动作块与时间集成。策略一次输出 $K$ 步动作序列而非单步动作,用动作块摊薄推理延迟;相邻动作块在时间上重叠,通过 temporal ensembling 融合成平滑命令,避免块边界处的抖动。
方法详解
X2W 移动双臂平台。机器人由两条 7 自由度机械臂构成,臂端各接 1 自由度夹爪,再加 4 自由度腰与 2 自由度头,共 22 个可控关节,全部安装在三轮全向移动底盘上;底盘三个独立驱动轮提供另外 3 个速度控制量,因此整机控制变量为 25 维。主体关节采用准直驱执行器,为接触丰富的双臂操作提供快速且柔顺的响应;视觉由一个头部相机与两个腕部相机组成,分别给全局场景上下文与近距操作细节,所有本体状态、动作与视觉观测以 30 Hz 统一同步记录。
状态与动作空间。本体感知状态是一个 89 维向量:
$$\mathbf{s}_{t}=\left[\mathbf{q}_{t},\dot{\mathbf{q}}_{t},\boldsymbol{\tau}_{t},\mathbf{p}_{t}^{L},\mathbf{p}_{t}^{R},\mathbf{q}_{t}^{w},\dot{\mathbf{q}}_{t}^{w},\boldsymbol{\tau}_{t}^{w}\right]\in\mathbb{R}^{89}$$
它拼接 22 个可控关节的位置、速度与力矩,两个末端执行器位姿 $\mathbf{p}_{t}^{L},\mathbf{p}_{t}^{R}$,以及三个驱动轮的位置、速度与力矩。动作则是 22 个目标关节位置加 3 个目标轮速:
$$\mathbf{a}_{t}=\left[\mathbf{q}_{t}^{\mathrm{cmd}},\dot{\mathbf{q}}_{t}^{w,\mathrm{cmd}}\right]\in\mathbb{R}^{25}$$
这个设计把移动底盘直接纳入策略的动作空间,使全身操作(边走边操作)可以在同一个策略里端到端学习,而不是把导航与操作切成两个模块。
专家示范流水线。离线采集把长程任务按固有结构分解为子任务,并为每个子任务编写标准作业程序(SOP),统一场景布置、物体摆放、机器人初始化与操作流程;远程操作员用 VR 设备遥操作机器人记录轨迹。原始多模态数据先做自动后处理与格式转换,上云后再过自动质量校验、VLM 驱动的任务与语言标注、最后人工复审三道关卡。标准化流水线保证数据跨机器人、跨场景、跨操作员的一致性,这是 531.7 小时数据能保持高质量的前提。
在线 DAgger 流水线。多台机器人共享同一策略执行完整长程任务;当策略到达失败状态或需要纠正时,人类操作员临时接管,纠正或完成当前子任务后立即把控制权交还策略。一次长程 rollout 因此可以包含多段机控与人控交替的片段,而不必在每次失败后重启任务。系统自动记录所有人工接管片段为纠正示范,绑定对应子任务指令,并在同一条轨迹内显式区分策略生成段与人类控制段,因此 DAgger 数据上云后无需再标注。部署机器人越多,真实执行中遇到的失败就越持续地转化为新纠正数据,形成可扩展的闭环数据流水线。
图2:数据集统计。(a) 场景覆盖:折叠站、洗衣机、沙发、洗衣篮四类家庭交互场景;(b) 长程分布:时长分布有延伸到约 150 秒的长尾;(c) 原子技能覆盖:11 个原子技能的分布。
真机语料构成。32,518 条遥操作轨迹覆盖四类家庭场景:折叠站约 14.6k 条、洗衣机约 8.4k 条、沙发约 6.1k 条、洗衣篮约 3.4k 条;轨迹时长从短原子原语延伸到超过 100 秒、个别超过 150 秒的长序列。把语义等价的指令合并后得到 11 个原子技能,既有高频的「叠衣服」(14.6k),也有低频但任务关键的「把衣服放进洗衣机」(1.2k)与「把毛绒玩具放进洗衣机」(0.8k);由于一条长程轨迹可能包含多个技能,技能计数互不排斥。多阶段任务提供与时间对齐的子步骤语言标注,使监督同时存在于任务级与技能级。
UMI 语料构成。与遥操作语料互补,作者采集约 1,000 小时野外双臂 UMI 家庭衣物操作示范(叠衣与整理),任务分布与折叠站场景对齐。每条示范提供同步的双第一视角视频($960\times 960$、30 Hz)、视觉惯性 SLAM 恢复的米制 6-DoF 末端轨迹、连续夹爪开度,以及两级粒度的帧级语言标注:物品级片段(如「叠那件红衬衫」)与片段内细粒度动作步骤(如抓取、铺平、折一侧)。数据来自两百多个家庭、一百多位采集者、五千件不同品类布料颜色与印花的衣物,在床面、桌面、晾衣架上从清晨到深夜采集,场景、光照与操作风格的覆盖远超固定机器人单元所能提供。
无编码器的双手夹爪。UMI 夹爪是完全机械的自包含结构:腕部相机是唯一传感器,夹爪开度由视觉恢复而非编码器读数,也不依赖头部或第三人称相机。作者用三条证据支撑这个设计:腕部视角单独就足以支撑操作任务中的双臂协同;手中心视角比第三人称视角有更高的训练效率与分布外泛化;近年仅用手中心感知的野外系统已能在未见家庭零样本部署。去掉编码器、电机与驱动电子还让夹爪显著更轻、功耗更低,操作员可以连续采集数小时,支持最长 90 分钟无重置的连续录制;手驱夹爪又能提供足够且可细调的抓握力,在叠衣时拉紧并压住布料。
图3:XR-2 的两阶段全参数训练。两阶段共用 VLM 加动作专家架构且全部参数可训;(a) 阶段一在专家访问的状态上拟合离线遥操作示范;(b) 阶段二从阶段一初始化,rollout 策略、在访问状态上收集专家纠正并在聚合数据上重训,使训练对齐策略自身的状态分布。
XR-2 架构。XR-2 是总参数 5B 的混合 Transformer(Mixture-of-Transformers)VLA:预训练视觉语言骨干 Qwen3-VL-4B-Instruct 负责多模态感知,动作专家是一个以流匹配目标训练的扩散 Transformer。动作专家由 18 个 Transformer 块堆叠,隐藏维 $D_{\text{hidden}}=1024$、8 个注意力头,并采用 4 个 KV 头的分组键值注意力;每个块内噪声动作 token 先做双向自注意力,再交叉注意力到骨干隐藏状态,最后过 SwiGLU 前馈层。交叉注意力是深度对齐的:第 $i$ 个块 attends 到 18 个暴露骨干层中的第 $i$ 层,使动作专家把预测逐步接地在越来越抽象的视觉语言特征上,而不是把所有条件压到最后一层;去噪时间步通过 adaLN-zero 调制注入。策略整体形式为 $\mathbf{a}_{t}=\pi_{\theta}(\mathbf{o}_{t},\mathbf{s}_{t},l)$,在视觉观测、语言指令与本体状态条件下生成长度 $K$ 的动作块。
动作前缀条件与异步执行。为让推理与执行无缝异步,动作专家额外用动作前缀条件训练:延迟 $d$ 定义一段被视为「已承诺」的前导动作,对应 token 锚定在真值、时间步固定为 $t=1$,只有后续后缀序列参与噪声注入、去噪与损失监督。推理时 $d$ 动态取最近 $R$ 轮推理的平均执行时长,从而把计算延迟显式建模进生成过程;完整动作序列由五步欧拉前向积分合成,支撑低延迟、平滑的实时控制。
阶段一:专家数据上的条件流匹配。收集专家示范后,XR-2 用条件流匹配目标训练,使单一策略联合学习多个子任务:
$$\mathcal{L}_{\mathrm{CFM}}(\theta)=\mathbb{E}_{\{\mathbf{a},\mathbf{o},\mathbf{s},l\}\sim\mathcal{D},\,\epsilon,\,t}\left\|\pi_{\theta}(\mathbf{a}_{t},\mathbf{o},\mathbf{s},l)-(\mathbf{a}-\epsilon)\right\|^{2}$$
其中 $\epsilon\sim\mathcal{N}(\mathbf{0},\mathbf{I})$、$t\sim\mathrm{Beta}(1.0,1.5)$,噪声动作块构造为 $\mathbf{a}_{t}=(1-t)\epsilon+t\mathbf{a}$;策略在噪声动作、视觉观测、机器人状态与语言指令条件下预测目标流 $(\mathbf{a}-\epsilon)$。Beta 采样把训练质量集中在插值路径的中后段,是两个阶段共用的全参数训练目标。
阶段二:DAgger 数据上的后训练。纠正轨迹流式上云后,策略针对测试环境中的失败案例继续优化。这一阶段有两个挑战:策略要从在线纠正中学会失败恢复,又不能忘记已有技能;学习动态不同的子任务必须被平衡训练。作者用数据分配同时解决两者。其一,DAgger 与专家数据按轨迹条数而非帧数 1:1 混合:子任务轨迹长度差异大,帧级混合会让随机采样扭曲技能覆盖,按条数对齐才能保留专家技能分布。其二,把 DAgger 预算偏向策略做得差的子任务:设 $N$ 为子任务数、$s_{i}$ 为当前策略在留出评测集上对子任务 $i$ 的成功率,则分配给子任务 $i$ 的纠正轨迹比例为
$$w_{i}=w_{\min}+\bigl(1-Nw_{\min}\bigr)\,\frac{\bigl(1-s_{i}+\epsilon\bigr)^{\alpha}}{\sum_{j=1}^{N}\bigl(1-s_{j}+\epsilon\bigr)^{\alpha}}$$
其中 $1-s_{i}$ 是需求信号,$\alpha\geq 0$ 控制预算向弱子任务集中的锐度($\alpha=0$ 退化为均匀分配),$\epsilon>0$ 保证子任务被解决后份额仍为正,$w_{\min}$ 给每个份额设下限;作者取 $w_{\min}=0.05$、$\epsilon=0.05$、$\alpha=1$。先预留 $Nw_{\min}$ 再做比例切分使分配保持闭式,满足 $\sum_{i=1}^{N}w_{i}=1$ 且 $w_{i}\geq w_{\min}$;下限同时防遗忘——预算向弱子任务倾斜时,强子任务仍保留数据。
flowchart TD A[VR 遥操作 + SOP 专家示范] --> B[云端质检 + VLM 标注 + 人工复审] C[多机共享策略在策略 rollout] --> D[失败时人类接管纠正段] D --> E[带子任务指令的 DAgger 纠正数据] B --> F[阶段一 专家数据 CFM 全参数训练] F --> G[部署 10Hz 异步推理 + 30Hz 命令 + 1000Hz 全身控制] G --> C E --> H[阶段二 失败加权 DAgger 后训练 公式4 分配] F --> H H --> G
上图把论文的方法闭环画完整:专家流水线供给阶段一,部署中的失败供给阶段二,阶段二的检查点再回到部署,形成数据与策略共同增长的飞轮。
实验结果
部署栈与评测口径。策略部署在单张 NVIDIA GeForce RTX 4090 上,以 10 Hz 异步推理生成 $\mathbf{a}_{t}\in\mathbb{R}^{50\times 25}$ 的动作块;经时间集成后全身关节命令以固定 30 Hz 同步下发,再由继承自遥操作阶段的全身运动控制器以 1000 Hz 实时优化执行。所有测试环境都包含轻微泛化(材料尺寸、材料颜色、机器人初始位置变化);作者报告在泛化条件下 85% 成功率的模型,在分布内条件下可超过 95%。
| 维度 | 真机遥操作语料 | 野外 UMI 语料 |
|---|---|---|
| 规模 | 531.7 小时 / 32,518 条轨迹 / 5,740 万帧 | 约 1,000 小时双手叠衣与整理 |
| 场景 | 折叠站 14.6k、洗衣机 8.4k、沙发 6.1k、洗衣篮 3.4k | 200+ 家庭、100+ 采集者、5,000 件衣物 |
| 采集方式 | VR 遥操作 X2W,SOP 标准化 | 无编码器手持夹爪,双第一视角 960×960@30Hz |
| 状态监督 | 89 维本体 + 25 维动作,30 Hz 同步 | SLAM 恢复 6-DoF 末端轨迹 + 视觉开度 |
| 语言标注 | 帧级 + 子任务级,11 个原子技能 | 物品级片段 + 片段内动作步骤两级 |
专家数据缩放。作者在叠衣任务上把训练集从 10 小时扩到 160 小时(8,000 条轨迹)。成功率从 30 小时的 34% 单调上升到 120 小时的 84%,随后趋于饱和:最后 40 小时没有带来进一步提升,160 小时为 82%。释放语料的规模正是让这一转折可测量的原因——它定位了专家示范已经密集覆盖任务分布的那个点。越过该点之后,残余失败来自策略只在测试时到达的状态,它们落在专家分布之外,无法由更多专家数据供给;弥合这一缺口需要人在环的干预数据。
| 有效专家数据时长 | 叠衣成功率 | 读法 |
|---|---|---|
| 30 小时 | 34% | 覆盖不足,失败以分布内错误为主 |
| 120 小时 | 84% | 专家分布密集覆盖任务分布,接近饱和 |
| 160 小时 | 82% | 最后 40 小时无增益,饱和确认 |
图4:叠衣任务的数据缩放。(a) 成功率随有效专家数据时长的变化,120 小时后饱和;(b) 从 58% 检查点出发的三轮 DAgger 训练,成功率升至 93%。
DAgger 实验。考虑到数据采集的时间开销与计算、实验资源约束,作者用在 18,695 条专家轨迹(跨 10 个子任务)上训练的检查点初始化 DAgger 实验。叠衣任务每轮的 DAgger 轨迹数按失败加权公式分配,每轮做 2.5 个 epoch 的后训练:成功率从 58% 依次升到 74%、82%、93%,相对仅专家数据的基线净增 35 个百分点。
| 训练轮次 | 叠衣成功率 | 相对上一轮 |
|---|---|---|
| 初始化(18,695 条专家轨迹) | 58% | — |
| DAgger 第 1 轮 | 74% | +16 |
| DAgger 第 2 轮 | 82% | +8 |
| DAgger 第 3 轮 | 93% | +11 |
两条曲线如何互相印证。专家曲线回答「分布内覆盖能走多远」,DAgger 曲线回答「分布外失败如何修复」;前者开始饱和的位置正是后者的起点,两条曲线在 58% 的检查点上衔接。把两轴放在一起看,论文最有说服力的证据不是单个 93%,而是「饱和点存在」与「纠正数据在饱和点之后仍稳定增益」同时成立——这直接把数据中心缩放的讨论从「堆量」推进到「堆哪种量」。
图5:开源真机语料的代表轨迹(头部相机视角)。每行一条轨迹,条上方为该时间步生效的子任务指令,覆盖洗衣机交互、衣物装卸、物体放置、双臂洗衣篮操作与长程展开折叠。
局限性
作者自述:专家数据的边际收益在 120 小时后消失。论文明确指出最后 40 小时没有带来提升,并把残余失败归因于策略只在测试时到达的状态;这意味着缩放结论只在所探数据范围内成立,作者也只声称「在当前数据规模上呈现清晰一致的缩放趋势」。
作者自述:DAgger 实验受资源约束。由于采集时间开销与计算、实验资源限制,DAgger 并非从完整 1,500 小时语料的检查点出发,而是用 18,695 条轨迹、10 个子任务的检查点初始化;每轮纠正数据量也受人类接管成本制约,三轮之后的走势未被测量。
我们的判断:缩放证据集中在单一任务。两条缩放曲线都只在叠衣任务上测量;饱和点位置、DAgger 的 35 个百分点增益能否迁移到洗衣机交互、洗衣篮等其余子任务或更长程的组合任务,论文没有给出对照证据。
我们的判断:缺少横向基线。论文未与同规模的其他公开 VLA 或跨数据集训练方案做头对头比较,XR-2 的「强操作性能」主要由作者自评协议支撑;UMI 部分也限于衣物折叠与整理,野外多样性对下游策略的独立贡献没有被单独消融。
总结与展望
这篇论文的贡献可以拆成三层:一层是数据,1,500 小时双臂家庭操作语料与时间对齐的子任务标注开源,填补野外双臂数据的空白;一层是模型,5B 的 XR-2 用深度对齐交叉注意力与动作前缀条件把异步实时控制做进架构;一层是科学结论,专家数据与在策略纠正数据是互补的缩放杠杆,前者负责密集覆盖任务分布,后者负责修复分布外失败。对做真机系统的团队而言,可复用的不只是语料,还有那套「SOP 标准化采集 + 部署中接管即标注」的数据流水线:它把每一次部署失败都变成下一轮训练的预算。展望部分,作者把语料定位为社区研究双臂操作数据中心缩放的共享基础,配套的 IROS 2026 挑战赛则把缩放问题交给更多团队在统一基准上继续推进。
金句
「放大数据与围绕在策略失败组织数据,是互补的杠杆,而不是竞争的杠杆。」——专家示范教策略如何成功,在策略纠正教策略如何从失败中恢复,两条曲线在 58% 的检查点上接力,把叠衣成功率送到 93%。