Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

机器人操作数据引擎社区驱动

AXIS:面向可扩展机器人操作的可增长社区驱动数据引擎

学习有效机器人操作策略需要多样化高质量演示,但现有数据管道难以扩展,因为依赖专用硬件、集中操作员或固定任务套件。AXIS提出可增长社区驱动数据引擎和可扩展数据收集框架。

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li2026年7月23日2 分钟阅读
EN

研究背景与动机

通用机器人操作需要能跨多样物体、场景和任务目标行动的策略。近年来模仿学习和视觉-语言-动作(VLA)模型的进展表明,策略性能严重依赖于训练数据的规模和多样性。然而,现有操作数据流水线难以扩展——它们依赖专用硬件、集中式操作员或固定任务套件。现有基准如 Open X-Embodiment 和 RoboCasa 虽提供了宝贵数据,但作为静态发布存在根本局限:不支持持续任务扩展、广泛社区参与或随机器人能力演进的快速迭代。扩展机器人学习需要能沿多维度持续增长的数据基础设施——任务、物体、场景、贡献者、视觉条件和物理变化。

本文提出 AXIS,一个可增长的社区驱动数据引擎和基准,用于可扩展机器人学习。AXIS 的核心设计理念是"可增长"(growable):数据集不是静态的演示集合,而是提供持续扩展机制。AXIS 目前包含 207 个多样任务和 50K+ 轨迹,通过浏览器端 MuJoCo-WASM 遥操作实现大规模演示收集,自动生成和验证新操作任务,并通过自动化成功检查、质量过滤、轨迹平滑和基于 IsaacSim 的视觉/物理增强将社区收集的演示转化为训练就绪数据。在 $\pi_{0.5}$ 上的持续预训练实验表明,AXIS-100% 将 LIBERO-Plus 整体成功率提升 5.8%,优于等量 RoboCasa365 基线 37.3%,且性能随数据量一致扩展(84.7%/85.7%/88.8% 对应 25%/50%/100%)。

三层架构设计

AXIS 由三层紧密集成:基础设施层、数据处理层和模型层。

基础设施层:TaskGen 与浏览器遥操作

TaskGen 将高级操作指令转化为仿真就绪的任务实例。给定指令如"拾起桌上的玩具车",任务管理器分解为任务配置(操作目标和所需物体交互)、场景配置(工作空间上下文如支撑面、杂乱度和空间约束)和物体配置(哪些物体出现、语义角色、是否完成任务所需或仅为装饰)。每任务分配 1-5 难度等级控制物体数量、空间约束紧度和场景复杂度。物体模型管理器从现有数据库检索或通过图像转 3D 管线生成物体模型,并归一化到合理尺寸。2.5D 布局生成器提出初始场景排列,布局管理器实例化为完整 3D 环境。新任务通过共享 Web 界面部署,用户使用商品输入设备(鼠标/键盘/手柄)收集演示——无需专用硬件,大幅降低了数据收集门槛。

数据处理层:验证、清洗与增强

社区收集引入显著的操作员技能、运动平滑度、策略和质量变化。有用变化让策略接触多样抓取、恢复和修正模式;有害变化表现为损坏状态、空闲段、失败回放、不连续或不稳定动作。AXIS 通过标准化轨迹处理解决这一权衡。数据清洗流程:

$$S_{\text{clean}} \leftarrow \text{RemoveStaticSegments}(S, \epsilon)$$

$$T_{\text{clean}} \leftarrow \text{RebuildUniformTime}(S_{\text{clean}}, \Delta t_{\text{raw}})$$

$$Q_{\text{clean}} \leftarrow \text{RobotJointSequence}(S_{\text{clean}})$$

第一步验证和分段:拒绝缺少必需字段、有限值、长度一致性、物理连续性或任务成功检查的轨迹 $S$。移除静态段(关节速度低于阈值 $\epsilon$ 的部分)。第二步机器人运动平滑:对清洁后的关节序列 $Q_{\text{clean}}$ 应用 Savitzky-Golay 滤波器(窗口 $W$、阶数 $P$):

$$Q_{\text{smooth}} \leftarrow \text{SavitzkyGolay}(Q_{\text{clean}}, W, P)$$

离散夹爪转换在需要时可从连续平滑中排除。第三步固定频率重采样:用三次样条插值到均匀时间步 $\Delta t$:

$$Q_{\text{final}} \leftarrow \text{CubicSpline}(T_{\text{clean}}, Q_{\text{smooth}})(T_{\text{new}})$$

最终 $S_{\text{final}}$ 对齐非机器人状态(夹爪、物体等)到新时间网格。该流程将原始社区演示转化为平滑、均匀采样、质量可控的训练数据。视觉和物理增强通过 IsaacSim 实现——改变外观(纹理、光照)、场景配置(物体位置扰动)和动力学(摩擦、质量),扩展环境多样性。

flowchart TD
    I["高级指令
如: 拾起玩具车"] --> TG["TaskGen 任务生成"] TG --> TC["任务配置"] TG --> SC["场景配置"] TG --> OC["物体配置"] TC --> LAY["2.5D布局生成器"] SC --> LAY OC --> LAY LAY --> WEB["Web界面部署
MuJoCo-WASM"] WEB --> TELE["浏览器遥操作
社区用户"] TELE --> RAW["原始演示数据 S"] RAW --> VAL["验证与分段"] VAL --> CLEAN["移除静态段"] CLEAN --> SMOOTH["SavitzkyGolay平滑"] SMOOTH --> RESAMP["三次样条重采样"] RESAMP --> AUG["IsaacSim增强
视觉+物理"] AUG --> READY["训练就绪数据 S_final"] READY --> VLA["VLA策略训练
π_0.5"]

从更宏观的视角看,AXIS 的工作呼应了大规模预训练在 NLP 和 CV 领域的成功经验——数据规模和多样性是模型能力涌现的关键驱动力。在 NLP 中,Common Crawl 等大规模文本数据使 GPT 系列模型展现出涌现能力;在 CV 中,LAION-5B 等大规模图文对使扩散模型和 CLIP 达到惊人性能。机器人学习领域的"基础模型"之路同样需要大规模、多样化、持续增长的数据基础设施。AXIS 的贡献在于提供了这样一个基础设施的可行设计——虽然当前规模(207 任务、50K 轨迹)远不及 NLP/CV 的数据集,但其可增长设计意味着规模可以随社区参与持续扩大。$\pi_{0.5}$ 在 AXIS 上持续预训练提升 5.8% 且优于 RoboCasa365 37.3% 的结果初步验证了这一方向的有效性。更重要的是,AXIS 的扩展性趋势(84.7%→88.8%)暗示了在更大规模上可能出现的性能跃升——如果这种趋势持续,机器人操作的"基础模型"时代可能比预期更早到来。当然,仿真到真实的迁移仍是关键挑战,AXIS 当前在仿真中验证的可增长性需要在真实世界部署中得到最终确认。

模型层:训练与评估

模型层支持传统视觉运动模仿学习和现代 VLA 模型的训练和评估,使用共享任务定义和成功检查器。AXIS 将演示组织为逐渐增大的任务快照,使用固定留出协议评估策略——策略架构、训练预算、回放协议、评估任务和成功标准保持固定,仅训练快照增长,实现受控扩展研究。图像观测归一化为:

$$x_{\text{norm}} = \frac{x - q_{01}}{q_{99} - q_{01} + 10^{-6}} \times 2.0 - 1.0$$

其中 $q_{01}$ 和 $q_{99}$ 为像素值的第 1 和第 99 百分位,$10^{-6}$ 防止除零。该归一化将像素值映射到 $[-1, 1]$ 范围,适应不同光照和相机条件下的亮度变化。

实验结果

持续预训练扩展性

在 $\pi_{0.5}$ 上进行持续预训练,比较 AXIS 和等量 RoboCasa365 数据:

数据量 LIBERO-Plus 成功率 vs 基线
AXIS-25%84.7%
AXIS-50%85.7%
AXIS-100%88.8%+5.8% vs 基线
RoboCasa365(等量)AXIS 优 37.3%

性能随数据量一致扩展(84.7%→85.7%→88.8%),验证了可增长设计的有效性。AXIS 相比 RoboCasa365 的优势不仅来自额外仿真数据,还来自环境、任务和演示的多样性。

鲁棒性扰动分析

扰动类型 改进幅度
相机扰动+15.6%
传感器噪声+16.6%
布局变化+3.1%
机器人姿态+5.1%

最大改进出现在相机(+15.6%)和传感器噪声(+16.6%)扰动下——正是 AXIS 视觉和物理增强设计针对的维度,说明增强策略有效提升了策略对视觉和几何偏移的鲁棒性。AXIS 在几乎所有扰动轴上优于 RoboCasa365 控制。

图1:AXIS 系统总览——三层架构从任务生成到策略训练

图2:TaskGen 管线——语言指令转化为仿真就绪任务实例

图3:数据清洗与轨迹精炼流程

从机器人数据收集的历史发展看,AXIS 代表了从"实验室集中式收集"向"社区分布式收集"的范式转变。早期机器人数据集如 DROID、Open X-Embodiment 虽然规模可观,但数据收集仍由少数研究机构的专家操作员在本地硬件上完成。这种模式的瓶颈在于:操作员数量有限导致数据多样性不足(同一操作员的运动习惯和策略偏差会被策略学习放大);本地硬件要求限制了贡献者范围;固定任务套件无法随模型能力演进而扩展。AXIS 的浏览器端 MuJoCo-WASM 遥操作从根本上解决了这些瓶颈——任何有浏览器和网络连接的人都可以成为数据贡献者,使用鼠标/键盘/手柄等商品输入设备操作仿真中的机器人。MuJoCo-WASM 将物理引擎编译为 WebAssembly 在浏览器中运行,无需安装本地软件,极大降低了参与门槛。社区贡献者的多样性(不同操作习惯、策略偏好、修正模式)反而成为数据多样性的来源而非噪声——这正是 AXIS 数据质量管线要区分"有用变化"和"有害变化"的原因。

TaskGen 的自动任务生成机制也值得深入分析。传统机器人基准的任务设计是人工的——研究者根据研究目标精心设计任务套件,这一过程耗时且受限于设计者的想象力。TaskGen 将任务生成自动化:给定高级自然语言指令,系统自动分解为任务/场景/物体配置并生成可执行的仿真任务。这一能力的核心在于将"什么构成一个操作任务"的形式化——任务由操作目标(如拾起、放置、推)、所需物体交互(哪些物体需要接触)、场景上下文(支撑面、杂乱度)和难度等级(物体数量、空间约束)定义。难度等级 1-5 的设计使任务可以按复杂度渐进,支持课程学习。2.5D 布局生成器提出物体在桌面上的近似位置关系,布局管理器实例化为 3D 环境并检查物理合理性(如物体不悬浮、不重叠)。这种自动化任务生成使数据集的语义多样性可以随社区需求持续扩展——用户可以提交新指令,系统自动生成对应任务并部署收集。

从评估方法论角度看,AXIS 的任务快照和固定留出协议设计体现了严谨的扩展性研究方法论。传统数据集评估中,研究者往往在不同数据量上训练后比较性能,但可能同时改变了任务集、评估协议或训练超参数,使扩展性结论不可靠。AXIS 通过将演示组织为逐渐增大的任务快照(如 25%/50%/100%),并保持策略架构、训练预算、回放协议、评估任务和成功标准完全固定,仅改变训练快照大小,实现了真正受控的扩展性研究。这种设计使性能提升可以明确归因于数据量增长而非其他混杂因素。84.7%→85.7%→88.8% 的递进趋势验证了数据扩展的边际收益——虽然增益递减(1.0%→3.1%),但趋势一致且显著,支持了"更多数据带来更好策略"的基本假设。留出协议确保评估任务不在训练集中,避免了过拟合评估。这种严谨的评估方法论对整个机器人学习社区的基准设计具有参考价值。

可增长数据集的意义

从方法论角度看,AXIS 的"可增长"理念对机器人学习领域具有深远意义。静态数据集(如 Open X-Embodiment)在发布时是基准,但无法随模型能力和观测到的失败模式演进。AXIS 将数据收集转变为迭代反馈循环:任务生成模块通过新操作问题扩展语义多样性,社区遥操作通过多样人类策略和修正添加行为多样性,视觉和物理增强通过外观、场景配置和动力学变化扩展环境多样性。数据集增长因此成为改进策略鲁棒性的机制而非一次性发布过程。

社区收集与数据质量的权衡是核心挑战。社区驱动收集提升了规模和可及性,但引入了操作员技能、运动平滑度、策略和任务完成质量的显著变化。有用变化让策略接触多样抓取、恢复和修正模式;有害变化表现为损坏状态、空闲段、失败回放、不连续或不稳定动作。AXIS 通过将验证、清洗、平滑、回放和增强作为数据集构建的核心阶段来应对这一权衡,将广泛参与与下游策略学习所需的质量控制统一起来。这种"社区收集+自动质控"的范式可能是未来大规模机器人数据收集的主流方向。

从数据工程角度看,AXIS 的标准化轨迹处理管线具有独立的工程价值。RemoveStaticSegments 移除关节速度低于阈值 $\epsilon$ 的空闲段避免策略学习无意义的静止行为;Savitzky-Golay 滤波在保持运动特征的同时平滑高频抖动;三次样条重采样确保所有轨迹具有统一时间步 $\Delta t$ 便于批量训练。这些步骤虽然看似简单,但对社区收集数据的实际可用性至关重要——没有它们,原始社区演示的操作员间差异会严重污染训练信号。IsaacSim 增强的物理参数化(摩擦 $\pm 0.10$、姿态 $\pm 8°$、位置 $\pm 0.02$m 等)为系统性鲁棒性提升提供了可控手段。

局限性与未来方向

局限一:仿真到真实的差距。 虽然 AXIS 在仿真中验证了扩展性和鲁棒性,但社区遥操作在 MuJoCo-WASM 仿真中进行,真实世界部署仍需额外迁移。文中提到实时推理和真实世界回滚验证,但规模有限。

局限二:任务多样性仍受限。 207 个任务虽多样但主要集中在桌面操作,未覆盖全身操作、移动操作或接触丰富的装配等更复杂场景。物体模型通过图像转 3D 生成可能存在几何精度不足。社区参与的实际规模和持续性也是长期挑战——论文未详细讨论社区贡献者的实际数量和活跃度。

总结与启示

AXIS 提出了可增长社区驱动数据引擎和基准,通过浏览器端遥操作、自动任务生成、标准化轨迹处理和 IsaacSim 增强构建可扩展的训练就绪数据集。核心技术贡献包括:TaskGen 将高级指令分解为任务/场景/物体配置并自动生成仿真就绪任务实例;标准化轨迹处理管线 RemoveStaticSegments→SavitzkyGolay→CubicSpline 将原始社区演示转化为平滑均匀的训练数据;图像归一化 $x_{\text{norm}} = \frac{x - q_{01}}{q_{99} - q_{01} + 10^{-6}} \times 2.0 - 1.0$ 适应光照变化;固定留出协议实现受控扩展研究。在 $\pi_{0.5}$ 上 AXIS-100% 提升 LIBERO-Plus 成功率 5.8%、优于等量 RoboCasa365 37.3%,性能随数据量一致扩展(84.7%→88.8%),相机和传感器噪声扰动下改进最大(+15.6%/+16.6%)。当前数据集含 207 任务 50K+ 轨迹。AXIS 指向了持续可扩展的机器人数据管线方向,数据集增长成为改进策略鲁棒性的机制而非一次性发布——这一范式对整个机器人学习社区的数据基础设施建设具有示范意义。

从更宏观的视角看,AXIS 的工作呼应了大规模预训练在 NLP 和 CV 领域的成功经验——数据规模和多样性是模型能力涌现的关键驱动力。在 NLP 中,Common Crawl 等大规模文本数据使 GPT 系列模型展现出涌现能力;在 CV 中,LAION-5B 等大规模图文对使扩散模型和 CLIP 达到惊人性能。机器人学习领域的"基础模型"之路同样需要大规模、多样化、持续增长的数据基础设施。AXIS 的贡献在于提供了这样一个基础设施的可行设计——虽然当前规模(207 任务、50K 轨迹)远不及 NLP/CV 的数据集,但其可增长设计意味着规模可以随社区参与持续扩大。$\pi_{0.5}$ 在 AXIS 上持续预训练提升 5.8% 且优于 RoboCasa365 37.3% 的结果初步验证了这一方向的有效性。更重要的是,AXIS 的扩展性趋势(84.7%→88.8%)暗示了在更大规模上可能出现的性能跃升——如果这种趋势持续,机器人操作的"基础模型"时代可能比预期更早到来。当然,仿真到真实的迁移仍是关键挑战,AXIS 当前在仿真中验证的可增长性需要在真实世界部署中得到最终确认。

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
StageWAM:面向机器人操作世界-动作模型的阶段联合嵌入预测

StageWAM:面向机器人操作世界-动作模型的阶段联合嵌入预测

通用机器人策略旨在将多模态观测和语言任务指令映射为跨任务的动作。现有方法通常将未来表示为固定的短视频-动作块。本文区分了两种互补的未来:捕获局部场景演化的短期物理未来,以及表示任务进度的阶段级语义未来。提出StageWAM,在基于Motus的世界动作模型(WAM)上增加Stage-JEPA——一种目标条件联合嵌入预测架构。Stage-JEPA使用冻结的V-JEPA2编码器提取当前状态表示,预测下一推断阶段的潜在目标。在50个RoboTwin 2.0任务中,StageWAM实现90.25%总体成功率,成功回合平均执行步数较最强基线减少5.97%。

机器人操作世界模型JEPA2026年8月11日
动作分块为何能提升机器人行为克隆性能?

动作分块为何能提升机器人行为克隆性能?

通过仿真与真机实验证明:动作分块的收益并非来自时间一致性、视界缩减或表征学习,而是来自非马尔可夫表达能力、基于延迟观测降低复合误差,以及隐式集成效应;并据此提出随机延迟集成与显式集成策略,可在无需动作分块的情况下匹敌甚至超越其性能。

动作分块行为克隆机器人操作2026年8月3日
Ego2Robot:从第一人称人类视频合成可扩展机器人数据

Ego2Robot:从第一人称人类视频合成可扩展机器人数据

将第一人称人类操作视频通过动作重定向、机械臂视觉合成、多级质量筛选转化为机器人训练数据,产出 18,561 小时跨 15 种机器人形态的数据,提升 VLA 模型 OOD 泛化,并在真机验证。

VLA机器人操作数据合成2026年8月3日