OPEN SOURCE DEEP DIVE
Dexbotic:一站式 VLA 预训练、微调、推理与评测工具箱
Dexmal 开源的一站式 VLA 工具箱:DexData 统一数据格式贯穿预训练、微调(全参/LoRA/RL)、推理与评测,支持 π0、CogACT、OFT、MemVLA、GR00T N1 等主流模型与自研双专家模型 DM0;DB 预训练在五大仿真基准带来一致增益,RoboChallenge Table30 真机评测平均成功率 62%。
一个工具箱,跑通 VLA 全流程
Dexbotic 是 Dexmal 团队开源的一站式视觉-语言-动作(VLA)工具箱,2025 年 10 月正式发布,配套技术报告 arXiv:2510.23511,此后保持高频更新。它把 VLA 研发的完整链路——数据准备、预训练、微调(全参 / LoRA / 强化学习)、推理服务、仿真基准评测、真机部署——收敛进同一个 PyTorch 代码库,而不是每个环节各自拼脚本。
框架设计上有三条主线:
- 统一模型接口:π0、π0.5、CogACT、OFT、MemVLA、GR00T N1 等主流操作模型,与 Uni-NaVid、NaVILA 等导航模型共用同一套训练、推理、评测框架,切换模型只需换一份实验配置文件;
- 统一数据格式 DexData:提供 RLDS、LeRobot 到 DexData 的官方转换脚本,外部数据集转换后即可直接进入训练管线;
- 模块化架构:分层配置、工厂注册、入口分发,新增模型或机器人本体时只需注册对应组件,不动主干代码。
训练、推理、部署的工程配套
训练侧,Dexbotic 支持 FSDP2 分布式后端;为 CogACT、Pi05、DM0 三个模型提供 Co-training 配置,让动作专家与语言模型骨干联合优化;推荐 8×A100/H100 起训,8×RTX 4090 可切换 ZeRO-3 offload 配置压低显存。微调侧提供 π0、π0.5、DM0、CogACT 四套 LIBERO LoRA SFT 配方,消费级单卡也能跑。
推理侧,统一的 v1 推理 API 抹平不同模型的包装差异:训练完成直接起服务。以 DM0 为例,启动推理服务后,一条 curl 把图像和指令发给 /process_frame 即可拿回动作。官方推荐用 Docker 做开发与部署,镜像 dexmal/dexbotic 开箱即用;Blackwell 架构显卡(如 RTX 5090)另有专门的 c130t28 镜像。最小上手路径:
docker pull dexmal/dexbotic
git clone https://github.com/dexmal/dexbotic && cd dexbotic
pip install -e .
torchrun --nproc_per_node=8 playground/benchmarks/libero/libero_dm0.py
DB 预训练模型:五个基准上的一致性增益
团队用自建大规模数据训练了 DB- 前缀的增强预训练模型,并在五个主流仿真基准上对比「原始模型」与「DB 预训练后再微调」的成绩。增益几乎全面为正,且在 SimplerEnv、ManiSkill2 这类迁移型基准上幅度最大——CogACT 从 51.25 提到 69.45,OFT 从 30.23 提到 76.39——说明大规模预训练对跨环境泛化的提升,远大于同分布刷点。
| 基准 | 模型 | 原始 | DB 预训练 |
|---|---|---|---|
| LIBERO(均分) | CogACT | 93.6 | 94.9 |
| LIBERO(均分) | MemVLA | 96.7 | 97.0 |
| LIBERO(均分) | GR00T N1 | — | 94.8 |
| CALVIN(平均长度) | CogACT | 3.246 | 4.063 |
| SimplerEnv(均分) | CogACT | 51.25 | 69.45 |
| SimplerEnv(均分) | OFT | 30.23 | 76.39 |
| SimplerEnv(均分) | MemVLA | 71.9 | 84.4 |
| ManiSkill2(均分) | CogACT | 40 | 58 |
| ManiSkill2(均分) | OFT | 21 | 63 |
| RoboTwin 2.0(均分) | CogACT | 43.8 | 58.5 |
DM0:双专家架构 + Flow Matching 的自研模型
DM0 是团队的自研 VLA(2026-02-10 发布,另附独立技术报告):视觉-语言骨干 + 动作专家的双专家结构,靠融合注意力桥接两路信息;动作头不走离散 token,而是用 Flow Matching 做扩散式连续生成,一次前向直接输出一段未来动作块。开源的 DM0-base 参数量 2.4B,动作维度 32,最多接 3 路相机。
成绩方面:DM0 在 LIBERO 四个子集均分 94.1(Spatial 98.2 / Object 98.8 / Goal 96.6 / Long 82.6);在 RoboChallenge 平台的 Table30 真机评测中,DM0 平均成功率 62%、平均分数 72.25,显著高于 π0(28%)与 π0.5(43%)。导航方向,DM0 在 HM3D 物体导航成功率 73.5、MP3D 45.3,与导航专用模型 Uni-NaVid 处于同一量级。工程上,Triton 实时推理后端为核心推理带来约 5 倍加速,支撑真机实时闭环。
RL 后训练与真机生态
2026-02-10,Dexbotic 与 RLinf 团队宣布战略合作,共同推进 VLA + RL 方向:框架内置 GRPO 算法,也可把 RLinf 整体作为外部 RL backend 做后训练,与 SFT/LoRA 微调共享同一套数据和模型接口。
真机生态已覆盖 UR5、Franka、ALOHA、DOS-W1 双臂、SO-101、XLeRobot 以及宇树 G1(含 SONIC 全身控制示例),各本体均附推理接入教程;评测侧另有独立的 dexbotic-benchmark 仓库,Docker 一键跑 LIBERO 全套,也可通过 RoboChallenge 平台提交远程真机评测。项目采用 MIT 许可,模型权重托管于 Hugging Face(Dexmal),完整文档见 dexbotic.com。