Skip to content
RobotWorld
返回开源项目

OPEN SOURCE DEEP DIVE

VLA持续预训练操作

VLAct:超越数据规模——表示中心化的 VLA 持续预训练

starVLA 团队开源的表示中心化持续预训练框架:冻结浅层保护 VLM 先验、图文描述协同训练、OFT+PI+GR00T 多头协同监督,用 Qwen3-VL-4B 主干在 LIBERO-Plus 达 82.6%、RoboTwin 2.0 达 92.5%,并支持跨具身迁移。

starVLA/VLAct57PythonNOASSERTION2 min read

项目定位:把 VLM 主干网络当作 VLA 的一阶设计变量

VLAct 是 starVLA 团队开源的 表示中心化持续预训练(Representation-Centric Continued Pre-training)框架与模型库,对应论文《Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models》(arXiv:2608.27550)。它回答了一个当前 VLA 领域的关键问题:在机器人数据预算固定的前提下,如何让有限的轨迹数据最大化地沉淀为可复用的视觉-动作知识

机器人轨迹无法像网页文本那样从互联网爬取——每一条轨迹都必须通过具身执行产生,而策略需要泛化的空间(场景、物体、目标、具身形态、接触动力学)是组合爆炸且连续的。即便最大的机器人数据集,也只是这个空间的稀疏采样。因此数据规模固然重要,但并非唯一轴:同样的数据量下,把轨迹"蒸馏"进主干网络的方式,决定了下游性能的上限。VLAct 把持续预训练视为表示学习而非单纯的动作拟合,产出了一个基于 Qwen3-VL-4B 的通用动作主干网络。

核心发现:朴素 VLA 持续预训练的三种失效模式

论文通过受控的先导实验,分离出三种直接拿机器人数据继续训练 VLM 主干时的典型失效模式,这是整个项目的立论基础:

编号失效模式证据
1先验侵蚀(Prior erosion)——机器人数据远比网络语料狭窄,端到端更新会覆盖掉广泛有用的视觉-语言特征全主干更新在 LIBERO-Plus 上仅 78.9,而浅层保护策略达 82.6
2解码器锁定(Decoder lock-in)——单一预训练头会把主干网络特化到该头的解码几何上OFT 预训练能把 OFT 微调从 61.7 提升到 75.8,却把 PI 微调从 60.5 拖低到 55.1
3离散化损失(Discretization loss)——离散动作 token 能教会粗结构,但丢失细粒度的时序与幅度信息FAST→FAST 在 LIBERO-Plus 上仅 45.2,而 FAST→GR00T 达 76.7

VLAct 的设计原则是:三种失效模式都在持续预训练阶段解决;到了下游阶段,丢弃预训练头、挂上任意全新初始化的动作头、解冻全部主干网络正常微调。在与 Qwen3-VL-OFT 基线的所有对照实验中,唯一变化的就是主干网络权重——下游头、初始化、数据、优化器、预算全部相同,因此增益可以干净地归因于学到的主干表示。

方法:三管齐下的持续预训练配方

1. 保护 VLM 先验

冻结视觉编码器与 LLM 下半部分层(浅层保护),并在每个 minibatch 中混入图文描述数据:$L_{total} = L_{action} + 0.5 \cdot L_{VLM\text{-}CE}$。浅层承载广泛的视觉与空间处理,描述文本提供关于物体、属性、关系与场景上下文的密集监督,使可训练层保持在原始工作区间附近。

2. 多头协同监督

针对解码器锁定,VLAct 同时训练 OFT + PI + GR00T 三个动作头(共享潜在表示),配合部分统一的动作布局(disjoint action layout + padded action dims 掩码),让主干网络对多种解码几何保持中立。这就是名字 "VLAct" 的含义:一个主干,多种动作解码。

3. 环绕感知损失

针对关节空间的角度周期性,引入最短角关节损失与端点环绕损失($L_{wrap}$),避免 359°→1° 这类动作被当成巨大误差惩罚。

结果:小模型大成绩

仅用 Qwen3-VL-4B 的规模与公开数据,持续预训练主干达到了:

基准成绩说明
LIBERO-Plus82.6%PI 头
VLA-Arena54.8%PI 头
RoboTwin 2.092.5%OFT 头
RoboCasa-GR149.5%仅用 20% 训练数据,迁移到未见过的机器人
RoboDojo 排行榜35 个策略中 第 6(按成功率)ARX X5 真机;超过所有明确标记的 world-action 模型

值得注意的是其跨具身迁移能力:在没见过的机器人上,只用两成数据就能达到接近完整数据的效果,这正是"可复用主干"价值的直接体现。

工程与使用

仓库提供完整的持续预训练管线(单机 8 卡脚本与多机 Slurm 脚本)与六大基准的下游微调/评测启动器:LIBERO-Plus、VLA-Arena、RoboTwin 2.0、DOMINO、RoboCasa、RoboDojo。配方组件与代码位置的映射清晰:

配方组件代码位置
浅层保护(视觉编码器 + LLM 0–17 层)--trainer.freeze_modules
图文描述混合协同训练--datasets.vlm_data.dataset_use--trainer.loss_scale.vlm
多头协同监督--framework.heads oft,gr00t,pi--framework.head_loss_weights
部分统一动作布局--framework.disjoint_action_layout--framework.mask_padded_action_dims
环绕感知损失--trainer.shortest_angular_joint_loss*--trainer.endpoint_wrap_loss_weight

模型库在 HuggingFace 上发布:原始持续预训练主干(推荐作为新具身/数据集/解码器的起点)以及 RoboDojo、RoboTwin、DOMINO、VLA-Arena、LIBERO-Plus 的下游检查点。需要注意:持续预训练检查点不是可直接部署的策略,下游使用时应从零初始化动作头,并保留 config.yamldataset_statistics.json

点评

VLAct 的价值不在于又一个更大的 VLA,而在于它把"如何把少量机器人数据炼成好主干"这件事做成了可复现的科学实验:三种失效模式的消融干净利落,多头协同监督是对解码器锁定问题的优雅回答,4B 规模达到与更大模型竞争的成绩则证明了路线的效率。对于想在自有机器人上微调 VLA 的团队,直接使用其公开的持续预训练主干作为起点,是当前性价比极高的选择。代码基于 MIT 协议开源。