OPEN SOURCE DEEP DIVE
VLAct:超越数据规模——表示中心化的 VLA 持续预训练
starVLA 团队开源的表示中心化持续预训练框架:冻结浅层保护 VLM 先验、图文描述协同训练、OFT+PI+GR00T 多头协同监督,用 Qwen3-VL-4B 主干在 LIBERO-Plus 达 82.6%、RoboTwin 2.0 达 92.5%,并支持跨具身迁移。
项目定位:把 VLM 主干网络当作 VLA 的一阶设计变量
VLAct 是 starVLA 团队开源的 表示中心化持续预训练(Representation-Centric Continued Pre-training)框架与模型库,对应论文《Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models》(arXiv:2608.27550)。它回答了一个当前 VLA 领域的关键问题:在机器人数据预算固定的前提下,如何让有限的轨迹数据最大化地沉淀为可复用的视觉-动作知识。
机器人轨迹无法像网页文本那样从互联网爬取——每一条轨迹都必须通过具身执行产生,而策略需要泛化的空间(场景、物体、目标、具身形态、接触动力学)是组合爆炸且连续的。即便最大的机器人数据集,也只是这个空间的稀疏采样。因此数据规模固然重要,但并非唯一轴:同样的数据量下,把轨迹"蒸馏"进主干网络的方式,决定了下游性能的上限。VLAct 把持续预训练视为表示学习而非单纯的动作拟合,产出了一个基于 Qwen3-VL-4B 的通用动作主干网络。
核心发现:朴素 VLA 持续预训练的三种失效模式
论文通过受控的先导实验,分离出三种直接拿机器人数据继续训练 VLM 主干时的典型失效模式,这是整个项目的立论基础:
| 编号 | 失效模式 | 证据 |
|---|---|---|
| 1 | 先验侵蚀(Prior erosion)——机器人数据远比网络语料狭窄,端到端更新会覆盖掉广泛有用的视觉-语言特征 | 全主干更新在 LIBERO-Plus 上仅 78.9,而浅层保护策略达 82.6 |
| 2 | 解码器锁定(Decoder lock-in)——单一预训练头会把主干网络特化到该头的解码几何上 | OFT 预训练能把 OFT 微调从 61.7 提升到 75.8,却把 PI 微调从 60.5 拖低到 55.1 |
| 3 | 离散化损失(Discretization loss)——离散动作 token 能教会粗结构,但丢失细粒度的时序与幅度信息 | FAST→FAST 在 LIBERO-Plus 上仅 45.2,而 FAST→GR00T 达 76.7 |
VLAct 的设计原则是:三种失效模式都在持续预训练阶段解决;到了下游阶段,丢弃预训练头、挂上任意全新初始化的动作头、解冻全部主干网络正常微调。在与 Qwen3-VL-OFT 基线的所有对照实验中,唯一变化的就是主干网络权重——下游头、初始化、数据、优化器、预算全部相同,因此增益可以干净地归因于学到的主干表示。
方法:三管齐下的持续预训练配方
1. 保护 VLM 先验
冻结视觉编码器与 LLM 下半部分层(浅层保护),并在每个 minibatch 中混入图文描述数据:$L_{total} = L_{action} + 0.5 \cdot L_{VLM\text{-}CE}$。浅层承载广泛的视觉与空间处理,描述文本提供关于物体、属性、关系与场景上下文的密集监督,使可训练层保持在原始工作区间附近。
2. 多头协同监督
针对解码器锁定,VLAct 同时训练 OFT + PI + GR00T 三个动作头(共享潜在表示),配合部分统一的动作布局(disjoint action layout + padded action dims 掩码),让主干网络对多种解码几何保持中立。这就是名字 "VLAct" 的含义:一个主干,多种动作解码。
3. 环绕感知损失
针对关节空间的角度周期性,引入最短角关节损失与端点环绕损失($L_{wrap}$),避免 359°→1° 这类动作被当成巨大误差惩罚。
结果:小模型大成绩
仅用 Qwen3-VL-4B 的规模与公开数据,持续预训练主干达到了:
| 基准 | 成绩 | 说明 |
|---|---|---|
| LIBERO-Plus | 82.6% | PI 头 |
| VLA-Arena | 54.8% | PI 头 |
| RoboTwin 2.0 | 92.5% | OFT 头 |
| RoboCasa-GR1 | 49.5% | 仅用 20% 训练数据,迁移到未见过的机器人 |
| RoboDojo 排行榜 | 35 个策略中 第 6(按成功率) | ARX X5 真机;超过所有明确标记的 world-action 模型 |
值得注意的是其跨具身迁移能力:在没见过的机器人上,只用两成数据就能达到接近完整数据的效果,这正是"可复用主干"价值的直接体现。
工程与使用
仓库提供完整的持续预训练管线(单机 8 卡脚本与多机 Slurm 脚本)与六大基准的下游微调/评测启动器:LIBERO-Plus、VLA-Arena、RoboTwin 2.0、DOMINO、RoboCasa、RoboDojo。配方组件与代码位置的映射清晰:
| 配方组件 | 代码位置 |
|---|---|
| 浅层保护(视觉编码器 + LLM 0–17 层) | --trainer.freeze_modules |
| 图文描述混合协同训练 | --datasets.vlm_data.dataset_use、--trainer.loss_scale.vlm |
| 多头协同监督 | --framework.heads oft,gr00t,pi、--framework.head_loss_weights |
| 部分统一动作布局 | --framework.disjoint_action_layout、--framework.mask_padded_action_dims |
| 环绕感知损失 | --trainer.shortest_angular_joint_loss*、--trainer.endpoint_wrap_loss_weight |
模型库在 HuggingFace 上发布:原始持续预训练主干(推荐作为新具身/数据集/解码器的起点)以及 RoboDojo、RoboTwin、DOMINO、VLA-Arena、LIBERO-Plus 的下游检查点。需要注意:持续预训练检查点不是可直接部署的策略,下游使用时应从零初始化动作头,并保留 config.yaml 与 dataset_statistics.json。
点评
VLAct 的价值不在于又一个更大的 VLA,而在于它把"如何把少量机器人数据炼成好主干"这件事做成了可复现的科学实验:三种失效模式的消融干净利落,多头协同监督是对解码器锁定问题的优雅回答,4B 规模达到与更大模型竞争的成绩则证明了路线的效率。对于想在自有机器人上微调 VLA 的团队,直接使用其公开的持续预训练主干作为起点,是当前性价比极高的选择。代码基于 MIT 协议开源。