分组误差而非总MSE:面向11自由度移动操作VLA模型的微调
为具有异构关节空间的移动操作机器人微调视觉-语言-动作(VLA)模型会产生一个反直觉的结果:总 MSE 最低的检查点并非在真实机器人上表现最好的。我们认为这是将异构关节组(臂、夹爪、头、轮式基座)折叠为单一指标的可预见后果,其中容易预测的关节可能掩盖仍然失败的关节。我们在 11 自由度丰田 HSR 上微调 SmolVLA(450M,仅动作专家),并与更强的预训练基线 π₀.₅(3.3B)进行比较。分组分析揭示了两种模式:在 SmolVLA 中,移动基座收敛最慢并限制了整体性能。在 π₀.₅ 的仅专家微调中(仅训练动作头,骨干网络冻结),总 MSE 降至基线以下但臂精度下降。在 60 次真实机器人试验中(每个模型 20 次),π₀.₅ 80k(4.0/4)显著优于两个微调变体,尽管仅专家 3k 具有最低的总 MSE。我们得出结论,对于具有异构动作空间的机器人,分组误差比总 MSE 是更可靠的检查点选择信号。
VLA模型移动操作微调Pau Montagut Bofi, Mario García Blasco, Tessa Pulli·2026年5月29日