Self-Adaptive VLA:让 VLA 从自己的失败回合里学会自我修正

视频加载中
视频加载中真实部署中硬件漂移无处不在——磨损、制造公差、校准偏差。在执行器偏置或关节编码器偏移下,VLA 基础策略成功率从约 100% 跌到约 0%,而任务本身没有任何变化。作者提出的 post-training 配方:1)在注入的硬件漂移下滚动冻结的基础策略;2)把每条 rollout 与针对同一漂移预先补偿的专家演示配对(无需新的人类数据);3)训练一个轻量插件编码器,把一条 rollout 压成单个 context token。该 token 经 AdaLN 调制 DiT 动作头、与时间步条件相加,每次试验只算一次,闭环控制零额外推理开销。Context token 可跨试验直接求和——每次失败暴露出前一次被掩盖的漂移:第一次修正抓取、第二次修正插入、第三次成功。在 4 个精密双臂/灵巧手任务(Piper、Piper-X、Marvin、20 自由度 Wuji 手)上:单次试验 context 恢复 46–49% 损失性能,最多 6 次试验集成恢复 80–84%;跨工位部署 5/5 全败的场景下,用 2 次失败试验作 context 即 5/5 全成。
Category: manipulation
Author: @icefox1104
Date: 2026-09-28T00:00:00
Duration: 137.493s





