
VLA-Precision:非对称协同自举让 VLA 真机在线 RL 高效又稳定
中科大团队提出 VLA-Precision,解决真机在线 RL 微调大 VLA 的两大瓶颈(价值信号不可靠诱发策略漂移、大模型开销限制吞吐)。ACoB 算法建立跨时间尺度的非对称协同自举:早期用人类介入引导的行为学习快速提升性能,全局回报传播与局部偏好排序渐进校准价值,相对优势改进配合参考正则化抑制漂移——其中局部排序专门修正『被人类纠正覆盖的原提案动作』的价值高估。ACoB-Stream 架构以不变状态解耦与按需流式传输带来最高 10.9× 吞吐提升。9 个高精度化学实验任务、4 种机器人本体上,98.3% 平均成功率、单任务平均 45.8 分钟,回合 27.6 秒(VLA 基线 1.2×、RL 基线 1.8× 速度)。
Su, Chenyu, Shen, Zhaolong, Qian, Yuan2026年9月3日
视觉语言动作模型强化学习真实世界RL2026年9月3日