
超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进
Q-Planning 冻结大型行为克隆策略,只训练一个约十亿参数的离线 Q 函数。推理时,Q 对 BC 采样出的多个候选动作块做单步加权平均;在线自改进时,成功与失败回放都只用于更新 Q。10 轮迭代将 LIBERO 平均成功率从 92.1% 提升到 97.6%,双臂真机堆杯与插卡任务分别从 40%/25% 提升到 90%/80%。
Varun Giridhar, Anant Khandelwal, Jeremy A. Collins2026年8月21日
Q-Learning视觉语言动作模型机器人操控2026年8月21日
