
RoboPrompt:用稀疏人类输入直觉式引导机器人策略
模仿学习训练的端到端机器人策略受限于数据多样性,零样本部署常常失败;遥操作纠正依赖专用硬件与熟练操作员,而把人类指导作为策略额外输入的方法又需要修改架构并专门训练可引导性。RoboPrompt 提出一个通用、轻量的机器人策略引导系统:用户只需用画出的轨迹、目标点或粗方向指令等稀疏输入,就能在线纠正策略行为。系统用一个 0.77B 参数的 VLA(Evo-1)作为人类意图翻译器,把稀疏提示转换为时空完整的动作草稿,再借助基策略(Diffusion Policy、π0.5、FastWAM)自身的扩散/流匹配去噪动力学,在噪声空间中平衡人类意图与策略先验,无需改动基策略架构或为可引导性微调。真机实验中三种策略的提示对齐率达 99.44%、97.1%、100.0%;将引导 rollout 用于 DAgger 在线改进,2–3 轮后 π0.5 三个任务平均成功率提升 15.5%,三个策略在 Insert Bread 上提升 21.3%,人工干预次数分别下降 44.0%(2.86→1.60)与 81.9%(2.60→0.47)。
Yanwen Zou, Chenyang Shi, Guoxuan Xu2026年10月7日
操作模仿学习扩散策略2026年10月7日