WARP-RM:时间扭曲增强的相对进度奖励模型提出自监督相对进度信号 WARP-RM,用时间扭曲增强从成功示教中学习帧级进度速度,再以 WARP-BC 过滤重加权行为克隆动作块。在双臂折 T 恤任务上,次优数据增多时相对原生 BC 吞吐提升最高约 18 倍;仿真瓶入箱 512 场景达 290 瓶/时。Justin Yu, Andrew Goldberg, Kavish Kondap·2026年6月26日模仿学习Data CurationBehavior Cloning2026年6月26日