PAPER DEEP DIVE
WARP-RM:时间扭曲增强的相对进度奖励模型
提出自监督相对进度信号 WARP-RM,用时间扭曲增强从成功示教中学习帧级进度速度,再以 WARP-BC 过滤重加权行为克隆动作块。在双臂折 T 恤任务上,次优数据增多时相对原生 BC 吞吐提升最高约 18 倍;仿真瓶入箱 512 场景达 290 瓶/时。
论文元信息
标题:WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
作者:Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg
机构:UC Berkeley AUTOLAB / BAIR;XDOF 提供示教数据、训练算力与评测硬件
论文链接:arXiv:2606.28320
项目主页:uynitsuj.github.io/warp-rm
代码状态:已开源(github.com/uynitsuj/WARP-RM),含训练脚本、LeRobot 标注注入、WebUI 检视与仿真复现产物
一句话总结
WARP 用时间扭曲增强从成功示教中自学有符号的相对进度速度,再以 WARP-BC 按终端帧速度过滤并重加权行为克隆动作块,使策略在次优遥操作数据增多时仍保持高吞吐。
研究背景与动机
模仿学习已成为长时程机器人操作的主流范式:策略从人类遥操作示教中拟合视觉-动作映射。策略建模与大规模预训练显著提升了表达力与泛化,但方法对示教质量仍然敏感。人类遥操作不可避免地混入停顿、重试与摸索;策略若照单全收,会把这些低效片段当成“正确行为”复现,在长时程任务上尤其致命。
次优片段并非一无是处。它们常含恢复动作,类似 DAgger 中暴露出的纠错数据。粗粒度的轨迹级策展——整条 episode 达不到质量阈值就整段丢弃——会同时犯两类错误:丢掉次优轨迹里高价值的推进片段,又放过保留轨迹里局部的犹豫与摸索。
于是近期工作转向帧级进度信号。多数进度奖励模型处于“绝对进度”体制:ReWiND 用归一化时间作监督;VIP、LIV 用时间对比把观测映射到全局进度轴。问题在于:时间流逝不等于任务推进。同一归一化帧索引上,两条示教可能分别停在抓取失败与袖口已折好——标签噪声随之而来。SARM 等更密的奖励模型靠人工标注子任务边界缓解噪声,但标注贵、口径难统一,难以随数据规模扩展。
本文的核心判断是:不必预测“任务完成了百分之几”,而应预测“相对当前窗口起点,任务正以多快的速度、朝哪个方向推进”。只要能稳定标出推进、停滞与回退,就可以在行为克隆目标里对动作块做细粒度门控与重加权,而无需人工子任务标注。
图1:WARP-RM 在未见过的混合质量示教上输出有符号进度速度 $\hat{v}_t$。大幅正值对应果断推进,近零对应停顿/摸索,负值对应状态回退。
预备知识
行为克隆与动作块。策略 $\pi_\theta$ 在状态 $s$ 上预测一段短时动作块 $a$(本文取约 1 秒)。标准目标对所有样本等权;一旦训练集混入犹豫片段,等权拟合会放大这些片段的出现频率。
流匹配损失。策略训练使用流匹配目标 $\mathcal{L}_{\mathrm{flow}}$;WARP-BC 并不改生成器结构,只在样本级乘上由进度速度导出的权重 $w(s,a)$。
绝对进度 vs 相对进度。绝对进度把全局时间或全局嵌入轴当作“完成度”;相对进度只问窗口内相对起点的累积位移。后者对操作员策略差异与局部停顿更鲁棒,因为标签来自同一条成功示教的重放速度,而不是跨 episode 对齐的帧号。
方法详解
总览与符号
WARP-RM 是视觉模型:输入观测序列,输出稠密的逐帧进度速度。训练完全自监督,只用成功遥操作示教。一条示教是固定帧率 $f$ 下的 $T$ 帧 RGB 序列 $o_0,\ldots,o_{T-1}$;冻结视觉编码器 $\phi$ 给出逐帧特征。通过时间扭曲采样器得到窗口索引 $i_0,\ldots,i_{N-1}$(可非单调),伪标签 $y_k$ 是相对窗口起点 $o_{i_0}$ 的归一化时间位移。
推理时,模型在步长为 $S$ 秒的线性窗口上滑窗预测,再按后文聚合规则得到 $\hat{v}_t$。标定语义为:$\hat{v}_t\approx 1$ 对齐参考专家节奏,$\hat{v}_t\approx 0$ 表示停滞,$\hat{v}_t<0$ 表示回退。
flowchart TD A[成功示教视频] --> B[Time-Warp Sampler
AR1 变速 + 反转] B --> C[相对累积进度伪标签 y_j] C --> D[冻结 DINOv3 + 双向 Transformer] D --> E[分类 bin 期望得到 y_hat] E --> F[窗内差分得速度 v_j] F --> G[重叠窗口平均得 v_hat_t] G --> H[WARP-BC: 终端速度门控与重加权] H --> I[加权流匹配行为克隆]
时间扭曲采样器
采样器先抽 $N-1$ 个相对对数速度,服从平稳 AR(1) 过程:
$$z_0\sim\mathcal{N}(0,\sigma_\infty^2),\quad z_k=\alpha z_{k-1}+\sqrt{1-\alpha^2}\,\sigma_\infty\,\epsilon_k,\quad\epsilon_k\sim\mathcal{N}(0,1)$$
指数化得到正播放速度 $\tilde{v}_k=e^{z_k}$。对数空间使 $2\times$ 加速与 $0.5\times$ 减速对称;$\alpha$ 控制相邻速度变化的平滑性。再抽路径长度预算 $\ell\sim\mathrm{Unif}[fL/3,\,5fL/3]$(并截断到 $T-1$),把速度重标定到预算:
$$\tilde{u}_k=\ell\,\tilde{v}_k\Big/\sum_{j=0}^{N-2}\tilde{v}_j$$
反转提供负位移样本:抽 $R=\min(R_0,N-2)$ 个反转点,$R_0\sim\mathrm{Poisson}(\lambda_{\mathrm{rev}})$,并有 0.5 概率整体翻转符号。累积位移 $c_j=\sum_{k=0}^{j-1}u_k$ 后,再选合法起点 $i_0$,得到 $i_j=\mathrm{round}(i_0+c_j)$。
图2:Time-Warp Sampler。变速覆盖慢放至快进,随机反转暴露负进度;累积播放速度得到 32 帧源窗口,相对起点偏移即为自监督进度标签。
开源实现中,对数空间 AR(1) 速度过程与 Poisson 反转点分别对应 warp_rm/data/curve_parameterizations.py 的 sample_speed_process 与 sample_reversal_signs;完整采样器封装为 ARSampler(warp_rm/data/samplers.py),并提供 iid_speed=True 消融分支以对照 IID 对数正态速度。
# warp_rm/data/curve_parameterizations.py — AR(1) 对数速度
z[0] = rng.normal(0.0, sigma_inf)
noise_scale = math.sqrt(1 - alpha**2) * sigma_inf
for k in range(1, n_gaps):
z[k] = alpha * z[k - 1] + noise_scale * rng.normal()
return np.exp(z)
进度模型训练目标
相对累积进度伪标签为源帧位移除以规范化常数 $C_{\mathrm{norm}}=f(N-1)S$:
$$y_j=(i_j-i_0)/C_{\mathrm{norm}},\qquad j=0,\ldots,N-1$$
模型不对 $y_j$ 直接回归,而是对每个时间步预测均匀分箱上的概率分布,并用两热点(two-hot)编码把连续值插值到相邻 bin 中心,以交叉熵训练。分类式目标缓解直接回归常见的优化不稳与容量浪费;开源代码里由 soft_bins 与 C51 风格交叉熵实现(warp_rm/core/loss.py)。
模型架构
结构类似 SARM:冻结视觉骨干 + Transformer 时间聚合,但把头换成单一进度速度头。骨干为 DINOv3 ViT-B/16,每帧 768 维。输入 token 拼接特征与时间差分 $[\phi(o_{i_j}),\,\phi(o_{i_j})-\phi(o_{i_{j-1}})]\in\mathbb{R}^{1536}$($j=0$ 时差分置零),经线性投影、正弦位置编码与双向 Transformer,再由线性层映射到分类分布;推理取期望得到 $\hat{y}_j$。
图3:WARP-RM 架构。32 帧窗口经冻结 DINOv3 与双向注意力 Transformer,每帧输出 30 个累积进度 bin 的分布;期望差分得窗内速度,再跨重叠窗口平均得到 $\hat{v}_t$。
源码对应关系清晰:DINOv3 封装在 warp_rm/models/backbones/dinov3.py;双向聚合与 C51 头在 TransformerAggregator(warp_rm/models/aggregators/transformer.py),文档字符串明确写出时间差分拼接、相对进度 bin 与绝对进度辅助头。
WARP-BC:用进度速度策展行为克隆
重叠窗口各含 $N$ 帧、步长 $S$ 秒,相邻窗口平移一帧。窗内速度
$$v_j=(N-1)(\hat{y}_j-\hat{y}_{j-1})$$
对覆盖同一源帧 $t$ 的所有 $v_j$ 取平均,得到稠密 $\hat{v}_t$。策略预测 1 秒动作块时,用块末端速度 $\hat{v}_{\mathrm{end}}$ 定义连续权重:
$$w(s,a)=\hat{v}_{\mathrm{end}}\cdot\mathbf{1}_{\hat{v}_{\mathrm{end}}>\tau}$$
二值变体把保留块权重置 1:$w(s,a)=\mathbf{1}_{\hat{v}_{\mathrm{end}}>\tau}$。$w=0$ 的块在训练前滤除,避免空权重稀释有效 batch。最终损失为加权流匹配:
$$\mathcal{L}_{\mathrm{BC}}=\mathbb{E}_{(s,a)\sim\mathcal{D}}\big[w(s,a)\cdot\mathcal{L}_{\mathrm{flow}}(\pi_\theta;s,a)\big]$$
作者强调:末端帧速度聚合优于块内均值聚合;$\hat{v}_{\mathrm{end}}$ 是经验进度速度优势代理,而非带价值基线的显式 RL 优势估计。
实验结果
评测覆盖三场景:真实双臂折 T 恤、真实瓶入箱、可复现的 MuJoCo 瓶入箱仿真。真机平台为双臂 I2RT YAM。折衣任务从装有不定数量衣物的箱子取出皱 T 恤,铺平、折袖、对折两次并移到工作台左上角;超时 240 秒判失败。吞吐按成功折叠数/小时计,失败 trial 计入完整超时。
图4:不同次优程度训练集上成功 trial 的完成时间分布。$\mathcal{D}_1$ 至 $\mathcal{D}_3$ 逐步放宽 episode 时长上限,纳入更多犹豫与恢复。
| 数据集 | 方法 | 成功率 | 平均完成时间(s) | 吞吐(/hr) | 保留动作块 |
|---|---|---|---|---|---|
| $\mathcal{D}_1$(≤60s) | Vanilla BC | 20/20 | 113.8 | 31.6 | 100% |
| WARP-BC | 20/20 | 63.9 | 56.3 | 35.7% | |
| $\mathcal{D}_2$(≤90s) | Vanilla BC | 2/20 | 199.0 | 1.5 | 100% |
| WARP-BC | 19/20 | 118.8 | 27.4 | 34.4% | |
| $\mathcal{D}_3$(≤120s) | Vanilla BC | 0/20 | — | 0.0 | 100% |
| WARP-BC | 14/20 | 117.4 | 16.3 | 22.5% |
表1:折衣跨层级结果。次优示教增多时原生 BC 崩溃,WARP-BC 在 $\mathcal{D}_2$ 上吞吐约提升 18 倍(27.4 vs 1.5)。
与 SARM、DemInf、SCIZOR 在匹配数据集 $\mathcal{D}_4,\mathcal{D}_5$ 上对比:更宽层级上 SARM 与 SCIZOR 从 19/20 跌到 2/20,DemInf 保 18/20,WARP-BC 达 20/20,且吞吐最高。WARP-BC 与 DemInf 保留率匹配;仿真实验进一步把所有策展方法统一到 31.5% 保留率。
| 方法 | 数据保留 | 瓶/场景 | 吞吐(/hr) | 清完 6 瓶 |
|---|---|---|---|---|
| Vanilla BC | 100% | 3.885 | 237 | 9.4% |
| Random | 31.5% | 3.770 | 230 | 10.9% |
| ReWiND | 31.5% | 3.781 | 231 | 9.4% |
| SARM (oracle) | 31.5% | 4.191 | 265 | 20.5% |
| DemInf | 31.5% | 4.332 | 271 | 18.8% |
| WARP-BC | 31.5% | 4.533 | 290 | 25.0% |
表2:仿真瓶入箱(512 配对场景)。策展方法均保留 31.5% 数据;WARP-BC 相对原生 BC 吞吐 +53 瓶/时(95% CI [42, 64])。
图5:真实瓶入箱每瓶放置时间。WARP-BC 放置 74/80 瓶、均时 11.3s、吞吐 237.8/hr;原生 BC 为 59/80、15.9s、147.8/hr。
消融表明:$\tau=1$ 的连续加权优于二值门控与 $\tau=0$;终端速度聚合优于块均值;AR(1) 采样相对 IID 在仿真同保留率下吞吐 290 vs 269。独立标注的 452 条专家折衣 episode 上,进度信号区分错误窗口的帧级 AUROC 为 0.83,高于本体速度(0.61)与衣物面积变化(0.68)。
局限性
作者指出:WARP-BC 只能削弱次优数据的影响,策略仍受训练集行为覆盖限制;后续需结合 DAgger、离线/在线 RL 与奖励对齐的迭代自改进,才能越出离线示教分布。
负进度监督完全来自反转播放——这是从 ReWiND 借用的近似,物理上可能不可实现。真实回退在正向时间与正常因果动力学下展开,与时间扭曲反转的时空分布存在缺口。作者认为实践中重叠常足够提取可用信号,但该对齐具有任务依赖性,部署前应在目标任务上验证合成信号是否有效。
实验覆盖两个真实操作任务与一个仿真任务,且均在同一双臂本体上;跨本体、跨任务族的泛化仍待检验。真机每配置 20 trial,作者也提醒相近成功率差异可能落在二项采样噪声内,应更看吞吐与完成时间。
总结与展望
WARP 把“示教里哪里在推进”变成可自学的相对速度问题,再用该信号对行为克隆动作块做细粒度策展。相对轨迹级过滤与依赖人工子任务边界的绝对进度模型,它在次优数据增多时更稳,并在真实折衣、真实/仿真瓶入箱上给出一致的吞吐收益。开源仓库把采样器、C51 损失、DINOv3+Transformer 与 LeRobot 标注注入串成可复现管线,便于在自有示教上先验证进度曲线再接入策略训练。
金句
时间流逝不是任务进度;学会相对窗口的推进速度,才能从嘈杂示教里留下真正推动任务的动作块。



