
RLT:Physical Intelligence 用「RL Token」让 VLA 在线 RL 攻克操作的最后一毫米
Physical Intelligence(Sergey Levine 团队,2026-03-19)发布 RL Token(RLT):冻结预训练 VLA,外挂编码器-解码器把内部嵌入压缩成信息瓶颈式的 RL token,再以约 1M 参数的 actor-critic 在真机上做在线 RL,只精修任务临界相位(编辑 VLA 动作块而非从零生成,BC 正则锚定 + 参考动作 dropout)。四个亚毫米级任务临界相位提速最高 3×,螺丝成功率 20%→65%,网线插入一半回合快过所有人类遥操作演示——只需 15 分钟真实机器人数据。
Physical Intelligence 发布 RLT:用「RL Token」让 VLA 在线 RL 攻克操作的最后一毫米
来源:Physical Intelligence 研究博客《Precise Manipulation with Efficient Online RL》(2026 年 3 月 19 日),作者 Charles Xu、Jost Tobias Springenberg、Michael Equi、Ali Amin、Adnan Esmail、Sergey Levine、Liyiming Ke。
问题:VLA 过得了 90%,过不了最后一毫米
预训练 VLA(视觉-语言-动作)模型的泛化能力已经很强,但真实部署中的精密任务——把 M3 螺丝拧进机械臂、把扎带穿过窄槽、把网线插进内凹端口——成功率与速度都卡在「接触丰富的临界相位」:位置、朝向或时机的微小误差直接导致失败。此前的机器人 RL 方法(包括 pi 自家的 Recap)着眼长程任务的大规模数据收集,追求的是广度提升;RLT 反其道而行,专门攻精细操作,只需几分钟到几小时的真实世界经验。
方法:冻结 VLA,只训一个约 1M 参数的小头
RLT 的核心洞察是:不要用 RL 去微调几十亿参数的 VLA,而是把 VLA 改造成对 RL 友好的接口。整个流程分两段:
第一阶段——训练 RL Token(离线,约 1 小时)。给冻结的 VLA 外挂一个轻量编码器-解码器 Transformer:编码器把 VLA 的内部 token 嵌入序列压缩成一个特殊的「RL token」,解码器再从这个 token 自回归重建原始嵌入(对原嵌入施加 stop-gradient,不动 VLA 本体)。重建损失迫使 RL token 成为信息瓶颈——保留任务相关的一切,丢掉其余。可选地,若 VLA 开箱表现太差,可与 RL Token 模块一起在演示数据上做联合监督微调。此阶段结束后,VLA 与 RL Token 模块永久冻结。
第二阶段——在线 RL 精修动作块(真机上,15 分钟到 5 小时)。以 RL token + 本体状态为输入,训练小 actor 与 critic(合计约 1M 参数,VLA 是它的三千倍):
- Critic:标准 off-policy 时序差分(TD3 式目标网络),奖励是稀疏的 +1 成功 / 0 失败,无需奖励工程。
- Actor:输出高斯分布的动作块(chunk,与 VLA 的输出结构对齐而非单步控制),且接收 VLA 的参考动作作为输入——学的是「编辑」VLA 的动作而非从零生成;损失函数中用 BC 正则项把策略锚定在参考动作附近,critic 认为有更好选择时才偏离。
- 参考动作 dropout:每批 50% 的转移把参考动作置零,防止 actor 退化成单纯复制 VLA,保持独立的动作生成通路。
- replay buffer 同时收 VLA、actor 与人类接管的转移;每环境步 5 次更新,数百次/秒的参数更新让训练响应快到「每试一次就变好一点」。
RL 只作用于任务中人工标记的临界相位(5–20 秒的插入/紧固/旋转段),抓取运输等容易阶段仍由基础 VLA 完成;测试时由事后微调的 VLA 自动触发切换。
实验:四个亚毫米级任务
任务:电动螺丝刀拧 M3 螺丝、扎带紧固、网线插入、充电器插入(USB-C 对电源插排)。演示数据每任务 1–10 小时,在线 RL 数据 400–1000 回合(实际执行时间 15 分钟–5 小时)。
| 任务 | 挑战 | 临界相位提速 | 成功率变化 |
|---|---|---|---|
| M3 螺丝安装 | 亚毫米对准 + 螺丝位置容差 | 约 3× | 20% → 65%(+45pp) |
| 扎带紧固 | 双臂操作柔性件穿窄槽 | 约 2× | +40pp(全任务 +60%) |
| 网线插入 | 位姿对准 + 果断插入力 | 约 2× | 显著提升 |
| 充电器插入 | 插脚可见度受限下对准 | 约 1.5× | 显著提升 |
最亮眼的一条:网线插入任务上,RLT 中位临界相位执行 66 步(@50Hz),遥操作专家演示 146 步,基础 VLA 228 步——一半的 RL 回合比所有人类遥操作演示都快,即机器人自己找到了演示数据里不存在的新执行策略(一次流畅插入,失败时用小幅柔顺摆动纠正,替代了 VLA 原来的试探-回退-再调整)。训练总耗时 2 小时,其中真实机器人数据只有 15 分钟,其余是复位等开销。跨工位与速度上对比基线:单步 RL 方法(HIL-SERL、PLD)因稀疏奖励下信用分配不可行而学不动;DAgger 成功率高但速度被人类演示封顶;DSRL 潜空间转向限制提速幅度。RLT 三项(成功率 × 速度 × 吞吐)综合最优。
消融:去掉 RL Token(换 ImageNet 预训练 ResNet-10)吞吐掉一半;去掉动作块连基础 VLA 都追不上;去掉 BC 正则掉得最狠(高维动作空间纯 critic 梯度探索漂移);去掉参考动作直通学习显著变慢、训练中失败更多。完整 RLT 在仅 5 分钟临界相位数据后就超越所有消融变体。
为什么值得注意
- 「冻结大模型 + 编辑小头」的分工范式很可能被广泛复制:泛化来自 VLA 的感知与语言先验,样本效率来自把 RL 的学习负担压到 1M 参数上。与 Recap(离线 RL 改善整体行为)互补,生产系统可以叠加使用。
- RL 终于快到能在线部署:数百次/秒更新 + 每次尝试后改进,机器人第一次能在「上班时」自己练手。
- 1X CEO Bernt Børnich 的评论点出边界:真实世界 RL 是行业的「终局」,但规模化需要安全柔顺的硬件撑过「失败-适应」阶段;pi 则押注软件优先(刚完成 6 亿美元融资、估值 56 亿),把 RL Token 作为模块化接口适配第三方本体。
- 诚实的局限:仍需人类提供稀疏奖励标签、安全接管与相位标记(未来用学习型奖励模型与进度预测器自动化);RL 只覆盖临界相位;RL Token 目前按任务训练,通用化是下一步。
资源
- 博客:https://www.pi.website/research/rlt
- 论文 PDF:https://www.pi.website/download/rlt.pdf
- 相关前作:Recap(pi*0.6,离线 RL 改善长程任务)
- 关键词:VLA、在线 RL、RLPD、动作块、亚毫米精度、sim-to-real 的反面——real-world RL
原文来源:Physical Intelligencehttps://www.pi.website/research/rlt


