Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLA强化学习离线RL

RL2-VLA:VLA 模型自适应 RL 潜空间组合引导与测试时扩展

提出 RL2 自适应推理时引导框架,在 VLA 动作专家潜空间上训练轻量离线 RL 策略,推理时将其流速度与冻结 VLA 组合,仅在预测失败时激活引导,在 SIMPLER 和 PolaRiS 基准上 OOD 场景成功率提升达 17.3%,真机实验验证迁移有效。

Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti2026年7月29日5 分钟阅读
EN

作者:Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti

机构:新加坡国立大学 · 多伦多大学 · 新科工程

论文arXiv:2607.26991 · 项目页rl2-vla.github.io · 代码:随终稿发布(尚未公开)

日期:2026年7月30日(v2)

一句话总结

RL²-VLA 提出自适应推理时引导框架:在冻结 VLA 动作专家的潜空间上训练轻量离线 RL 流匹配策略,推理时将其流速度与 VLA 流速度组合,仅在失败检测器预测失败时激活引导,在 SIMPLER 和 PolaRiS 基准上 OOD 场景成功率提升达 17.3%,真机平均提升 17.5%。

研究背景与动机

视觉-语言-动作(VLA)模型通过大规模机器人演示和视觉语言模型的强先验,在多种操作任务上展现出日益鲁棒和泛化的性能。然而,在挑战性和分布外(OOD)任务上,性能常显著下降——例如从 70.2% 降至 36.0%。已有工作通过预训练数据扩展和架构设计改进模型,通过偏好对齐和思维链推理进行后训练,但近期注意力转向部署时改进——利用测试时额外计算提升鲁棒性,无需大量数据采集和重训练。

图1:域内和 OOD 任务类型。VLA 在域内任务上表现良好,但在 OOD 语言指令和任务环境上成功率显著下降。

现有方法沿两条平行方向发展。推理时引导分为两类:离散动作选择从策略采样多个候选动作,用外部验证器选择最优——保留了策略学到的动作分布但受限于样本多样性;可微引导通过 VLM 评分函数或世界模型的可微度量引导动作生成——能超越原始分布但受限于 VLM 的不完美物理基础和世界模型精度。测试时扩展则反复采样动作或从改写指令生成多样本,但所有样本最终来自同一策略,可能继承相关偏差和失败模式。

更根本的问题是:现有引导和扩展方法施加固定干预策略,不区分基策略已可能成功和需要干预的情况。但人类行为截然不同:面对不确定性时主动拓宽备选方案的多样性。当桌上无遮挡时直接抓杯子,但杯子被部分遮挡时可能从另一侧接近或先移除障碍。多样备选在默认行为可能失败时最有用,但在基方案可能成功时可能引入不必要扰动。

这引出核心问题:如何以及何时将预训练 VLA 引导向多样动作候选以增强挑战/OOD 场景的鲁棒性? RL²-VLA 用"VLA 潜空间上的强化学习"回答这两个问题。

预备知识

理解 RL²-VLA 需要几个核心概念。首先是流匹配策略:通过学习从噪声到动作的向量场(流速度)来生成动作序列,$\pi_0$ 等 VLA 使用此范式。给定噪声动作 $\mathbf{a}_t$,流速度 $v_\theta(\mathbf{a}_t, t, \mathbf{c})$ 定义了去噪方向。其次是离线强化学习:从固定数据集学习策略,不与环境在线交互,通过 Q 函数评估动作价值。第三是分类器引导:用可微评分函数 $g(o, a, \ell)$ 的梯度引导扩散/流匹配采样向高价值区域偏移。

另一个关键概念是组合引导:将两个流匹配策略的速度场加权组合,产生融合两者行为分布的新分布——既保留模仿学习的强先验,又引入 RL 发现的多样行为。

方法详解:RL² 框架

RL² 框架回答两个问题:如何引导(组合引导)和何时引导(自适应失败检测)。整体流程为:从冻结 VLA 提取动作专家潜表示 → RL 流匹配策略提供引导速度 → 与 VLA 速度组合 → 失败检测器决定是否激活引导 → 验证器选择最优动作。

框架总览

flowchart TB
    subgraph VLA["冻结 VLA (pi_0/pi_0.5)"]
        OBS[观测 + 语言] --> AE[动作专家]
        AE --> EL[潜表示 e_t]
        AE --> VV[VLA 流速度 V_VLA]
    end
    subgraph RLP["RL 引导策略"]
        EL --> RLP2[流匹配策略 pi_RL]
        RLP2 --> VRL[RL 流速度 V_RL]
    end
    subgraph FD["失败检测"]
        EL --> SAFE[SAFE LSTM 检测器]
        SAFE --> SC[失败分数 s_t]
        SC --> CP[共形预测 CP 阈值]
        CP --> DEC{失败?}
    end
    VV --> COMP[速度组合]
    VRL --> COMP
    DEC -->|是| COMP
    COMP --> AS[引导动作候选]
    DEC -->|否| AS2[VLA 原始动作候选]
    AS --> VER[验证器评分]
    AS2 --> VER
    VER --> BEST[最优动作执行]

上图展示了 RL² 的完整框架。VLA 动作专家的潜表示 $e_t$ 同时输入 RL 引导策略和失败检测模块。当失败被检测到时,RL 速度与 VLA 速度组合生成引导候选;否则回退到 VLA 原始分布。验证器从候选中选择最优动作执行。

RL 潜空间策略训练

为生成可微引导函数 $g(o, a, \ell)$,RL² 首先训练一个条件于 VLA 动作专家潜表示的流匹配 RL 策略 $\pi_{\text{RL}}(a_{t:t+H} \mid e_t)$。训练数据通过在 BridgeV2 和 DROID 数据集上增加策略潜表示获得:$\mathcal{D} = \{o_i, a_i, \ell_i, e_i\}_{i=1}^N$,其中 $e_i$ 是将观测通过 VLA 后提取的嵌入。

训练流匹配 actor-critic 网络的挑战在于:从 critic $Q(s,a)$ 通过策略的多步流匹配过程直接反向传播数值不稳定。RL² 采用 QAM(Q-Adjusted Matching)方法,用稳定的逐步匹配目标替代不稳定反向传播。QAM 利用精简伴随状态 $\tilde{g}_t$ 作为时间相关引导信号,从终端动作 $a_1$ 通过反向 ODE 计算:

$$d\tilde{g}_t = -\nabla_{a_t}[2f_\beta(s, a_t, t) - a_t/t]\,\tilde{g}_t\,dt$$

终端条件为 $\tilde{g}_1 = -\tau\nabla_{a_1}Q(s, a_1)$,其中 $f_\beta$ 是固定行为先验,$\tau$ 是逆温度。策略的目标速度场 $f_\theta$ 通过最小化匹配损失与伴随信号对齐:

$$\mathcal{L}_{\text{AM}}(\theta) = \mathbb{E}_{s,\{a_t\}}\int_0^1 \left\|\frac{2(f_\theta(s, a_t, t) - f_\beta(s, a_t, t))}{\sigma_t} + \sigma_t \tilde{g}_t\right\|_2^2\,dt$$

其中 $\sigma_t = \sqrt{2(1-t)/t}$ 是固定噪声调度。该公式确保策略收敛到最优行为正则化分布:

$$\pi(a|s) \propto \pi_\beta(a|s)\exp(\tau Q(s,a))$$

同时通过稳定的一阶优化路径保持完全表达力。实践中,仅调整逆温度 $\tau$ 即可超越行为克隆基线。RL² 框架兼容不同 RL 方法——包括非流匹配方法如 V-GPS 中通过 CQL 训练的策略,适用于 OpenVLA 等自回归 VLA。

组合引导

推理时,RL² 将 RL 策略的流速度与冻结 VLA 的流速度组合。在每个流匹配步,组合速度为:

$$V_{\text{comp}} = W \cdot V_{\text{VLA}} + (1-W) \cdot V_{\text{RL}}$$

其中 $W$ 是组合权重。这种组合引导将大规模模仿学习的行为先验与离线 RL 诱导的动作多样性融合。VLA 贡献从大规模但不完美演示中学到的强行为先验,离线 RL 鼓励发现替代高价值行为并诱导超越主导演示模式的更大动作多样性。

对于自回归 VLA(如 OpenVLA),RL² 使用高斯扰动实现组合引导:对 VLA 和/或组合的 9 个动作样本拟合高斯分布,再从中重采样 32 个动作。对于流匹配 VLA(如 $\pi_0$),使用 8 个改写指令各 5 个动作样本。

失败检测与自适应引导

RL² 的核心洞察是:组合引导的多样性在基 VLA 可能失败时最有用,但在成功时可能不必要地扰动已准确动作。因此引入失败检测触发器,仅在检测到失败时启用引导,否则回退到原始 VLA 分布。

失败检测器使用 SAFE——一个条件于 VLA 内部特征的多任务轻量检测器。LSTM 检测器 $f_\psi$ 接收截至当前时间步的 VLA 特征,输出失败分数:

$$s_t = f_\psi(e_{0:t}) \in [0, 1]$$

引导由简单阈值规则触发:当预测失败分数超过时变阈值 $\delta_t$ 时干预。$\delta_t$ 使用共形预测(CP)校准,采用单侧时变 CP 公式。给定 rollout 级分数序列 $s_{1:T}$ 和显著性水平 $\alpha \in (0,1)$,CP 带定义为 $C_\alpha = \{[\text{lower}_t, \text{upper}_t]\}$,其中 $\text{upper}_t = \mu_t + h_t$,$\mu_t$ 和 $h_t$ 分别是时变均值失败分数和共形带宽。校准使用成功 rollout,使新成功 rollout 以至少 $1-\alpha$ 概率满足 $s_t < \mu_t + h_t$。

实践中,最佳 CP 显著性水平 $\alpha$ 因任务而异——$\alpha$ 直接控制引导触发频率。RL² 引入测试时 alpha 选择启发式:在验证集上用平衡准确率评估候选 $\alpha$ 值,选择最优者。

测试时扩展定律

图3:测试时扩展定律。引导改善失败状态但降低成功状态——成功和失败遵循根本不同的扩展规律。

RL² 首次建立了区分成功和失败状态的测试时扩展定律。假设有预言验证器,归一化动作误差与生成动作样本数的关系遵循指数幂律。分析揭示关键洞察:组合引导诱导的多样性在基 VLA 可能失败时最有用——可以避免主导失败模式,但在成功时可能不必要地降低已准确动作的质量。这一发现直接激励了自适应引导的设计。

实验结果

实验设置

RL² 在多个仿真基准、VLA 和验证器上评估。SIMPLER(域内):OpenVLA 在 BridgeV2 的 4 个标准任务上测试,使用 V-GPS 的 CQL 策略作为 RL 引导,RoboMonkey 作为验证器。SIMPLER(OOD):$\pi_0$ 在相同 4 个任务上用红队指令测试 OOD 语言提示,另加 4 个 OOD 任务环境,使用 QAM 策略和 CoVer 验证器。PolaRiS(OOD):$\pi_{0.5}$ 在 Franka Panda 上用 DROID 适配的 3 个任务测试 OOD 红队提示。所有实验 50 次 × 3 个随机种子。

仿真结果

任务指标$\pi_{0.5}$ 原始改写RL² 组合RL² 自适应
移动拿铁杯S(%)18.748.755.366.0
胶带入容器S(%)12.722.022.028.7
清洁锅S(%)11.524.724.033.3
平均S(%)14.331.833.842.7

表1:PolaRiS OOD 提示评估。自适应 RL² 在成功率上比改写基线提升达 +17.3%。

在 SIMPLER 域内任务上,OpenVLA 的自适应 RL² 比最强 Repeated 基线平均提升 +7.5%(任务级 +19.4%)。在 SIMPLER OOD 语言提示上,$\pi_0$ 的自适应 RL² 比最强 Rephrase 基线平均提升 +10.1%(最高 +14.7%)。在 SIMPLER OOD 任务环境上,平均提升 +8.5%(最高 +14.6%)。在 PolaRiS OOD 提示上,$\pi_{0.5}$ 的自适应 RL² 比改写基线成功率提升达 +17.3%,进度率提升 +12.4%。

消融研究

自适应性至关重要。去除失败检测模块后(Compose-Always),性能在 $\pi_{0.5}$ 上从 42.7% 降至 33.8%,在 OOD 任务上从 53.8% 降至 46.5%。非自适应引导在所有场景上均逊于自适应引导,验证了"仅在失败时引导"的核心洞察。

模型潜表示方法OOD 提示(%)OOD 任务(%)
$\pi_0$RL57.846.5
$\pi_0$BC55.842.0
$\pi_{0.5}$RL33.8
$\pi_{0.5}$BC29.7
OpenVLARL39.3
OpenVLARL0.5

表2:RL 训练和 VLA 潜表示增强组合引导。无潜表示时性能崩溃至 0.5%。

使用潜表示和 RL 训练有效。RL 训练一致优于行为克隆(BC),$\pi_0$ 上 RL 为 57.8% vs BC 55.8%,$\pi_{0.5}$ 上 RL 为 33.8% vs BC 29.7%。关键发现:去除 VLA 潜表示后 OpenVLA 性能崩溃至 0.5%——潜表示提供了 RL 策略理解当前状态的关键信息,无此条件 RL 策略无法有效引导。

SAFE 失败检测优于其他触发器。SAFE 触发在 $\pi_0$ 上达 60.3%(OOD 提示)和 53.8%(OOD 任务),优于 CoVer 触发(57.8%/50.3%)和始终触发(57.8%/46.5%),在 $\pi_{0.5}$ 上 42.7% vs 39.8% vs 33.8%。

真机实验

图2:真机实验——胶带入工具箱(OOD 环境)。自适应 RL² 在检测到失败时引导动作将胶带举高以避免碰撞。

在 PiperX 机械臂和 Realsense D405 相机上验证。使用与 $\pi_0$ 仿真相同的模型权重,QAM 作为引导策略,CoVer 作为验证器。在 4 个 OOD 任务上测试(2 个红队提示 + 2 个 OOD 环境),每任务 10 次 × 3 种子。自适应 RL² 比改写基线平均提升 +17.5%,比非自适应 RL² 平均提升 +14.2%。真机结果与仿真紧密对齐,验证了框架的实用性和模块化。

局限分析

论文自述了三个局限。第一,引导函数:虽评估了多种轻量引导函数,尚未与 VLM 或其他 VLA 的可微引导比较,因工作聚焦于最小化额外开销。第二,失败检测:alpha 选择启发式需要额外测试时评估确定最优 CP 显著性水平 $\alpha$,且可用比平衡准确率更有效的度量(如检测及时性)改进;当前依赖在线 rollout 采集训练,未来将利用大规模离线数据集提升泛化。第三,验证器:假设有鲁棒验证器有效选择动作候选,未来将共训练 RL 引导策略与验证器增强选择鲁棒性。

从独立判断角度,失败检测器的泛化性是一个关键瓶颈。论文承认 SAFE 检测器在仿真上训练后无法直接泛化到真机——需要额外采集真机 rollout 重新训练。这意味着每部署到新平台都需重新收集失败数据,增加了部署成本。此外,组合权重 $W$ 的选择论文未充分讨论——固定权重可能在不同任务和状态下非最优,自适应调整权重可能进一步提升性能。

总结与展望

RL²-VLA 提出了一种推理时引导框架,通过自适应 RL 组合引导条件于 VLA 潜表示改进预训练 VLA。轻量 RL 策略在 VLA 潜空间和相同离线数据上训练,通过引导模仿学习样本向超越演示模式的多样动作偏移来提升下游性能。论文首次发现 VLA 引导在成功和失败状态下遵循根本不同的扩展定律,证明 RL 组合引导在基策略可能失败时最有益。跨 VLA、验证器和操作基准的实验验证了 RL² 作为域内和 OOD VLA 部署的模块化框架。

这项工作将自适应测试时引导定位为通向鲁棒通用机器人基础模型的实用路径。核心洞察——"多样性在失败时最有用,在成功时可能有害"——不仅适用于 VLA,也为其他基础模型的推理时策略提供了设计原则。

"不是每一步都需要更多选择,而是在对的那一刻给予更多选择。RL² 教会 VLA 像人一样:顺利时果断前行,受挫时才打开思路。"

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日