Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLAPaperVision-Language-Action

FutureRTC:基于预期条件动作分块的实时机器人执行

提出FutureRTC,基于预期条件动作分块实现实时机器人执行,降低VLA推理延迟,提升实时控制性能。

Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu2026年7月27日3 分钟阅读
EN

1. 论文概览:面向异步 VLA 执行的前瞻性条件化动作分块

FutureRTC 由 Hai Jiang、Yixian Zou 等于 2026 年 7 月提出,是一个即插即用的适配框架,通过预测执行时观测与状态来缓解异步 VLA 控制中的预测-执行错位,无需修改底层策略。VLA 策略的实时部署需要异步执行——后续动作分块在当前分块执行期间并行计算,导致预测-执行错位,表现为分块间不连续。现有方法要么仅表面平滑分块边界、要么需要昂贵的策略优化、要么仅前向预测本体感受状态而忽略关键视觉观测。FutureRTC 包含状态校正模块(SCM)补偿前向滚动与实际执行时本体感受状态的偏差,以及观测预测模块(OPM)利用机器人运动作为显式物理先验通过运动感知特征传输与重建来预测执行时视觉表示。此外引入策略一致性损失,使从预测上下文生成的动作分块与 VLA 策略在期望执行时输入下产生的分块对齐。实验证明 FutureRTC 对推理延迟具有卓越鲁棒性,轨迹更平滑、执行更快、成功率更高。

FutureRTC 与现有执行范式对比

2. 核心问题:异步执行的预测-执行错位

VLA 模型将深度视觉-语言推理与富有表达力的动作生成统一,但推理计算成本与低层控制高频需求间的矛盾催生了动作分块策略:策略单次前向生成未来动作序列,通过开环执行摊销推理开销。异步执行成为实时部署的标准范式,但其引入根本性的预测-执行错位——策略在步骤 $t+K-d$ 基于陈旧的 $(o_{t+K-d}, s_{t+K-d})$ 生成动作,却在步骤 $t+K$ 执行,此时真实观测与状态已变化。设延迟为 $d$,错位可形式化为:

$$\Delta_{\text{misalign}} = (o_{t+K}, s_{t+K}) - (o_{t+K-d}, s_{t+K-d})$$

随 $d$ 增大,错位急剧恶化,导致性能坍缩。

3. 方法:即插即用前瞻性适配器

3.1 总览

给定流匹配 VLA $\pi_\theta(\cdot \mid o_t, s_t)$,目标是缓解异步执行的错位,其中策略在执行步骤 $t+K$ 前的步骤 $t+K-d$ 以陈旧对 $(o_{t+K-d}, s_{t+K-d})$ 为条件。引入即插即用前瞻性适配器 $\phi(\cdot)$ 从陈旧对应预测执行时观测与状态:

$$\hat{o}_{t+K}, \hat{s}_{t+K} = \phi(o_{t+K-d}, s_{t+K-d}, [a_{t+K-d}:a_{t+K-1}])$$

3.2 状态校正模块(SCM)

执行时状态 $s_{t+K}$ 在生成步骤 $t+K-d$ 不可观测,但可通过用已提交动作前向滚动陈旧状态估计:

$$\tilde{s}_{t+K} = s_{t+K-d} \oplus \sum_{i=t+K-d}^{t+K-1} a_i \tag{3}$$

但前向积分因指令运动与实际运动的固有偏差不可避免地累积偏差。故引入 SCM $\phi_{\text{SCM}}(\cdot)$(MLP 层)预测补偿残差:

$$\tilde{s}_\Delta = \phi_{\text{SCM}}\!\left(\tilde{s}_{t+K}, \frac{d}{d_{\max}}\right), \quad \hat{s}_{t+K} = \tilde{s}_{t+K} \oplus \tilde{s}_\Delta$$

状态校正损失最小化预测残差与真值差距:

$$\mathcal{L}_{\text{state}} = \left\|(s_{t+K} \ominus \tilde{s}_{t+K}) - \tilde{s}_\Delta\right\|_2^2 \tag{4}$$

3.3 观测预测模块(OPM)

SCM 仅缓解部分错位,观测陈旧仍是关键未解因素。OPM $\phi_{\text{OPM}}(\cdot)$ 利用陈旧观测、已提交动作与校正状态生成执行时观测。不在高维像素上重建,而在 VLA 视觉编码器 $\mathcal{E}(\cdot)$ 的潜在空间 $z = \mathcal{E}(o)$ 中运作。因主要视觉变化由机器人物理位移引起,将特征演化建模为空间传输而非从零合成。对窗口内每个已提交动作 $a_i$,构建物理特征向量:

$$\mathbf{u}_i = \left[a_i,\ \sum_{j \leq i} a_j,\ a_i - a_{i-1},\ \sum_{j \leq i} |a_j|,\ \frac{i}{d}\right] \tag{5}$$

分别编码瞬时命令、累积位移、动作增量、累积路径长度与时间进度。拼接为轨迹特征矩阵 $\mathbf{U} = [\mathbf{u}_1, \dots, \mathbf{u}_d]^\top$,经时序自注意力捕获时间依赖,产生动作条件化运动先验 $\mathbf{c}_{\text{motion}}$,再与陈旧潜在 $\mathbf{z}_{t+K-d}$ 与相机嵌入融合,通过传输门 $\alpha$ 与合成门 $\beta$ 生成预测潜在 $\hat{z}_{t+K}$。

适配器架构:SCM 与 OPM

3.4 策略一致性损失

为确保预测观测 $\hat{z}_{t+K}$ 与校正状态 $\hat{s}_{t+K}$ 被策略忠实消费,引入策略一致性损失鼓励从未触碰策略以预测对 $(\hat{z}_{t+K}, \hat{s}_{t+K})$ 生成的动作分块与以真值对 $(z_{t+K}, s_{t+K})$ 生成的对齐。用单步流近似避免多步流匹配开销:

$$\mathcal{L}_{\text{policy}} = \left\|\pi_\theta(z_{t+K}, s_{t+K}) - \pi_\theta(\hat{z}_{t+K}, \hat{s}_{t+K})\right\|_2^2 \tag{9}$$

总目标为 $\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{state}} + \mathcal{L}_{\text{obs}} + \lambda \mathcal{L}_{\text{policy}}$,其中 $\lambda=10$。

4. 实验:仿真与真实世界

4.1 LIBERO 仿真基准

在 LIBERO 上比较 $\pi_{0.5}$ 与 SmolVLA-450M 两种 VLA 骨干,延迟 $d \in \{5,10,15,20\}$:

方法类别$\pi_{0.5}$ d=5$\pi_{0.5}$ d=20SmolVLA d=5SmolVLA d=20
Naive Async.推理时89.568.370.356.2
TE推理时87.874.868.459.7
RTC推理时89.973.769.758.7
VLASH训练时88.074.569.361.9
REMAC训练时90.873.970.959.7
FutureRTC(本文)推理时94.288.575.869.4

FutureRTC 在所有延迟上全面领先。$\pi_{0.5}$ 在 d=20 时仍达 88.5%(基线 Naive Async. 仅 68.3%,提升 20.2 个百分点);SmolVLA 在 d=20 时 69.4%(基线 56.2%,提升 13.2 个百分点)。

LIBERO 性能对比表

4.2 Kinetix 动态仿真

在 Kinetix 的 12 个高动态随机环境中,预测视野 $H=8$,延迟 $d \in [0,4]$。Naive Async. 随延迟增加性能坍缩;推理时方法部分缓解;训练时方法更强但仍因依赖陈旧观测在大延迟下退化。FutureRTC 显著优于所有方法。

Kinetix 仿真性能对比

4.3 真实世界评估

部署于双臂 AgileX Cobot Magic 机器人,以 $\pi_{0.5}$ 为骨干,执行视野 $K=25$,控制频率 30Hz($\Delta t \approx 33$ms)。单次 VLA 前向约 99ms,加 LAN 通信 40ms 与数据处理 30ms,端到端延迟约 170ms($d=5$);注入额外 150ms 模拟远程部署延展至 $d=10$。三项双臂任务(堆盘、折毛巾、挂杯)各 20 次试验,物体初始位姿随机化。

4.4 消融研究

配置说明效果
基线直接用陈旧对随延迟快速退化
+SCM仅校正状态低延迟改善,大延迟无效
+OPM加观测预测大幅改善
+策略一致性损失对齐预测与策略期望总体进一步提升

证明陈旧视觉观测(而非仅本体感受状态)是异步执行的瓶颈。

消融研究结果

5. 局限性

  • 依赖 VLA 视觉编码器:OPM 在预训练 VLA 的视觉编码器潜在空间内运作,若编码器对某些场景表征不足则受限。
  • 运动先验假设:假设主要视觉变化由机器人位移引起,对环境自身高动态变化(如移动物体、光照突变)的建模能力有限。
  • 单步流近似:策略一致性损失用单步流近似以避免开销,可能引入近似误差。
  • 延迟上限:在极大延迟下(超过训练的 $d_{\max}$)性能仍会退化。

6. 总结

FutureRTC 是一个即插即用的适配框架,通过状态校正模块校正前向滚动本体感受状态、观测预测模块利用运动先验预测未来视觉表示,使 VLA 策略能在执行时观测与状态上条件化生成动作,并引入策略一致性损失确保预测上下文被策略忠实消费。在 LIBERO 与 Kinetix 仿真及真实双臂操作上,FutureRTC 一致提升延迟鲁棒性、执行平滑性、任务效率与成功率,且无需修改底层 VLA 策略。核心洞见是:与其让策略用过时的"快照"决策,不如用运动先验把陈旧观测"传输"到执行时刻——视觉的陈旧才是异步执行的真正瓶颈。

flowchart LR
    A["陈旧观测 o_t+K-d"] --> B["VLA 视觉编码器"]
    A2["陈旧状态 s_t+K-d"] --> C["前向滚动 + 已提交动作"]
    C --> D["滚动状态 s̃_t+K"]
    D --> E["SCM 校正残差"]
    E --> F["校正状态 ŝ_t+K"]
    G["已提交动作窗口"] --> H["物理特征 u_i 构建"]
    H --> I["时序自注意力 → 运动先验 c_motion"]
    B --> J["陈旧潜在 z_t+K-d"]
    J --> K["OPM: 传输门 α + 合成门 β"]
    I --> K
    F --> K
    K --> L["预测潜在 ẑ_t+K"]
    L --> M["VLA 策略 π_θ(ẑ_t+K, ŝ_t+K)"]
    F --> M
    M --> N["执行时动作分块"]
与其让策略用过时的快照决策,不如用运动先验把陈旧观测传输到执行时刻——视觉的陈旧,而非仅仅是状态的陈旧,才是异步执行的真正瓶颈。

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日