Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLAflow matching流式解码

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

Zekai Li, Jiaming Tang, Zhijian Liu2026年8月27日4 分钟阅读
EN

一句话总结:FlashVLA 用一个「按噪声分层、分块因果注意力的流式动作缓冲区」,把流式视频生成的思想迁移到机器人动作解码,让任何基于 flow-matching 的 VLA 模型在单卡上实现 ≥30 Hz 的平滑异步控制——推理延迟最高降低 20 倍,且无需额外的未来状态预测模块。

研究背景与动机

视觉-语言-动作(VLA)模型正成为机器人操作的主流范式,但真机部署长期被两个问题卡住:高推理延迟不稳定的异步执行。以 flow-matching 为基础的 VLA(如 π0.5)尤其严重——每个动作块(action chunk)的解码都要在同一个观测条件下做多步迭代去噪(π0.5 需要 10 次串行前向传播),而这些去噪全部集中在单次块解码内部。

作者在剖析中把代价拆成两部分:延迟代价来自「把所有去噪塞进一个块的解码」,失配代价来自「块与块之间没有任何注意力交互」。传统推理里,每个块都是孤立的——它既看不到前一块,也看不到后一块。

于是出现了两条互不相让的技术路线。高效推理方向(如 Realtime-VLA 的 kernel 级优化)降低单次前向成本、提高控制频率,但块仍是孤立解码的;异步执行方向(如 VLASH 的未来状态条件、StreamingVLA 的动作流匹配)让推理与执行重叠以消除空转,却往往在降低延迟的同时牺牲了精度与时序一致性。现有方法很难同时拿到「低延迟」和「准确且时序一致的异步执行」。

FlashVLA 的核心洞察是:这两个代价其实源于同一个结构缺陷——块的孤立性。如果把多个块联合解码而不是逐个孤立解码,两个问题可以被一个统一设计同时消解。

FlashVLA 概念图

图1:(a) 传统 VLA 推理要么让机器人停顿等待解码,要么异步执行导致预测-执行失配;(b) 动作解码占推理时间的 75%,FlashVLA 正是要攻克这个瓶颈。

预备知识:flow-matching 动作解码

flow-matching VLA 从观测 $o_t$ 生成连续动作块 $\mathbf{a}_t=\{a_t,a_{t+1},\dots,a_{t+H-1}\}$,方法是对高斯采样 $\mathbf{x}_1\sim\mathcal{N}(0,I)$ 做迭代去噪。模型学习一个速度场 $v_\theta$,把含噪动作搬运到干净动作:

$$\mathbf{x}_\tau=(1-\tau)\mathbf{a}_t+\tau\mathbf{z},\quad \mathbf{z}\sim\mathcal{N}(0,I),\quad \tau\in[0,1],\quad \frac{d\mathbf{x}_\tau}{d\tau}=\mathbf{z}-\mathbf{a}_t=v_\theta(\mathbf{x}_\tau,\tau\mid o_t)$$

推理时,每个块解码需要多次串行前向(π0.5 为 10 次),全部条件于同一个 $o_t$,且没有任何块关注其他块。FlashVLA 正是从这个「孤立」出发重构整个解码过程。

方法详解

FlashVLA 是对任何 flow-matching VLA 的即插即用式改造:只需轻量架构修改加一次微调。它由三部分组成:分块自回归形式化(§3.1)、流式推理算法(§3.2)、多缓冲联合微调(§3.3)。

3.1 分块自回归形式化

FlashVLA 不再把所有去噪步数花在单个块上,而是维护一个含 $N$ 个块的缓冲区,各块处于错开的噪声水平:

$$\mathbf{B}_t=[\mathbf{x}^{(1)}_{\tau_1},\mathbf{x}^{(2)}_{\tau_2},\dots,\mathbf{x}^{(N)}_{\tau_N}],\quad \tau_1<\tau_2<\cdots<\tau_N$$

其中噪声水平按 Beta 分布抖动后均匀铺满区间:$u_i\sim\operatorname{Beta}(1.5,1.0)$,$\tau_i=0.001+0.999\,\frac{i-1+u_i}{N}$。第一个槽位是一个即将执行的近乎干净的块;最后一个槽位是几步之后才执行的纯噪声块。单次前向传播推进所有块各一步,预热完成后每步就从队首弹出一个可执行块。

「错开噪声水平」是流式得以成立的关键。单调阶梯 $\tau_1<\cdots<\tau_N$ 让缓冲区位置同时对齐去噪进度与执行顺序——去噪最靠前的块恰好也是最该先执行的块。如果不做错开,缓冲区会退化成一批(batch):块会成批涌现而非每步一个,重新引入触发流式设计的块边界停顿。

在缓冲区内部,FlashVLA 施加分块因果掩码(chunk-wise causal mask):靠后的(更噪的)块可以注意靠前的(更干净的)块,反向则不行。双向注意力会让即将执行的块去条件于执行顺序上更靠后的噪声块,违背信息流的自然时间方向;而完全没有块间注意力,则会失去让模型获得「持续轨迹视野」的隐式条件。分块因果让信息在时间上向前流,但不在噪声上向后流。

同一套「缓冲区+掩码」设计在运行时产生三个性质:

  • 去噪摊还:每个块在执行前会经过缓冲区全部 $N$ 个噪声水平,但这 $N$ 次前向被分摊到 $N$ 个不同的推理步上,每步同时推进缓冲区里的其他所有块。单步动作解码延迟最高降低 20 倍。
  • 隐式异步条件:因为未来块会注意接近执行的块,解码未来机器人状态的模型已经条件于该状态将要到达的轨迹——无需显式的未来状态预测器或辅助动作条件模块。
  • 块级记忆:每个更高时间步的块注意缓冲区内所有更早的块,而不只是直接前驱。缓冲区因此编码了一段近期已精炼块的结构化短历史。作者推测这种隐式记忆正是 FlashVLA 在长时程任务上收益特别大的原因。

架构上只需对动作专家做轻微修改:用 FiLM 增强动作专家的多级时间步条件。下面这张图是训练与推理管线的总览。

FlashVLA 训练管线

图2(左):多缓冲联合微调把同一观测的全部冷启动配置打包进单一样本;注意力掩码隔离各缓冲区,分块因果注意力让更噪的块只注意更干净的块。

3.2 流式推理

FlashVLA 分两个阶段运行。冷启动:回合开始时缓冲区为空,无法立即产出干净块。先用 $N-1$ 个填充块加一个高斯样本初始化 $\mathbf{B}$,再跑 $N-1$ 步推理填满其余槽位。预热期间机器人不执行预测动作,而是执行安全默认值(关节空间控制的初始状态,或末端执行器控制的归一化零动作),机械臂保持静止。冷启动开销每回合只付一次,并被整个 rollout 摊还。稳态流式:缓冲区填满后按队列运行——每步 (i) 推进所有块一步去噪,(ii) 弹出最干净的块去执行,(iii) 其余块前移,(iv) 在队尾追加一个纯噪声新块。每个块在被执行前都经过了缓冲区全部噪声水平。

FlashVLA 推理管线

图2(右):流式推理把缓冲区当作队列:冷启动用 N−1 次预热填充,稳态流式则推进所有块、执行最干净者、追加新噪声。灰色方块表示填充。

系统级优化:由于稳态迭代在结构上完全相同,推理路径极适合编译。作者把每个阶段编译成 CUDA Graph(派发更快、异步执行下非阻塞),并打包线性层减少 kernel 启动开销、用 PyTorch 的 max-autotune 编译消除残余 kernel 气泡。这些优化与算法设计正交,但要在实践中兑现全部延迟收益必不可少。

3.3 多缓冲联合微调

预训练 VLA 从未见过部分填充的缓冲区或分块因果注意力模式,需要在标准下游微调阶段适配。难点在于:对单一观测 $o_t$,冷启动流程会让模型暴露 $N$ 个不同的缓冲区配置——配置 $k$ 在更噪槽位有 $k$ 个真实动作块、更干净槽位有 $N-k$ 个填充块,最后一个配置即稳态流式。若把每个配置当独立样本,数据集会膨胀 $N$ 倍、拖慢微调,且优化器无从得知它们共享同一观测。

FlashVLA 的解法是打包:把全部 $N$ 个缓冲区配置塞进单个训练样本。打包样本内,所有配置共同注意同一个编码观测,但注意力掩码把各缓冲区彼此隔离。模型在训练时见到每一种缓冲区状态,而昂贵的观测编码只算一次。训练目标是标准 flow-matching 损失,对所有缓冲区配置求和:

$$\mathcal{L}=\sum_{k=1}^{N}\mathbb{E}_{\tau,\mathbf{z}}\left\|v_\theta\big(\mathbf{x}^{(k)}_\tau,\tau\mid o_t,\mathbf{B}_t\big)-(\mathbf{z}-\mathbf{a}^{(k)}_t)\right\|^2$$

这个打包利用了流式算法的一个结构性事实:观测上下文在各缓冲状态间共享,只有动作部分在变化。

方法流程

flowchart TD
    A[预训练 VLA
孤立块解码] --> B[分块自回归形式化] B --> C[N 块缓冲区
错开噪声水平 τ1<...<τN] C --> D[分块因果掩码] D --> E[多缓冲联合微调] E --> F[流式推理] F --> G[冷启动: N-1 步预热填充] F --> H[稳态: 每步推进全部块] H --> I[弹出最干净块执行] I --> J[追加新噪声块] J --> H I --> K[单卡 ≥30 Hz 平滑异步控制]

实验结果

作者在 LIBERO(单臂,4 套件)与 RoboTwin 2.0(双臂,50 任务,clean+randomized)上,以 π0.5 为主干、SmolVLA 与 LingBot-VLA 验证跨架构泛化。全部训练在 H200 GPU 上,仿真在 RTX 4090。

异步执行:速度与质量同时提升

在一步异步延迟(d=1)下,FlashVLA 在 LIBERO 上把平均成功率从 96.9% 提到 97.8%,同时单步耗时从 53.8 ms 降到 22.1 ms(2.43× 加速)。对比基线:VLASH 只有 1.15× 加速且成功率相当;StreamingVLA 达 1.70× 但掉 2.0 个成功率点。在 50 任务 RoboTwin 2.0 上,FlashVLA 达 90.6%,同步 π0.5 为 86.0%、VLASH 为 86.9%。

方法SpatialObjectGoalLongAvg单步耗时(ms)
π0.5(同步)98.898.298.092.496.953.8
+VLASH (d=1)98.899.296.794.497.246.8 (1.15×)
+StreamingVLA (d=1)96.696.695.491.094.931.6 (1.70×)
+FlashVLA (d=1)98.899.697.695.497.822.1 (2.43×)

表1:LIBERO 一步异步延迟下的成功率与单步耗时(2000 回合平均)。FlashVLA 加速最大且成功率最高。

鲁棒性方面,随着异步延迟 d 增大(预测-执行失配加剧),FlashVLA 在 LIBERO 上维持 97.5–98.3% 成功率(始终高于同步基线 96.9%),同时保持 2.43–2.62× 加速;而 VLASH 在 d=4 时掉到 93.1%。这种鲁棒性源自分块因果注意力——它保住了时序一致性而无需外部失配修正。

解码延迟与反应速度

FlashVLA 延迟对比

图3:FlashVLA 与 Realtime-VLA、FASTER 的延迟与反应速度对比。

与 kernel 级优化的 Realtime-VLA 相比,FlashVLA 在 RTX 4090/5090、2/3 相机输入的全部 4 种配置下都是最快的。相对优化后的 π0.5 基线,它在 4090 上把延迟从 45.8/55.4 ms 降到 26.7/36.8 ms,在 5090 上从 37.0/44.8 ms 降到 20.3/27.1 ms。20.3 ms 对应持续的 50 Hz 策略更新率。反应速度上,相对 30 Hz 目标,FlashVLA 把 TTFA(首动作时间)从 π0.5 的 80.0 ms、FASTER 的 62.1 ms 降到 37.1 ms,期望 TTR(反应时间)从 130.0/112.1 ms 降到 70.4 ms——比 FASTER 低 1.7×(TTFA)和 1.6×(TTR)。

同步质量与长时程收益

同步评估下,FlashVLA 在 LIBERO 上把平均成功率从 96.9% 提到 97.9%;在 RoboTwin 2.0 上,clean 从 86.1% 提到 90.8%,randomized 从 85.8% 提到 90.2%。训练预算与执行视野在各方法间完全匹配,因此增益孤立地来自「联合块解码」,而非更多优化或更频繁重规划。

最惊艳的是收益随任务视野急剧放大:在同样 50 个 RoboTwin 2.0 任务上,相对 π0.5 的平均差从短视野的 −0.7 点,到中视野的 +4.3 点,再到长视野的 +36.6 点;长视野子集 clean 成功率从 54.2% 飙到 90.8%,randomized 从 51.8% 到 88.4%。LIBERO 同模式,LIBERO-Long 提升 3.8 点(92.4%→96.2%)。

视野π0.5 Clean/Random/Avg+FlashVLA Clean/Random/Avg平均提升
短视野93.5/94.2/93.993.2/93.3/93.2−0.7
中视野81.9/80.4/81.186.0/84.8/85.4+4.3
长视野54.2/51.8/53.090.8/88.4/89.6+36.6

表2:RoboTwin 2.0 按任务视野分组。FlashVLA 保住短视野性能,长视野提升 36.6 点。

这正是 §3.1 描述的「块级记忆」在指标上的体现:分块因果注意力下,每个更高噪声的未来块都注意缓冲区内所有更早的块,动作专家因此获得一段结构化的近期精炼历史。跨越更多块转移的任务从这段历史中受益更多——因果掩码消融提供了旁证:移除块间注意力而保留流式缓冲区,在 LIBERO-Long 上退化最大。

跨架构泛化

FlashVLA 跨架构泛化

图4:FlashVLA 在 SmolVLA 与 LingBot-VLA 上的跨架构泛化。

FlashVLA 是即插即用的解码方法。推理延迟在 SmolVLA 上从 19.7 ms 降到 10.1 ms(1.95×),在 LingBot-VLA 上从 70.6 ms 降到 25.1 ms(2.81×)。关键是这样加速保住甚至提升了任务质量:SmolVLA 同步成功率保持 80.1%,一步异步 79.5%(仅低基线 0.6 点);LingBot-VLA 同步提升 3.4 点(85.2%→88.6%),异步提升 4.1 点(89.3%)。适配极轻量:只改动作专家的时间步条件与注意力掩码,有原生 FiLM 层就复用,没有才为 SmolVLA 加轻量 time-MLP 和 FiLM 层。

真机部署

作者把 FlashVLA 部署到 7 自由度 Franka 机械臂,用单张 RTX A4000 GPU,验证 30 Hz 控制。三个任务覆盖视野谱:拾放(短)、擦白板(中)、清桌面(长),各用 Gello 采集 50 段遥操作演示(22K/30K/68K 帧)。对比四种配置:π0.5 同步、朴素异步、带 RTC 的异步、FlashVLA 异步,全部用相同 CUDA Graph 与 kernel 融合优化,异步方法统一两步延迟,每任务 15 次试验、三分制打分。

结果:FlashVLA 在所有任务的打分与完成时间上均优于三种 π0.5 配置,跨任务平均打分从同步的 80.0%、RTC 的 75.6%(朴素异步 75.6%)提到 84.4%。相对同步平均加速 1.3×,相对 RTC 加速 1.2×,且加速随任务视野增长——与仿真里的长时程模式呼应。在 RTX A4000 上,FlashVLA 推理延迟 67.3 ms(约两个 30 Hz 控制周期),两步异步延迟恰好把这段延迟与动作执行重叠,实现 30 Hz 控制。

局限性

  • 继承预训练目标:FlashVLA 通过多缓冲联合微调适配预训练 VLA,是即插即用改造,但继承了预训练模型「独立块」的训练目标。从头在分块因果形式化下预训练 VLA 是自然的下一步,可能带来更多收益。
  • 冷启动开销:流式缓冲区每回合需要一次 $N-1$ 步的预热冷启动;这个成本在数秒级 rollout 上摊还很快,但在极短任务上更明显。

总结与展望

FlashVLA 用单一设计选择——错开噪声水平的动作块缓冲区 + 分块因果注意力——同时消解了此前两条独立工作线的动机:延迟代价与异步失配代价。在 LIBERO、RoboTwin 2.0 与真机任务上,它把单步动作解码延迟最高降低 20 倍,无需显式未来状态预测器就恢复异步连续性,并在单卡上维持 ≥30 Hz 平滑控制。消融证明分块因果掩码是「活性成分」:保留流式缓冲区但移除因果性,异步增益就崩塌。这项工作把流式分块扩散从长视频生成迁移到机器人动作解码——缓冲区里低噪声的块不仅「即将被展示」,更是「即将被执行」,作者预期这种迁移能推广到 VLA 栈中其他适合流式的头部。

金句:「缓冲区里低噪声的块不仅即将被展示,更是即将被执行——流式视频生成的这套思想,正是机器人实时控制一直在等的那块拼图。」

论文信息
标题:FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference
作者:Zekai Li, Jiaming Tang, Zhijian Liu 等
arXiv:2608.27384 · 代码:z-lab/flashvla(已开源,含 HF 检查点)

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日
超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进

超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进

Q-Planning 冻结大型行为克隆策略,只训练一个约十亿参数的离线 Q 函数。推理时,Q 对 BC 采样出的多个候选动作块做单步加权平均;在线自改进时,成功与失败回放都只用于更新 Q。10 轮迭代将 LIBERO 平均成功率从 92.1% 提升到 97.6%,双臂真机堆杯与插卡任务分别从 40%/25% 提升到 90%/80%。

机器人操控强化学习行为克隆2026年8月21日