Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLA人形机器人humanoid

HAF:层级动作流与谱潜空间强化学习将通用VLA适配人形全身运动操作

人形机器人是面向人类环境的通用智能体载体,但通用视觉-语言-动作(VLA)基础模型难以直接用于人形全身运动-操作:全身动作高维且相互耦合,单阶段架构难以协调移动、腰部姿态与双臂操作,纯离线行为克隆策略在真实部署中也往往次优。HAF(Humanoid Adaptation Framework)由两部分组成:HAF-VLA 在预训练 flow-matching VLA 之上把全身动作去噪拆为三个阶段(移动+头→腰→操作),用阶段嵌入与跨阶段 KV 缓存保留运动学依赖;HAF-Steer 在冻结的生成器之上利用流匹配可逆性与 DCT 降维,把 RL 优化限制在紧凑噪声子空间,训练正则化 SAC 策略,实现离线到在线的高效真实世界微调而无需更新大型 VLA 主干。在 7 个真实人形全身运动-操作任务上,HAF 超越单阶段 VLA 基线,显著提升全身协调与任务成功率。

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang2026年8月17日5 分钟阅读
EN

论文:HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL
作者:Langzhe Gu、Chengkai Hou、Meng Li(共同一作)等 17 人,通讯作者:Zhengping Che、Shanghang Zhang
机构:北京大学多媒体信息处理国家重点实验室 · 北京人形机器人创新中心 · 南开大学 · 西安交通大学
链接:arXiv:2608.16837 · 项目主页
代码状态:暂未开源(截至收录时未见公开仓库)

一句话总结

HAF 把预训练的通用 flow-matching VLA(π₀.₅)迁移到人形机器人全身运动操作:HAF-VLA 按"移动/头部→腰部→双臂操作"的运动学依赖把动作去噪拆成三个级联阶段并用跨阶段 KV 缓存传递条件,HAF-Steer 则利用 flow 可逆性把演示反演回噪声空间、DCT 压缩成 8 维谱系数,在冻结的大模型之上用一个小型 SAC 策略做离线到在线的轻量化真机微调。在天工 2.0/3.0 平台 7 个家务级长时序任务上,归一化任务得分从最强基线 π₀.₅ 的 53.3% 提升到 70.5%。

图1:HAF 总览——框架覆盖洗衣装载、取衣、整理桌面、篮子转运、玩具收纳、抛球、箱子转运七个人形机器人全身运动操作任务。

研究背景与动机

人形机器人被期待成为以人为中心环境中的通用智能体,但与固定基座或轮式机械臂不同,人形平台要求移动、躯干姿态与双臂操作三者同步协调。这一复杂性带来一个核心难题:不稳定的底盘运动会诱发上半身杂乱的补偿性动作,严重破坏平衡与操作精度。论文引用了大量已有工作(HOMIE、ExBody2、Humanoid-VLA 等)佐证这一点,这也是人形全身控制区别于桌面操作的根本难点。

近两年通用视觉-语言-动作(VLA)基础模型在常规机器人平台上展现了强泛化能力,例如 π₀ 系列、GR00T、Cosmos Policy 等。但标准 flow-matching VLA 通常在单一阶段内一次性生成所有身体部位的动作,没有显式建模移动、姿态与操作之间的依赖关系。已有的人形 VLA 方案多靠人形专属预训练或大规模具身数据集来解决这一问题,这显著推高了把一个通用 VLA 迁移到新的人形平台的成本——换句话说,每换一个机器人就得重训一遍大模型,这条路对多数团队并不现实。

第二个瓶颈在部署端。离线行为克隆得到的策略在真机部署时常因分布漂移而表现退化;在线强化学习虽然可以通过真机交互打磨策略,但直接微调大型 VLA 主干网络计算开销过大,且在真机探索中存在安全风险。已有的潜噪声 RL 方法虽然避免了更新主干网络,但走向了两个极端:要么在整个时间维度上优化高维原始噪声(探索空间过大),要么把一个噪声向量在整个动作时域上重复使用(牺牲了时间维度的表达能力,论文实验显示这会引起机体抖动甚至训练中止)。

HAF 正是针对这两个瓶颈提出的统一框架:HAF-VLA 重组全身动作的生成结构,让生成顺序服从人形运动学依赖;HAF-Steer 在一个紧凑的谱潜空间里做轻量策略精修。两者工作在互补层面——前者提供结构化的全身动作生成器,后者在冻结的生成器之上通过真实世界离线到在线自适应进一步打磨策略。

预备知识:flow-matching VLA 与动作块

HAF 的底座是预训练的 flow-matching VLA。给定当前观测 $o_{t}=(I_{t},q_{t})$(头部自我中心视角 RGB 图像 $I_{t}$ 与本体状态 $q_{t}$)以及语言指令 $\ell$,VLA 预测一个结构化的全身动作块 $A_{t}=[a_{t},\ldots,a_{t+H-1}]\in\mathbb{R}^{H\times D}$,其中 $H$ 是预测时域长度,$D$ 是每步全身动作维度。论文实现中 $H=100$,机器人每次执行前 40 步后触发下一次推理(滚动时域控制)。flow-matching 的生成过程是从高斯噪声 $\epsilon_{t}$ 出发,沿学习到的速度场 $v_{\theta}$ 积分到干净动作,即 $A_{t}=F_{\theta}(\epsilon_{t}\mid\zeta_{t})$;其关键性质是确定性流映射在数值上可逆——这为后文的"动作反演回噪声"提供了理论基础。

每个瞬时动作被显式分解为四个相互正交的运动学子分量:$a_{t}=[a_{t}^{\mathrm{move}},a_{t}^{\mathrm{head}},a_{t}^{\mathrm{waist}},a_{t}^{\mathrm{manip}}]$,分别对应移动与技能模式指令、头部朝向控制、腰部姿态调节和双臂操作目标。对应的动作维度索引空间被划分为四个互不相交的子集 $\mathcal{A}_{t}^{\mathrm{move}}$、$\mathcal{A}_{t}^{\mathrm{head}}$、$\mathcal{A}_{t}^{\mathrm{waist}}$、$\mathcal{A}_{t}^{\mathrm{manip}}$。这一分解是 HAF-VLA 全部设计的出发点。

方法详解

1. HAF-VLA:嵌套累积动作集与三阶段层级生成

HAF-VLA 不是一次性预测全部 $D$ 维动作,而是基于上述分解构造三个嵌套累积的动作索引集合:

$$\mathcal{A}_{t}^{1}=\mathcal{A}_{t}^{\mathrm{move}}\cup\mathcal{A}_{t}^{\mathrm{head}},\qquad\mathcal{A}_{t}^{2}=\mathcal{A}_{t}^{1}\cup\mathcal{A}_{t}^{\mathrm{waist}},\qquad\mathcal{A}_{t}^{3}=\mathcal{A}_{t}^{2}\cup\mathcal{A}_{t}^{\mathrm{manip}}$$

严格满足 $\mathcal{A}_{t}^{1}\subset\mathcal{A}_{t}^{2}\subset\mathcal{A}_{t}^{3}$。阶段一在最小动作集上生成基础移动行为、任务技能模式与视线方向;阶段二把腰部驱动信号纳入活跃空间,精修躯干姿态、重塑上半身工作空间;阶段三激活完整动作空间,输出最终可执行的全身指令。值得注意的是,这与"早期阶段输出被冻结"的刚性解耦方案不同:累积嵌套设计允许后续阶段继续精修早期阶段预测的维度,从而得到更连贯的全身动作。

图2:HAF-VLA 结构。共享的动作专家逐步扩展活跃动作空间,前序阶段的干净动作被编码为 KV 缓存,条件化后续阶段,最终只部署一个动作块。

三个阶段共享同一个动作流专家网络的权重。视觉-语言前缀 KV 缓存只在开始时计算一次并在所有阶段复用:$P_{t}=F_{\mathrm{prefix}}(o_{t},\ell)$。每个阶段从独立的高斯噪声 $\epsilon_{t}^{s}\sim\mathcal{N}(\mathbf{0},\mathbf{I})$ 出发采样,阶段行为由可训练的阶嵌入 $e_{s}$($s\in\{1,2,3\}$)调制。完整的多阶段生成过程写作:

$$A_{t}^{1}=F_{\theta}(\epsilon_{t}^{1}\mid P_{t},e_{1}),\quad C_{t}^{1}=\operatorname{Cache}_{\theta}(A_{t}^{1}\mid P_{t},e_{1})$$ $$A_{t}^{2}=F_{\theta}(\epsilon_{t}^{2}\mid P_{t},C_{t}^{1},e_{2}),\quad C_{t}^{2}=\operatorname{Cache}_{\theta}(A_{t}^{2}\mid P_{t},C_{t}^{1},e_{2})$$ $$A_{t}^{3}=F_{\theta}(\epsilon_{t}^{3}\mid P_{t},C_{t}^{1},C_{t}^{2},e_{3})$$

其中 $\operatorname{Cache}_{\theta}(\cdot)$ 算子把当前阶段去噪后的动作预测重新编码并压缩为动作 KV 缓存,把粗粒度的运动先验注入后续生成步骤。只有最终输出 $A_{t}\equiv A_{t}^{3}$ 被送往机器人控制器执行,中间预测 $A_{t}^{1}$、$A_{t}^{2}$ 纯粹作为条件上下文存在。

flowchart LR
  O[Observation: egocentric RGB + proprioception] --> P[Prefix KV cache P_t
computed once] L[Language instruction] --> P P --> S1[Stage 1: denoise 10 steps
locomotion + head on A1] S1 --> C1[Cache C1 = re-encoded A1] C1 --> S2[Stage 2: denoise 10 steps
+ waist on A2] S2 --> C2[Cache C2 = re-encoded A2] C2 --> S3[Stage 3: denoise 10 steps
+ bimanual manipulation on A3] S3 --> EX[Execute first 40 steps
receding horizon] EX --> O

HAF-VLA 三阶段层级生成流程:移动/头部 → 腰部 → 双臂操作,跨阶段 KV 缓存传递运动学依赖。

2. 训练目标:分阶段 flow-matching 损失

设 $m_{s}\in\{0,1\}^{D}$ 为活跃动作集 $\mathcal{A}_{t}^{s}$ 沿时间维广播的二值掩码,三个阶段的条件分别记为 $h_{t}^{1}=(P_{t},e_{1})$、$h_{t}^{2}=(P_{t},C_{t}^{1},e_{2})$、$h_{t}^{3}=(P_{t},C_{t}^{1},C_{t}^{2},e_{3})$。给定干净动作块 $A_{t}$,每个阶段独立采样噪声 $\epsilon_{t}^{s}$ 与流时间 $\tau^{s}\sim\mathcal{U}(0,1)$,带噪输入与目标速度场为:

$$X_{\tau^{s},t}^{s}=\left[(1-\tau^{s})\epsilon_{t}^{s}+\tau^{s}A_{t}\right]\odot m_{s},\qquad u_{t}^{s}=\left(A_{t}-\epsilon_{t}^{s}\right)\odot m_{s}$$

掩码同时作用于输入和目标:非活跃维度的目标速度被置零,而不是从优化中剔除,保证三个阶段都在同一个全局动作空间中运行。共享专家用分阶段 flow-matching 目标训练:

$$\mathcal{L}_{\mathrm{HAF}}=\mathbb{E}_{A_{t},\{\epsilon_{t}^{s},\tau^{s}\}_{s=1}^{3}}\left[\sum_{s=1}^{3}\frac{1}{HD}\left\|v_{\theta}\left(X_{\tau^{s},t}^{s},\tau^{s};h_{t}^{s}\right)-u_{t}^{s}\right\|_{F}^{2}\right]$$

三个阶段损失等权求和,除独立采样的噪声与流时间外,各阶段只在条件 $h_{t}^{s}$ 和掩码 $m_{s}$ 上不同。训练时用 teacher forcing 从重新编码的带掩码真值动作(而非阶段输出)计算跨阶段缓存 $C_{t}^{1}$、$C_{t}^{2}$,防止误差累积的同时保留层级推理结构;推理时缓存改由前序阶段的去噪输出构建。

3. 部署:滚动时域与实时性

每个阶段做 10 步流去噪,三阶段共 30 步。在单张 RTX 5090 GPU 上,完整三阶段推理约 0.12 秒,支持实时闭环的人形全身运动操作。机器人执行动作块的前 40 步后重新推理,构成滚动时域控制。

4. HAF-Steer:flow 反演 + DCT 谱潜空间

HAF-Steer 通过初始流噪声来适配冻结的 flow-matching VLA。骨干网络以确定性流映射生成动作块:$A_{t}=F_{\theta}(\epsilon_{t}\mid\zeta_{t})$,其中 $\zeta_{t}$ 是视觉-语言-机器人状态的统一条件,参数 $\theta$ 在整个 RL 适配过程中完全固定。直接在 $H\times D$ 的原始噪声空间做 RL 探索维度爆炸;而此前方法(如 DSRL)把一个噪声向量在整个时域上重复,论文在真机实验中发现这会诱发严重的机体抖动与不安全的瞬态行为。HAF-Steer 的折中方案是:把 RL 探索约束在前 $K$ 个离散余弦变换(DCT)基张成的低维谱子空间内,经验取 $K=8$,探索空间从 $H\times D$ 压缩到 $K\times D$,既保留多种平滑的时间变化模式,又天然抑制高频抖动。

图3:HAF-Steer 流程。演示动作先经 flow 反演回到噪声,再压缩为低维谱动作;谱空间训练随机策略,经冻结的 flow 生成器解码为可执行动作块。

谱监督目标由离线演示构造。给定演示动作 $A_{i}^{*}$ 及其条件 $\zeta_{i}^{*}$,利用冻结 VLA 的数值反向积分(而非学习逆模型)把动作反演回噪声,再做 DCT 截断与归一化:

$$\epsilon_{i}^{*}=F_{\theta}^{-1}\left(A_{i}^{*}\mid\zeta_{i}^{*}\right),\quad c_{i}^{*}=\operatorname{DCT}_{K}(\epsilon_{i}^{*}),\quad z_{i}^{*}=\frac{c_{i}^{*}-\mu_{c}}{\sigma_{c}+\delta}$$

其中 $\mu_{c},\sigma_{c}$ 在整个演示集上预计算,$\delta$ 是数值稳定项。随后构造 VLA 级别的离线回放缓冲:$\mathcal{D}_{\mathrm{off}}=\left\{\left(x_{i},z_{i}^{*},r_{i},x_{i+1},d_{i}\right)\right\}_{i=1}^{N-1}$,采用稀疏奖励——成功轨迹的终止转移 $r_{i}=1$,其余中间转移 $r_{i}=0$。

5. 行为克隆初始化与离线-在线混合 SAC

设随机谱策略 $\pi_{\psi}(z\mid x)$ 的均值输出为 $\mu_{\psi}(x)$。第一阶段用行为克隆初始化演员网络,向反演得到的专家谱动作回归:$\mathcal{L}_{\mathrm{BC}}=\mathbb{E}_{(x_{i},z_{i}^{*})\sim\mathcal{D}_{\mathrm{off}}}\left[\left\|\mu_{\psi}(x_{i})-z_{i}^{*}\right\|_{2}^{2}\right]$,此阶段只优化谱演员,VLA 骨干与价值函数均不动。

随后策略按谱生成管线与真机交互,新转移存入在线缓冲 $\mathcal{D}_{\mathrm{on}}$。每次迭代从双缓冲采样混合小批量 $\mathcal{B}=\mathcal{B}_{\mathrm{off}}\cup\mathcal{B}_{\mathrm{on}}$,全部样本参与标准 SAC 策略更新,BC 正则项只施加在离线专家数据上:

$$\mathcal{L}_{\pi}=\mathbb{E}_{x_{i}\sim\mathcal{B},\,z_{i}\sim\pi_{\psi}(\cdot\mid x_{i})}\left[\alpha\log\pi_{\psi}(z_{i}\mid x_{i})-\min_{j}Q_{\omega_{j}}(x_{i},z_{i})\right]+\lambda_{\mathrm{BC}}\mathbb{E}_{(x_{i},z_{i}^{*})\sim\mathcal{B}_{\mathrm{off}}}\left[\left\|\mu_{\psi}(x_{i})-z_{i}^{*}\right\|_{2}^{2}\right]$$

其中 $\alpha$ 是 SAC 熵温度,$\{Q_{\omega_{j}}\}$ 是双评论家网络,$\lambda_{\mathrm{BC}}$ 平衡演示正则强度。训练中逐步衰减离线采样比例,让优化重心从演示行为转向真机经验。整个 flow-matching VLA 主干全程冻结,只有谱演员、评论家、目标评论家与熵温度被更新。

6. 推理管线与骨干无关性

测试时谱演员完全在归一化谱空间内运行:给定当前观测 $x_{t}$,采样谱动作、逆 DCT 恢复全时域噪声、经冻结 flow 模型生成精修后的全身动作块:

$$z_{t}\sim\pi_{\psi}(\cdot\mid x_{t}),\quad c_{t}=\mu_{c}+(\sigma_{c}+\delta)\odot z_{t},\quad\epsilon_{t}=\operatorname{IDCT}_{K}(c_{t}),\quad A_{t}=F_{\theta}(\epsilon_{t}\mid\zeta_{t})$$

$\operatorname{IDCT}_{K}$ 对截断的谱系数补零重建平滑的全时域噪声。由于 $K\ll H$,该设计显著降低优化复杂度、抑制高频抖动,产出物理上合理的全身修正。这一公式化与具体 flow-matching 架构无关:对 π₀.₅ 直接作用于其原生动映射;对 HAF-VLA 则只实例化在最后一个生成阶段——阶段一、二正常执行并提供干净动作缓存,HAF-Steer 只替换阶段三的初始噪声。

flowchart TB
  DEMO[Offline demonstrations A*] --> INV[Flow reversal
numeric backward integration] INV --> EPS[Recovered noise eps*] EPS --> DCT[DCT_K truncate, K=8] DCT --> NORM[Normalize with mu_c, sigma_c] NORM --> BUF[Offline spectral buffer D_off
sparse terminal reward] BUF --> BC[BC init: regress spectral actor] BC --> SAC[Mixed offline-online SAC
backbone frozen] ROBOT[Real robot rollouts] --> SAC SAC --> PI[Spectral actor pi_psi] PI --> DEC[z -> IDCT -> eps -> frozen F_theta] DEC --> ACT[Refined whole-body action chunk]

HAF-Steer 离线到在线谱强化学习管线:flow 反演 → DCT 压缩 → BC 初始化 → 混合 SAC → 冻结生成器解码。

实验结果

真机实验在天工 2.0 与天工 3.0 人形平台上进行,感知仅依赖头部自我中心 RGB 相机。训练演示通过同构遥操作采集:运动学主手控制双臂操作,手持摇杆控制移动与腰部,IMU 追踪头部朝向指令,每个家务任务采集 120 条轨迹。评测覆盖七个长时序家务级任务(见图5),要求横跨移动、全身姿态调整、双臂操作与物体交互的组合,包括穿越分隔区域、躯干弯腰、下蹲、搬运与投掷等技能。评价指标采用归一化任务得分:每个任务拆分为带分值的里程碑子目标,单次试验得分为 $\mathrm{Score}(\%)=\frac{s_{\mathrm{achieved}}}{s_{\mathrm{max}}}\times 100$,每方法每任务报告 10 次独立 rollouts 的平均值。

图5:七个真实世界人形全身运动操作任务,每行展示任务的关键进程。

主实验:七个任务全面领先

基线包括 ACT、π₀.₅、GR00T N1.7 与 Cosmos Policy 四种代表性方案,均严格遵循官方实现与推荐超参。如表 1 所示,HAF-VLA 在全部七个任务上取得最优或并列最优的归一化得分,平均分从最强基线 π₀.₅ 的 53.3% 提升到 70.5%。提升在"移动+精细操作"组合任务上尤为显著:Box Transfer 从 60.0% 到 93.3%,Ball Tossing 从 33.3% 到 56.7%,Laundry Loading 从 53.3% 到 66.7%。作者观察到 π₀.₅ 与 GR00T N1.7 频繁出现移动漂移,而 Cosmos Policy 受困于较高的在线推理延迟。

任务HAF-VLAπ₀.₅GR00T N1.7Cosmos PolicyACT
Laundry Loading 洗衣装载66.753.340.00.010.0
Clothes Retrieval 取衣53.353.333.326.723.3
Table Tidy 整理桌面80.070.040.016.723.3
Basket Transfer 篮子转运63.350.043.333.316.7
Toy Storage 玩具收纳80.053.330.040.023.3
Ball Tossing 抛球56.733.336.73.330.0
Box Transfer 箱子转运93.360.043.373.350.0
平均70.553.338.127.625.2

表1:七个长时序人形全身运动操作任务的归一化得分(%)。

消融:层级顺序本身就是关键

在 Laundry Loading 任务上做了针对性消融,隔离层级设计的贡献。对照组包括:All-Joint Denoising(每阶段同时对所有维度去噪)、Arm-First Hierarchy(把生成顺序反转为先操作后移动)、以及同为 30 步去噪的原版 π₀.₅(控制总去噪预算)。结果显示完整层级设计优于所有消融变体,说明增益并非来自去噪迭代次数的增加;arm-first 变体的劣势进一步印证"先稳定移动与姿态、再做精细操作"的顺序必要性。另一个反直觉发现:π₀.₅ 把去噪步数从 10 增加到 30 反而掉分(20.0%),主因是推理延迟从 0.075 秒升到 0.115 秒——由于 π₀.₅ 在人形任务上本就有移动预测误差,额外延迟放大了速度指令与机器人执行之间的时间错位;而 HAF-VLA 在相近延迟下依然有效,显示出对推理延迟更强的鲁棒性。

方法 / 变体阶段设计总步数归一化得分 (%)
HAF-VLA移动/头部 → +腰部 → +操作3066.7
All-Joint Denoising每阶段全关节3053.3
Arm-First Hierarchy操作 → +腰部 → +移动/头部3050.0
π₀.₅(30 步)全身动作单阶段3020.0

表2:层级动作流设计消融(Laundry Loading 任务)。

分布外泛化:视觉干扰与位置偏移

在两类受控分布偏移下评估鲁棒性:Laundry Loading 的导航路径上放置一把演示中未见过的黑色办公椅(视觉干扰),Clothes Retrieval 的机器人初始位置相对演示采集布置后移 20 厘米(位置扰动),每条件 10 次 rollouts。HAF-VLA 在两种扰动下均保持更高的任务得分(40.0 vs 26.7;43.3 vs 36.7),显示出超越精确演示布局的泛化能力。

HAF-Steer:真机离线到在线适配

HAF-Steer 在天工 3.0 平台的 Toy Storage 与 Basket Transfer 两个任务上评估,每个任务均含演示覆盖的同分布(ID)设置与目标位置未见过的分布外(OOD)设置(目标桌均相对演示位置平移 30 厘米)。对比四个变体:Base Model(冻结 VLA 直接部署)、DSRL(优化单个 D 维噪声向量并在整个时域重复)、Noise BC(谱行为克隆初始化后不再训练)、HAF-Steer(BC 初始化后继续混合离线-在线 SAC)。结果显示 HAF-Steer 在 ID 与 OOD 设置下对 π₀.₅ 和 HAF-VLA 两个骨干均带来一致提升;Noise BC 本身在部分设置下已有改善,混合 RL 进一步推高成功率。DSRL 的重复噪声参数化因丢失时间变化,在多个真机实验中产生不安全的探索动作,导致训练提前终止。把 HAF-Steer 施加于 HAF-VLA 后,四个评测设置全部提升,其中三个达到最优或并列最优——验证了结构化动作生成与轻量潜空间策略适配在统一框架内的互补收益。

图6:主实验结果对比(论文表 1 可视化)。

局限性

作者自述两点:其一,层级管线增加了去噪计算量并引入部署延迟(三阶段 30 步推理约 0.12 秒,虽实时但对边缘算力提出更高要求);其二,潜空间 RL 模块受限于底座 VLA 的固有先验,在极端的未见场景下可能无法纠正错误动作。此外从读者视角还可以补充:稀疏终止奖励的真机在线 RL 对试验次数与硬件损耗敏感,论文未报告 HAF-Steer 训练所需的真机交互时长与样本量;评测集中在天工平台与家务场景、每任务仅 120 条演示,跨平台迁移成本与数据规模上限仍待验证;且截至收录时代码与权重未公开,第三方复现存在门槛。

总结与展望

HAF 给出了把现成通用 VLA 迁移到人形全身运动操作的一条务实路径:不改底座大模型,用运动学依赖重组生成结构(HAF-VLA),再用可逆 flow 打开的噪声空间做低维 RL 精修(HAF-Steer)。前者在七个真实任务上把平均得分从 53.3% 提到 70.5%,后者在冻结骨干上继续榨取部署性能。作者计划探索更高效的去噪方案与轻量化 RL 实现,以提升实时性与任务鲁棒性。对社区而言,"生成结构服从物理依赖 + 潜空间适配代替全参微调"这一组合,很可能成为后 VLA 时代人形策略适配的常见范式。

金句

"The two components operate at complementary levels: HAF-VLA provides a structured whole-body action generator, while HAF-Steer further refines the frozen generator through real-world offline-to-online adaptation."
(两个组件工作在互补层面:HAF-VLA 提供结构化的全身动作生成器,HAF-Steer 则通过真实世界的离线到在线自适应进一步精修这个冻结的生成器。)

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日