HAF:层级动作流与谱潜空间强化学习将通用VLA适配人形全身运动操作
人形机器人是面向人类环境的通用智能体载体,但通用视觉-语言-动作(VLA)基础模型难以直接用于人形全身运动-操作:全身动作高维且相互耦合,单阶段架构难以协调移动、腰部姿态与双臂操作,纯离线行为克隆策略在真实部署中也往往次优。HAF(Humanoid Adaptation Framework)由两部分组成:HAF-VLA 在预训练 flow-matching VLA 之上把全身动作去噪拆为三个阶段(移动+头→腰→操作),用阶段嵌入与跨阶段 KV 缓存保留运动学依赖;HAF-Steer 在冻结的生成器之上利用流匹配可逆性与 DCT 降维,把 RL 优化限制在紧凑噪声子空间,训练正则化 SAC 策略,实现离线到在线的高效真实世界微调而无需更新大型 VLA 主干。在 7 个真实人形全身运动-操作任务上,HAF 超越单阶段 VLA 基线,显著提升全身协调与任务成功率。
Langzhe Gu, Chengkai Hou, Meng Li·2026年8月17日
视觉语言动作模型人形机器人全身2026年8月17日