PAPER DEEP DIVE
人形机器人行为基础模型的扩展
面向人形控制需全身协调、实时响应和跨环境泛化的挑战,利用大规模行为数据扩展行为基础模型,实现自然人形运动控制。
一句话总结
ScaleBFM 系统研究人形机器人行为基础模型(BFM)的扩展规律,揭示三个核心因素需协调:把动作跟踪(motion tracking)作为统一学习范式、on-policy rollout 数量与参考动作多样性的协同、以及更具表达力可扩展的 Humanoid Transformer 架构——在全身控制上将 MPKPE 局部模式降 10%+、全局模式降 82%。
摘要(中英双语)
中文:人形控制需要自然的全身协调、对控制信号的精确实时响应、以及在多样环境下的鲁棒泛化,是通用具身智能体的基石。行为基础模型(BFM)利用大规模行为数据实现卓越表达力、多样性和泛化。但如何扩展 BFM 以提升能力仍不清晰——学习范式、行为数据和模型架构等关键因素应如何协调。本文重新审视 BFM 的扩展配方,证明通过三个核心组件的协调可实现显著性能提升:1)将多样人形控制问题重构为全局坐标系下整体全身行为再现的动作跟踪学习范式;2)on-policy rollout 数量与参考动作多样性的策略性协同;3)名为 Humanoid Transformer 的表达力强且可扩展的架构,促进结构化行为表示的自然涌现。实验在仿真和真机部署中展示控制保真度和任务泛化的大幅提升,测试集 MPKPE 局部模式降超 10%、全局模式降 82%。
Abstract (EN): Humanoid control requires natural whole-body coordination, precise real-time responses to control signals, and robust generalization. Behavior Foundation Models leverage large-scale behavioral data. This work revisits the scaling recipe for BFMs and demonstrates substantial gains through coordination of three core components: motion tracking as unified learning paradigm, synergy between on-policy rollout quantity and reference motion diversity, and the Humanoid Transformer architecture. MPKPE is reduced by over 10% in local mode and 82% in global mode versus existing controllers.
1. 研究背景与动机
人形机器人控制是通用具身智能的基石,但要求自然的全身协调(whole-body coordination, WBC)、对控制信号的精确实时响应、以及跨环境的鲁棒泛化。行为基础模型(Behavior Foundation Models, BFM)通过大规模行为数据预训练来获得表达力、多样性和泛化,是近期有前景的方案。然而,如何有效扩展 BFM 仍不清晰:学习范式、行为数据和模型架构这三个关键因素应如何协调以实现有效扩展,缺乏系统研究。
现有 WBC 系统通常为每个任务定制目标状态和奖励函数,无法建立跨场景的统一抽象。ScaleBFM 的出发点是:以动作跟踪(motion tracking)为统一可扩展的代理任务(proxy task),把多样的行为学习问题重构为对参考动作的模仿再现,从而提供密集的全身体验监督和可测量的优化目标。但关键在于:不是简单堆数据或堆参数,而是要理解每种扩展因素的作用机制并协调它们。
图1:ScaleBFM 使人形机器人能执行广泛谱系的多样行为(敏捷移动、灵巧操作、协调 loco-manipulation),覆盖仿真与真实世界。
2. 核心方法
2.1 问题形式化
将人形控制建模为马尔可夫决策过程 $M=\langle\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{R},\gamma\rangle$。每步状态 $s_t\in\mathcal{S}$ 由本体感知状态 $s_t^p$ 和指定控制目标的目标状态 $s_t^g$ 组成,动作 $a_t\in\mathcal{A}$ 为期望关节角度,由底层 PD 控制器执行。将人形行为定义为本体感知状态和动作的轨迹(目标状态作为外部规范被排除):
$$B\triangleq(s_0^p,a_0^p,s_1^p,a_1^p,\cdots,s_{T-1}^p,a_{T-1}^p,s_T^p).$$
BFM 旨在将行为学习与任务特定控制模式解耦,建立统一可扩展目标。形式化为目标条件强化学习(GCRL),最大化期望回报:
$$\max_\theta\mathbb{E}_{\tau\sim p_\theta(\tau)}\left[\sum_{t=0}^{T}\gamma^t r_t\right],\qquad p_\theta(\tau)=p(s_0)\prod_{t=0}p(s_{t+1}|s_t,a_t)\pi_\theta(a_t|s_t).$$
BFM 的两个目标:1)识别一个可跨行为共享的代理任务与通用奖励;2)构造能从多样行为规范描述同一底层行为的通用控制接口。模仿天然是行为获取的通用范式,故以全身动作跟踪为代理任务,奖励评估人形忠实跟随参考动作的程度。
2.2 学习范式:动作跟踪配方
本体感知设计:采用 PPO 的非对称 actor-critic。Actor 本体感知 $s_t^p\triangleq(\omega_t^{root},g_t,q_t,\dot{q}_t)$(基座角速度、投影重力、当前关节位置/速度);Critic 可用仿真器特权信息 $\hat{s}_t^p\triangleq(h_t,p_t,\theta_t,v_t,\omega_t,q_t,\dot{q}_t)$(根高度、连杆位置/朝向/线速度/角速度)。
控制接口设计:基于根相对笛卡尔空间下的掩码全身目标位姿。目标表示 $x_t\triangleq(p_{t+1}^{ref}-p_t^{root},p_{t+1}^{ref}-p_t^{root},\theta_{t+1}^{ref}\ominus\theta_t^{root},\theta_{t+1}^{ref}\ominus\theta_t^{root})$。从掩码集 $\mathcal{M}=\{m_0,\dots,m_7\}$ 随机采样链级掩码,构造 actor 目标 $s_t^g\triangleq(x_t\odot m_i,m_i),m_i\sim\mathcal{M}$,定义 8 种控制模式(全身、双臂、根、末端等)。
奖励设计:关键区别——不移除根位置跟踪,也不解耦根跟随与全身位姿跟踪,而是要求机器人在全局坐标系下将参考动作作为整体全身轨迹再现。移除根跟踪会为全局语义不同的行为分配近乎相同的学习引导,解耦根与位姿跟踪会损害根与位姿演化的协调。全局帧跟踪提供一致的全身行为引导,减少引导歧义。
flowchart TB
RM["Reference Motions
102M frames @50FPS
LAFAN+AMASS+OMOMO+GRAB+
SnapMoGen+FineDance+BONES-SEED+Embody3D"] --> RT["Two-stage Retargeting
skeleton align + IK"]
RT --> REF["Humanoid reference motions"]
REF --> PPO["PPO Motion Tracking
(proxy task)"]
ENV["IsaacLab env
Unitree G1, 29-DoF"] --> PPO
PPO --> ROLLOUT["On-policy rollouts
(width=#GPUs, depth=horizon)"]
ROLLOUT --> ADAPT["Adaptive Sampling
up-weight failed motions"]
ADAPT --> REF
PPO --> BFM["Behavior Foundation Model
Humanoid Transformer"]
CTRL["Control modes x8
(masked whole-body targets)"] --> PPO
style PPO fill:#e0e7ff,stroke:#2563eb
style BFM fill:#dcfce7,stroke:#16a34a
style ADAPT fill:#fef3c7,stroke:#d97706
2.3 训练数据:数量与多样性的协同
关键洞察:在 PPO 框架下,有效训练数据是环境交互收集的 on-policy rollout,其规模由环境并行度和 rollout horizon 决定;增加参考动作数量影响的是 rollout 分布(引入更广行为模式),且其收益关键取决于参考动作语料的多样性而非规模本身。例如,任意大量的前行动作仍只代表单一行为模式。
图3:参考动作数据集组成。聚合多源 1.02 亿帧 @50FPS,重定向到目标人形。可视化随机样本展示其广泛行为覆盖。
自适应采样:对每个动作序列初始赋统一权重 $w_0=1$,每 $T_{eval}$ 轮在全训练集评估。若轨迹失败则提升权重、成功则降低:
$$w_t=\begin{cases}w_{t-1}/\beta^{T_{eval}},&\text{若轨迹失败}\\w_{t-1}\cdot\beta^{T_{eval}},&\text{若轨迹成功}\end{cases},\qquad w_t\leftarrow\text{clip}(w_t,w_{min},w_{max}).$$
实践中 $T_{eval}=200,\beta=0.999,w_{min}=0.03,w_{max}=1.0$,形成评估-反馈-重采样的闭环,使训练聚焦困难动作同时保留覆盖。
2.4 Humanoid Transformer 架构
为行为学习提供更丰富时序信息,将本体感知、目标和动作扩展为有限时序窗口,经模态特定 tokenizer 编码。本体感知和动作 token 交错形成上下文序列,后接可学习 query token。自注意力中 query token 不被上下文 token 注意,但保留对全部上下文的注意力以聚合历史信息。目标状态连同相对当前步的时序偏移沿时间维拼接,经 cross-attention 注入骨干。
图2:Humanoid Transformer 架构概览。用 RMSNorm 将目标嵌入归一化到连续有界超球面,自然诱导结构化行为意图潜在表示空间。
结构化潜在空间:用 RMSNorm 将目标嵌入归一化到连续有界超球面,不显式正则化,仅通过动作跟踪目标塑造。Actor 的未来窗口含连续 5 帧 $\{0,1,2,3,4\}$ 加一帧 $[5,32]$ 随机采样(缓解部署延迟);Critic 用指数间距 $\{0,1,2,4,8,16,32\}$ 兼顾短时细粒度与长视野结果。
3. 关键实验
在 Unitree G1(1.3m,29 自由度)训练,IsaacLab 训练、MuJoCo 评估动态迁移鲁棒性。两个测试集:BONES(1 万条留出序列,~360 万帧)和 Ours(839 条 Xsens + 810 条 100Style,~450 万帧)。
3.1 扩展 on-policy 数据
联合扩展宽度(GPU 数)和深度(horizon)显著提升性能,最大配置(64 GPU + horizon 64)几乎所有实验最佳。但单独扩展某一维不总产生一致改善——收益不仅取决于经验总量,还取决于如何积累,需适当平衡宽度与深度。
3.2 扩展参考动作:同质 vs 异质
用聚类模型量化行为覆盖率(占用率)。XXS→S 占用率几乎不变(~0.936),S→L 大幅提升(0.937→0.9995)。这把参考动作扩展分两区:同质扩展(XXS→S,量增覆盖不变)仅边际改善;异质扩展(S→L,量增覆盖也增)在 BONES 上几乎无额外收益,但在 Ours 测试集大幅提升。结论:扩展参考动作有效性取决于是否扩展行为覆盖以及新行为是否与目标基准相关。
| 分区 | 占用率 | 行为覆盖 |
|---|---|---|
| XXS | 0.9365 | ~不变 |
| XS | 0.9350 | ~不变 |
| S | 0.9365 | ~不变 |
| M | 0.9825 | 提升 |
| L | 0.9995 | 大幅提升 |
表1:训练分区占用率。XXS→S 同质(覆盖不变),S→L 异质(覆盖扩展)。
3.3 扩展模型架构
Humanoid Transformer 普遍取得比 MLP 更高的成功率和更低的跟踪误差。中等规模 Transformer 已达到甚至超过大得多的 MLP,继续增大 Transformer 收益递减。不同控制模式扩展不一致:全身模式比根-末端模式更易学(后者需从稀疏约束推断自然全身行为),模式间优化权衡随训练深入加剧。
3.4 潜在空间分析
潜在空间满足局部性(时间相近命令映射相近)和全局组织性(不同方向行为占据可区分区域)。可视化显示前进/后退分布于一维两端,左蹲/右蹲沿另一维分离。加入中等潜噪声仍保持高性能,证明潜在空间鲁棒。
图4:潜在空间可视化。每种行为形成连续光滑轨迹;不同方向行为占据可区分区域,保持方向关系。
3.5 性能基准
全身控制下,3M 参数的 ScaleBFM 在成功率和跟踪误差上全面领先 GMT、TWIST、SONIC 等现成全身控制器。相对 BFM-Bym(用 BeyondMimic 奖励的消融),全局跟踪误差更低,证明全局帧整体跟踪的奖励设计提供更一致的行为引导。
| 测试集 | 方法 | 成功率↑ | G-MPKPE↓ | L-MPKPE↓ |
|---|---|---|---|---|
| BONES | SONIC | 0.9239 | 0.1740 | 0.0436 |
| BFM-Bym(消融) | 0.9644 | 0.1005 | 0.0406 | |
| BFM-Global | 0.9677 | 0.0798 | 0.0400 | |
| Ours | SONIC | 0.5937 | 0.5035 | 0.0430 |
| BFM-Bym(消融) | 0.9709 | 0.1224 | 0.0403 | |
| BFM-Global | 0.9776 | 0.0915 | 0.0396 |
表2:全身控制性能基准。BFM-Global 在两测试集均最佳。G-MPKPE=全局均每关键点位置误差,越低越好。
4.
GCRL目标函数
$$ \max_{\theta}\,\mathbb{E}_{\tau\sim p_{\theta}(\tau)}\left[\sum_{t=0}^{T}\gamma^{t}r_{t}\right] $$
掩码目标状态
$$ s_{t}^{g}\triangleq(x_{t}\odot m_{i},\,m_{i}),\qquad m_{i}\sim\mathcal{M} $$
局限与展望作者自述局限:
- 虽设计了 8 种控制模式的统一接口,但这是否是最恰当抽象、以及这些模式如何与未来高层策略集成仍不清晰,BFM 设计应随高层策略学习进展而演进。
- 当前 BFM 预训练基础设施仍较初步受限,限制向更广设置的可扩展性。
分析判断:ScaleBFM 的核心贡献不是提出新方法,而是系统性地厘清了"扩展什么、为什么有效"——尤其是揭示了同质扩展 vs 异质扩展的区分(量增不等于覆盖增)。这一洞察对数据集策展有直接指导意义:域内性能提升应靠精细覆盖而非堆量,通用能力提升应引入互补数据源。Humanoid Transformer 的结构化潜在空间自然涌现且随规模收敛,暗示更大模型可能统一不同控制模式的表示。但 29 自由度的 Unitree G1 是较小骨架,向更高自由度人形或不同形态的迁移未验证;on-policy 数据扩展需大量 GPU(64 GPU 配置),中小团队复现门槛高;控制模式间的优化权衡是开放问题。
5. 总结
ScaleBFM 的核心思想是:扩展 BFM 不是简单堆数据堆参数,而是要协调学习范式、行为数据和模型架构——尤其要区分"量的扩展"和"覆盖的扩展"。为此它做了三件事:以全局帧动作跟踪为统一代理任务提供一致行为引导;通过 on-policy 宽深协同 + 自适应采样实现数量与多样性的平衡;用 Humanoid Transformer 的超球面潜在空间让结构化行为表示自然涌现。实验上 3M 参数模型在两测试集全身控制全面领先,全局 MPKPE 降超 10%(局部)和 82%(全局)。该工作为 BFM 系统化发展提供了基础,但控制接口抽象的恰当性、基础设施可扩展性、以及跨形态迁移仍是待验证的开放问题。



