PAPER DEEP DIVE
GigaBrain-WBC:人形机器人全身控制的行为世界模型
首个用于人形机器人全身控制的行为世界模型(BWM),训练因果Transformer联合预测下一步动作、状态和潜在行为指令分布,使策略网络同时建模环境对行为的影响。自动地形标注管线从重定向运动中恢复3D接触几何,部署时检测不合理指令并回退到已学行为,在四项测试中成功率最高(地形交互81.3%、不合理指令83.1%、跌倒恢复99.3%),Unitree G1检查点可迁移至Maker L01机器人。
论文元信息
标题:GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction
作者:Ziyang Cheng, Tianshu Tang, Jinxin Lan, Xinze Chen, Yuhan Gong, Zhichao Liu, Changzhong Wu, Yahao Mao, Zongyan Deng, Mingxuan Ma, Huasen Xi, Yilong Liu, Yutong Wu, Xiaofeng Wang, Yang Wang, Yun Ye, Guan Huang, Xiaojie Jin, Zheng Zhu, Jiwen Lu
代码状态:本文未提供公开代码仓库。论文提及"All code and experimental configurations will be released as open-source",但截至采集时尚未发布。
一句话总结:GigaBrain-WBC-0.5 是首个用于人形机器人全身控制的行为世界模型(BWM),通过让策略网络同时预测下一步动作、状态和潜在行为指令分布,使单一因果 Transformer 策略在实现精准运动跟踪的同时,具备环境交互、不合理指令过滤和跌倒自恢复能力。
研究背景与动机
人形机器人的价值在于能够使用手和脚在为人类设计的环境中完成复杂地形穿越。全身运动跟踪策略将人形机器人变成了一个鲁棒的控制接口:操作者——无论是穿戴 VR 设备的人类、运动规划器还是视觉-语言-动作模型——只需提供粗略的运动意图,底层策略负责保持机器人平衡和物理可行性。这种跟踪器既是全身示范数据采集的接口,也是学习型高层策略的执行层。
然而,现有的全身跟踪器都有一个致命限制:它们只在平地上有效。几乎所有现有控制器(SONIC、HoloMotion-1、Humanoid-GPT)都在空场景平地上训练和评估,机器人从不踩踏任何东西、不坐在任何东西上、不搬运重物。策略从未被要求感知自身动力学的变化——地面反力现在高了 18 厘米,或者负载偏移了质心——也从未学会利用这种变化。
第一个障碍是数据。环境交互式跟踪器需要地形和物体几何与一致参考运动配对的大规模数据,而这种数据十分稀缺。Chen 等人的 SceneBot 尝试通过事后从运动中重建场景来解决这个瓶颈,但其地形是 2.5D 高程图,无法表达全身交互所需的空间几何——椅子座面下方有间隙、桌子边缘、扶手——且其语料仅有 7.5 小时的专用交互数据,策略由每连杆的接触标签驱动,这不是操作者能在线产生的指令通道。
第二个困难更隐蔽:用于增强平地跟踪器鲁棒性的配方在环境变化时不再有效。在平地上,领域对命令鲁棒性的回答是不断扩大参考分布直到策略在几乎任何命令下都能保持平衡。但一旦环境变化,这个回答就失效了:在平地上可行的大幅前扑在狭窄台阶上可能不可行,而向后靠坐的运动在平地上毫无意义。可行集合变成了环境的条件函数,而 RL 策略一旦偏离训练分布就会行为不可预测——地形急剧放大了这个风险。
还有一个常被忽视的需求:当指令不可行时,需要一个在线机制识别并响应以"尽力而为"的运动,而不是紧急停止或退回站立——两者都会中断操作者的任务,在楼梯上比继续运动更危险。同样,当机器人已经摔倒时,把控制权交给专门的起身控制器会像摔倒本身一样中断任务。保持指令不可行时可驾驶和摔倒后可驾驶是互补的——两者合一在一个策略中,才是作者所说的鲁棒全身控制。
核心创新
GigaBrain-WBC-0.5 的三个核心贡献环环相扣:
创新一:行为世界模型。策略不再仅预测下一个动作,而是同时预测下一步状态和下一步潜在行为指令的分布。训练控制器这样做的效果是改变了它必须表征的内容:预测自身下一状态要求内化当前作用于其上的接触动力学,预测下一指令分布要求建模环境允许哪些行为——这正是平地跟踪器从未需要也从未获得的能力。
创新二:自动空间地形标注管线。从普通重定向运动中恢复运动必须在其上执行的真实 3D 接触几何。与高程图不同,输出是真正的 3D 几何——椅子、桌子、箱子、楼梯踏面——使得地形配对运动语料可以在现有运动数据集的规模上构建,而非场景采集的规模。
创新三:在线 OOD 指令过滤器。由世界模型自身预测的分布驱动,识别分布外指令并将其投影到策略能执行的最近行为,而非拒绝它。过滤器无状态且闭式,暴露单一运行时可调的安全半径,在精度与鲁棒性之间权衡。
方法详解
问题设定
控制 Unitree G1 人形机器人,29 个驱动自由度,50Hz 控制。每个时间步 $t$,策略接收本体感知观测 $\bm{s}_t \in \mathbb{R}^{67}$(投影重力、基座角速度、躯干线加速度、关节位置和速度)、前一步动作 $\bm{a}_{t-1} \in \mathbb{R}^{29}$,以及未来 10 帧的参考窗口 $\bm{c}_t$;输出 PD 关节目标 $\bm{a}_t \in \mathbb{R}^{29}$。
参考窗口由驱动源(VR 遥操作、运动规划器或离线回放)在线产生,因此策略必须能从任何源可提供的信号驱动。
图1:GigaBrain-WBC-0.5 总览。自动运动-地形标注与因果行为世界模型耦合,使单一策略实现精准跟踪、环境交互、跌倒恢复和跨机器人迁移。
行为世界模型
参考窗口 $\bm{c}_t \in \mathbb{R}^{440}$ 由 10 个未来帧组成,每帧包含:(i) 29 个参考关节位置,(ii) 参考根相对于当前机器人根的 6D 旋转,(iii) 参考根相对于前一帧的平移,(iv) 参考根相对于当前机器人根的平移,(v) 在参考根坐标系中的世界向下方向。每个块都加入加性均匀噪声。
MLP 编码器 $E$ 产生连续潜在行为指令 $\bm{z}^{\mathrm{raw}}_t = E(\bm{c}_t + \bm{\epsilon}_t) \in \mathbb{R}^{64}$,表示为两个 32 维 token。潜在空间的塑造通过有限标量量化器和小型 MLP 解码器实现——仅在训练时附加,将量化后的潜在映射回干净的 440 维窗口进行重构,而策略本身始终接收未量化的潜在。这种设计使量化成为纯正则化器:32 级每维下,将过多信息折叠到过少维度的潜在在舍入后变得不可区分且无法重构,迫使编码器跨维度展开信息。
每帧输入 $\bm{e}_t = [\bm{s}_t, \bm{a}_{t-1}, \bm{z}_t] \in \mathbb{R}^{160}$ 投影到 256 维,经 6 层因果 Transformer(4 头,旋转位置编码)处理,窗口限制为 32 帧。三个线性头读最终隐藏状态:
$$\bm{a}_t \in \mathbb{R}^{29}, \quad \hat{\bm{s}}_{t+1} \in \mathbb{R}^{67}, \quad \mathcal{G}_t = \{\pi_k, \bm{\mu}_k, \log \bm{\sigma}_k\}_{k=1}^{K} \in \mathbb{R}^{516}$$
其中 $K=4$ 个对角高斯分量建模下一步潜在指令 $\bm{z}_{t+1} \in \mathbb{R}^{64}$ 的分布。第一个头是策略;另外两个使网络成为世界模型。预测 $\bm{s}_{t+1}$ 迫使它表征当前作用于身体的接触动力学——正是机器人踩上箱子或拿起负载时变化的东西。预测 $p(\bm{z}_{t+1} \mid \text{history}_t)$ 迫使它表征当前情况允许哪些行为,因为楼梯上可达的下一步指令集合与平地上不同。混合故意设为多模态:不同行为模式占据潜在空间的不同区域,折叠成单一高斯会将这些区域抹平。
完整目标函数结合 PPO 损失与四个辅助项:
$$\mathcal{L} = \mathcal{L}_{\mathrm{PPO}} + 0.01\,\mathcal{L}_{\mathrm{recon}} + 1.0\,\mathcal{L}_{\mathrm{cycle}} + 0.01\,\lVert \hat{\bm{s}}_{t+1} - \bm{s}_{t+1} \rVert^2 - 0.005\,\log \mathcal{G}_t(\bm{z}_{t+1})$$
两个下一步项在 episode 边界处被遮蔽,不监督虚假转移。
自动空间地形标注
图2:从运动到空间地形。(a) 重定向运动运动学回放。(b) 接触检测标记法向和切向速度低于阈值的帧。(c) 检测到的接触累积为 3D 点云。(d) 全身穿透过滤后分组为碰撞安全簇。(e) 每个簇拟合为基本体,生成训练用 3D 地形。
管线首先在接触相关连杆(默认两个踝连杆,可选扩展到手、膝、肘、骨盆和躯干背部)的碰撞几何上均匀采样点,在 MuJoCo 中运动学回放重定向轨迹,获取每个采样点每帧的世界位置和法向。经 Savitzky-Golay 平滑后,当法向速度低于 0.2 m/s 且切向速度低于 0.3 m/s,且前 10 帧中至少 2 帧显示法向减速度超过 1 m/s² 时,标记为接触——这个减速特征区分了支撑事件与仅仅是暂时变慢的肢体。接触在漂移超过 5 cm 或开始滑动时结束,低于 10 帧的接触被丢弃。
检测到的接触然后转化为几何。低于 10 cm 或法向朝下的点被丢弃为普通地面或非支撑面;其余在 1 mm 体素网格上去重。每个存活点在整条轨迹上对整个机器人进行穿透测试:只有当放置在该处沿法向偏移至少 5 cm 的支撑在所有帧中都不与任何身体相交时才保留。这个穿透过滤器防止重建虚构机器人会穿过的几何。
点然后通过法向一致性(40° 内)和法向偏移(10 cm 内)的成对亲和度分组为平面支撑,DBSCAN 分离不同高度的楼梯踏面。每个簇拟合为 1 cm 厚的定向盒子,内平面轴来自切向投影的 PCA,法向偏移对齐最低接触点。每个基本体最终通过穿透安全二分搜索横向扩展,给机器人在其原始足迹周围留出余量。
过滤分布外指令
部署时,上一步输出的混合 $\mathcal{G}_{t-1}$ 是在看到 $\bm{c}_t$ 之前对哪些行为指令与训练经验一致的预测。将每个高斯分量定义的内分布区域通过马氏半径平方给出:
$$M^2_k(\bm{z}) = \sum_{i=1}^{D} \left(\frac{z_i - \mu_{k,i}}{\sigma_{k,i}}\right)^2, \quad D=64$$
其中 $\sigma_{k,i} = \exp(\log \sigma_{k,i})$,$\log \sigma_{k,i}$ 被截断到 $[-3, 10]$。首先通过 MAP 风格规则选择最可能的行为模式:
$$k^{\star} = \arg\max_k \left[\log(\pi_k + 10^{-10}) - \frac{1}{2D} \sum_{i=1}^{D} \left[\left(\frac{z_i - \mu_{k,i}}{\sigma_{k,i}}\right)^2 + 2\log \sigma_{k,i} + \log 2\pi\right]\right]$$
当指令超出分布时,不替换为均值,而是沿射线向 $\bm{\mu}_{k^{\star}}$ 方向径向回缩到安全椭球边界:
$$\bm{z}^{\star}_t = \bm{\mu}_{k^{\star}} + \sqrt{R^2_{\mathrm{safe}} / M^2_{k^{\star}}(\bm{z}^{\mathrm{raw}}_t)} \; (\bm{z}^{\mathrm{raw}}_t - \bm{\mu}_{k^{\star}})$$
这是闭式重缩放,不是欧几里得最近点(那需要每帧求解拉格朗日乘子)。回缩后的指令仍从可信模式指向操作者要求的方向,所以机器人继续尝试任务而非冻结。过滤器无记忆,每帧重新选择 $k^{\star}$ 并重新评估不等式,O(1) 每步成本远低于 1 ms。
graph TD
A["参考窗口 c_t
440维"] -->|MLP编码器 E| B["潜在指令 z_raw
64维"]
B -->|上一步混合 G_{t-1}| C{"马氏距离
M² > R²?"}
C -->|是:OOD| D["径向回缩
到安全椭球边界"]
C -->|否:ID| E["直接通过 z_t = z_raw"]
D --> E
E --> F["因果Transformer
6层 4头"]
F --> G["动作 a_t
29维"]
F --> H["状态预测 s_{t+1}
67维"]
F --> I["下一步混合 G_t
4高斯分量 516维"]
I -.->|下一步| C
训练
使用三大重定向人类运动语料:Bones-Seed(288 h)、MotionMillion(900 h)和 MotionDecode(1000 h)。其中分别识别出 12.50 h、22.22 h 和 37.85 h 包含空间地形交互的运动片段。地形与平地运动以 0.2 的可控比率混合。在 Isaac Lab 中用 PPO 优化,序列级更新:每次更新用梯度重新计算当前 rollout 段,同时附加 rollout 开始时保存的分离逐层 KV 前缀。rollout 在平地上用 4096 个并行环境,启用地形几何和摔倒初始化后降至 512 个。
鲁棒性训练的两个关键成分:一部分平地 episode 从合成摔倒姿态开始(躯干倾角课程直到完全俯卧),精确跟踪奖励由平滑的目标相对恢复门控,使策略在起身过程中不被惩罚。手腕和躯干持续随机外力模拟负载和接触力。
实验结果
在四个测试集上评估,每个针对不同的失败模式。所有策略在 MuJoCo 中以相同标准评估,包括完整长度 rollout——摔倒不会提前终止,所以策略无法通过缩短自身误差来缩减错误。
| 方法 | 标准 MPKPE↓ | 标准 SR↑ | 地形 MPKPE↓ | 地形 SR↑ | OOD SR↑ | 跌倒 SR↑ | Jerk↓ |
|---|---|---|---|---|---|---|---|
| SONIC | 82.3 | 94.1% | 331.2 | 15.3% | 50.0% | 5.9% | 1295.5 |
| HoloMotion-1 | 109.4 | 89.0% | 330.0 | 18.7% | 67.7% | 0.7% | 2000.0 |
| Humanoid-GPT | 90.9 | 91.9% | 283.3 | 14.0% | 70.6% | 2.9% | 3598.1 |
| GigaBrain-WBC-0.5 | 76.6 | 96.3% | 93.3 | 81.3% | 83.1% | 99.3% | 1050.6 |
表1:MuJoCo 仿真对比。MPKPE 单位 mm,RootPos 单位 mm,RootVel 单位 mm/s,Jerk 单位 rad/s³,SR 为成功率。
在标准平地跟踪上,行为世界模型训练方式在自由空间中不损失任何能力:76.6 mm MPKPE 和 96.3% SR 是四个策略中最准确、最可靠的,甚至超过了专门为平地设计的 SONIC(82.3 mm, 94.1%)。唯一不领先的是根线速度(211.1 vs HoloMotion-1 的 121.3 mm/s),归因于间歇性根平移遮蔽——三分之二时间必须在无绝对根反馈下运行的策略用小修正重新锚定而非连续匹配参考速度曲线。
地形测试集是环境感知训练的分离点。三个基线全部崩溃至 14-19% SR、MPKPE 在 283-331 mm——从未经历非地面接触的它们将台阶或座椅视为要拒绝的干扰而非要承载的表面。GigaBrain-WBC-0.5 保持 81.3% SR、93.3 mm MPKPE,成功率提高 4.3 倍,跟踪误差降低 3.0 倍。更说明性的内部对比:从平地到地形,我们的 MPKPE 仅升高 22%(76.6→93.3),而基线升高 3-4 倍。
图3:硬件环境交互。(a)-(d) SONIC(左)与 GigaBrain-WBC-0.5(右)的匹配硬件对比,同时驱动相同指令。(a) 我们的策略将箱子作为座椅加载而 SONIC 保持半蹲。(b) 我们的策略踏上平台并稳定;SONIC 未能爬上。(c) 我们的策略举起并保持箱子而 SONIC 失去稳定抓握。(d) 我们的策略完成跪-站转换举起 2 kg 灭火器而 SONIC 在起身时摔倒。
OOD 测试集中每个参考都物理上不可能执行。GigaBrain-WBC-0.5 存活了 83.1% 的片段,而基线为 50.0-70.6%,执行运动也最接近意图(158.0 mm vs 最优基线 208.0 mm)——过滤器不是丢弃指令,而是回缩到策略能做的最近的事。跌倒测试的差距是分类性的:基线从 0.7-5.9% 的摔倒初始化中恢复,而我们的从 99.3% 恢复。
鲁棒性-精度前沿由单一安全半径 $R_{\mathrm{safe}}$ 参数控制。部署设置 $R_{\mathrm{safe}}=3$ 位于拐点:从未过滤极限收紧获得 2.9 个 OOD 存活百分点,代价是 12.7 mm 标准 MPKPE。由于过滤器无状态且 $R_{\mathrm{safe}}$ 在运行时读取而非训练时固定,操作者可在运行中的机器人上沿这条曲线移动,在环境不宽容时过滤更激进,在精度更重要时放松。
图4:鲁棒性与精度随安全半径的函数关系。$R_{\mathrm{safe}}=3$ 是报告的操作点。
| 地形类别 | 采样数 | 正确率 | 主要失败模式 |
|---|---|---|---|
| 楼梯/台阶 | 50 | 92% | 快脚步使减速特征模糊 |
| 椅子/座椅 | 50 | 94% | 躯干摇摆使靠背接触错位 |
| 箱子/平台 | 50 | 98% | 稀疏接触无法形成基本体 |
| 其他 | 50 | 84% | 手部重定向噪声掩盖速度下降 |
| 总计 | 200 | 92% | — |
表2:自动地形标注的人工审计结果。
跨机器人迁移
将 G1 检查点迁移到 Maker L01 人形机器人时,重用相同训练配方:将语料重定向到 L01,在单个 8-GPU 节点上微调 G1 检查点,快速恢复全身跟踪。而从头在 L01 上训练相同架构收敛缓慢——行为世界模型似乎携带了关于人形机器人如何与环境交互的结构,这种结构不特定于一组连杆长度。
图5:全身运动能力展示,包含敏捷运动、家务任务和工业任务,均由一个跟踪策略在实时全身指令下产生。
局限性
局限一(作者自述):过滤器在仿真中验证,其半径必须在硬件上每个检查点和平台重新校准后才能依赖。它标记的是与策略训练经验不同的指令,而非直接推理物理风险,因此对不可行指令的拦截是高概率而非确定的。
局限二(作者自述):地形标注源自接触证据,因此只能恢复运动实际接触的几何——存在但未使用的表面不会被重建,生成的场景是支撑而非完整环境。将重建扩展到非支撑几何、将世界模型的状态预测连接到更直接的物理风险概念是自然的下一步。
局限三(分析判断):根线速度跟踪在标准平地上不领先(211.1 vs 121.3 mm/s),这是间歇性根平移遮蔽的直接代价。虽然这不影响关键点精度,但对需要精确速度匹配的应用(如与外力同步的动态任务)可能构成限制。
总结与展望
GigaBrain-WBC-0.5 证明了人形机器人全身控制中两个缺失的能力——环境交互和对环境不允许的事情保持良好行为——是同一能力的一体两面,都源于让控制器预测自身未来而非仅预测下一步动作。围绕这个前提,作者构建了从普通重定向运动恢复空间接触几何的自动管线,以及将模型自身预测的指令分布转化为在线 OOD 过滤器的无状态闭式投影。在四项测试中均达到最高成功率,地形交互 81.3%(4.3 倍最强基线)、跌倒恢复 99.3%(16.8 倍最强基线),Unitree G1 检查点可迁移至 Maker L01 机器人。
作为首个用于人形机器人全身控制的行为世界模型,这项工作开辟了将环境交互与鲁棒执行结合的控制器方向。将世界模型的状态预测连接到更直接的物理风险推理、将地形重建扩展到非支撑几何,以及更大规模的真实机器人验证,都是有价值的后续方向。



