PAPER DEEP DIVE
PGMT:面向人形机器人的感知式通用动作跟踪
人形动作跟踪器已能复现多样的全身动作,但一旦地形复杂起来,地形无关的参考动作常常物理不可行——参考要求右脚落在某处,而那里恰好是台阶棱或石块。PGMT 把地形适应做成跟踪策略自身的能力,而不是上游参考动作生成器的负担:第一阶段在平地上用 LAFAN1 人体动作学出通用的跟踪与跌倒恢复先验;第二阶段通过「动作条件化的地形一瞥」把高程图中与当前动作真正相关的区域稀疏注入意图融合模块,并用地形感知的跟踪松弛允许必要偏离、同时保住参考动作的意图。整套流程不需要任何「动作—地形」配对数据,任务完成率从 40.02% 提升到 87.81%(最难的 L9 档从 35.31% 提升到 83.33%)。在 29 自由度 Unitree G1 上零样本部署,可跨越 37 cm 高障碍箱、在楼梯上慢跑与冲刺、完成侧手翻并自主起身,同时支持遥操作与动态动作跟踪。
论文元信息
| 项目 | 内容 |
|---|---|
| 标题 | PGMT: Perceptive General Motion Tracking for Humanoid Robots(PGMT:面向人形机器人的感知式通用动作跟踪) |
| 作者 | Hongyi Li、Li Peizhuo、Yucheng Tao、Ze Wang、Fangzhou Xu、Jinyi Chen、Yanyan Yuan、Dapeng Jia、Yongbin Jin、Mingfeng Fan、Guillaume Sartoretti、Hongtao Wang(通讯作者 Hongtao Wang,项目负责人 Guillaume Sartoretti) |
| 机构 | 浙江大学 X-Mechanics 中心、新加坡国立大学 MARMot Lab、MirrorMe Technology(镜我科技) |
| arXiv | 2609.08511v2(2026-09-08,cs.RO) |
| 项目主页 | luyili.github.io/pgmt,代码页面当前标注 “Code Coming soon”,尚未开源 |
| 硬件平台 | 29 自由度 Unitree G1;Livox Mid-360S 激光雷达 + 机载高程图管线;NVIDIA Jetson Orin NX 单板承载感知与控制 |
| 训练开销 | 4× RTX 5090,每卡 15,000 个并行环境,单次 PPO 迭代约 8.44 s,单卡峰值显存 29.23 GiB |
| 预训练数据 | LAFAN1 人体动作重定向到人形机器人,全程在平地上训练 |
一句话总结
PGMT 把「地形适应」做成跟踪策略自身的能力而不是上游的参考动作生成器:第一阶段在平地上用 LAFAN1 学出一个地形无关的全身跟踪与跌倒恢复先验,第二阶段再把高程图通过「动作条件化的地形一瞥(terrain glimpse)」稀疏注入意图融合模块,配合地形感知的跟踪松弛,让同一个策略在不需要任何「动作—地形」配对数据的前提下,把完成率从预训练版的 40.02% 提到 87.81%(最难 L9 档从 35.31% 提到 83.33%),并在真机上零样本爬楼梯、跨 37 cm 障碍箱、做侧手翻并自主起身。
图1:论文 Fig. 1。同一个 PGMT 策略在结构化室内、楼梯、不平整室外地面与茂密植被上执行全身动作;不同指令来源(摇杆、遥操作、动作库)共用同一个策略,构成感知式全身运动的统一接口。
研究背景与动机
大规模人形动作跟踪这两年进步很快:从 retargeting + 特权蒸馏,到 SONIC 这类把数据与算力都堆上去的通用跟踪器,机器人已经能以相当高的保真度复现人体动作库。但作者指出了一个被普遍回避的事实——这些成功基本都发生在平地上。一旦环境复杂起来,地形无关的参考动作可能直接物理不可行:参考轨迹要求右脚落在某处,而那里恰好是一个台阶棱、一块石头或者一道斜坡。此时正确的行为不是继续硬跟参考,而是主动调整落脚点、摆动轨迹和全身姿态去迁就局部地形。
这个能力对应用很关键。远程遥操作与数据采集、崎岖地形搜救、复杂环境中的搬运——这些场景里,人类操作员或上层规划器不可能预先知道机器人脚下确切踩到什么几何。所以作者的定位很清楚:参考动作负责说明「要做什么动作」,环境观测负责决定「这个动作在物理上该怎么实现」,二者之间的鸿沟必须由机载感知在底层自己填掉。
难就难在数据。大规模动作数据与大规模地形数据天然是不配对的:人体动作数据集(AMASS、LAFAN1 之类)提供丰富的全身行为,但几乎没有同步的地形几何与地形特化的适应方式;反过来,地形数据集里没有人在上面跳舞。而要显式采集「动作—地形」配对示范,随着动作多样性和地形多样性同时增长,成本会爆炸。近期工作(如 Perceptive BFM)走的是「先构造地形适应后的参考、再去跟踪」的路线,虽然有效,但整条链路受制于中间那个参考生成阶段的质量与泛化能力,而且这个中间阶段本身就限制了向大规模数据扩展的可能。
PGMT 的选择是不要中间阶段:让跟踪策略自己学会把「动作意图」与「地形约束」在同一层关联起来。原始参考给出意图,高程图给出局部物理约束,两者被送进同一个意图融合模块(IFM)联合处理。策略因此在必要时偏离参考以保住可行性,而不需要上游生成一个地形匹配版参考。这样做的另一个收益是把感知式跟踪变成了一个可复用的底层接口:来自人类操作员、motion matching 系统或上层规划器的动作参考都不必编码脚下的几何,PGMT 负责把它们落地成物理可行的全身运动。
论文列了三条贡献:一是提出直接跟踪地形无关参考、无需地形匹配轨迹的感知式通用跟踪器 PGMT;二是设计了一个可渐进扩展的架构,把动作编码与感知编码解耦,使得新感知模态可以被注入而不破坏已学到的跟踪能力;三是做了大规模仿真与真机实验,覆盖多种地形与多种指令来源,验证零样本泛化。
图2:论文 Fig. 2 流程总览。第一阶段 Tracking Pretraining 建立通用的全身跟踪与恢复先验;第二阶段 Perception Injection 把局部几何有选择地与动作意图融合,从而在不需要地形匹配参考轨迹的情况下获得地形适应能力。最终得到的统一策略同时支持地形自适应行走、全身动作跟踪与多种遥操作接口。
预备知识:问题形式化与观测构成
作者把感知式全身动作跟踪形式化为部分可观测马尔可夫决策过程(POMDP)。每个时间步 $t$,策略 $p_{\theta}$ 接收观测并输出目标关节位置 $\bm{a}_{t}\in\mathbb{R}^{29}$ 作为动作(29 对应 Unitree G1 的自由度数),再由低层 PD 控制器转成关节力矩。完整的感知观测写成 $\bm{y}_{t}=\{\bm{o}_{t},\bm{H}_{t},\bm{C}_{t}^{K},\bm{M}_{t}\}$ 四部分:
| 符号 | 维度 | 含义 | 引入阶段 |
|---|---|---|---|
| $\bm{o}_{t}$ | $\mathbb{R}^{96}$ | 当前本体感知:参考相对锚点朝向 $\bm{e}_{t}\in\mathbb{R}^{6}$、基座角速度 $\bm{\omega}_{t}\in\mathbb{R}^{3}$、关节位置 $\bm{q}_{t}$ 与速度 $\dot{\bm{q}}_{t}$(各 $\mathbb{R}^{29}$)、上一动作 $\bm{a}_{t-1}$ | 第一阶段 |
| $\bm{H}_{t}$ | $\mathbb{R}^{10\times 96}$ | 十帧本体感知历史,提供瞬态观测拿不到的时间上下文 | 第一阶段 |
| $\bm{C}_{t}^{K}$ | $\mathbb{R}^{K\times 61}$ | 未来参考帧,按指数递增的时间偏移采样,携带未来动作意图 | 第一阶段 |
| $\bm{M}_{t}$ | $\mathbb{R}^{21\times 21}$ | 高程图,覆盖与偏航角对齐的 $2\,\mathrm{m}\times 2\,\mathrm{m}$ 区域 | 仅第二阶段 |
未来参考帧的采样偏移不是均匀的,而是指数展开:第 $k$ 帧取自 $\tau=t+2^{k}-1$,这样近期意图密集、远期意图稀疏,符合控制上「近处要精确、远处只需趋势」的直觉。
$$\bm{C}_{t}^{K}=\left([\bm{q}^{r}_{\tau},\dot{\bm{q}}^{r}_{\tau},\widetilde{\bm{v}}^{r}_{\tau}]\right)_{k=0}^{K-1}\in\mathbb{R}^{K\times 61},\qquad \tau=t+2^{k}-1$$
其中上标 $r$ 表示参考量,$\widetilde{\bm{v}}^{r}=(\widetilde{v}_{x},\widetilde{v}_{y},0)$ 是经过修正的平面锚点速度指令——这个「修正」是后文全局位置修正机制的产物,也就是说策略看到的参考速度并不完全等于原始 motion 数据里的速度。
方法详解
1. 第一阶段:跟踪预训练(Tracking Pretraining)
第一阶段在平地上学一个地形无关的全身跟踪先验,为后续注入地形感知提供一个稳定初始化。架构由三块组成:意图融合模块(IFM)、actor、多头 critic。
历史 token。先用当前观测 $\bm{o}_{t}$ 作为 query 去 attend 十帧历史 $\bm{H}_{t}$,压出一个历史条件化的状态 token:
$$\bm{s}_{t}^{\mathrm{hist}}=\operatorname{CrossAttn}_{H}\left(Q=\bm{o}_{t},\,K=V=\bm{H}_{t}\right)$$
这里 $\operatorname{CrossAttn}_{\cdot}$ 是多头交叉注意力(MHCA)。这个 token 编码的是近期动力学与时间上下文——那些只看瞬时本体感知拿不到的信息,比如「我是不是正在往某个方向倾」。
意图融合模块(IFM)。这是整套架构的枢纽。它用一个带旋转位置编码(RoPE)的 MHCA 层,以 $\bm{s}_{t}^{\mathrm{hist}}$ 为 query,去 attend「当前状态 token 拼上未来参考帧」:
$$\bm{s}_{t}^{\mathrm{int}}=\operatorname{CrossAttn}_{C}\left(Q=\bm{s}_{t}^{\mathrm{hist}},\,K=V=[\bm{s}_{t}^{\mathrm{hist}};\bm{C}_{t}^{K}]\right)$$
设计的意图是:让策略有条件于自身当前状态去有选择地强调未来参考信息。同样一段参考动作,机器人在稳态站立时和在即将失衡时对它的关注点显然应该不同,这个 attention 就是把「此刻该在意参考的哪一部分」学出来。产出的意图 token $\bm{s}_{t}^{\mathrm{int}}$ 被 actor 与 critic 共享,并且在第二阶段还会被地形信息进一步扩充。
Actor。把当前本体感知 $\bm{o}_{t}$ 与意图 token 拼接后映射到动作:
$$\bm{a}_{t}=\operatorname{MLP}_{A}\left([\bm{o}_{t},\bm{s}_{t}^{\mathrm{int}}]\right)$$
为什么要再拼一次 $\bm{o}_{t}$?作者的解释是:意图 token 提供的是紧凑的、状态条件化的动作意图,而直接保留 $\bm{o}_{t}$ 是为了给细粒度低层控制留一条瞬时本体感知反馈通路。值得强调的是,actor 只依赖部署时可得的信息——特权观测只进 critic,不进 actor,这是能 sim-to-real 零样本迁移的前提。
多头 critic。全身跟踪的目标函数天然异构:上身目标主要保动作表现力与姿态保真,下身目标与平衡和接触切换紧耦合,剩下的目标管根部运动、恢复、安全与控制正则化。作者把预训练奖励拆成三组:
$$r_{t}=r_{t}^{\mathrm{upper}}+r_{t}^{\mathrm{lower}}+r_{t}^{\mathrm{aux}}$$
一个标量 critic 会把量级和学习动态差别很大的奖励分量搅在一起。所以 PGMT 用多头 critic 输出一个价值向量,每组奖励一个头:
$$\bm{V}_{t}=\operatorname{MLP}_{V}\left([\bm{o}_{t}^{\mathrm{priv}},\bm{s}_{t}^{\mathrm{int}}]\right)=\left[V_{t}^{\mathrm{upper}},V_{t}^{\mathrm{lower}},V_{t}^{\mathrm{aux}}\right]$$
三个头共享同一个 critic 主干(表征共享),但分别建模各自的奖励组。$\bm{o}_{t}^{\mathrm{priv}}$ 是仅仿真训练期可得的特权观测。奖励权重(Table I)里几个数值很能说明设计取向:恢复用上升速度给到 $+12.5$(鼓励摔倒后主动往上顶),关节限位罚 $-15.0$,而第二阶段新增的地形接触组里触地质量给 $+10.0$、绊脚(stumble)罚 $-20.0$、接触切换罚 $-30.0$——后两者是全场最重的负项,等于告诉策略「宁可步子难看,也不许乱换脚」。
训练细节。动作用 LAFAN1 重定向到人形,跨序列、跨起始帧采样片段,用一个统一策略覆盖多样的全身行为。采用根部中心化(root-centric)的跟踪形式:主要身体跟踪误差相对于参考根部锚点计算,而不是在世界系里跟全轨迹。好处是弱化了对绝对全局位置与朝向的依赖,同一个动作意图可以从不同初始姿态和朝向复现出来——这正是能给第二阶段提供可迁移初始化的原因。此外沿用 RGMT 的恢复课程(离线构造跌倒后状态池,按回合存活表现逐步提高从该池初始化的环境比例)与自适应采样(给频繁跟踪失败的动作片段更高采样概率,同时保持对整个动作集的均匀覆盖)。
2. 第二阶段:地形一瞥编码器(Terrain-Glimpse Encoder)
第二阶段的核心问题是:高程图 $\bm{M}_{t}$ 该怎么喂给策略?最直接的做法是把整张 $21\times 21$ 图稠密编码成一个地形表征。作者认为这既贵又会引入不必要的噪声——对行走真正相关的往往只有一小片区域,主要是潜在落脚点周围和地形边界处。PGMT 的答案是稀疏的、动作条件化的「一瞥」。
编码器先用一个 MLP 位置选择器,基于展平的高程图、历史 token 与未来参考帧,预测 $N_{g}=4$ 个一瞥位置:
$$\bm{r}_{t}^{j}=\left[\operatorname{MLP}_{\phi}\left(\operatorname{vec}(\bm{M}_{t}),\bm{s}_{t}^{\mathrm{hist}},\bm{C}_{t}^{K}\right)\right]_{j},\qquad j\in\{1,\cdots,N_{g}\}$$
$\bm{r}_{t}^{j}\in\mathbb{R}^{2}$ 是第 $j$ 个预测采样位置,$\operatorname{vec}(\cdot)$ 是展平操作。注意这个选择器的输入里同时有未来参考帧 $\bm{C}_{t}^{K}$——这就是「动作条件化」的含义:看哪里取决于接下来要做什么动作。要抬腿跨箱子和要原地转身,需要关注的地形区域显然不同。
然后在每个预测位置裁一块 $5\times 5$ 的地形 patch,连同其在机器人坐标系下的中心位置 $\bm{\rho}_{t}^{j}$ 一起过一个 MLP,得到局部地形 token:
$$\bm{z}_{t}^{j}=\operatorname{MLP}_{\psi}\left(\operatorname{Crop}_{5\times 5}(\bm{M}_{t},\bm{r}_{t}^{j}),\bm{\rho}_{t}^{j}\right),\qquad j\in\{1,\cdots,N_{g}\}$$
一个关键的工程细节:裁剪用双线性采样实现,因此是可微的。这使得一瞥位置可以直接端到端学出来,完全不需要区域标注或落脚点标注。这在方法论上很重要——它避免了「先训一个落脚点预测器再接进来」这种两阶段监督的脆弱性。
注入 IFM。地形 token 不是新开一条支路,而是直接扩充 IFM 的 key/value 集合:
$$K=V=\left[\bm{s}_{t}^{\mathrm{hist}};\bm{C}_{t}^{K};\bm{z}_{t}^{1};\ldots;\bm{z}_{t}^{N_{g}}\right]$$
于是地形信息与动作意图在同一个 attention 层、同一层级被联合处理,意图 token 自然带上地形感知。这正是论文「解耦动作编码与感知编码、可渐进注入新模态」这条贡献的具体落点:注入地形只需要往 key/value 里加几个 token,主干和已学到的跟踪能力不动。
critic 扩展到四头。为鼓励稳定接触,第二阶段引入新的地形接触奖励组 $r_{t}^{\mathrm{terrain}}$:用局部高度变化评估触地质量,用离线地形网格查询得到的接触标签监督「参考接触」与「仿真接触」的一致性,并对脚底打滑、绊脚、快速接触切换、过大接触力分别施加惩罚。critic 相应地把最后一层从输出三个值改成四个:
$$\bm{V}_{t}^{\mathrm{inj}}=\left[V_{t}^{\mathrm{upper}},V_{t}^{\mathrm{lower}},V_{t}^{\mathrm{terrain}},V_{t}^{\mathrm{aux}}\right]$$
这个专用价值头为地形交互与落脚点选择提供聚焦的学习信号,而不干扰其它奖励组的价值估计。为什么这很要紧,后面 Fig. 4 的消融给出了非常直接的证据。
3. 地形感知的跟踪松弛
光有感知还不够。如果对每个跟踪误差都严格惩罚,策略就会被迫去跟一个在物理上不可行的参考,反而抑制了必要的落脚点变更、摆动轨迹调整和下半身姿态变化。作者的解法是给选定的跟踪目标加一层地形感知松弛:
$$\widehat{e}_{t,h,j}=\left[e_{t,h,j}-\alpha_{h,j}\,\chi(\kappa_{t})\,\tau_{m_{h}}(d_{t})\right]_{+}$$
其中 $e_{t,h,j}$ 是目标 $h$ 在连杆或关节 $j$ 上的原始误差,$[\cdot]_{+}=\max(0,\cdot)$,$\widehat{e}_{t,h,j}$ 取代 $e_{t,h,j}$ 进入指数形式的跟踪奖励。三个调制因子各司其职:
| 因子 | 作用 | 取值范围 |
|---|---|---|
| $\chi(\kappa_{t})$ | 地形族指示器,$\kappa_{t}$ 是机器人脚下 tile 的地形族 | $\{0,1\}$,仅在斜坡、楼梯、箱体上激活;平地与随机崎岖地形不松弛 |
| $\tau_{m_{h}}(d_{t})$ | 目标 $h$ 单位下的基础松弛量,$d_{t}$ 是地形难度等级 | 随 $d_{t}$ 线性增长并饱和 |
| $\alpha_{h,j}\geq 0$ | 逐元素缩放因子 | $\alpha_{h,j}=0$ 时退化为严格跟踪 |
松弛的施加范围被刻意限制得很窄:只作用于下半身的连杆位置、连杆朝向与关节位置目标;上半身跟踪目标与其余运动约束全部保持严格。这个取舍保留了参考动作的表现力意图(上身照样好好跳舞),同时给下半身留出迁就地形的自由度。换句话说,松弛不是「降低标准」,而是「在标准本来就物理不可行的地方改写标准」。
4. 全局位置修正
跟踪松弛放开了下半身,随之而来的风险是全局位置误差累积——每一步都允许偏一点,走远了就偏很多。作者把平面位置误差反馈进参考速度指令来堵住这个漏洞。误差在参考锚点系里计算:
$$\bm{e}_{t,xy}^{p}=\left[(\bm{R}_{t}^{r,w})^{\top}\left(\bm{p}_{t}^{r,w}-\bm{p}_{t}^{w}\right)\right]_{xy}$$
其中 $\bm{p}_{t}^{r,w}$ 与 $\bm{p}_{t}^{w}$ 分别是参考与机器人在世界系下的锚点位置,$\bm{R}_{t}^{r,w}$ 是参考锚点的世界系旋转,$[\cdot]_{xy}$ 取平面分量。标称平面参考速度随后被修正:
$$\widetilde{\bm{v}}_{t,xy}^{r}=\bm{v}_{t,xy}^{r}+\operatorname{clip}_{[-\bar{v},\bar{v}]}\left(g\left(\lVert\bm{v}_{t,xy}^{r}\rVert_{2}\right)\lambda_{\mathrm{pos}}\,\bm{e}_{t,xy}^{p}\right)$$
这是一个增益为 $\lambda_{\mathrm{pos}}$ 的比例项,再被一个饱和速度门 $g(\cdot)\geq 0$ 调制($g$ 随标称速度增大,参考静止时归零),最后逐分量截断在 $\pm\bar{v}$。速度门的意义在于:机器人本来就静止时不该被位置误差「推着走」,只有参考确实在移动时才做位置纠偏。修正后的速度同时充当策略指令与速度跟踪目标——$\lambda_{\mathrm{pos}}=0$ 退化为纯速度跟踪,$\lambda_{\mathrm{pos}}>0$ 开启全局位置修正。
5. 地形课程与参考采样
训练覆盖平地、斜坡、楼梯、箱体与随机崎岖五类地形,采用基于等级的课程:环境在成功完成后升级到更难地形,跟踪失败后降级。地形等级同时控制三件事——几何难度、跟踪松弛幅度、以及部分终止条件的延迟。因为不是每个动作在每个地形上都可行,作者用一条粗粒度的行为—地形兼容性规则在采样参考时排除明显无效的组合。整套机制的要点是:既不需要地形适配过的参考,也不需要显式落脚点目标,更不需要配对的动作—地形示范。
flowchart TD
subgraph S1["Stage 1: Tracking Pretraining (flat ground, LAFAN1)"]
O["o_t (R^96) proprioception"] --> CA_H["CrossAttn_H
Q=o_t, K=V=H_t"]
H["H_t (10x96) history"] --> CA_H
CA_H --> SH["s_t^hist history token"]
SH --> IFM1["IFM: MHCA + RoPE
K=V=[s_t^hist ; C_t^K]"]
C["C_t^K future refs
tau = t + 2^k - 1"] --> IFM1
IFM1 --> SI["s_t^int motion-intent token"]
SI --> ACT["Actor MLP_A([o_t, s_t^int])"]
ACT --> PD["Low-level PD controller"]
SI --> CR3["3-head critic
V_upper / V_lower / V_aux"]
CR3 --> RSPLIT["Split return r = r_upper + r_lower + r_aux"]
end
subgraph S2["Stage 2: Perception Injection (terrain curriculum L0-L9)"]
M["M_t elevation map 21x21
2m x 2m, yaw-aligned"] --> SEL["MLP_phi position selector
(also sees s_t^hist, C_t^K)"]
SEL --> RG["N_g = 4 glimpse locations r_t^j"]
RG --> CROP["Crop 5x5 patch
bilinear sampling = differentiable"]
CROP --> ZE["MLP_psi -> terrain tokens z_t^j"]
ZE --> IFM2["IFM K=V augmented with z_t^1..z_t^4"]
CR4["4-head critic
+ V_terrain"] --> RTER["r_terrain: touchdown +10.0
stumble -20.0, contact switch -30.0"]
end
SI -.->|reuse prior| IFM2
RELAX["Terrain-aware relaxation
e_hat = [e - alpha * chi(kappa) * tau_m(d)]_+
lower-body only"] --> RTER
GPC["Global position correction
v_tilde = v + clip(g * lambda_pos * e_xy^p)"] --> C
IFM2 --> POL["Unified PGMT policy"]
POL --> MODES["Real-world modes: joystick locomotion,
teleoperation, whole-body tracking,
fall recovery (zero-shot on G1)"]
实验结果
1. 评测设置
地形自适应跟踪在五类地形族上评测:平地、斜坡、楼梯、箱体障碍、随机崎岖。每族含十个难度等级 L0–L9(递增)。每个策略在 9,600 个严格匹配的 30 秒回合上评测,每个「地形—等级」组合 192 回合;匹配的含义是对应回合使用完全相同的动作参考、起始帧、地形分配、动力学随机化、观测扰动与执行器延迟设置。回合成功的判据是跑满最大 rollout 时域而未提前终止。这个评测规模与匹配严格度在同类工作里算相当扎实的。
2. 主结果:完成率接近翻倍
图3:论文 Fig. 3 地形感知消融。(a) L9 成功率带 Wilson 95% 置信区间;(b) 各消融变体相对 PGMT-Ours 的 L9 动作组成功率差值(每组 48 回合);(c) L0–L9 全难度上相对 PGMT-Ours 的成功率差值。
论文 Table II 的完整结果如下(RMSE 为均方根误差;训练开销仅统计本文自行训练的配置,基于四块 RTX 5090,Time 为单次 PPO 迭代平均墙钟时间,VRAM 为单卡峰值占用):
| 策略 | 完成率 (%) ↑ | L9 (%) ↑ | 身体位置 (m) ↓ | 身体朝向 (°) ↓ | 关节 RMSE (rad) ↓ | 接触 F1 ↑ | Time (s/iter) | Max VRAM (GiB) | Envs/GPU |
|---|---|---|---|---|---|---|---|---|---|
| 只在平地训练的基线,放到地形上测 | |||||||||
| PGMT-Pretrain | 40.02 | 35.31 | 0.0897 | 27.70 | 0.2957 | 0.7436 | 4.54 | 16.11 | 10k |
| RGMT-Reimpl | 46.68 | 40.52 | 0.0700 | 20.15 | 0.2251 | 0.7680 | 5.42 | 24.78 | 8,192 |
| SONIC v1.1 External † | 25.09 | 20.73 | 0.1204 | 36.42 | 0.2650 | 0.8232 | – | – | – |
| 在地形上训练的策略 | |||||||||
| Perceptive BFM(原论文报告值)∗ | 55.1 | – | – | – | – | – | – | – | – |
| PGMT-NoHeight | 86.53 | 78.85 | 0.0659 | 20.32 | 0.2937 | 0.8157 | 8.47 | 29.88 | 15k |
| PGMT-CNN | 87.38 | 80.52 | 0.0645 | 18.33 | 0.2397 | 0.8173 | 11.95 | 27.30 | 15k |
| PGMT-2Glimpse | 85.17 | 77.71 | 0.0676 | 18.27 | 0.2340 | 0.8234 | 8.36 | 28.10 | 15k |
| PGMT-Fixed | 86.38 | 79.58 | 0.0645 | 18.47 | 0.2461 | 0.8218 | 8.28 | 28.66 | 15k |
| PGMT-Ours | 87.81 | 83.33 | 0.0678 | 18.14 | 0.2299 | 0.8217 | 8.44 | 29.23 | 15k |
† 外部 checkpoint 结果使用重新审计过的适配层与 checkpoint 原生控制器;∗ Perceptive BFM 结果引自原论文。
最刺眼的对比是第一组与第二组之间的断层:PGMT-Pretrain 只有 40.02%,注入地形感知后 PGMT-Ours 达到 87.81%;L9 最难档从 35.31% 跃到 83.33%。其它没有地形观测的跟踪器表现出类似的崩塌——SONIC v1.1 外部 checkpoint 在这个基准上只有 25.09%。作者的结论很直接:单靠一个通用动作先验无法可靠化解参考动作与局部地形之间的失配,而地形感知能实质性提升复杂地形上的跟踪成功率。与「先造地形参考再跟踪」的 Perceptive BFM(55.1%,引自原文)相比,PGMT 走的是不需要中间生成器的路线却拿到更高完成率。
需要留意的是,误差指标并非全面碾压:PGMT-CNN 的身体位置误差 0.0645 m 略优于 PGMT-Ours 的 0.0678 m,PGMT-2Glimpse 的接触 F1 0.8234 也略高。这符合直觉——松弛机制本来就是用「允许偏离参考」换「活下来」,所以完成率与跟踪精度之间存在预期内的取舍。
3. 感知机制消融:动作条件化的空间选择究竟值多少
四个消融变体只改地形感知机制,其余组件与训练设置完全一致:
| 变体 | 改动 | 完成率 | L9 |
|---|---|---|---|
| PGMT-NoHeight | 地形感知输入强制置零(等于没有感知) | 86.53 | 78.85 |
| PGMT-CNN | 用 CNN 把整张高度扫描编码成固定的 $2\times 2$ 地形 token 网格 | 87.38 | 80.52 |
| PGMT-2Glimpse | 一瞥数量从 4 减到 2 | 85.17 | 77.71 |
| PGMT-Fixed | 用 4 个预定义位置,而非依据机器人历史与未来动作动态预测 | 86.38 | 79.58 |
| PGMT-Ours | 4 个动态预测的动作条件化一瞥 | 87.81 | 83.33 |
在全评测日程上,PGMT-CNN 与 PGMT-Ours 相当接近(87.38 vs 87.81)。但 Fig. 3 把镜头推到最难的 L9 非平坦地形时,差距被放大:四类非平坦地形族上 PGMT-Ours 平均成功率 79.56%,最强的 PGMT-CNN 是 76.43%。分离最大的是楼梯——PGMT-Ours 达 78.12%,而各消融变体只有 64.58%–69.79%,落后约 8–14 个百分点。作者的解读是:当复杂地形几何与困难动作同时出现时,动作条件化的空间选择特别有价值。楼梯恰好是这种耦合最紧的场景——落脚窗口窄、时序要求严,看错地方就直接绊倒。
这组消融里信息量最大的其实是 PGMT-Fixed:它和 Ours 一样看 4 个位置、看同样大小的 patch,唯一区别是位置是预定义的而非依历史与未来动作预测。86.38% vs 87.81%、L9 上 79.58% vs 83.33%,说明「看哪儿由动作决定」这一条贡献了 L9 上近 4 个百分点。而 PGMT-2Glimpse 掉到 85.17% 说明 4 个一瞥不是随意选的超参,稀疏预算本身也吃紧。
4. 多头 critic:感知注入后才分道扬镳
图4:论文 Fig. 4。拆分回报(split-return)与聚合回报(aggregate-return)两种 critic 的对比。两者在第一阶段跟踪预训练期间都能正常学习,但只有拆分回报 critic 在感知注入阶段继续进步。曲线为原始日志的因果 EMA,截断于 10k 次 PPO 迭代。
作者把多头拆分回报 critic 换成单头聚合回报 critic(估计一个整体的全身回报)做对照。结果非常有戏剧性:两种 critic 在第一阶段表现相当,平均回合长度与超时率都在正常学习——也就是说,在平地纯跟踪任务上,拆分回报看起来是「没必要的复杂度」。但一旦注入地形感知,两者的训练行为立刻分岔:拆分回报 critic 持续进步,最终达到约 380 步的平均回合长度与接近 80% 的超时率;而聚合回报 critic 的这两条曲线双双停在接近零的位置。
这个结果值得单独拿出来讲。它说明多头 critic 的价值不是普遍性的,而是针对「奖励组之间学习动态冲突」这一特定病理的解药:新增的地形接触奖励组(触地质量 $+10$、绊脚 $-20$、接触切换 $-30$)量级大、信号稀疏,与上身表现力目标混在一个标量价值里时,梯度会把整个价值估计带偏,训练直接崩掉。分成独立头之后,地形交互的学习信号被隔离在自己的头里,不去干扰其它组的价值估计。这也是「架构可渐进扩展」这条主张的实证支撑——扩展一个感知模态时,价值侧必须同步扩展一个头,否则学不动。
5. 真机零样本部署
PGMT 策略零样本部署到 29 自由度 Unitree G1 上:Livox Mid-360S 激光雷达配合机载高程图管线提供与仿真格式一致的地形观测,感知与控制全部跑在单块 Jetson Orin NX 上。没有任何真机微调。
图5:论文 Fig. 5。单个统一的 PGMT 策略支持多种指令来源与控制模式:(a) 摇杆行走、(b) 遥操作行走、(c) 全身遥操作、(d-e) 全身动作跟踪、(f) 扰动恢复。行走指令由 Unitree 或 PICO 手柄给出,所有行为由同一策略执行,不做策略切换。
地形自适应行走。室内外均测,平地参考由 motion matching 在线生成。PGMT 走过不平整地面、上下未见几何的楼梯、爬上最高 37 cm 的箱体;过程中依据局部高程图调整落脚位置、摆动离地间隙与身体姿态,同时保持行走意图。在草地与茂密植被这类不规则室外地面,以及在楼梯上慢跑与冲刺(单步跨越多个台阶)时,尽管支撑面柔软且感知噪声很大,策略仍保持稳定。
遥操作。同一策略支持两种模式。全身遥操作下,操作员通过 PICO 捕捉全身动作、经 GMR 在线重定向到机器人,机器人执行出拳、下蹲、卧倒并从卧姿恢复站立等多样行为。行走遥操作更有意思:操作员只控制行走与上身动作,下身参考由 motion matching 在线生成——机器人可以一边爬楼梯、一边被遥操作上身。PGMT 负责把行走参考适配到局部地形,操作员因此不必显式指定地形相关的下半身动作。这其实就是论文「底层感知式接口」定位的实际形态。
通用动态全身动作跟踪。除行走与遥操作外,PGMT 在真机上保留了执行高动态动作的能力,包括侧手翻;并且在非平坦地形(如楼梯)上执行全身参考时,能调整接触与姿态以适应局部地形。这一点回答了「地形适应会不会把策略退化成只会走路」的疑问:动作结构被保住,地形相关的调整是叠加上去的。
扰动鲁棒与跌倒恢复。机器人在跳舞的同时承受强力推搡与踢击,大幅扰动后仍能恢复姿态且不中断被指令的动作;当扰动足够大导致跌倒时,PGMT 自主从跌倒构型恢复并回到稳定站姿。扰动抑制与跌倒恢复由同一个统一策略完成,不切换到专用恢复控制器。
局限性
作者自述:高程图只有几何,没有语义与可供性。作者在结论里明确点出,当前的高程图表征编码的是几何信息,但不含环境语义或 affordance,因此难以区分「需要避开的障碍」与「本就该去交互的物体」。例如一个可抓取的箱子与一块该绕开的石头,在纯高程图里可能长得一模一样。作者认为引入更丰富的感知表征可以把 PGMT 从「地形感知的动作执行」推向「非结构化环境中更通用的人形交互」。
读者视角补充:其一,障碍高度存在明确上限——真机演示的箱体最高 37 cm,而 G1 的腿长决定了这已接近其跨步能力边界;论文没有报告超过该高度时策略如何失败,也没有分析失败是否可预测(这在实际部署里是安全性问题)。其二,感知输入被假定为与仿真格式严格一致的高程图:真机链路是 Mid-360S 激光雷达 + 高程图管线,但论文没有量化高程图噪声、延迟或漏检(如玻璃、稀疏植被、悬空障碍)对策略的影响,只在草地场景定性提到「感知噪声很大」。其三,真机部分完全没有定量表格——全部是定性演示与照片,没有成功率、尝试次数或跨地形的统计;相比之下仿真部分有 9,600 回合的严格评测,真机侧的证据强度落差明显。其四,预训练动作集只有 LAFAN1,这是一个规模有限的动作捕捉数据集;论文声称「大规模动作与地形数据天然不配对」是核心动机,但实际用的动作数据并不算大规模,方法能否随动作库扩展到 AMASS 量级并未验证。其五,地形感知松弛的适用范围被硬编码为三类地形(斜坡、楼梯、箱体),随机崎岖地形不松弛;这条规则是人工设计的,换到新地形族时需要重新判断 $\chi(\kappa_{t})$ 该怎么定义。其六,代码尚未开源(项目页标注 “Code Coming soon”),上述数字目前无法复现验证。
总结与展望
PGMT 的贡献不在某个单点技术,而在一个干净的架构决策:把地形适应从上游的参考生成问题,改写成跟踪策略内部的注意力问题。这一步同时解掉了两个麻烦——不需要「动作—地形」配对数据,也不需要中间那个会传播误差的参考生成器。具体机制上,三件事互相咬合:动作条件化的地形一瞥(用可微双线性裁剪学到「该看哪儿」,无需落脚点标注)、地形感知跟踪松弛(只在物理不可行的地方、只对下半身放宽标准)、全局位置修正(把松弛带来的漂移用比例速度反馈拉回来)。而多头 critic 的扩展是让这套注入在优化层面真正跑得动的前提——Fig. 4 那条「聚合回报 critic 一注入感知就停在零」的曲线,是全文最有说服力的一张图。
数字上,完成率从 40.02% 到 87.81%、L9 从 35.31% 到 83.33%,是同类里相当显著的跃升;真机上同一策略同时承担地形自适应行走、全身遥操作、高动态动作跟踪(含侧手翻)与跌倒恢复,不做任何策略切换,验证了「感知式底层接口」这个定位是成立的。
往后看,作者指的方向是给感知加语义与可供性。从工程角度,还有几条同样关键:把真机评测补成定量表格;分析高程图退化(噪声、延迟、悬空障碍、透明材质)下的鲁棒边界;以及把动作库从 LAFAN1 扩到大规模数据集,验证「独立采样动作与地形」这条路线在数据规模上的可扩展性。如果这三条能补上,PGMT 这套「意图与约束同层融合」的范式很可能成为人形底层控制的标准配置之一。
金句
参考动作负责说明「要做什么」,环境观测负责决定「这在物理上该怎么实现」——感知式跟踪的工作,是在这两句话之间架一座桥,而不是要求上游先把桥修好再交给你。



