Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

人形机器人注意力机制地形编码

人形感知运动中地形编码的全局-局部注意力分解

虽然强化学习显著推进了人形运动,但感知策略在稀疏落脚点地形和受限环境中仍存在困难。这些场景需要广泛的地形感知和精确的落脚点选择,而传统编码器往往将这两个感知角色纠缠在一起。本文提出全局-局部注意力分解解决此问题。

Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao2026年5月30日3 分钟阅读
EN

Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion

作者:Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao

机构:同济大学 · 上海创新研究院 · 上海交通大学 · 人形机器人(上海)有限公司

论文链接: https://arxiv.org/abs/2606.00637


一句话总结

GLAD通过粗到细编码器在机器人中心高程图上显式分离全局注意力(汇总周围地形上下文)和局部注意力(稀疏化编码精确落足几何),使人形机器人在稀疏落足点、间隙、楼梯上实现稳健运动,并在Unitree G1上零样本迁移。

研究背景与动机

强化学习极大推进了人形运动,但感知策略在稀疏落足点地形和受限环境中仍挣扎。这些场景的成功需要同时具备广阔的地形感知和精确的落足选择——两个感知角色常被常规编码器纠缠在一起。稀疏落足点地形上,成功取决于识别可行支撑区域并精确放脚。

现有感知运动策略引入高程图或深度图像等外部观测,但这些原始观测高维且含噪,降低鲁棒性、增加计算成本并使策略训练复杂化。它们需要被编码为紧凑地形表征后才能提供给运动控制器。然而常规地形编码器通常将感知视为孤立的几何压缩任务,忽略机器人即时运动学状态。这种缺乏状态感知的编码过程倾向于稀释细粒度几何线索,削弱编码特征与可达落足区域间的空间对应,最终限制基于RL的感知运动的落足精度。

注意力机制提供了融合本体感知与外部感知的原则性方法:在当前运动状态引导下,强调运动相关的地形区域。AME引入基于注意力的地图编码器用MHA聚合本体感知条件的局部地形特征;AME-2进一步增加全局上下文。但这些现有注意力方法通常在单一注意力机制内纠缠多个感知目标,未显式分离两个必需角色:捕捉广阔周围地形上下文和编码精确落足相关局部几何。GLAD正是通过显式分解这两个角色来解决此问题。

核心创新

  1. 全局注意力分支:用注意力池化将所有局部特征聚合为紧凑的周围地形上下文向量 $c \in \mathbb{R}^D$,捕捉广阔地形感知。
  2. 状态条件局部注意力分支:将上下文向量与本体感知嵌入融合生成状态条件查询向量,评分并稀疏化保留top-K局部特征,再用MHA产生细粒度落足相关编码。
  3. 显式注意力分解:避免单一MHA中全局上下文与局部落足几何的纠缠,防止细粒度空间线索被稀释,同时降低训练开销。

方法详解

问题建模

将人形感知运动建模为POMDP $\mathcal{M}=(\mathcal{S}, \mathcal{A}, \mathcal{O}, p, r, \gamma)$,因有限传感器视场和测量噪声而部分可观测。策略 $\pi_\theta$ 接收含本体感知和外部地形感知(高程图)的观测,输出动作。目标最大化期望折扣回报 $J(\pi_\theta) = \mathbb{E}_{\pi_\theta}[\sum_{t=0}^{\infty} \gamma^t r(s_t, a_t)]$。 $$ J(\pi_\theta)=\mathbb{E}_{\pi_\theta}\left[\sum_{t=0}^{\infty}\gamma^{t}\,r(s_t,a_t)\right] $$

策略参数化为 $a_t \sim \pi_\theta(\cdot \mid o_t)$,系统动力学 $p(s_{t+1} \mid s_t, a_t)$,折扣因子 $\gamma \in (0,1)$。

观测与动作空间

Actor观测含基座角速度 $\omega_t^b$、重力方向 $g_t^b$、关节位置 $q_t$、关节速度 $\dot{q}_t$、上一步动作 $a_{t-1}$ 和高程图 $m_t \in \mathbb{R}^{L \times W \times 3}$(每格存机器人基座坐标系下3D坐标)。Critic额外接收无噪声基座线速度 $v_t^b$。动作为29维向量对应29个驱动关节,解释为标称站立配置 $\theta_{\text{stand}}$ 的偏移:$\theta_{\text{target}} = \theta_{\text{stand}} + a_t$。 $$ \theta_{\mathrm{target}}=\theta_{\mathrm{stand}}+a_t $$

高程图定义为 $m_t \in \mathbb{R}^{L \times W \times 3}$,其中 $L$ 和 $W$ 分别为地图长度和宽度,每格存储机器人基座坐标系下的3D坐标。

空间对齐局部特征提取

高程图 $m_t \in \mathbb{R}^{L \times W \times 3}$ 先经两层CNN提取空间对齐局部特征。不同于AME仅卷积高度值再拼接原始3D坐标,GLAD直接卷积3D坐标使位置线索从一开始就嵌入特征。两层均用零填充保持边界信息和与地形图的空间对齐——这对后续注意力模块锚定物理地图位置至关重要。

第一层卷积以步幅 $s$ 进行跨步下采样,将地形感知分辨率与编码特征分辨率解耦,输出粗网格 $(L/s) \times (W/s)$。第二层投影到统一嵌入维度 $D$,输出 $K_{\text{grid}} \in \mathbb{R}^{(L/s) \times (W/s) \times D}$。实现中 $L=33$、$W=21$、$s=2$、$D=64$,下采样后 $17 \times 11 = 187$ 个局部特征。

全局-局部注意力分解

局部特征 $\{k_i\}_{i=1}^N$ 经三步构建GLAD编码。第一步,全局注意力分支用注意力池化聚合所有局部特征为上下文向量。全局注意力logit $u_i = v^\top k_i + b_u$,归一化权重 $\alpha_i = \frac{\exp(u_i)}{\sum_j \exp(u_j)}$,上下文向量: $$ u_i = v^\top k_i + b_u, \qquad \alpha_i = \frac{\exp(u_i)}{\sum_{j=1}^{N}\exp(u_j)} $$

$$c = \sum_{i=1}^N \alpha_i k_i$$

第二步,将 $c$ 与本体感知嵌入拼接,线性投影为状态条件查询向量 $q \in \mathbb{R}^D$。对每个局部特征 $k_i$ 形成融合特征 $[q; k_i]$,计算相关性分数: $$ s_i = w^\top [q; k_i] + b_s, \quad i=1,\ldots,N $$ 仅保留top-K($K=32$)实现状态条件稀疏化。

第三步,保留的稀疏特征经MHA(16头)处理,以同一查询向量 $q$ 为query,产生细粒度落足相关特征 $f \in \mathbb{R}^D$。最终地形编码为上下文向量 $c$ 和落足特征 $f$ 的拼接,与本体感知一起输入策略网络。

方法流程总览

flowchart TD
    A[高程图 m_t 33x21x3] --> B[两层CNN 零填充 下采样s=2]
    B --> C[局部特征 17x11x64 = 187个]
    C --> D[全局注意力池化]
    D --> E[上下文向量 c 64维]
    E --> F[拼接本体感知嵌入]
    F --> G[状态条件查询 q 64维]
    C --> H[相关性评分 top-K=32稀疏化]
    G --> H
    H --> I[MHA 16头]
    G --> I
    I --> J[落足特征 f 64维]
    E --> K[拼接 c + f]
    J --> K
    K --> L[策略网络 MLP]
    M[本体感知] --> L
    L --> N[29维关节动作]

实验结果

训练设置

策略用PPO训练,Actor/Critic共享地形编码模块,隐藏层 [512, 256, 128]。高程图覆盖1.6m×1.0m机器人中心区域,0.05m分辨率。两阶段训练:第一阶段在基础地形(楼梯、随机网格、粗糙地形、斜坡、踏脚石、间隙)上用完美感知训练;第二阶段保留楼梯和间隙,替换为更挑战的稀疏落足点课程(平行行、单行、交替踏脚石布局、栏杆、随机圆柱障碍)。每阶段十级渐进课程,4096机器人并行,各10000次迭代。仅用标准运动奖励,避免手工落足奖励或地形特定塑形。

图1:Unitree G1真实世界运动结果。单一学习策略穿越稀疏踏脚石、楼梯-间隙复合地形、宽达70cm间隙和密集障碍地形。

训练效率

GLAD在单块H200上仅需1.00天完成两阶段训练,而AME需1.36天、AME w/全局上下文需1.50天。粗到细设计避免对全局部特征集施加MHA,在保持运动性能的同时显著降低计算开销。

未见地形性能

在四种严格未见的10m长时域测试地形上评估:复合踏脚石课程(a)、随机单行踏脚石(b)、不规则五边形柱(c)、正弦窄路径(d)。

方法(a)复合踏脚石(b)单行踏脚石(c)五边形柱(d)正弦窄路径
AME94.9293.7583.5925.00
AME w/全局上下文96.6891.9974.6142.58
GLAD w/o全局注意力80.0885.9486.9123.98
GLAD w/o局部注意力92.9793.5573.4418.95
GLAD95.5196.8891.2195.90

在踏脚石(a)(b)上所有方法表现尚可,但GLAD w/o全局注意力低于90%,确认仅靠细粒度落足特征不足以维持结构相似地形的性能。更大差距出现在(c)(d)。地形(c)中可行支撑密集但模糊,完整GLAD结合落足级精度与周围地形上下文保持90%以上成功率,而AME w/全局上下文因单一MHA纠缠两个目标稀释注意力浓度仅74.61%。地形(d)最苛刻需前瞻性方向调整,GLAD以95.90%大幅领先所有基线(最高42.58%)。消融证明全局和局部注意力分支互补——移除任一都显著降低性能。

图6:全局和局部注意力权重可视化。黄色和红色标记分别表示全局和局部注意力权重,强度越高越大。

注意力-落足对齐

记录触地事件的MHA注意力权重,比较注意力局部特征位置 $p_i$ 与实际落足位置 $p_f$。三个指标:注意力加权距离 $D_{\text{attn}} = \sum_i \alpha_i \|p_i - p_f\|$、峰值定位误差 $D_{\text{peak}} = \|p_{\arg\max \alpha_i} - p_f\|$、注意力浓度 $A_{\text{peak}} = \max_i \alpha_i$。

方法地形$D_{\text{attn}}$ ↓$D_{\text{peak}}$ ↓$A_{\text{peak}}$ ↑
GLAD连续0.137±0.0060.103±0.0060.257±0.029
GLAD离散0.133±0.0060.113±0.0060.447±0.035
AME连续0.400±0.0000.107±0.0120.073±0.006
AME-GC连续0.530±0.0100.140±0.0300.023±0.006

GLAD在连续地形上 $D_{\text{attn}}$ 仅0.137(AME 0.400、AME-GC 0.530),离散地形注意力浓度 $A_{\text{peak}}$ 达0.447(AME仅0.077),证明状态条件稀疏化使注意力高度集中于实际落足区域。AME的注意力分散在全局部特征上无法集中,这正是其落足精度受限的根本原因。

图3:第二阶段训练地形(最高课程难度),含稀疏踏脚石、栏杆、间隙和随机圆柱障碍。

真实世界部署

GLAD在Unitree G1上用机载LiDAR实现零样本sim-to-real迁移,穿越多样稀疏落足点和障碍密集区域。学习策略展现涌现的地形响应行为——在简单速度指令下自主跟随窄路径和避开障碍,无需显式导航规划器。

两阶段训练策略

GLAD采用两阶段训练渐进提升运动性能和地形表征质量。第一阶段在基础地形(楼梯、随机网格、随机粗糙地形、斜坡、踏脚石全覆盖和间隙)上用完美地形感知训练,初始化地形表征模块并让控制器从准确地形观测中习得基础运动技能。第二阶段保留楼梯和间隙,将较易的踏脚石全覆盖替换为更挑战的稀疏落足点课程——平行行、单行、交替踏脚石布局,加上栏杆和随机分布圆柱障碍地形。因此策略不仅需学会精确落足放置,还需学会穿越和避开障碍的地形响应运动调整。每阶段内采用十级渐进地形课程:成功穿越的机器人晋升更高级别,失败的降级。这种课程设计使策略从简单地形逐步过渡到复杂稀疏落足场景,避免训练崩溃。

域随机化与奖励设计

GLAD仅使用标准运动奖励,刻意避免手工落足奖励或地形特定塑形——这一设计选择旨在隔离地形表征质量对运动性能的贡献。观测噪声和域随机化主要在第二阶段引入,包括逐步观测噪声、地形图随机扫描漂移、人工推力以及躯干质量和接触摩擦系数随机化,无需地形特定调参。这种"不靠奖励工程靠表征质量"的理念是GLAD的核心主张:足够信息丰富的地形表征可以支撑稀疏落足点和复杂地形运动,而无需特别定制的奖励设计。所有方法在NVIDIA Isaac Sim中用相同机器人模型、观测设置、地形课程、奖励设计、域随机化和优化协议训练,每方法4096机器人并行两阶段各10000次迭代,确保公平对比。

可解释注意力分解

GLAD的注意力分解不仅提升性能,还提供可解释性。全局注意力权重可视化显示哪些地形区域被汇总到上下文向量——通常对应机器人周围的可通行走廊和障碍分布。局部注意力权重在触地事件中高度集中于实际落足区域,证明状态条件稀疏化有效引导注意力到运动相关的地形位置。这种可解释性对调试和理解策略行为有重要价值——不同于黑盒编码器,GLAD的注意力模式可直接验证是否与预期运动行为一致。在地形(d)正弦窄路径上,全局注意力捕捉到路径的弯曲趋势使策略能前瞻性调整方向,而局部注意力在每步精确锁定落足点——两者的协同是95.90%高成功率的基础。

涌现地形响应行为

GLAD的策略在简单速度指令下展现涌现的地形响应行为——自主跟随窄路径和避开障碍,无需显式导航规划器。这种行为的涌现源于第二阶段训练中随机分布圆柱障碍和窄路径课程,使策略学会在不改变高层速度指令的情况下根据局部地形几何调整运动方向。这与需要显式路径规划的传统方法形成对比,表明足够丰富的地形表征能让RL策略隐式学习导航能力。在真实世界部署中,这种涌现行为使机器人能在未见过的障碍布局中自主寻找可通行路径。

训练效率的对比也值得关注。GLAD仅需1.00天而AME需1.36天、AME-GC需1.50天,这种效率优势来自粗到细设计——跨步下采样将187个局部特征缩减后仅对top-K=32个施加MHA,而非AME对全部特征施加MHA。如果AME严格保持原始分辨率不下采样,其计算开销将显著更高。这种效率优势对实际研究具有重要意义,因为它降低了迭代实验的时间成本。

从注意力-落足对齐的定量分析中可以更深入理解GLAD的优势。在连续地形上GLAD的注意力加权距离 $D_{ ext{attn}}$ 仅0.137m而AME达0.400m、AME-GC达0.530m——这意味着AME的注意力平均偏离实际落足点40-53cm,而GLAD仅13.7cm。在离散地形上GLAD的注意力浓度 $A_{ ext{peak}}$ 达0.447而AME仅0.077——GLAD将近45%的注意力权重集中在最相关的单一特征上,AME仅7.7%。这种注意力集中度的巨大差异直接解释了GLAD在稀疏落足点地形上的 superior 性能:只有当注意力真正聚焦于落足候选时,策略才能精确放脚。

GLAD在正弦窄路径(d)上的95.90%成功率尤其引人注目——该地形要求机器人在保持前向速度指令的同时大幅偏离标称航向以跟随弯曲路径,AME最高仅42.58%。这证明全局注意力分支提供的周围地形上下文使策略能"看到"前方路径走向,而局部注意力确保每步精确落足,两者协同实现了无需显式规划器的路径跟随能力。

局限性

  1. 感知范围有限:高程图仅覆盖1.6m×1.0m机器人中心区域,对于需远距离路径规划的场景可能不足。窄路径上需前瞻性方向调整,但感知窗口限制了前瞻距离。
  2. 固定top-K阈值:稀疏化保留K=32个特征是固定值,对于地形复杂度变化大的场景可能不是最优。自适应K值或基于分数阈值的保留可能进一步提升性能。
  3. 依赖高程图质量:框架假设高程图可靠,但真实LiDAR的噪声、遮挡和漂移可能影响编码质量。域随机化虽缓解,但极端感知失效场景未充分验证。

总结与展望

GLAD提出全局-局部注意力分解用于人形感知运动的地形编码。通过粗到细编码器在机器人中心高程图上显式分离全局注意力(周围地形上下文)和局部注意力(精确落足几何),GLAD避免单一注意力机制的感知目标纠缠。实验证明GLAD在间隙、踏脚石、楼梯上实现稳健运动,在未见地形上显著优于AME和AME-2,学习策略展现涌现的地形响应行为,在Unitree G1上零样本迁移。

核心洞见在于:广阔地形感知和精确落足选择是两个本质不同的感知角色,将它们纠缠在单一注意力机制中会互相稀释。全局注意力用池化捕捉"周围有什么",局部注意力用稀疏化聚焦"脚该放哪"。这种显式分解不仅提升性能和训练效率,还产生可解释的注意力对齐——局部注意力高度集中于实际落足区域。状态条件稀疏化是关键创新:用当前运动状态引导查询向量,使注意力自动聚焦于可达且几何合适的落足候选。

金句

当"看见周围"和"看清脚下"不再由同一双眼睛同时承担,而是分工给两种注意力时,机器人终于能在稀疏落足点上既不迷失方向也不踩空。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
LAC:人形机器人全身线性与角度柔顺控制

LAC:人形机器人全身线性与角度柔顺控制

LAC 提出通用人形全身柔顺控制器:在人体交互数据接触帧上施加采样的力/力偶扰动合成大规模柔顺响应数据,经教师-学生强化学习训练单一策略,实现对上半身外力的线性与角度柔顺、刚度全程单调调制,并在仿真、真机与遥操作移动操作中验证。

人形机器人全身控制柔顺控制2026年8月26日
GigaBrain-WBC:人形机器人全身控制的行为世界模型

GigaBrain-WBC:人形机器人全身控制的行为世界模型

首个用于人形机器人全身控制的行为世界模型(BWM),训练因果Transformer联合预测下一步动作、状态和潜在行为指令分布,使策略网络同时建模环境对行为的影响。自动地形标注管线从重定向运动中恢复3D接触几何,部署时检测不合理指令并回退到已学行为,在四项测试中成功率最高(地形交互81.3%、不合理指令83.1%、跌倒恢复99.3%),Unitree G1检查点可迁移至Maker L01机器人。

人形机器人Humanoid世界模型2026年8月18日
LATENT:从不完美人类动作学习人形网球技能

LATENT:从不完美人类动作学习人形网球技能

LATENT 以碎片化、不完整的人类网球动作数据为先验,经修正与组合学出可稳定击球的人形策略,部署到 Unitree G1,能与人类进行多拍对拉。

LATENT人形机器人网球2026年3月13日