PAPER DEEP DIVE
架构即一切:鲁棒人形运动的多样性使能甜蜜点
非结构化环境中鲁棒的人形运动需要平衡快速低级稳定和较慢感知决策的架构。本文展示了一种简单的分层控制架构——高频本体感知稳定器与紧凑低频感知策略相结合——能够实现更鲁棒的运动。核心思想是架构设计本身就能创造鲁棒性的甜蜜点。
Architecture Is All You Need:多样性使能的鲁棒人形机器人行走甜点
arXiv:2510.14947(2025-08)|领域:人形机器人行走/分层控制|平台:Unitree G1|IsaacSim 4096 并行环境|单 RTX 4090
一句话总结
论文论证并实证:鲁棒的人形机器人行走不需要复杂模型,而需要分层多速率控制架构(LCA)——高速本体感知稳定器(快层)配合低速紧凑感知策略(慢层),通过两阶段课程(先盲训稳定器再加感知微调)训练;在 Unitree G1 上,两阶段分层策略在楼梯和台阶任务上成功而单阶段感知策略失败,证明架构分离(而非网络规模或复杂度)才是鲁棒性的关键使能器。
研究背景与动机
非结构化环境中的鲁棒人形行走是一个与平台本身一样古老却仍未解决的问题。地形感知是部分且嘈杂的,接触事件是不连续的,控制器必须比感知能解析细节的速度更快地反应。数十年的制导-导航-控制(GNC)实践启示了一个简单教训:鲁棒性源自快速低层稳定与慢速长视界导航的配对。典型例子是航空航天 GNC:慢的语义制导层决定去哪,中速率轨迹生成层把目标转为可行参考,快反馈控制层跟踪参考并抑制扰动。这种"慢而灵活"在上、"快而刚性"在下、带明确接口的模式,在机器人和生物感觉运动系统中反复出现。
论文把这一观察推到逻辑极端,主张对于高维感知条件控制问题,分层控制架构(LCA)是鲁棒性的主要驱动因素。复杂模型、学习世界表示或精细奖励塑造有助于榨取最大绝对性能,但当栈本身良态时并非任务成功所必需。在良态 LCA 中,信息通过窄接口流动:参考下行(规划器→控制器),跟踪误差或状态上行(控制器→规划器)。关键是各层以不同时间尺度运作——既减少计算负担又通过让每层专精其最有效之处提升鲁棒性。
LCA 中层的分离加上异构目标和信息,实现了"多样性使能的甜点"(DeSS):组合栈能超越任何单独调优的单体组件。对于感知条件人形行走,LCA 框架暗示一个最小却充分的栈:(i) 紧凑的局部感知导航编码器以中速率更新,构造反映长视界地形几何的隐空间;(ii) 快速稳定器用本体感知条件化于该几何并应对接触变异性。
图1:人形机器人通过结合感知信息与快速本体感知信息穿越复杂地形。有效利用这些输入需要结构化架构以产生高性能鲁棒结果。
方法详解
优化分析:单阶段 vs 两阶段
单阶段 RL 把全局最优控制表述为:
$$\theta^* = \max_\theta \mathbb{E}\left[\sum_k \gamma^k r(s_k, a_k \mid \theta)\right]$$
这虽试图求解全局最优,但对初始条件高度敏感。两阶段方法把参数分为 $\theta = [\theta_x, \theta_y]^T$(快参数 $\theta_x$、慢参数 $\theta_y$),先解快层:
$$\theta_x^\dagger = \max_{\theta_x} \mathbb{E}\left[\sum_k \gamma^k r(s_k, a_k \mid \theta_x, \theta_{y,0})\right]$$
第一阶段移除感知($\theta_{y,0}$ 不依赖),允许更简单的优化更易找到满意局部最大。第二阶段再联合优化:
$$\theta_x^*, \theta_y^* = \max_{\theta_x, \theta_y} \mathbb{E}\left[\sum_k \gamma^k r(s_k, a_k \mid \theta_x, \theta_y)\right] \quad \text{s.t.} \quad \theta_{x,0} = \theta_x^\dagger$$
在严格凹奖励景观下两阶段与单阶段同解,但在高度非凹景观中,第一阶段的好初始化使优化不易被坏的局部最大吸引。两阶段训练让网络在结构上假设分层控制角色,即使网络架构本身可能与单阶段相同。
图2:训练与部署概览——actor 和 critic 都是两阶段架构各有感知编码器;actor 收噪声高度图,critic 收完美信息;部署时深度图经滤波通过训练好的编码器,actor 结合本体感知历史决定动作。
观测与归一化
设 $q$ 为关节位置、$\dot{q}$ 关节速度、$g_b$ 体系投影重力、$\omega_b$ 体系角速度、$a_{k-1}$ 上次动作、$u$ 指令平面速度。本体观测为 $K$ 长度历史 $o_k = [q_k, \ldots, q_{k-K}, \dot{q}_k, \ldots, \omega_{b,k}, \ldots, g_{b,k}, \ldots, u, a_{k-1}]$。Actor 观测 $o_k^\pi = [o_k, H^\pi]$,其中 $H^\pi \in \mathbb{R}^{11 \times 11}$ 是覆盖机器人周围 1.0m×1.0m 的噪声稀疏高度图。Critic 观测 $o_k^V = [o_k, v_{\text{base}}, H^V]$,含世界系体速度和更大更准确的 1.5m×1.5m 零噪声高度图。高度图均减网格均值并裁剪到 $[-1, 1]$,零中心化消除 sim-to-real 稳态偏移。
网络架构
两主组件:感知编码器(把高度图编码为隐表示)和主 actor 网络(结合隐感知与本体感知决定动作)。编码器为小 CNN 或 MLP,把 $H \in \mathbb{R}^{N \times N}$ 映射到 $z_H \in \mathbb{R}^{d_H}$。Actor 为 LSTM 或 MLP(隐藏层 {512, 256, 128}),输出关节位置设定点由 PD 控制器跟踪。消融 CNN vs MLP 以检验空间编码是否优于简单模型。
奖励设计
奖励含相位-接触一致性、足击打成本、足滑动成本、足朝向(平坦)成本、足间隙成本,以及标准行走奖励。相位-接触一致性奖励用 XNOR 一致性:
$$r_{\text{phase}}(k) = 2 - \sum_{i \in \{L,R\}} |c_i(k) - s_i(k)|$$
足击打成本惩罚横向地面反力:$r_{\text{strike}} = \sum_i \|\mathbf{F}_i^{xy}\|_2$。足滑动成本抑制站立期平面滑动:$r_{\text{slide}} = \sum_i \mathcal{C}_i(k) \|\mathbf{v}_i^{xy}(k)\|_2^2$。足朝向成本鼓励接触时平足:$r_{\text{orient}} = 1 - \exp(-k_\theta \sum_i \mathcal{C}_i(k) |\theta_{i,\text{pitch}}|)$,$k_\theta=25$。总奖励为各项加权和:
$$r = r_{\text{locomotion}} + 0.5\, r_{\text{phase}} - r_{\text{strike}} - 0.2\, r_{\text{slide}} - r_{\text{orient}} + r_{\text{clear}}$$
两阶段课程
阶段1(盲稳定):设 $H \equiv 0$(actor 无感知,critic 仍有完整信息),在上楼/下楼/不平地形/平地各四分之一的环境中训练,强调稳定化。阶段2(感知关键):重新启用 $H$,允许机器人基于局部地形做长视界规划——即把盲策略条件化于感知环境。
图3:分层 vs 单体架构——网络架构可能相同,但两阶段训练使它们承担分层控制结构。
实验结果
仿真实验
在 IsaacSim 单 RTX 4090 上 4096 并行环境训练,非对称 actor-critic 算法到 40000 步。比较 7 个变体:盲基线、3 个单阶段感知模型、3 个两阶段模型。训练批次为上楼25%/下楼25%/不平25%/平地25%平衡混合。
在中等(分布内)设定下所有策略近乎持平,残差在运行间变异内。但分布外(OOD)效应更揭示性:楼梯 OOD——两阶段变体的接触/步比单阶段低约 3×,更接近盲基线;机制是噪声感知下两阶段策略回退到阶段1学的鲁棒盲稳定器,而单阶段更依赖高度图做规划和稳定,导致偶发不良落脚。不平地形 OOD——两阶段比单阶段成功率高约 10 个百分点,因为不平地形难以记忆,鲁棒性需同时具备快速稳定和长视界放置——两阶段显式分离并协同训练这些能力,单阶段则将其纠缠。
| 设定 | 单阶段 vs 两阶段 | 关键差异 |
|---|---|---|
| 中等(分布内) | 近乎持平 | 残差在运行间变异内 |
| 楼梯 OOD | 两阶段接触/步低 3× | 两阶段回退盲稳定器 |
| 不平地形 OOD | 两阶段成功率高 ~10pp | 分离稳定与长视界放置 |
表1:仿真 OOD 结果汇总——架构分离的收益在分布外显现。
硬件实验
在 Unitree G1 上评估四个任务:上楼、下楼、铰接台阶、软台阶。楼梯三级( riser ~18cm)带 ~25° 水平偏斜,主要测试导航(长视界落脚/速度规划)。台阶任务 36cm 高差带瞬态顺应性(铰接版为支点上的板,软版落在体操垫上),主要测试控制(瞬态下快速稳定)。每任务每策略 5 次试验。
关键观察:(1) 单阶段 MLP 跨地形表现差,落脚选择常看似合理但稳定化快速退化——与过度依赖噪声高度图做低层控制一致;(2) 盲策略在台阶(控制主导)任务上表现好但在楼梯(需精确边缘感知放置)上频繁失败;(3) 两阶段策略(MLP 和 CNN+MLP)在导航和控制主导任务上均类似且鲁棒——支持核心主张:一旦分层结构到位,具体编码器和骨干选择重要性降低。
图4:各策略的训练奖励——训练中所有策略表现大致相同,差异在 OOD 部署时才显现。
图5:硬件实验场景与结果。
| 策略变体 | 感知 | 训练 | 楼梯 OOD 表现 | 不平地形 OOD 表现 |
|---|---|---|---|---|
| 盲基线 | 无 | 全程无感知 | 楼梯失败(缺边缘感知) | 依赖稳定化 |
| 单阶段 MLP | 高度图 | 全程有感知 | 接触/步高 | 成功率低 ~10pp |
| 单阶段 CNN | 高度图 | 全程有感知 | 类似单阶段 MLP | 类似 |
| 两阶段 MLP | 高度图 | 盲→感知 | 接触/步低 3× | 成功率高 ~10pp |
| 两阶段 CNN+MLP | 高度图 | 盲→感知 | 接触/步低 3× | 成功率高 ~10pp |
表2:五种策略变体在 OOD 设定下的对比——两阶段不论编码器选择均显著优于单阶段。
从 DeSS 理论的深层逻辑看,"多样性使能的甜点"的核心在于异构组件的组合能超越任一单体。在 LCA 中,快层(稳定器)和慢层(导航)的信息预算和速率不同:快层以高速率处理高频本体感知但视野狭窄(仅当前状态历史),慢层以低速率处理低频感知但视界更长(高度图编码未来地形)。这种异构性使组合栈能同时覆盖"快速反应"和"长视界规划"两个维度,而单体网络因在统一速率和信息预算下运作难以兼顾。两阶段训练通过先固化快层再引入慢层,显式地塑造了这种异构分工,避免了单阶段中两层能力的纠缠退化。
从两阶段优化的非线性景观视角看,论文的核心论证可进一步阐释。人形行走的奖励景观高度非凹,充满坏的局部最大(如"不迈步也能站住"的平庸解、"靠感知记忆特定地形"的过拟合解)。阶段1盲训通过移除感知简化了优化,使快层先找到鲁棒稳定解(好的局部最大),阶段2以此为初始化引入感知时,优化倾向于在稳定解附近做感知增强而非重新搜索。这解释了为何两阶段在 OOD 下能"回退"到盲稳定器——因为阶段1的稳定解是优化的主吸引子,阶段2只是在其上叠加感知条件化。
从硬件实验的任务设计智慧看,四任务巧妙分离了导航主导与控制主导能力。楼梯任务(带水平偏斜的窄台阶)主要测试长视界落脚规划——必须提前感知台阶边缘并规划落脚点;台阶任务(铰接板和软垫)主要测试瞬态扰动下的快速稳定——感知看到的名义台阶与实际接触的顺应行为不匹配,稳定器必须快速反应。盲策略在台阶上强(控制主导)但楼梯上弱(缺导航),单阶段在两者上都弱(稳定化退化),两阶段在两者上都强——这一交叉模式精确验证了分层架构同时覆盖导航与控制能力的论点。
从与端到端潮流的对比看,这项工作的立场鲜明且具争议性。端到端学习主张让网络从原始感知到关节力矩一体化学习,理论上可发现人类未设计的最优策略。但论文的经验证据表明,在非结构化地形行走这一高维非凹问题上,端到端的单体网络容易陷入稳定化与导航纠缠的坏局部最大,而分层架构通过结构先验引导优化走向更好的解。这不是否认端到端的价值,而是指出在安全关键的实时控制中,结构化的分层设计可能比纯端到端更可靠——尤其当部署环境超出训练分布时。
从评估方法论的严谨性看,论文在仿真和硬件两个层面设计了互补的验证策略。仿真用 4096 并行环境和 500 单元×3 回合的统计性评估量化成功率/接触率/跟踪误差,确保结论非偶然;硬件用精心设计的四任务交叉矩阵(导航主导 vs 控制主导)和 5 次重复试验验证 sim-to-real 迁移。尤其值得称道的是硬件任务对导航与控制能力的解耦设计——通过任务类型而非单一指标来隔离不同能力,使架构优势的归因更具说服力。这种分层评估策略本身也体现了 LCA 思想:仿真做广度统计(慢层),硬件做深度验证(快层)。
从奖励设计的工程细节看,相位-接触一致性奖励的 XNOR 设计巧妙地把步态相位与实际接触绑定,既惩罚过早/过晚接触又奖励正确时序。足平坦成本用指数饱和 -\exp(-k_ heta \cdot | heta|)$ 而非线性惩罚,避免了大角度时的梯度爆炸。足间隙成本用 $ anh$ 门控按步态活动调制,使静止时不过度惩罚。这些细节虽非论文核心贡献,但体现了让简单架构奏效所需的工程精度——分层架构释放了对复杂模型的需求,但对奖励工程的精度要求并未降低。
系统架构 Mermaid 图
flowchart TB
subgraph Slow["慢层 导航(低速率)"]
HM["高度图 H
11x11 噪声 1.0m"]
ENC["感知编码器
CNN/MLP -> z_H"]
NAV["导航隐表示
长视界地形几何"]
end
subgraph Fast["快层 稳定器(高速率)"]
PRO["本体感知历史 o_k
q/dot_q/omega/g_b/u/a"]
ACT["Actor 网络
LSTM/MLP {512,256,128}"]
PD["PD 控制器
关节位置设定点"]
end
subgraph Train["两阶段课程"]
S1["阶段1 盲稳定
H=0 只训快层"]
S2["阶段2 感知关键
启用H 联合训练"]
end
HM --> ENC --> NAV --> ACT
PRO --> ACT --> PD
S1 --> ACT
S2 --> ENC
S2 --> ACT
局限性
导航/制导层被假设给定。论文的最小 LCA 只实现两层核心(稳定器+导航),制导层(更高层目标决策)被假设给定。完整的 GNC 栈还需顶层语义制导,论文未涉及。
感知接口极简。仅用 11×11 局部高度图作为感知接口,未处理更复杂的感知(如 RGB 语义、远距离地形预测)。虽然证明了最小接口的充分性,但更复杂场景可能需要更丰富的感知。
未处理感知延迟。为简化和一致性未纳入感知延迟或延迟建模,但真实部署中感知延迟可能影响分层架构的时间尺度分离有效性。
两阶段优化的理论保证有限。虽然直观上两阶段提供好初始化避免坏局部最大,但论文未给出严格收敛性保证,非凹景观中的优势主要为经验观察。
总结与展望
论文论证并实证:鲁棒人形行走的关键不是模型复杂度而是架构分层——高速本体感知稳定器与低速紧凑感知策略通过两阶段课程训练,在 Unitree G1 上成功完成单阶段失败的任务。核心洞见是"多样性使能的甜点":不同层以不同速率和信息预算处理信息,组合栈超越任何单体组件。一旦分层结构到位,具体编码器和骨干选择重要性降低——这解释了为何简单架构配合分层训练能匹配依赖更丰富模型的近期方法。
从更广阔的视角看,这项工作是对当下"端到端大一统"潮流的有力反题。它提醒机器人学界:生物学和经典 GNC 几十年的分层智慧不应被端到端学习的便利性掩盖。分层架构的鲁棒性来自信息瓶颈和时间尺度分离——快层不受慢噪声污染,慢层不被快瞬态干扰。这种"结构先于规模"的思想,可能比堆叠更大模型更具工程实用价值。当人形机器人走向真实非结构化环境,分层多速率栈或许是比单体网络更可靠的部署范式。
金句
"架构分离而非网络规模或复杂度,才是鲁棒感知条件行走的关鍵使能器。"
"鲁棒性来自信息瓶颈和时间尺度分离——快层不受慢噪声污染,慢层不被快瞬态干扰。"



