Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

humanoid locomotionperceptive locomotionteacher-student

SOLO:面向全地形长时域稳定感知的人形机器人运动

SOLO 提出 Query Reconstructor 与 Trajectory-Aware MSE Distillation,分别解决稠密地形重建抹平关键边界和逐点模仿缺少未来信用分配的问题;仅用一台胸前深度相机与本体感觉,在真实连续路线中完成 1.5 公里户外行走。

Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Yijie Guo, Qiang Zhang2026年8月27日3 分钟阅读
EN

论文:SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion
作者:Pihai Sun、Gang Han、Jingkai Sun、Jiahao Ma、Zeran Su、Zelin Tao、Peiran Liu、Shuai Shi、Wei Cui、Zifan Wang、Jialin Yu、Wen Zhao、Kangning Yin、Jiaxu Wang、Jiahang Cao、Lingfeng Zhang、Hao Cheng、Jian Tang、Yijie Guo、Qiang Zhang
链接arXiv:2608.26583
项目页sunpihai-up.github.io/solo
代码状态:截至论文发布时未提供公开代码仓库;项目页标注论文与链接为预览状态。

一句话总结

SOLO 用逐格查询式地形重建和轨迹感知蒸馏解决人形机器人长时域感知运动中的两类误差累积,仅凭一台胸前深度相机和本体感觉完成 1.5 公里连续户外行走。

研究背景:孤立障碍成功不等于长时域稳定

人类走过山路、台阶和稀疏落脚点时,感知与控制是闭环耦合的:每次落脚改变下个状态,校正动作又防止小错误演变为跌倒。人形机器人面对同样的反馈回路,但长时域部署会不断重复地形切换、视角变化和接触误差,局部错误因此可能累积。

当前主流做法是教师—学生强化学习:仿真中的特权教师看到真实高程图和状态,学生只使用机载深度图像与本体感觉,通过模仿教师获得可部署策略。这个范式在短试验中表现很好,因为每个 episode 会重置局部误差。可真实部署没有这么宽容,连续路线会反复触发误差复合。

SOLO 将长时域脆弱性拆成两个相互放大的问题。第一,稠密地形重建器常用 CNN–RNN 编码深度历史,再从共享表征解码局部高程图;共享瓶颈相当于低通滤波器,保留大尺度几何,却抹平台阶边缘、踏脚石边界等对动作至关重要的细节。第二,常规控制器蒸馏用当前状态的动作 MSE 匹配教师,无法区分当前误差相似但未来后果不同的动作;缺少轨迹级信用分配,学生可能走进后续难以跟教师对齐的状态。

论文的回应是两个互补机制。Query Reconstructor(QR)为每个高程图网格分配 Fourier 编码查询,从深度—本体感觉 token 记忆中检索该位置专属证据;Trajectory-Aware MSE(TA-MSE)把下一状态的教师—学生分歧加入 PPO 奖励,让 GAE 把未来惩罚传播回先前动作。

这套系统不依赖外部定位、地图或动捕。部署时只保留 QR 和学生策略,输入为四帧 D455 深度图、十帧本体感觉/控制历史和人类平面速度指令,输出 25 个关节目标,以 50 Hz 运行。

SOLO 户外长时域行走
论文图 1:SOLO 在自然台阶、坡地、草地过渡和不平整地面组成的连续户外路线上完成 1.5 公里单次部署。

系统设定与预备知识

仿真状态 $s_t$ 下,特权教师观测 $o_t^T=(m_t,v_t,p_t)$。这里 $m_t$ 是干净局部高程图,$v_t$ 是实际基座速度,$p_t=[\omega_t^b,g_t^b,c_t,q_t,\dot q_t,a_{t-1}]\in\mathbb{R}^{84}$ 包含角速度、重力方向、速度指令、关节位置、关节速度和上一动作。学生只看到 $o_t^S=(D_{t-T_d+1:t},p_{t-T_p+1:t})$,即深度图历史和本体感觉历史。

教师 $\pi_T$ 与学生 $\pi_S$ 共享 Attention-based Map Encoder(AME)骨干;学生额外加入 LSTM 本体感觉旁路,用于保留 rollout 历史。QR 把学生观测映射为 $(\hat m_t,\hat v_t)$,学生再结合本体感觉生成动作分布。两者都输出相对默认关节位置的 25 维偏移。

训练分三个阶段。第一阶段训练 AMP 正则化 PPO 特权教师;第二阶段只迁移形状兼容的 AME 参数,学生在仍使用特权地形输入的条件下用 TA-MSE 蒸馏;第三阶段用 QR 估计替换特权地形状态,联合微调学生,并从 QR 条件学生的 on-policy buffer 更新 QR。这个顺序很关键:QR 的监督来自 QR 条件学生实际访问的状态,而不是教师状态分布。

Query Reconstructor:每个网格自己提问

QR 的输入是可部署观测,输出是机器人中心局部高程图和基座速度。它不把所有位置塞进一个共享解码瓶颈,而是让每个地图网格都拥有一个空间查询,主动从传感器历史记忆中取回自己需要的证据。

传感器记忆的构造分两路。轻量 ResNet 编码每帧深度图为视觉 token;每帧 MLP 编码本体感觉,并加入可学习时间位置嵌入。两组 token 拼接后进入 Transformer encoder,得到 $M_t$。这样视觉证据、接触相位和机器人运动被放在同一个上下文里解释。

设地图有 $N=G_xG_y$ 个网格。每个网格的平面坐标先做 Fourier 编码,再投影为查询 $q_i$。$N$ 个查询通过多层多头 cross-attention 访问 $M_t$;高度头把解码后的 $q_i'$ 映射为该格高度 $\hat h_i$。一个独立速度查询访问同一记忆,解码出三自由度基座速度 $\hat v_t$。

重建目标为:

$$\mathcal{L}_{rec}=\lambda_h\frac{1}{N}\sum_{i=1}^{N}|\hat h_i-h_i^{GT}|+\lambda_v\|\hat v_t-v_t^{GT}\|_1$$

该项同时约束逐格高度误差和速度误差。第三阶段中,策略更新使用 detach 的 QR 预测,重建更新只优化 QR,避免策略梯度被重建监督干扰。

SOLO 架构总览
论文图 2:训练时特权教师在学生访问状态上提供动作目标;部署时只保留 QR 和学生策略。
flowchart LR
  A["深度历史
D455"] --> C["ResNet 视觉 token"] B["本体感觉历史
84 维 / 10 帧"] --> D["MLP + 时间位置"] C --> E["Transformer sensor memory Mt"] D --> E F["每个高程格
Fourier query"] --> G["cross-attention 解码"] E --> G G --> H["逐格高程图 m_hat"] E --> I["速度 query"] I --> J["基座速度 v_hat"] H --> K["AME 学生策略"] J --> K B --> L["LSTM 旁路"] L --> K K --> M["25 关节目标 @50Hz"]

TA-MSE:把未来分歧变成今天的奖励

常规 MSE+PPO 在学生 rollout 上加入当前状态动作匹配:

$$L_{aux}(\theta)=\mathbb{E}_t\left[\|\mu_\theta(h_t^S)-\mu_T(o_t^T)\|_2^2\right]$$

这个目标逐样本独立,不知道当前动作会改变后面访问什么状态。TA-MSE 保留该辅助损失,同时在系统从 $s_t$ 转移到 $s_{t+1}$ 后评估两个策略在学生实际到达状态上的分歧:

$$\bar\ell_{t+1}=\operatorname{sg}\left(\|\mu_\theta(h_{t+1}^S)-\mu_T(o_{t+1}^T)\|_2^2\right)$$

其中 $\operatorname{sg}$ 表示 stop-gradient 并直接存储该值。于是训练奖励变为:

$$r_t^{TA}=r_t^{task}-\beta\bar\ell_{t+1}$$

这样,上一转移的动作立即对它造成的下一状态分歧负责。更重要的是,PPO 的 return 和 GAE 会把后续惩罚沿着采样轨迹向前传播,不需要额外 critic、动力学模型或教师 rollout。

对动作 $a_t$,轨迹加权模仿回报为:

$$G_t^{imit}=-\beta\sum_{k=t+1}^{T_R}\gamma^{k-t-1}\operatorname{sg}[\bar\ell_k]$$

统一策略目标为:

$$\max_\theta J_{PPO}(\theta;r^{TA})-\lambda L_{aux}(\theta)$$

当 $\lambda=0,\beta=0$ 时退化为 PPO;$\lambda>0,\beta=0$ 是 MSE+PPO;$\lambda>0,\beta>0$ 才是 TA-MSE。这个参数化让实验中的三类控制器目标可以被统一定义。

真实机器人部署

SOLO 是命令条件式策略:操作者只提供平面 joystick 速度 $c_t$,地形感知和全身控制由策略完成。论文在 Omni 平台上做零样本部署,没有外部状态、地图或动捕。孤立地形测试中,七类地形每类十次,总体 69/70 成功,只有一次踏脚石失败。

真实世界孤立地形成功率
地形成功率
上楼梯10/10
下楼梯10/10
20° 坡10/10
40cm 高台10/10
50cm 沟壑10/10
可移动物体10/10
踏脚石9/10
总计69/70

户外路线包含自然台阶、坡地、草地过渡和不平整地面,单次连续完成 1.5 公里,没有策略重置或人工帮助。室内混合路线则把上楼梯、踏脚石、沟壑、下楼梯和可移动物体集中到一个连续课程中,同样无重置通过。

室内混合地形连续部署
论文图 3:一次连续运行穿过上楼梯、踏脚石、沟壑、下楼梯和可移动物体。

论文还对比了已报告硬件设置:AME 使用 Qualisys 与网格;CReF 使用一台深度相机;RPL 使用两台硬件深度相机并报告 50m 路线与旋转楼梯;SOLO 使用一台深度相机,报告踏脚石、1.5km 户外路线和超过 100 级楼梯的连续上升。这个对比并不等于完全同一协议下的成绩,但显示了硬件感知和长时域证据的上下文。

重建精度与踏脚质量

在固定教师、任务、课程、训练预算和蒸馏目标的前提下,论文比较 START 式循环稠密解码器、DPL 式 cross-attention 重建器和 QR。指标为最高课程难度下的逐格 L1 误差。

on-policy 高程图重建误差(cm,课程难度 0.99)
方法GAP随机网格下25下35上25上35踏脚石高台平均
START10.115.188.355.328.105.5414.763.317.59
DPL10.628.0911.747.4710.687.5712.755.169.26
QR2.272.432.031.471.891.315.920.972.29

QR 将平均误差从 7.59/9.26cm 降到 2.29cm,即 3.3–4.0 倍降低。踏脚石上的绝对改进最大,因为局部高度不连续对逐格保真度最敏感。论文的离线协议还报告 QR 总体 L1 为 2.98±0.07cm,Edge F1@1 为 0.386±0.008;START/DPL 分别为 4.32–4.36cm 和 0.214–0.242。

重建精度与足部惩罚
论文图 4:不同重建器在难度上升时的重建误差与足部碰撞、跨越高度边界的惩罚对比。

泛化测试中,所有重建器都在 8m 场景训练,并评估匹配 8m 与未见 10m 场景。难度 0.99 时,QR 误差从 0.020m 增至 0.043m;DPL 从 0.117m 增至 0.271m,START 从 0.084m 增至 0.264m。未见 10m 场景上,DPL 和 START 分别为 QR 的 6.2 倍和 6.1 倍,说明 QR 对地形范围变化更稳。

课程进展与最高难度成功

蒸馏课程实验在引入 QR 前的第二阶段完成,教师、特权地图输入、课程、初始化和训练预算均相同。指标是训练期间达到的平均课程等级。TA-MSE 达到约 5.5 的课程上限;MSE+PPO 在约 5.1 停滞,PPO 低于 5.0 且振荡更大。低难度时三者接近,高难度时未来分歧信号的价值开始显现。

蒸馏课程进展
论文图 5:固定教师与特权地图输入时,TA-MSE 在基线平台期后继续推进并达到课程上限。

最高难度地形实验固定 TA-MSE,比较不同重建器。QR 将平均成功率从 75.0–75.6% 提升到 97.5%,最差地形成功率从 0–3% 提升到 92%。踏脚石上 QR 为 96%,START 为 3%,DPL 为 0%。足部碰撞与跨越高度边界惩罚也最低:START 和 DPL 的两类惩罚分别是 QR 的 1.78–7.40 倍和 1.94–10.83 倍。

最高难度成功率
论文图 6:课程难度 0.99、每地形 100 次 rollout 的成功率比较。

局限与批判性解读

第一,前方深度相机存在后方盲区。作者明确指出,前向相机在后向运动或地形变化时无法覆盖身后几何。LF2WB 式更长寿命记忆可以保留视野外的落脚点信息,但 SOLO 尚未引入。

第二,2.5D 高程图只能表示每个网格一个地面表面。对透明、反射表面或多层结构,深度和高程表示会被破坏。作者提出互补传感与 volumetric 地形表示是扩展方向。

第三,系统仍是命令条件式,不是自主导航。操作者提供平面速度指令,策略负责感知与控制。这意味着路线级决策、避障和目标理解仍在系统之外,不能把 1.5km 行走等同于完整自主移动。

第四,跨方法硬件比较不完全同协议。表 2 整理的是各论文报告的硬件设置和任务证据,硬件平台、传感器、课程与评估协议不同。它提供上下文,但不能当作严格排名。

第五,公开代码缺失。项目页目前是 preview,未提供代码和正式 BibTeX。读者可以复现实验设置的思想,但完整训练细节、环境配置和网络实现还需等待发布。

总结

SOLO 的贡献不是简单把更多传感器装到机器人上,而是重新审视教师—学生管线中两个容易被忽视的误差来源:共享解码器抹平局部几何,逐点模仿缺少未来信用。QR 用逐格查询保留边界;TA-MSE 用下一状态分歧改造 PPO return。二者分别作用于感知输入和训练信号,因此可以互补。

实验链条比较完整:重建误差降低、足部质量惩罚降低、课程等级更高、最高难度成功率提升,再到 1.5km 零样机外部署。这种从组件到系统的对应关系比单一总分更有说服力。

对于后续工作,最自然的方向是把 QR 换成长时记忆或多视角表示,把 2.5D 地图换成体积表示,并把命令条件控制接入自主规划。作者已点出其中前两条;第三条是走向真正室外自主系统的必要步骤。

长时域稳定不是把每一步做对,而是让每一个错误在变成跌倒之前,已经被未来反馈回来。