PAPER DEEP DIVE
CReF:跨模态与循环融合的视觉条件人形运动
CReF 提出单阶段、直接以深度图+本体感知映射到关节目标的视觉人形运动框架:本体感知查询的跨模态注意力、门控残差融合与 GRU 高速公路门控循环融合从原始前向深度提取运动相关特征,并引入基于足端点云可支撑候选的地形感知落脚奖励。仿真中在楼梯/间隙/平台三类地形全部难度档取得领先,零样本部署到 AGIBOT X2 Ultra,在带扶手楼梯、镂空托盘、强反光与杂乱户外场景中稳定行走。
一句话总结
CReF 是一个单阶段、深度图条件化的人形机器人运动策略:它不借助高度图等显式几何中间表示,而是用本体感知引导的跨模态注意力、门控残差融合与带高速门控的循环融合,把前向深度图直接映射为关节位置目标,并辅以地形感知落脚点奖励,在仿真与真机上实现楼梯、缺口、平台等地形的鲁棒穿越与零样本迁移。
研究背景与动机
人形机器人要在以人为中心的环境中执行多样移动任务,深度强化学习已经让多种平台获得了敏捷的站立与行走能力。以本体感知为主的策略通过反应式稳定控制即可取得不错的基线表现,但当安全通行依赖于在接触发生之前预判地形几何结构时,外感知就变得不可或缺。楼梯场景尤为典型:下楼时脚踏位置一旦出现偏差,极易发生踩边、打滑甚至摔倒,缺口与突变高度处同理。
把外感知引入运动控制的一条主流路线,是经由显式的 2.5D 地形表示做中介:早期系统用地形图支撑落脚点选择与预测控制,后续学习方法让控制器以地形图或地形观测为条件,注意力地图编码器进一步允许策略关注未来可踏足区域。这条路线的优点是接口紧凑、可解释,且有线上高程建图等成熟工具支撑;缺点则是控制性能被中间表示的保真度与表达力牢牢绑住——2.5D 高程本质上无法表达悬垂结构、垂直方向的杂乱障碍与穿孔物体。
另一条路线直接以深度图作为外感知输入,但往往仍依赖辅助监督目标来塑造深度分支的学习:由于前向深度相机只能提供前瞻几何线索、看不到脚下瞬时区域,这些方法用地形重建、解码器约束的隐状态估计或特权教师迁移来正则化深度表征。结构化监督确实改善了优化与迁移,却也让表征被锚定在辅助目标自身的归纳偏置上——当目标是高度图、几何代理或已建立在这类抽象之上的教师时,编码器主要被奖励去保留支撑该目标的信息,超出其表示范围的场景结构则被自然弱化。用论文的话说,中间表示的盲区并没有被消除,而是经由监督被继承了下来。
近期已有人形工作尝试更直接的路线:端到端策略直接消费原始深度与本体感知,用深度历史帧缓解部分可观测性;同时投入大量精力缩小深度传感的 sim-to-real 差距,例如面向迁移的训练设计与模拟立体视觉伪影、标定不确定性的真实传感器仿真。这些技术有效但提高了训练复杂度,并可能把鲁棒性偏向所假设的伪影分布。CReF 正是在这一背景下提出的:能否完全不引入显式几何中介与多阶段监督,单阶段地从原始前向深度中学到与运动相关的特征,并直接迁移到真机?
预备知识:平台与训练框架
CReF 的部署平台是智元 AGIBOT X2 Ultra 人形机器人,官方规格为身高约 1.31 m、体重约 39 kg、峰值关节扭矩 120 Nm。机上感知为一台向前安装的 Intel RealSense D435i 深度相机,俯仰角向下 35°,策略推理运行在 NVIDIA Jetson AGX Orin 上。训练在 Isaac Gym 中以 4096 个并行环境完成,控制频率 50 Hz,深度流以 64×48 分辨率、20 Hz 更新,单张 RTX 4090 训练约 30 小时(20000 次迭代),优化算法为 PPO。为了支撑大批量训练,深度渲染用 NVIDIA Warp 实现:机器人连杆被近似为胶囊,自遮挡通过 GPU 上的首次命中射线-胶囊求交计算,训练全程不注入任何合成深度扰动。
框架采用非对称 actor-critic 结构。策略网络(actor)在每个控制步只使用机载可得的信息:本体感知观测 $\mathbf{o}^{p}_{t}$ 与前向深度图 $\mathbf{D}_{t}\in\mathbb{R}^{H\times W}$,整体观测为
$$\mathbf{o}_{t}=\big(\mathbf{o}^{p}_{t},\;\mathbf{D}_{t}\big).$$
本体感知观测按腿足运动的惯例组织:
$$\mathbf{o}^{p}_{t}=\Big[\boldsymbol{\omega}_{t},\;\mathbf{r}^{\mathrm{grav}}_{t},\;\mathbf{u}^{\mathrm{cmd}}_{t},\;\mathbf{q}_{t}-\mathbf{q}_{0},\;\dot{\mathbf{q}}_{t},\;\mathbf{a}_{t-1}\Big],$$
其中 $\boldsymbol{\omega}_{t}$ 是基座角速度,$\mathbf{r}^{\mathrm{grav}}_{t}$ 是体坐标系下的重力方向,$\mathbf{u}^{\mathrm{cmd}}_{t}$ 是运动指令,$\mathbf{q}_{t}$、$\dot{\mathbf{q}}_{t}$ 是关节位置与速度,$\mathbf{q}_{0}$ 是标称站立姿态,$\mathbf{a}_{t-1}$ 是上一时刻动作。价值网络(critic)则在仿真中非对称地接收特权信息,除 $\mathbf{o}^{p}_{t}$ 外还包括真值基座线速度 $\mathbf{v}_{t}$ 与机器人中心的局部地形高度观测 $\mathbf{m}_{t}$:
$$\mathbf{s}_{t}=\big[\mathbf{o}^{p}_{t},\;\mathbf{v}_{t},\;\mathbf{m}_{t}\big].$$
动作空间采用围绕标称姿态的残差参数化,策略输出 $\mathbf{a}_{t}\in\mathbb{R}^{n_{a}}$ 由低层 PD 控制器跟踪:
$$\mathbf{q}^{\mathrm{target}}_{t}=\mathbf{q}_{0}+\mathbf{a}_{t}.$$
方法详解
奖励函数。训练奖励遵循近期关于鲁棒人形奖励设计的分析,包含低速感知的线速度跟踪项与接触整形项(站立时给予奖励、运动时鼓励短时程单脚接触)。论文表 I 列出 21 项奖励,正向项包括:线速度跟踪 $\exp\!\left(-\frac{\mathbb{I}_{s}\|\mathbf{e}_{v}\|_{1}+(1-\mathbb{I}_{s})\|\mathbf{e}_{v}\|_{2}^{2}}{\sigma_{v}}\right)$(权重 2.5,$\mathbf{e}_{v}=\mathbf{u}^{\mathrm{cmd}}_{xy}-\mathbf{v}_{xy}$ 为平面速度跟踪误差,指令速度低于 $v_{s}$ 时切换为低速形式)、角速度跟踪(1.5)、姿态保持 $\exp\!\left(-10\|\mathbf{r}^{\mathrm{grav}}_{xy}\|_{2}\right)$(1.0)、脚部接触(1.5)、脚间距(0.1)、落脚点放置即式 (23)(2.0)、基座高度 $\exp\!\left(-10|(z^{\mathrm{base}}-\bar{z}^{\mathrm{supp}})-0.55|\right)$(0.8);惩罚项涵盖脚滑、空气时间不足、落脚冲击、关节位置/速度越限、绊倒检测等,其中支撑脚平均高度定义为
$$\bar{z}^{\mathrm{supp}}=\frac{\sum_{f}\mathbb{I}(F^{f}_{z}>1)\,z^{f}}{\sum_{f}\mathbb{I}(F^{f}_{z}>1)}.$$
深度编码与速度估计。原始深度图先做归一化 $\mathbf{D}_{t}=\mathbf{D}^{\mathrm{raw}}_{t}/d_{\max}-0.5$($d_{\max}$ 为预设最大量程),再由轻量 CNN 深度分词器编码为一组局部深度 token:
$$\mathbf{Z}_{t}=\mathcal{T}_{\theta}(\mathbf{D}_{t})\in\mathbb{R}^{N\times d},$$
$N$ 为 token 数、$d$ 为 token 维度。为改善速度指令跟踪,框架联合训练一个辅助基座速度估计器:
$$\hat{\mathbf{v}}_{t}=\mathrm{LSTM}\!\left([\mathbf{o}^{p}_{t};\mathcal{C}_{\psi}(\mathbf{D}_{t})]\right),$$
其中 $\mathcal{C}_{\psi}(\cdot)$ 是轻量深度压缩模块,估计器用仿真器真值基座线速度以 $\ell_{2}$ 损失监督。这一设计把「深度里蕴含的速度线索」显式提取出来供策略使用,弥补本体感知在低速与接触扰动下的速度估计误差。
本体感知条件化的跨模态注意力。本体感知分词器以本体观测与估计速度的拼接为输入:
$$\mathbf{e}^{p}_{t}=\mathcal{P}_{\phi}\!\left([\mathbf{o}^{p}_{t};\hat{\mathbf{v}}_{t}]\right),\qquad\mathbf{E}^{d}_{t}=\mathrm{LN}(\mathbf{Z}_{t}),$$
随后以本体感知 token 为查询、深度 token 为键值做跨模态注意力:
$$\mathbf{Q}_{t}=\mathrm{LN}(\mathbf{e}^{p}_{t})\mathbf{W}_{q},\qquad\mathbf{K}_{t}=\mathbf{E}^{d}_{t}\mathbf{W}_{k},\qquad\mathbf{V}_{t}=\mathbf{E}^{d}_{t}\mathbf{W}_{v},$$
其中 $\mathbf{Q}_{t}\in\mathbb{R}^{1\times d}$,$\mathbf{K}_{t},\mathbf{V}_{t}\in\mathbb{R}^{N\times d}$。多头注意力在当前本体状态的条件下从深度 token 中聚合与运动相关的信息:
$$\bar{\mathbf{e}}^{d}_{t}=\mathrm{MHA}\!\big(\mathbf{Q}_{t},\mathbf{K}_{t},\mathbf{V}_{t}\big),$$
再与本体感知 token 拼接形成融合输入 $\mathbf{x}_{t}=[\mathbf{e}^{p}_{t};\bar{\mathbf{e}}^{d}_{t}]$。这一设计的关键在于「以本体状态为查询」:同样是前方一段楼梯,站立稳定与身体前倾时策略关心的深度区域并不相同,查询条件化让注意力聚焦随运动状态动态变化。消融实验也证明这是全框架中最关键的组件。
graph TD DT["Forward depth D_t 64x48"] --> NM["Normalize: D_raw/d_max - 0.5"] NM --> TK["CNN depth tokenizer Z_t"] TK --> LN1["LayerNorm to E_d"] OB["Proprioception o_p + velocity est."] --> PT["Proprio tokenizer e_p"] PT --> QQ["Q = LN(e_p) W_q"] LN1 --> KK["K = E_d W_k"] LN1 --> VV["V = E_d W_v"] QQ --> MHA["Cross-modal MHA"] KK --> MHA VV --> MHA MHA --> XX["x_t = [e_p ; e_d_bar]"] PT --> XX XX --> GRF["Gated residual fusion
f_t = x_t + c_t * sigmoid(g_t)"] GRF --> GRU["GRU temporal fusion
z_rec_t = W_h h_t"] GRF --> GT["Highway gate beta_t"] GRU --> GT GT --> YY["y_t = beta*z_rec + (1-beta)*f"] YY --> HD["Action MLP head"] HD --> AC["Joint targets q_0 + a_t"] RD["Foot point-cloud reward branch
Eq. 17-23 (training only)"] -.-> GRF
图:CReF 策略前向通路——跨模态注意力、门控残差融合、循环融合与高速门控的数据流(依据论文 Fig. 2 绘制;落脚点奖励分支仅在训练时生效)。
门控残差融合(GRF)。融合输入先经一层投影混合本体与深度条件特征:
$$\tilde{\mathbf{x}}_{t}=\phi\!\big(\mathbf{W}_{1}\,\mathrm{LN}(\mathbf{x}_{t})+\mathbf{b}_{1}\big),$$
$\phi(\cdot)$ 取 ELU。第二层线性层同时产出内容分支与门控分支:
$$\begin{bmatrix}\mathbf{c}_{t}\\ \mathbf{g}_{t}\end{bmatrix}=\mathbf{W}_{2}\,\tilde{\mathbf{x}}_{t}+\mathbf{b}_{2},\qquad\mathbf{c}_{t},\mathbf{g}_{t}\in\mathbb{R}^{2d},$$
融合输出为
$$\mathbf{f}_{t}=\mathbf{x}_{t}+\mathbf{c}_{t}\odot\sigma(\mathbf{g}_{t}).$$
$\mathbf{c}_{t}$ 提供候选残差更新,$\sigma(\mathbf{g}_{t})$ 逐通道地自适应控制其贡献强度。这样策略既能放大信息量大的多模态修正,又保留了一条直接残差通路以稳定优化——这是 Highway Network 思想在多模态融合处的一次针对性运用。
循环融合与高速输出门。$\mathbf{f}_{t}$ 进入 GRU 做时序积分:
$$\mathbf{h}_{t}=\mathrm{GRU}(\mathbf{f}_{t},\mathbf{h}_{t-1}),\qquad\mathbf{z}^{\mathrm{rec}}_{t}=\mathbf{W}_{h}\mathbf{h}_{t},$$
$\mathbf{z}^{\mathrm{rec}}_{t}\in\mathbb{R}^{2d}$ 聚合短时程时序上下文——单帧深度不足以消歧地形结构或接触时序时,这一记忆尤为重要。随后循环特征与当前融合特征经高速输出门按状态混合:
$$\beta_{t}=\sigma\!\big(\mathbf{W}_{\beta}[\mathbf{z}^{\mathrm{rec}}_{t};\mathbf{f}_{t}]+\mathbf{b}_{\beta}\big),\qquad\mathbf{y}_{t}=\beta_{t}\odot\mathbf{z}^{\mathrm{rec}}_{t}+(1-\beta_{t})\odot\mathbf{f}_{t}.$$
门值 $\beta_{t}$ 让策略在模糊或高风险阶段更多依赖时序记忆,在当前观测已足够时保持更强的前馈响应。最终动作由 $\mathbf{y}_{t}$ 上的 MLP 头产生。
地形感知落脚点放置奖励。这是论文的第二项贡献,用于在触地时刻整形脚的落点。对每只脚,在局部脚坐标系下维护一个短时程点云采样缓冲;先做指令条件化的前向门控,滤除近脚点——保留的最小前向距离取当前前进指令下 0.5 s 所覆盖的距离。剩余点云被切分为 $24\,cm\times 10\,cm$、步长 $4\,cm$ 的重叠候选窗口。设 $\mathcal{P}^{f}_{t,k}$ 为脚 $f$ 在 $t$ 时刻的第 $k$ 个窗口(含 $n^{f}_{t,k}$ 个点),计算窗口均值与协方差:
$$\boldsymbol{\mu}^{f}_{t,k}=\frac{1}{n^{f}_{t,k}}\sum_{i=1}^{n^{f}_{t,k}}\mathbf{p}^{f}_{t,k,i},\qquad\mathbf{\Sigma}^{f}_{t,k}=\frac{1}{\max(n^{f}_{t,k}-1,1)}\sum_{i=1}^{n^{f}_{t,k}}\big(\mathbf{p}^{f}_{t,k,i}-\boldsymbol{\mu}^{f}_{t,k}\big)\big(\mathbf{p}^{f}_{t,k,i}-\boldsymbol{\mu}^{f}_{t,k}\big)^{\top},$$
再做特征分解 $\Sigma_{t,k}^{f}v_{t,k,j}^{f}=\lambda_{t,k,j}^{f}v_{t,k,j}^{f}$(特征值升序排列),并定义粗糙度
$$\rho^{f}_{t,k}=\sqrt{\max(\lambda^{f}_{t,k,1},0)}.$$
窗口须同时满足足够平面、近似水平、非凹陷三条判据才被接受为落脚点候选:
$$\rho_{t,k}^{f}<r_{\mathrm{th}},\qquad|v_{t,k,1,z}^{f}|>\eta_{\mathrm{th}},\qquad\mu_{t,k,z}^{f}>h_{\min},$$
被接受窗口的候选落脚点取其均值 $\mathbf{p}^{f,\star}_{t,k}=\boldsymbol{\mu}^{f}_{t,k}$。为避免抖振,候选集只在离地时刻刷新,随后保持固定直到下一次触地。触地时计算实际接触位置与候选集在 $x$-$z$ 平面上的最近距离:
$$d^{f}_{xz}=\min_{k}\left\|\begin{bmatrix}p^{f}_{x,t}\\ p^{f}_{z,t}\end{bmatrix}-\begin{bmatrix}p^{f,\star}_{x,t,k}\\ p^{f,\star}_{z,t,k}\end{bmatrix}\right\|_{2},$$
奖励定义为
$$r_{\mathrm{fh}}=\sum_{f\in\mathcal{F}}I^{f}_{\mathrm{td}}\exp\!\left(-d^{f}_{xz}/s_{xz}\right),$$
其中 $I^{f}_{\mathrm{td}}$ 指示触地事件,$s_{xz}$ 为容差尺度。虽然奖励在触地时刻结算,但它实质上提供了一个预期性的整形目标:鼓励摆动脚在接触发生之前就向局部可支撑区域靠拢。与 BeamDojo 的 FCQR 那类「禁止踩某处」的约束式奖励不同,该奖励是「鼓励踩向可支撑处」的方向性监督。
图:CReF 框架总览(论文 Fig. 2)——单阶段深度条件策略结合跨模态注意力、门控残差融合、循环融合与地形感知落脚点奖励。
实验结果
实验设置。对比对象在同地形、同奖励、同优化配置下从零训练,共五个变体:完整 CReF;w/o Cross-Attn(去掉跨模态注意力);w/o GRF(以同深度同宽度的残差 MLP 替换门控残差融合);w/o Highway Gate(去掉高速输出门,直接从 GRU 特征解码动作);以及感知运动基线 HPL(Humanoid Parkour Learning,原文部署于 Unitree H1——约 1.8 m、47 kg、膝部扭矩约 360 Nm——因硬件差异只作为地形难度参考,仿真中在 X2 Ultra 上重新实现以做受控对比)。架构对比在 2000 个并行环境中评测,每条 rollout 最长 40 s;楼梯落脚分析使用 2048 条并行楼梯 rollout;门控行为分析在 4096 个并行环境中记录;另用 MuJoCo 做跨仿真器的分布外评测。
| 方法 | 楼梯 Easy/Med/Hard/OOD | 缺口 Easy/Med/Hard/OOD | 平台 Easy/Med/Hard/OOD | MuJoCo OOD | 总体 |
|---|---|---|---|---|---|
| Full CReF | 99.85 / 99.75 / 97.85 / 72.75 | 99.30 / 98.35 / 92.15 / 44.70 | 99.65 / 99.35 / 97.35 / 84.35 | 100%(20/20) | 90.45 |
| w/o Cross-Attn | 96.25 / 87.50 / 78.70 / 34.00 | 97.10 / 97.70 / 83.00 / 8.60 | 99.40 / 98.75 / 96.90 / 64.80 | 95%(19/20) | 78.56 |
| w/o GRF | 99.60 / 93.40 / 83.60 / 49.10 | 98.00 / 98.25 / 90.05 / 29.95 | 99.45 / 99.15 / 96.20 / 68.55 | 95%(19/20) | 83.78 |
| w/o Highway Gate | 97.65 / 98.40 / 93.65 / 50.20 | 98.50 / 96.90 / 86.35 / 17.20 | 98.45 / 97.65 / 91.45 / 73.10 | 100%(20/20) | 83.29 |
| HPL | 96.30 / 81.45 / 71.05 / 27.40 | 97.45 / 94.40 / 78.25 / 20.85 | 98.05 / 92.65 / 81.80 / 55.15 | 5%(1/20) | 74.57 |
表:架构对比的地形穿越成功率(%,论文表 II)。楼梯按踏步高/踏深标注难度(如 20/30 cm),缺口按宽度,平台按高度;OOD 列均为超出训练范围的难度。
完整 CReF 在三类地形上总体表现最佳,且优势随难度上升而扩大,在 OOD 档位与 MuJoCo 跨仿真器评测上尤为明显。消融层面,去掉跨模态注意力的退化最剧烈——缺口 OOD 档从 44.70% 跌至 8.60%、楼梯 OOD 档从 72.75% 跌至 34.00%——说明以本体状态为条件的深度特征提取是感知式穿越的关键;去掉 GRF 或高速门同样在困难与 OOD 条件下显著掉分。HPL 在 MuJoCo OOD 地形上仅 1/20 成功,与其在训练地形上的表现形成强烈反差,侧面反映其对特权几何监督的依赖在分布外场景中被放大。
| 方法 | Easy 上/下 | Medium 上/下 | Hard 上/下 | OOD 上/下 |
|---|---|---|---|---|
| Full CReF | 1 / 2 | 2 / 3 | 5 / 49 | 90 / 454 |
| w/o Cross-Attn | 0 / 75 | 47 / 203 | 88 / 338 | 496 / 824 |
| w/o GRF | 2 / 6 | 25 / 107 | 39 / 289 | 128 / 890 |
| w/o Highway Gate | 13 / 34 | 3 / 29 | 39 / 88 | 293 / 703 |
| HPL | 31 / 63 | 136 / 235 | 241 / 338 | 493 / 959 |
表:楼梯上行/下行失败次数(每难度 2000 个楼梯环境,论文表 III)。所有方法的下行失败都随难度增长远快于上行,印证下楼是更困难的机制;完整 CReF 在 Hard 与 OOD 档的下行失败数均为最低。
图:CReF 的真机运动能力(论文 Fig. 1)——包括 20 次以上连续楼梯穿越、40 cm 高平台、80 cm 缺口,以及踏步高 20 cm、踏深 26 cm 的真实楼梯,并能泛化到训练地形之外。
落脚点分布分析。在困难楼梯设置下,将落脚点放置奖励与 FCQR 基线的触地分布对比(汇聚两脚、全部环境的触地样本,取脚端几何中心的投影接触点):所提奖励在上行与下行都产生更集中、更可重复的落点分布,上行中位绝对偏差从 3.0 cm 降到 1.5 cm,下行从 2.8 cm 降到 1.4 cm,并且消除了上行 rollout 中记录到的全部踝关节-立板碰撞。论文强调这不是落点均值的整体平移,而是整个分布收紧——奖励改善的是接触精度与可重复性,与其「触地结算、预期整形」的设计逻辑一致。
高速门行为分析。定义风险状态为 $|\mathrm{roll}|>0.20$ rad 或 $|\mathrm{pitch}|>0.20$ rad 的时刻,其余为稳定状态,腾空相由脚部接触模式判定。门值(通道平均后按状态分组)呈现三条一致趋势:台阶类地形上的门值高于平地;腾空相高于稳定支撑相;风险状态高于稳定状态。这与高速门的设计意图吻合——瞬时观测不足以支撑可靠控制时,时序记忆被更强地征用;前馈感知已足够时则被衰减。
图:不同通行条件下的高速门行为(论文 Fig. 6),门值越高代表对循环特征的依赖越强。
真机零样本迁移。策略不经任何任务特定微调直接部署。利用 RealSense 硬件时间戳对相机时间与系统时间做线性回归对齐,选取有效延迟 20 ms 的深度帧。室内定量评测(每任务 20 次试验)结果如下:
| 任务 | 设置 | 成功 / 试验 |
|---|---|---|
| 楼梯 | 室内,15 cm / 30 cm | 20 / 20 |
| 平台 | 室内,40 cm | 20 / 20 |
| 缺口 | 室内,80 cm | 18 / 20 |
| OOD 地形 | 室内 OOD 场景 | 19 / 20 |
表:室内真机穿越结果(论文表 IV)。
在标准化任务之外,CReF 还能稳定通过带侧扶手的真实楼梯(踏步高 20 cm、踏深 26 cm,光照变化下依然有效)、空心托盘组件、存在强反射导致大面积深度失效的场景,以及植被密集、边界不对称的室外环境。论文据此认为所学表征保留了地形相关线索,同时对扶手干扰、反射传感失效与杂乱真实几何保持鲁棒——训练全程未注入任何合成深度扰动,这一点使结果更有说服力。
图:CReF 在多种地形与部署场景下的代表性真机 rollout(论文 Fig. 5),红框标出环境因素导致深度观测分布外的例子,如深度图中的大面积无效区域。
局限性
作者自述两点:其一,系统依赖 RealSense 的主动深度测量,对光照与反射表面敏感;其二,深度本身不携带外观与纹理线索,未来工作将探索双目 RGB 感知,以同时获得深度结构与纹理信息。除此之外,从精读角度看还有几处值得注意:其一,HPL 基线原始平台(Unitree H1,膝部 360 Nm)与本文平台(X2 Ultra,120 Nm)差异显著,虽已在同平台重实现做受控对比,但跨论文的横向参照仍受平台能力限制;其二,落脚点奖励在训练侧依赖仿真点云样本与特征分解计算,属于典型的特权奖励工程,其收益能否等效迁移到其它地形族(如稀疏踏点、斜面)尚待验证;其三,64×48 的低分辨率深度与单目 35° 下俯视角限制了前瞻距离,论文对远距离规划与高速运动场景未作评测;其四,代码仓库在论文发布时尚不可访问,复现门槛较高。
总结与展望
CReF 用一个结构清晰的答案回应了「感知式人形运动能否摆脱显式几何中介」的问题:以本体感知为查询的跨模态注意力负责从原始深度中提取状态相关的通行线索,门控残差融合保证多模态修正与残差通路的平衡,带高速门的循环融合按运动状态调配时序记忆,地形感知落脚点奖励则把「踩向可支撑区域」变成方向性监督。三项消融与 HPL 基线共同支撑其结论,真机零样本部署覆盖楼梯、平台、缺口与多类分布外场景。下一步的自然方向是作者提出的双目 RGB 感知:若能在保留深度结构的同时引入纹理线索,主动深度传感在反光与光照变化下的脆弱性有望被系统性缓解。
金句
「中间表示的盲区并没有被消除,而是经由监督被继承了下来。」(The blind spots of the intermediate are not removed, but inherited through supervision.)——论文对辅助几何监督路线的批判,也是 CReF 选择单阶段端到端学习的立论支点。



