PAPER DEEP DIVE
HyperDCM:用双曲动态聚类记忆实现跨场景持续机器人导航
论文提出HyperDCM,把RGB观测转为场景图并映射到Poincaré双曲空间,再用结构敏感动态聚类维护回放样本,缓解扩散导航策略跨场景训练的灾难性遗忘。
论文:HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes
作者:Zhengfei Lu, Jian Yang, Muyu Wang, Shaowen Chen, Jinpeng Mi, Ke Li, Xiong You, Qi Wu, Xuan Tang, Xian Wei
arXiv:2607.16267
代码状态:本文未提供公开代码;GitHub 搜索未发现可靠官方实现。
一句话总结:HyperDCM 把 RGB 观测转成场景图,投影到 Poincaré 双曲空间,再用结构敏感的动态聚类维护回放样本,使扩散导航策略在多场景持续训练时保留旧知识、适应新环境。
研究背景与动机
视觉导航的核心困难不是把一张图分类正确,而是在连续动作序列中不断判断“现在该去哪里、该怎样走”。机器人在真实建筑、庭院、走廊和户外路面上会遇到家具变动、光照变化、动态障碍和目标描述差异。一个只在静态数据集上训练的策略,即使能在测试集里得到漂亮数字,也难以承担持续部署后的场景迁移。
扩散策略为这类问题提供了新的表示方式。传统回归头往往被迫把多峰行为压成单个均值:遇到“可以从左边或右边绕过桌子”的样本时,容易输出一条穿过桌子或贴得过近的轨迹。扩散模型把动作生成视为从噪声到可行轨迹的去噪过程,因而更能保留多模态动作分布。NoMaD 等目标条件扩散导航模型已经证明,序列化生成未来动作能带来更强的前瞻性。
但作者指出,扩散策略在持续学习里有明显短板。它的动作生成高度依赖像素级或向量化特征,缺少显式的结构记忆和关系记忆。机器人先在场景 A 学会导航,再进入场景 B、C、D、E 训练时,旧场景的知识会被参数更新覆盖,成功率迅速下降。重复训练所有旧数据虽然有效,但算力开销随场景积累增长,还会带来过拟合和部署延迟。
单纯保存一批旧样本也不够。均匀随机回放假设每个样本同等重要,可是导航经验天然带层级:房间包含桌子,桌子上放着物体,门口通向走廊,走廊连接不同房间。若记忆库只记住像素相似度高的样本,结构上最不同的经验反而可能被挤出。这样回放虽能缓解遗忘,却可能让策略反复学习同类信息。
论文的切入点因此很明确:让记忆知道“经验之间的关系”。场景图把图像写成主语—谓语—宾语三元组,比平面检测框更能表达对象交互;双曲几何则适合编码树状层级,在低维空间里给分支结构更低失真的表示。把两者结合,HyperDCM 希望在记忆阶段就保留结构和语义多样性,而不是只靠最终动作误差去约束学习。

图 1:HyperDCM 总览。RGB 轨迹由视觉语言模型转为语义描述,再解析成三元组、场景图和 R-GCN 嵌入,最后映射到双曲空间供扩散策略记忆回放使用。
预备知识:从策略到记忆几何
扩散策略的输出不是单个坐标,而是一段未来动作轨迹。给定当前观测和目标,模型先初始化噪声动作序列,再按扩散过程逐步去噪,得到可行航点。这种生成方式让模型可以在不同上下文之间切换探索和导航,同时保留多条可能路径。持续学习中的问题是:一旦新场景的数据进入优化,旧场景轨迹的去噪模式会被遗忘。
持续学习常见做法包括正则化、样本回放和参数隔离。正则化方法约束重要参数移动,回放方法保存代表性旧样本并与新样本联合训练,参数隔离则为任务分配独立容量。在机器人导航中,回放通常最容易适配扩散策略,因为它不需要改变模型架构,也不依赖复杂的生成器。真正难的是从有限缓冲里挑出值得保存的样本。
场景图把观测表示为实体和关系。例如“房间—包含—桌子”“桌子—支撑—杯子”“门口—连接—走廊”不只是物体列表,而是把环境组织成图结构。R-GCN 可以对不同关系类型使用不同权重,从而从图中得到一个既有语义又有拓扑的嵌入。HyperDCM 用这种嵌入作为记忆样本的身份标识。
双曲几何提供第二个关键先验。Poincaré 圆盘是负曲率空间,越接近边界,测地距离越大。树状结构的叶子可以靠近边界获得更大表示容量,而层级关系通过测地距离保留。论文的 UMAP 对比显示,Poincaré 嵌入比欧氏嵌入形成更清晰的局部聚类,这正是动态记忆需要的几何性质。

图 2:场景级记忆样本的 UMAP 可视化。右侧 Poincaré 嵌入表现出更好的分离度和局部聚类,说明层级结构被保留得更完整。
方法详解
HyperDCM 的流程可以拆成三段:先把 RGB 观测结构化,再把结构嵌入映射到双曲空间,最后用动态聚类和结构敏感替换维护回放记忆。整体框架如图 3 所示。关键设计在于,聚类分配用欧氏距离保证速度,聚类内部更新和样本代表度判断用双曲测地距离,兼顾工程可行性和几何表达。

图 3:动态聚类记忆管理。新样本先按欧氏距离找最近聚类,超过阈值且容量允许则新建聚类;更新和回放阶段使用双曲几何与 Karcher 中心。
结构化场景图表示
机器人先从轨迹中收集 RGB 观测。Qwen-VL 负责把图像转成文本描述,Qwen3-7B 再从描述中解析出语义三元组 $(s,r,o)$,其中 $s$ 是主语实体,$r$ 是关系,$o$ 是宾语实体。这一步是离线预处理,不需要手工规则,也不把导航经验压缩成单张特征图。
三元组汇成场景图后,R-GCN 对不同关系类型执行消息传递。论文给出的节点更新为:
$$h_i^{(l+1)}=\sigma\left(\sum_{r\in\mathcal{R}}\sum_{j\in\mathcal{N}_{r}(i)}\frac{1}{c_{i,r}}W_r^{(l)}h_j^{(l)}+W_0^{(l)}h_i^{(l)}\right)$$
这里 $\mathcal{R}$ 是关系类型集合,$\mathcal{N}_r(i)$ 是节点 $i$ 在关系 $r$ 下的邻居,$c_{i,r}$ 做归一化,$W_r^{(l)}$ 和 $W_0^{(l)}$ 分别对应关系消息和自环变换。场景级嵌入 $z_i\in\mathbb{R}^{128}$ 会作为后续双曲映射和记忆聚类的输入。
值得注意的是,R-GCN 只用于离线嵌入生成,权重在预处理后固定。这意味着场景图编码器不是训练中持续移动的组件,也因此不会因为新场景梯度而污染旧场景图嵌入。它的作用是给记忆提供稳定语义坐标,而不是直接作为策略主干。
Poincaré 映射
欧氏嵌入容易把不同层级的节点挤在同一个度量半径内。场景图往往呈树状:房间包含桌子,桌子支撑物体,门口连接走廊。若两个场景拥有相似物体集合但层级不同,欧氏距离可能无法反映任务差异。Poincaré 圆盘则把结构更复杂的样本推向更远位置,让不同局部簇自然分开。
HyperDCM 用固定曲率 $c$ 把欧氏嵌入 $z_i$ 投影到 Poincaré 圆盘:
$$\phi(z_i)=\frac{z_i}{\sqrt{c}(\|z_i\|+\epsilon)}\cdot\tanh(\sqrt{c}\|z_i\|)$$
$c$ 控制空间曲率,$\epsilon$ 防止数值不稳定。论文强调这个曲率在所有场景之间固定,并在最终评估中保持不变。这样不同阶段的记忆样本处在同一度量系统里,聚类中心和替换规则不会因为每换一个场景就改变几何基准。
双曲空间的测地距离由下式计算:
$$d_{\mathbb{H}}(\mathbf{u},\mathbf{v})=\operatorname{arcosh}\left(1+\frac{2\|\mathbf{u}-\mathbf{v}\|^2}{(1-\|\mathbf{u}\|^2)(1-\|\mathbf{v}\|^2)}\right)$$
当 $\mathbf{u}$ 或 $\mathbf{v}$ 靠近圆盘边界时,分母变小,测地距离迅速增加。因此结构上更丰富的场景图不会因为绝对范数大而被普通欧氏距离误判为异常,反而能占据适合其层级的记忆位置。
动态聚类与调度
记忆被分成 $C$ 个簇,每簇容量为 $M$。对一个新场景嵌入 $\phi(z_i)$,系统先计算它到所有簇中心 $\{c_k\}_{k=1}^{C}$ 的欧氏距离,并选择最近的簇:
$$\min_{k\in\{1,...,C\}}d_E(\phi(z_i),c_k)$$
如果最小距离超过阈值 $\tau$ 且总簇数尚未达到上限,就新建一个簇;否则加入最近簇。这里用欧氏距离做粗分配,是为了避免每个新样本都做昂贵的测地计算。若簇数已达上限,样本会直接分配到最近簇,从而保证内存增长有界。
进入簇内更新后,HyperDCM 放弃欧氏均值,使用 Karcher 中心。它是欧氏均值在黎曼流形上的推广,定义为:
$$\mu=\arg\min_{y\in\mathcal{M}}\sum_{i=1}^{N}d_{\mathbb{H}}^2(y,x_i)$$
对具体簇 $C_k$,其中心 $\bar{x}_k$ 同样满足:
$$\bar{x}_k=\arg\min_{x\in\mathbb{D}^{n}}\sum_{x_j\in C_k}d_{\mathbb{H}}^2(x,x_j)$$
实践中,论文用少量固定的黎曼梯度步更新受影响簇,而不是反复做大规模优化。由于簇数和簇容量都有上界,这一步开销可控,也不需要重训练扩散策略。中心保留在流形内,避免简单平均把双曲点“平均”到不真实的欧氏位置。
结构敏感替换是 HyperDCM 最有辨识度的部分。设新样本为 $\tilde{x}_i$,它到簇中心的双曲距离为 $d_{\mathbb{H}}(\tilde{x}_i,\bar{x}_k)$;当前簇中离中心最近的老样本为 $x_j$。若新样本离中心更远,也就是 $d_{\mathbb{H}}(\tilde{x}_i,\bar{x}_k)>d_{\mathbb{H}}(x_j,\bar{x}_k)$,论文认为它携带的结构信息更丰富,于是替换 $x_j$。
这个规则背后的假设是:靠近簇中心的样本已经被结构代表,而离中心更远但仍属于该簇的样本捕捉了分支、边界或稀有关系。把它们留在记忆里,可以防止回放集退化成大量彼此相似的典型画面。相反,如果一味保留靠近中心的样本,记忆会越来越保守,旧场景内部的多样性反而流失。

图 4:四个代表性场景中的预测航点轨迹。左侧持续 NoMaD 基线在早期场景出现漂移,右侧 HyperDCM-Hyp 保持更稳定的目标对齐轨迹。
回放采样
训练时,回放批从所有簇的并集中均匀取出 $n$ 个样本:
$$\mathcal{B}=\text{Sample}\left(\cup_{k=1}^{C}\text{Cluster}_{k},\text{size}=n\right)$$
这些样本与当前场景数据一起微调扩散策略。均匀簇采样不是按样本总数随机,而是让每个结构簇都有机会进入回放。于是旧知识不再只由高频画面代表,稀有但关键的拓扑关系也能持续参与去噪训练。
整个机制没有改动扩散策略主干。HyperDCM 外挂了一条记忆管线:观测结构化、嵌入、双曲聚类、样本替换、回放采样。这使得它更容易嫁接到 NoMaD 这类已有导航模型上,也解释了为什么论文能与 EWC、SI、LwF、TinyER 在同一训练协议下比较。
实验结果
作者在室内 SACSoN 和室外 Recon 数据上构造五个场景分裂,每个场景 $60\%$ 轨迹用于训练,$40\%$ 用于测试。扩散策略采用 NoMaD 风格主干,单卡 NVIDIA RTX 4090 训练;每个场景训练 20 个 epoch,并在阶段结束保存检查点,用来评估对已学场景的保留能力。
主要指标是成功率 SR:
$$\text{SR}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}\left[d(s_i,g_i)\leq\delta\right]$$
其中 $s_i$ 是轨迹最终状态,$g_i$ 是目标,$\delta$ 是成功阈值。模型记号 $1\sim X$ 表示按顺序训练到第 $X$ 个场景后的检查点。论文还定义 Drop 为 $\text{SR}_{1\sim A}-\text{SR}_{1\sim E}$,数值越大说明遗忘越严重。
主实验结果如下。无回放的 NoMaD-CL 从 $1\sim A$ 的 70.0 降到 $1\sim E$ 的 26.7,Drop 达到 43.3;EWC、SI、LwF 分别把 Drop 降到 40.1、38.6、37.4;TinyER 为 36.9。HyperDCM-VisFeat 说明加入聚类回放即使没有场景图也能降到 35.2,HyperDCM-Euc 进一步降到 34.8,而完整 HyperDCM-Hyp 只有 28.5。
| 方法 | 1~A | 1~B | 1~C | 1~D | 1~E | Drop ↓ |
|---|---|---|---|---|---|---|
| Joint NoMaD | 66.5 | 62.7 | 58.1 | 60.5 | 60.2 | 6.3 |
| NoMaD-CL(无回放) | 70.0 | 40.6 | 34.4 | 25.2 | 26.7 | 43.3 |
| NoMaD-CL + EWC | 67.4 | 42.3 | 35.7 | 30.2 | 27.3 | 40.1 |
| NoMaD-CL + SI | 66.2 | 44.7 | 36.3 | 29.4 | 27.6 | 38.6 |
| NoMaD-CL + LwF | 66.5 | 46.1 | 38.5 | 33.9 | 29.1 | 37.4 |
| NoMaD-CL + TinyER | 65.5 | 45.5 | 37.6 | 31.5 | 28.6 | 36.9 |
| HyperDCM-VisFeat | 65.7 | 48.6 | 40.7 | 37.5 | 30.5 | 35.2 |
| HyperDCM-Euc(L2) | 66.7 | 48.2 | 41.1 | 36.0 | 31.9 | 34.8 |
| HyperDCM-Hyp(Poincaré) | 70.0 | 50.8 | 55.2 | 45.2 | 41.5 | 28.5 |
这组数字有一条清晰的递进链:回放提供稳定性,结构化编码提升样本多样性,双曲几何进一步增强长期保留。特别是 $1\sim C$ 和 $1\sim D$ 处,HyperDCM-Hyp 的 55.2 与 45.2 明显高于其他持续方法,说明优势不只是最后阶段少掉几个百分点,而是在中间阶段就维持了更好的可迁移表征。

图 5:轨迹级遗忘分析。左图显示无回放时更长训练放大余弦相似度下降;右图显示 10 个聚类的结构化记忆相对单缓冲持续降低遗忘。
Habitat 在 MatterPort3D 五个场景上的在线评估进一步验证了结论。这里的指标除了 SR,还包括按路径长度加权成功的 SPL 和每米碰撞频率。无回放 NoMaD-CL 只有 39.2 SR、38.5 SPL、0.37 碰撞;TinyER 提升到 41.7 SR;HyperDCM-Hyp 达到 56.0 SR、48.3 SPL,并把碰撞降到 0.17。Joint NoMaD 仍以 63.1 SR、52.7 SPL、0.13 碰撞作为联合训练上界。
| 方法 | SR ↑ | SPL ↑ | Collision ↓ |
|---|---|---|---|
| Joint NoMaD | 63.1 | 52.7 | 0.13 |
| NoMaD-CL(无回放) | 39.2 | 38.5 | 0.37 |
| NoMaD-CL + TinyER | 41.7 | 40.2 | 0.29 |
| HyperDCM-VisFeat | 45.0 | 42.0 | 0.24 |
| HyperDCM-Euc(L2) | 49.8 | 46.0 | 0.22 |
| HyperDCM-Hyp(Poincaré) | 56.0 | 48.3 | 0.17 |
消融实验把两个因素分开。HyperDCM-VisFeat 去掉场景图,直接把 EfficientNet 视觉特征嵌入双曲空间,用来检验结构表示的价值;HyperDCM-Euc 保留质心回放,但用欧氏 L2 距离替代双曲距离,用来检验几何本身的价值。两者都不如完整模型,说明层级场景编码和负曲率几何是互补的,而不是同一件事的重复表述。
效率方面,联合重训练需要每加入一个场景就访问所有累计数据,GPU 小时近似线性增长;HyperDCM 每阶段成本接近常数。场景图抽取作为离线预处理每个场景执行一次,报告的 GPU 小时只统计扩散策略训练。联合重训练在新场景适配性上仍更强,但 HyperDCM 用明显更低的训练成本保持有竞争力的成功率。

图 6:联合重训练与 HyperDCM 的成本与适配对比。左侧为每阶段 GPU 小时,右侧为最新场景成功率。
局限性
第一,记忆质量依赖视觉语言模型抽取的三元组。论文使用 Qwen-VL 与 Qwen3-7B 做离线解析,但未展开分析幻觉实体、错误关系或漏检边对回放样本的影响。若导航场景出现长尾物体、模糊遮挡或语言歧义,错误的场景图可能把样本放进错误结构簇。
第二,动态聚类的阈值 $\tau$、簇数 $C$、单簇容量 $M$ 和曲率 $c$ 都是在评估中固定的。固定参数让实验可控,但真实机器人会经历场景规模变化:有些阶段可能只需少数簇,有些阶段则可能迅速出现多种布局。作者也把自适应记忆分配列为未来工作。
第三,双曲替换假设“离 Karcher 中心更远”等价于“结构信息更丰富”。这个启发式在层级场景图中合理,但远距离也可能来自噪声嵌入、异常检测或错误关系。论文没有给出坏样本替换率或错误边对导航性能的敏感性实验。
第四,Habitat 在线评估集中在五个 MatterPort3D 场景,SACSoN 和 Recon 覆盖室内外轨迹,但真实动态行人、门开合、光照突变和长时间部署噪声仍需更多实证。作者的另一个未来方向是用模型生成样本增强回放,也说明当前系统仍以真实保存样本为主。
总结与展望
HyperDCM 的价值在于把持续导航的瓶颈从“要不要回放”推进到“回放什么、按什么几何组织回放”。它没有发明新的扩散导航策略,而是给 NoMaD 类模型外接了一条结构记忆管线:VLM 生成三元组,R-GCN 得到图嵌入,Poincaré 映射保留层级,动态聚类决定谁值得被记住,最后跨簇采样参与训练。
实验给出的证据比较一致。持续训练无回放时,五场景成功率从 70.0 跌到 26.7;完整 HyperDCM 把最终成功率拉回 41.5,Drop 从 43.3 降到 28.5。Habitat 在线任务中,SR 从 39.2 提升到 56.0,碰撞从 0.37 降到 0.17。消融也分别支持了场景图和双曲几何的作用。
对机器人系统而言,这个方向的关键不是某一个组件,而是把记忆视为结构化资产。未来若结合自适应簇分配、生成式样本合成和在线错误校正,HyperDCM 的记忆机制可能扩展到更长任务序列和更开放的环境。论文结尾也指出,结构化世界建模加双曲几何的应用不止导航,还可能用于其他持续机器人学习问题。
flowchart TD
A[RGB trajectories] --> B[VLM description]
B --> C[semantic triples]
C --> D[scene graph]
D --> E[R-GCN embedding]
E --> F[Poincare mapping]
F --> G{nearest cluster}
G -- distance greater than threshold --> H[create cluster]
G -- distance within threshold --> I[assign cluster]
I --> J[Karcher center update]
J --> K[structure sensitive replacement]
H --> L[uniform cross cluster replay]
K --> L
L --> M[current scene batch]
M --> N[finetune diffusion policy]
N --> O[continual navigation]
金句
“持续导航不是把新场景学得更好,而是在学新场景时不把旧场景的方法论丢掉。”
“当记忆只按相似度保存样本时,机器人记住的是画面;当记忆按结构保存样本时,机器人记住的是环境如何组织。”

