PAPER DEEP DIVE
SuperMap:面向视觉语言导航的时空SLAM系统
SuperMap是CMU提出的实时4D时空语义建图框架,将高频几何SLAM与异步开放词汇感知结合,通过一致性驱动的建图引擎维护稳定的物体实例身份并在遮挡和场景变化下修剪过时内容,生成可查询的4D场景图接口供视觉语言模型进行零样本推理和语言引导导航。
SuperMap:面向视觉语言导航的时空SLAM系统
论文标题:SuperMap: A Spatio-Temporal SLAM System for Visual-Language Navigation
作者:Shibo Zhao, Guofei Chen, Honghao Zhu, Zhiheng Li, Changwei Yao, Nader Zantout, Seungchan Kim, Wenshan Wang, Ji Zhang, Sebastian Scherer
机构:Carnegie Mellon University(卡内基梅隆大学机器人研究所)
发表:RSS 2022
项目主页:superodometry.com/supermap
关键词:时空SLAM、开放词汇感知、场景图、视觉语言导航、动态环境建图
一句话总结
SuperMap 是首个实时、开放词汇、实例级的 4D 时空语义 SLAM 系统——将高频几何 SLAM 与异步开放词汇感知融合,通过 3D 感知的实例关联/重激活和基于置信度的存在性-标签更新,在遮挡和场景变化下维护稳定的物体身份,生成可查询的 4D 场景图供 VLM 进行零样本语言导航。
研究背景与动机
机器人要在人类环境中执行开放词汇导航目标(如"去白板旁边的显示器"或"回到之前植物附近的椅子"),仅靠位姿估计和几何重建远远不够——机器人需要维护一个以物体为中心的时空地图表示,保留实例身份、语义属性和空间关系随时间的演变。然而真实场景是动态的:物体可能被遮挡、移动、移除或新引入。
现有方法的根本局限在于:多数方法要么处理短动态(如运动行人),要么处理静态物体识别,很少同时解决两者。语义建图方法(ConceptGraphs、HOV-SG)需离线处理数分钟到数小时;动态SLAM方法(Khronos)受限于闭集类别且无法实时运行;开放词汇方法(OpenScene、OpenMask3D)假设完整场景数据,不支持在线使用。此外,遗漏检测和遮挡会导致实例身份碎片化,场景变化引入过时内容,而多数表示缺乏高效的查询接口。
SuperMap 的核心洞察是:将时空SLAM问题分解为三个可链式分解的子问题——位姿估计(几何)、时空实例关联和在线地图更新——每一步都有明确的概率意义,且可以独立优化。
问题建模:时空SLAM的概率分解
系统处理连续的 RGB-D 或点云视频流 $C_{1:T}=\{C_1, C_2, \ldots, C_T\}$ 和 $D_{1:T}=\{D_1, D_2, \ldots, D_T\}$,估计相机位姿 $P_{1:T}$,并在每个时刻 $t$ 输出包含语义实例物体的全局地图 $M_t$。时空SLAM问题定义为:给定当前观测 $Q_t=\{C_t, D_t\}$ 和已有地图 $M_{t-1}$,估计位姿 $P_t$、实例ID $I_t$ 和更新后地图 $M_t$,最大化后验概率:
通过链式法则分解为三项:
这一分解是 SuperMap 架构的理论基础——三个模块分别对应几何层、实例层和拓扑层。
方法详解
1. 几何层:在线3D重建
使用 SuperOdometry 作为 LiDAR-Visual-Inertial 里程计后端,估计机器人状态 $T_{WB}^{(t)} \in SE(3)$。给定固定外参标定 $T_{BC}$,相机位姿推导为:
估计的位姿和同步深度 $D_t$ 构成观测 $Q_t$,为后续实例级检测提供度量基础:2D语义观测反投影到3D世界、运动补偿时序跟踪、全局地图一致性维护。
2. 实例层:时空实例关联
2.1 混合跟踪状态
定义 tracklet 状态 $S_i(t) \in \mathbb{R}^6$(或 $\mathbb{R}^8$ 含尺度速度)为解耦向量:
其中 $c_i(t) = [x, y]^\top$ 为2D图像质心,$s_i(t) = [w, h]^\top$ 为边界框宽高,$\dot{c}_i(t)$ 为图像平面平移速度。
2.2 3D-to-2D运动补偿
标准2D跟踪器(如ByteTrack)在快速自运动下失效。SuperMap 用3D信息补偿:将地图 $M_{t-1}$ 中实例的3D质心 $X_i$ 用当前位姿 $P_t$ 投影到2D,得到预测质心:
卡尔曼滤波器状态转移使用此投影作为先验:
其中 $F$ 为状态转移矩阵,$w_t$ 为过程噪声。这种基于投影的先验使系统在遮挡和剧烈机器人机动中维持身份一致性。
2.3 概率几何一致性更新
对地图中每个点 $X_k \in M_{t-1}$,计算深度残差:
测量似然建模为高斯噪声 $p(\Delta d) \sim \mathcal{N}(0, \sigma^2)$。占据状态 $o_k$ 用 log-odds 形式递归更新:
其中 $L(n) = \log\frac{n}{1-n}$。逆传感器模型通过阈值化 $\Delta d$ 的几何一致性分类点状态:
被分类为动态的点在 log-odds 更新中被惩罚,有效修剪瞬态或已移动物体,维持环境的一致表示。这是动态场景变化检测的核心机制。
2.4 贝叶斯语义融合
每个实例维护类别分布 $P(L_j = c)$。给定开放词汇检测器的观测 $z_{1:t}$,后验信念更新为:
其中 $P(z_t \mid L_j = c)$ 为检测器的混淆矩阵。后验信念过小的物体点被移除,抑制瞬态误分类。
3. 拓扑层:时空场景图
地图 $M_t$ 被抽象为图 $G = (V, E_S, E_T)$,节点 $V$ 代表物体实例:
- 空间边 $E_S$:通过类相关几何谓词建立。对于物体 A, B:$\text{On}(A, B) \Leftrightarrow (z_A^{\min} \approx z_B^{\max}) \wedge (\text{IoU}_{xy}(B_A, B_B) > \gamma)$
- 时间边 $E_T$:基于实例关联结果 $I_t$ 跨时间链接节点,追踪物体轨迹
实时操作中,先按质心距离聚类物体,再在满足类相关几何谓词(on, beside, under)时添加空间边。时间边从物体关联结果追踪轨迹,在整个序列中保持身份。生成的图紧凑地捕获瞬时布局和长期动态。
实验结果
1. 语义质量:ScanNet基准
| 方法 | 建图方式 | mIoU (%) | f-mIoU (%) | Acc (%) |
|---|---|---|---|---|
| ConceptGraphs | 物体级 | 21.62 | 24.32 | 31.05 |
| HOV-SG | 物体级 | 26.79 | 36.05 | 35.17 |
| RayFronts | 点特征 | 41.29 | 46.42 | 56.76 |
| SuperMap | 物体级 | 27.42 | 43.50 | 55.48 |
SuperMap 的 f-mIoU 达到 43.50%,大幅超越 ConceptGraphs 和 HOV-SG。虽然 mIoU 略低于 RayFronts 的点特征融合方法,但计算开销显著更低,更适合高频机器人反馈回路。
2. 实例级分割
| 方法 | Chair mAP50 | Window mAP50 | Refrig. mAP50 | Sofa mAP50 | Door mAP50 |
|---|---|---|---|---|---|
| HOV-SG | 4.58 | 0.00 | 0.00 | 30.00 | 9.70 |
| ConceptGraphs | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 |
| SuperMap | 63.76 | 42.20 | 62.50 | 33.35 | 10.00 |
SuperMap 在 Chair 上 mAP50 达 63.76%,远超 HOV-SG 的 4.58%。3D 感知的 tracking-by-detection 方法在离散物体上显著优于点特征聚类或过分割几何方法。
3. 时空变化检测
| 方法 | 检测召回率(出现) | 变化检测召回率(消失) | ||||
|---|---|---|---|---|---|---|
| 桶 | 推车 | 标识 | 植物 | 垃圾桶 | 椅子 | |
| DualMap | 0.000 | 0.000 | 0.000 | 0.310 | 0.000 | 0.000 |
| SuperMap | 1.000 | 0.262 | 0.583 | 0.755 | 0.434 | 1.000 |
SuperMap 在桶和椅子上达到 100% 检测召回率,在植物上达 75.5%。DualMap 几乎全部失败,其变化检测"召回率"仅因初始检测失败导致的数学假象。
4. 消融研究
| 配置 | Precision | Recall | F1 |
|---|---|---|---|
| 无2D跟踪器 | 0.7787 | 0.4595 | 0.5780 |
| 无语义融合 | 0.7929 | 0.3870 | 0.5201 |
| 无几何一致性更新 | 0.8189 | 0.4448 | 0.5764 |
| 完整系统 | 0.8677 | 0.4955 | 0.6308 |
完整系统在所有指标上最优。2D跟踪器在大视角变化下维持身份关联防碎片化;几何和语义融合让系统抵抗瞬时检测失败——通过跨帧重新评估历史推断,地图自我修正并过滤检测噪声。
5. 视觉语言导航
机器人在自主探索中增量构建实例级语义地图。给定自然语言指令后,VLM 通过场景图序列化接口进行零样本推理,返回目标实例ID。解析器提取ID并从地图 $M_t$ 检索3D质心 $X_j$ 作为导航航点,将高级语言指令转化为精确的接地机器人动作。
方法工作流
flowchart TD
A["传感器输入: RGB + Depth/LiDAR + IMU"] --> B["几何层: SuperOdometry"]
B --> C["位姿估计 P_t + 密集3D重建"]
C --> D["实例层: GroundingDINO + SAM2"]
D --> E["3D-to-2D运动补偿跟踪"]
E --> F["概率几何一致性更新
log-odds占据 + 变化检测"]
F --> G["贝叶斯语义融合
P(L=c|z)递归更新"]
G --> H["拓扑层: 4D场景图构建"]
H --> I["空间边 E_S + 时间边 E_T"]
I --> J["VLM序列化接口
零样本语言导航"]
J --> K["航点生成 + 机器人执行"]
style B fill:#e3f2fd
style F fill:#e8f5e9
style H fill:#fff3e0
style J fill:#fce4ec
局限性
- 开放词汇检测器依赖:系统性能受限于 GroundingDINO 和 SAM2 的检测/分割质量,稀有或未见类别可能被遗漏。
- 几何一致性阈值敏感性:深度残差阈值 $\tau_\epsilon$ 需针对不同传感器和环境调整,固定阈值在极端场景下可能导致误判。
- 计算资源需求:虽为实时系统,但需 RTX 4090 + i9 处理器,对资源受限的边缘设备可能不适用。
- 场景图谓词有限:当前空间关系谓词(on, beside, under)较为基础,复杂空间关系(如"在...后面")可能需要更丰富的几何推理。
总结与展望
SuperMap 的核心贡献在于将时空SLAM问题概率分解为几何-关联-更新三步,每步都有明确的数学基础。3D-to-2D运动补偿解决了快速自运动下的跟踪难题——不是在2D图像平面预测运动,而是在3D世界投影后用卡尔曼滤波修正。log-odds占据更新与三态分类(可观测/不可观测/已消失)的结合,使系统能区分"看不到"和"已移除"——这是长期地图维护的关键。贝叶斯语义融合让开放词汇检测的噪声被跨帧累积的信念平滑,而非单帧决策。
4D场景图作为VLM与物理世界之间的"结构化记忆"具有深远意义:VLM不再需要处理原始点云或视频流,而是在符号化的时空关系上推理。空间逻辑查询利用度量边精确计算距离,时间逻辑查询通过时间边 $E_T$ 追踪物体历史轨迹——这是原始视频输入无法可靠提供的。SuperMap 开源的完整系统为开放词汇时空建图提供了可部署的基线。



