Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

动态环境Dynamic EnvironmentsSLAM

DL-SLAM:基于双层概率的动态环境高保真高斯泼溅SLAM

3D高斯泼溅(3DGS)推动了稠密动态SLAM的进展,但主流方法直接丢弃预定义的动态物体,忽略了瞬时静止物体对位姿估计的几何约束价值;WildGS-SLAM用逐像素不确定性图利用这类物体,却会把它们融进静态地图留下持久伪影,且纯几何的不确定性在物体边界处含糊不清。DL-SLAM提出双层概率框架:像素级结合语义与几何信息计算动态概率,作为稠密束调整的自适应权重;像素概率被提升到三维高斯属性并按实例聚合为对象级动态概率,用于类别化剪枝动态高斯,得到无伪影的静态地图;纯净的静态地图再渲染出几何一致的概率图,贝叶斯式地反哺像素级估计。配合动态感知的语义标签修正,DL-SLAM在TUM RGB-D、BONN与Wild-SLAM iPhone三个动态数据集上将跟踪精度最多提升13%,同时生成高保真语义地图。

Ziheng Xu, Qingfeng Li, Xuefeng Liu, Chen Chen, Jianwei Niu2026年7月2日6 分钟阅读
EN

论文元信息

  • 标题:DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability(DL-SLAM:基于双层概率的动态环境高保真高斯泼溅 SLAM)
  • 作者:Ziheng Xu, Qingfeng Li, Xuefeng Liu, Chen Chen, Jianwei Niu(该团队此前发表过 NID-SLAM,长期深耕动态环境稠密 SLAM)
  • 发表:ACM Multimedia 2026(里约热内卢);arXiv 2607.01860v2 [cs.RO]
  • 论文链接arxiv.org/abs/2607.01860
  • 代码状态:截至本解读撰写时未发现官方开源仓库(GitHub 检索无对应项目),论文亦未给出代码链接

一句话总结

DL-SLAM 用「像素级 + 对象级」双层动态概率重构了动态场景下的高斯泼溅 SLAM:瞬时静止的物体既能作为几何约束参与跟踪,又会在对象级概率确认后从高斯地图中被整类剪枝,从而在 TUM RGB-D、BONN 和 Wild-SLAM iPhone 三个动态数据集上同时拿到最优跟踪精度与无伪影的静态地图。

研究背景与动机

视觉 SLAM 是具身智能、自动驾驶与混合现实的基础能力。近几年以 NeRF 和 3D 高斯泼溅(3DGS)为场景表示的 SLAM 方法在新视角合成与稠密建图上展现了前所未有的能力,但这些方法几乎都依赖静态世界假设:一旦场景中出现运动的行人、推车或搬运的箱子,动态物体会在帧间引入错误的对应关系,直接污染相机位姿估计;而把它们纳入三维地图又会产生挥之不去的视觉伪影。动态环境与高保真重建之间的矛盾,是稠密 SLAM 走向真实应用必须跨过的门槛。

最流行的应对策略是「语义掩码一刀切」:DynaSLAM、DG-SLAM、SDD-SLAM 等方法用分割网络识别出预定义的动态类别(人、车等),把这些区域整体排除在跟踪与建图之外。论文指出这种做法有两个结构性缺陷。其一,动态物体并不总是有害的——当它瞬时静止时,反而能提供宝贵的几何与光度约束;不加区分地丢弃这些区域,在动态物体占据画面主体时会适得其反,此时剩余的静态结构过于稀疏,根本无法可靠约束相机位姿。其二,固定类别清单限制了泛化能力,预定义类别之外的动态物体(比如移动的纸箱、椅子)会被直接漏掉。

WildGS-SLAM 是离 DL-SLAM 最近的前作。它用逐像素的不确定性图作为跟踪权重,让瞬时静止物体得以为位姿估计做贡献。但论文分析出它的两个软肋:第一,不确定性低的瞬时静止物体会被顺势融合进地图表示,静态地图里留下持久伪影——物体只是「当时没动」,却被当成了永远的静态背景;第二,不确定性估计纯靠几何线索,在物体边界处数值含糊,动态区域识别不稳健。

DL-SLAM 的思路因此可以概括成一句话:让瞬时静止物体「帮忙跟踪,但不进地图」。要在一个系统里同时做到这两点,单一粒度的判断是不够的——像素级判断擅长精细加权,却看不到物体的整体状态;对象级判断能给出「这个实例到底是不是动态」的全局结论,却依赖像素级证据的可靠性。论文的答案是双层概率框架:像素级动态概率由语义与几何信息联合计算,作为稠密束调整(DBA)的自适应权重;像素概率被提升到三维高斯属性上,按实例聚合成对象级概率,用于类别化剪枝;而剪枝后得到的纯净静态地图又反过来渲染出几何一致的概率图,贝叶斯式地修正像素级估计,形成一个闭环。

除了动态物体的处理,论文还瞄准了一个常被忽视的配套问题:动态环境下的语义建图质量。物体运动和严重遮挡会让逐帧抽取的语义标签在时间上前后矛盾、在空间上出现空洞。DL-SLAM 为此引入动态感知的语义标签修正策略,用在线标签合并解决不一致、用面向遮挡区域的稠密化补全空洞,最终支撑起可交互编辑的对象级语义地图。三项贡献合在一起,构成了这篇 ACM MM 2026 论文的完整叙事。

预备知识:带动态概率属性的 3DGS 场景表示

DL-SLAM 用各向异性三维高斯集合 $\mathcal{G}=\{g_i\}_{i=1}^{K}$ 表示场景的静态部分。每个高斯 $g_i$ 由均值 $\mu_i\in\mathbb{R}^3$、协方差 $\Sigma_i\in\mathbb{R}^{3\times3}$、不透明度 $o_i\in[0,1]$ 和 RGB 颜色 $c_i\in\mathbb{R}^3$ 参数化。论文在此之上给每个高斯追加了两个关键属性:动态概率 $p_i\in[0,1]$ 与显式语义标签 $\ell_i$。动态概率是 0 到 1 的连续分数,越大越可能运动;显式标签则沿用 OpenGS-SLAM 的对象级表示路线,便于直接做实例推理,而不像隐式特征向量那样需要额外解码。

渲染沿用 3DGS 的 alpha 混合。颜色图 $\hat{C}$ 与深度图 $\hat{D}$ 由下式给出:

$$\hat{C}=\sum_{i=1}^{n} c_i \alpha_i T_i,\qquad \hat{D}=\sum_{i=1}^{n} d_i \alpha_i T_i,\qquad T_i=\prod_{j=1}^{i-1}(1-\alpha_j) \tag{1}$$

其中 $c_i$、$d_i$ 是高斯 $g_i$ 的颜色与深度值,透射率 $T_i$ 表示光线到达第 $i$ 个高斯前未被遮挡的比例。像素空间内二维泼溅的不透明度为:

$$\alpha_i=o_i\exp\left(-\frac{1}{2}(u-\mu)^{T}\Sigma_{2D}^{-1}(u-\mu)\right) \tag{2}$$

这里 $u$ 是像素坐标,$\mu$、$\Sigma_{2D}$ 是泼溅后的二维均值与协方差。关键的一步是:动态概率图可以像颜色、深度一样被渲染出来——

$$\hat{P}=\sum_{i=1}^{n} p_i \alpha_i T_i \tag{3}$$

这条看似平凡的公式是反馈闭环的基石:它让系统能从三维地图渲染出几何一致的概率图,而不仅仅是从单帧图像做二维估计。语义标签图 $\hat{L}$ 则采用高斯投票渲染:对标签 $l_j$ 累计权重

$$W_j=\sum_{g_i\in\mathcal{G}_j^{u}}\alpha_i\prod_{k=1}^{i-1}(1-\alpha_k) \tag{4}$$

其中 $\mathcal{G}_j^{u}$ 是对像素 $u$ 有贡献且带标签 $l_j$ 的高斯集合,累计权重最高的标签被赋给该像素。

方法详解

图 2 给出了系统总览:输入 RGB 序列后,跟踪分支估计像素级动态概率图 $P$ 并将其作为 DBA 的权重;建图分支把概率与标签提升到三维高斯,做对象级概率估计与动态剪枝;静态地图再渲染出概率图 $\hat{P}'$ 反哺像素级估计。下面按数据流顺序拆解每个环节。

DL-SLAM system overview

图2:系统总览(论文 Fig.2)。跟踪分支用语义标签图与光流估计像素级动态概率并加权 DBA;建图分支将概率与标签提升为高斯属性,完成对象级概率估计与动态剪枝;纯净静态地图渲染出的概率图再经贝叶斯更新反哺像素级估计。

语义地图生成:开放词表分割与跨帧关联

双层概率框架的地基是稳健且时间一致的语义理解。与依赖预定义动态类别(如「人」)的方法不同,DL-SLAM 走开放词表路线:先用 Recognize Anything Model(RAM)从输入图像生成开放集类别标签,把这些标签作为文本提示喂给 Grounding DINO 生成类别感知的检测框,再由 MobileSAMv2 产出精细的语义标签图。这套组合让系统不必事先约定哪些类别会动,任何被检测出的实例都能进入后续的概率推理。

逐帧分割本身并不够用——帧间标签必须对齐到同一实例身份。此前的 OpenGS-SLAM 只用 IoU 做匹配,对位移较大的动态物体并不可靠。DL-SLAM 改用融合匹配分数:空间重叠(IoU)与 CLIP 特征度量的外观相似度联合计分,新检测与同类别下所有已跟踪对象逐一比较,得分最高且超过阈值 $\tau_{sim}=0.7$ 的对象继承其对象 ID,匹配失败的检测被初始化为新标签。最终得到的语义标签图 $L$ 中,每个物体在帧间拥有一致的身份编号,这是对象级概率聚合的前提。

像素级动态概率:对极几何的统计建模

像素级概率要回答的问题是:在静态场景假设下,这个像素的观测有多「不一致」。DL-SLAM 用对极几何来量化这种不一致。出于效率考虑,概率图只在关键帧上估计:ConvGRU 网络估计当前关键帧 $I_k$ 与上一关键帧 $I_{k-1}$ 之间的光流(该光流同时用于位姿估计),从光流给出的稠密像素对应中估计基础矩阵 $F_{k,k-1}$,再对每个像素 $u$ 计算 Sampson 误差 $e_{F_{k,k-1}}(u)$,度量它偏离对极约束的程度。

得到几何误差后,论文借鉴 CFP-SLAM 的统计建模思路:假设静态像素的误差服从高斯分布,则平方 Sampson 误差服从自由度为 2 的卡方分布。像素的动态概率直接由该分布的累积分布函数给出:

$$\tilde{P}_{k|k-1}(u)=\mathrm{CDF}_{\chi^2}\left(\left(e_{F_{k,k-1}}(u)\right)^{2};\,2\right) \tag{5}$$

几何误差越大,动态可能性越高。相比 WildGS-SLAM 需要在线优化一个不确定性估计网络,这种解析式的概率建模几乎零额外开销,而且通过语义掩码的先验约束弥补了纯几何方法边界模糊的弱点。

初始概率图 $\tilde{P}_{k|k-1}$ 还要做一次语义聚合。依据是刚体假设:同一物体上所有像素共享运动状态。对每个对象 $o$,收集其语义掩码 $\mathcal{M}_o$ 内所有像素的概率并按降序排序,取前四分位数的均值与中位数的均值作为该对象的二维动态概率 $p^{2D}_o$,再把这个值赋回掩码内所有像素,构成聚合概率图 $P_k$。这种「显著运动说了算」的聚合方式既避免了个别噪声像素的干扰,也避免了均值被大量静止像素稀释。

对象级动态概率:近因加权聚合

像素级信息随后被提升到三维表示:每个在关键帧 $k$ 创建的新高斯 $g_i$,从对应像素继承动态概率 $p_i$ 与语义标签 $\ell_i$。对象级概率最朴素的做法是对物体名下所有高斯的概率求平均,但论文指出这会有「时间惯性」——一个长期静止的物体积累了大量低概率高斯,当它突然开始运动时,新创建的高概率高斯会被历史存量稀释,系统迟迟无法察觉状态变化。

DL-SLAM 的解法是近因加权聚合。设 $\mathcal{G}_o$ 是属于对象 $o$ 的高斯集合,在关键帧 $k$ 给每个高斯赋予指数衰减权重 $w_i=\exp(-\delta(k-k_i))$,其中 $k_i$ 是 $g_i$ 的创建关键帧索引,衰减率 $\delta=0.3$。对象级概率为加权平均:

$$p^{3D}_o=\frac{\sum_{g_i\in\mathcal{G}_o}w_i p_i}{\sum_{g_i\in\mathcal{G}_o}w_i} \tag{6}$$

这样,物体的运动状态主要由其近期行为决定,状态切换可以被快速捕获。这个设计与像素级的「上四分位聚合」形成呼应:两级都在回答同一个问题——如何让「正在发生的运动」压过「历史的静止」。

时间确认与动态高斯剪枝

有了对象级概率,剪枝策略采取保守姿态以避免误删:只有当某对象的 $p^{3D}_o$ 超过阈值 $\tau_{prune}=0.8$ 且连续三个关键帧保持超标,它才会被标记为动态并加入全局动态对象集合;属于该集合内任何对象的所有高斯随后被整体移出场景。「连续三帧」的时间确认协议牺牲了少量响应速度,换取对瞬时误判的鲁棒性;而一旦确认,剪枝是类别化、整实例的——这是静态地图无伪影的直接来源,也是与 WildGS-SLAM「低不确定性就融进地图」的本质区别。

概率更新:静态地图反哺的贝叶斯闭环

聚合概率图 $P_k$ 的上限受制于初始估计 $\tilde{P}_{k|k-1}$ 的可靠性,而基于二维光流的估计在无纹理区域容易出错。传统几何方法(如 CFP-SLAM)靠昂贵的多阶段流水线更新概率,DL-SLAM 则利用三维表示本身完成高效更新:用公式 (3) 从当前地图渲染出几何一致的概率图 $\hat{P}_k$。渲染本质是加权平均,高概率动态高斯的贡献会被大量静态高斯稀释,因此先做幂律放大 $\hat{P}'_k=(\hat{P}_k)^{\gamma}$,$\gamma=0.5$,再与初始估计 $P_k$ 做贝叶斯融合得到后验:

$$P^{post}_k=\frac{\hat{P}'_k\cdot P_k}{\hat{P}'_k\cdot P_k+(1-\hat{P}'_k)\cdot(1-P_k)} \tag{7}$$

这个公式把「地图渲染的似然」与「帧间几何的先验」相乘归一:两者都认为动态的像素概率被推高,任一方强烈认为静态的像素概率被压低。随后后验概率被回传到三维表示——当前视角下所有可见高斯的中心投影到图像平面,用对应像素的后验概率更新其动态属性 $p_i$。至此,像素级与对象级通过三维地图完成了一次完整的信息交换,这也是论文标题中「双层概率」耦合的真正含义。

动态感知的语义标签修正

语义建图面临两个动态环境特有的挑战:一是尽管有二维数据关联,纯帧间线索缺少全局几何上下文,标签不一致仍会残留;二是动态物体遮挡造成欠重建区域,语义含糊。对前者,论文设计在线修正机制:判断渲染掩码 $\mathcal{M}_i\subset\hat{L}$(标签 $i$)与输入掩码 $\mathcal{M}_j\subset L$(标签 $j$)是否对应同一物体,匹配分数取 IoU 与两个方向包含率的最大值:

$$S_m(i,j)=\max\left(\frac{|\mathcal{M}_i\cap\mathcal{M}_j|}{|\mathcal{M}_i\cup\mathcal{M}_j|},\frac{|\mathcal{M}_i\cap\mathcal{M}_j|}{|\mathcal{M}_j|},\frac{|\mathcal{M}_i\cap\mathcal{M}_j|}{|\mathcal{M}_i|}\right) \tag{8}$$

当 $S_m(i,j)$ 超过阈值 $\tau_{match}=0.8$,标签 $j$ 被视为标签 $i$ 的别名;为防止瞬时误匹配,这一关联需要连续三个关键帧重复出现才固化为永久身份合并,随后对相关高斯重新赋标签。包含率的引入让「渲染掩码只是输入掩码的一部分」这类遮挡场景也能正确匹配。对后者,论文用逐像素语义梯度度量语义碎片化程度:

$$S_g(u)=\sum_{q\in\mathcal{N}(u)}\mathbb{1}\left(\hat{L}(u)\neq\hat{L}(q)\right) \tag{9}$$

其中 $\mathcal{N}(u)$ 是 $u$ 的四邻域,$\mathbb{1}(\cdot)$ 为指示函数。在动态物体掩码并集覆盖的区域内,凡是 $S_g(u)$ 超过阈值 $\tau_{grad}=3$ 的高碎片化区域都会被定向稠密化,从而补全被动态物体遮挡的重建空洞。图 3 展示了这一机制的效果。

Semantic label refinement

图3:语义标签修正效果(论文 Fig.3,Bonn_mv_box2 序列第 520 帧)。从左到右:输入标签图、无修正的渲染、本文修正后的渲染。方法纠正了语义不一致(如地面上的纸箱),并稳健重建了被动态物体遮挡的区域(如椅子)。

跟踪与建图:概率加权的 DBA 与局部窗口优化

跟踪模块建立在 DROID-SLAM 之上:DBA 层在帧图 $\mathcal{F}=(V,E)$ 上联合优化关键帧位姿 $\omega$ 与视差 $d$。DL-SLAM 用 Metric3D 为每个新关键帧估计度量深度 $\tilde{D}_i$,并把动态概率图作为权重注入 DBA 目标函数:

$$\arg\min_{\omega,d}\sum_{(i,j)\in E}\left\|\tilde{u}_{ij}-\Pi_c\left(\omega_j^{-1}\omega_i\Pi_c^{-1}(u_i,d_i)\right)\right\|^{2}_{\Sigma_{ij}/(1-P_i)} \tag{10}$$

其中 $u_i$ 是关键帧 $I_i$ 的像素坐标,$\tilde{u}_{ij}$ 是光流预测的帧间对应,$\Pi_c$ 是相机投影函数,协方差权重由 ConvGRU 的置信矩阵 $\Sigma_{ij}$ 与动态概率 $P_i$ 共同构成。权重形式 $\Sigma_{ij}/(1-P_i)$ 意味着概率越接近 1 的像素信息矩阵越小、贡献越低:正在运动的像素被降权,而瞬时静止物体的稳定区域照常参与约束。这正是「帮忙跟踪」的落地方式。

建图侧,高斯地图随关键帧增量扩展。与在二维阶段过滤动态物体的方法不同,DL-SLAM 允许所有像素初始化新高斯,把动态处理完全推迟到三维剪枝阶段,避免二维误判造成不可逆的信息丢失。地图扩展后在共视关键帧的局部窗口内优化,渲染损失为:

$$(1-P)\left(\lambda_c\mathcal{L}_{color}+(1-\lambda_c)\mathcal{L}_{depth}\right)+\lambda_{reg}\mathcal{L}_{iso} \tag{11}$$

颜色损失与深度损失都被 $(1-P)$ 加权,动态像素不参与监督。颜色损失组合 L1 与 SSIM:

$$\mathcal{L}_{color}=(1-\lambda_{ssim})|\hat{C}-C|_1+\lambda_{ssim}\left(1-\mathrm{SSIM}(\hat{C},C)\right) \tag{12}$$

深度损失 $\mathcal{L}_{depth}=|\hat{D}-\tilde{D}|_1$ 以 Metric3D 的度量深度为监督。各向同性正则防止弱约束区域的高斯被拉得过长:

$$\mathcal{L}_{reg}=\frac{1}{|\mathcal{G}|}\sum_{i=1}^{|\mathcal{G}|}|s_i-\bar{s}_i|_1 \tag{14}$$

其中 $s_i$ 是第 $i$ 个高斯的尺度,$\bar{s}_i$ 是地图内的平均尺度。另一个工程细节是优化终止条件:不固定迭代次数,而是当局部窗口内建图损失的方差低于 $\tau_{var}=0.002$ 时提前终止,避免收敛后的冗余计算。实现参数为 $\lambda_c=0.5$、$\lambda_{reg}=10$、$\lambda_{ssim}=0.2$。

flowchart TD
    A[RGB 关键帧序列] --> B[开放词表语义分割
RAM + Grounding DINO + MobileSAMv2] B --> C[跨帧数据关联
IoU + CLIP 外观相似度] C --> D[语义标签图 L
实例身份跨帧一致] A --> E[ConvGRU 光流估计] E --> F[基础矩阵与 Sampson 误差] F --> G[像素级初始概率
卡方 CDF 建模] D --> H[对象内语义聚合
上四分位与中位数] G --> H H --> I[聚合概率图 P 加权 DBA 跟踪
动态像素降权] H --> J[概率与标签提升为高斯属性] J --> K[对象级概率
近因加权聚合 δ=0.3] K --> L{连续 3 个关键帧
概率超过 0.8} L -->|是| M[类别化剪枝动态高斯] M --> N[纯净静态地图] N --> O[渲染概率图
幂律放大 γ=0.5] O --> Q[贝叶斯后验更新像素概率] Q --> H D --> R[语义标签修正与遮挡区稠密化] R --> N

DL-SLAM 双层概率流水线:像素级概率支撑跟踪加权,对象级概率驱动剪枝,静态地图渲染的概率图经贝叶斯更新回流,形成闭环。

实验结果

实验在 Intel i9-12900KF + NVIDIA RTX 3090 平台上完成,评测覆盖三个动态数据集:TUM RGB-D 动态子集(8 条序列)、BONN(8 条序列)以及用于无约束场景的 Wild-SLAM iPhone 数据集(piano、shop、street、tower、wall、wander 6 条序列)。跟踪用 ATE 的 RMSE 与标准差衡量,重建与渲染用 PSNR、SSIM、LPIPS 对照真值训练视角评估。基线按场景表示分三组:传统方法(ORB-SLAM2、ReFusion、DynaSLAM、CFP-SLAM)、NeRF 系(Co-SLAM、NID-SLAM、RoDyn-SLAM、DynaMoN)、3DGS 系(SGS-SLAM、DG-SLAM、SDD-SLAM、WildGS-SLAM),每组各含一个静态参考方法。

跟踪:TUM 与 BONN 双榜第一

表 1 给出 TUM RGB-D 动态数据集上的跟踪结果(ATE RMSE,单位 cm)。DL-SLAM 在全部 8 条序列中的 6 条上拿到最优、其余两条与最优持平或接近,平均 RMSE 1.3cm,比次优的 WildGS-SLAM(1.5cm)低约 13%——这正是摘要中「跟踪精度最多提升 13%」的出处。对比之下,语义掩码系的 DynaSLAM、CFP-SLAM 平均在 1.7–1.9cm,而完全不做动态处理的静态方法(ORB-SLAM2 平均 30.2cm、Co-SLAM 平均 63.3cm)在 walk 系列高动态序列上彻底崩溃,ATE 动辄数十厘米至上米。

方法f3/sit_sf3/sit_xf3/sit_rf3/sit_hf3/walk_sf3/walk_xf3/walk_rf3/walk_h平均
ORB-SLAM20.90.92.01.938.772.178.446.730.2
ReFusion0.94.013.211.01.79.940.610.411.5
DynaSLAM0.51.32.71.90.71.63.53.01.9
CFP-SLAM0.50.92.51.50.71.43.72.41.7
Co-SLAM1.54.851.78.630.672.5236.0100.763.3
NID-SLAM1.97.58.610.56.26.464.87.114.1
RoDyn-SLAM1.75.26.74.41.78.37.95.65.2
DynaMoN0.51.02.42.60.71.43.51.91.8
SGS-SLAM1.41.813.512.960.3130.470.769.637.2
DG-SLAM0.71.13.62.53.52.94.43.72.8
WildGS-SLAM0.50.82.31.70.51.33.11.51.5
DL-SLAM(本文)0.50.81.91.30.41.22.91.41.3

表1:TUM RGB-D 动态数据集跟踪性能,ATE RMSE [cm],越低越好(论文 Table 3,标准差此处省略)。加粗为各列最优。

BONN 数据集的结果(表 2)呈现同样格局:DL-SLAM 平均 RMSE 2.2cm 排名第一,领先 WildGS-SLAM(2.5cm)约 12%;在人群密集的 crowd、crowd2 序列上优势尤其明显(1.3cm 对 1.6cm、1.6cm 对 2.2cm)。两处例外值得如实指出:ps_trk2 序列上 DynaMoN 以 2.3cm 小幅领先(DL-SLAM 2.9cm),mv_box2 序列上 WildGS-SLAM 以 2.3cm 领先(DL-SLAM 2.6cm)。整体而言,3DGS 系方法包揽前列,而静态方法在 BONN 上平均误差达到 22–90cm,再次印证动态处理的必要性。

方法ballball2crowdcrowd2ps_trkps_trk2mv_boxmv_box2平均
ORB-SLAM215.812.698.062.869.878.632.379.656.2
DynaSLAM3.43.22.52.94.712.62.026.27.2
Co-SLAM25.038.7245.8229.077.273.710.525.490.7
RoDyn-SLAM7.911.513.513.714.513.824.912.614.1
DynaMoN2.92.73.34.815.12.31.52.74.4
SGS-SLAM44.737.2105.8267.0128.766.723.641.589.4
DG-SLAM6.24.82.13.24.66.32.83.64.2
WildGS-SLAM2.82.51.62.23.73.11.72.32.5
DL-SLAM(本文)2.42.31.31.63.42.91.42.62.2

表2:BONN 数据集跟踪性能,ATE RMSE [cm](论文 Table 2 节选,ReFusion 与 SDD-SLAM 因报告不全未列入)。加粗为各列最优。

渲染:无伪影静态地图的量化证据

渲染评测是「剪枝带来无伪影地图」这一主张的量化证据。表 3 给出 Wild-SLAM iPhone 数据集上的完整结果:DL-SLAM 在 6 条序列上全部取得最优 PSNR 与 SSIM,例如 piano 序列 PSNR 19.18dB(WildGS-SLAM 17.93、SGS-SLAM 16.65),street 序列 21.06dB(WildGS 19.69),tower 序列 19.93dB。LPIPS 上 DL-SLAM 在 5/6 条序列最优。图 4(论文)的定性对比解释了差距来源:WildGS-SLAM 在 wandering 序列把瞬时静止的两个人融进了地图,在 mv_box 序列把移动过的箱子留在初始位置,形成明显伪影;DL-SLAM 的对象级剪枝把这些动态高斯整体移除,渲染干净。论文还展示了该方法对 mv_box 中「从桌上移到地面的箱子」的正确处理——箱子被判定为动态并从初始与最终位置同时清除。

方法指标pianoshopstreettowerwallwander
SGS-SLAMPSNR [dB]↑16.6515.5918.3117.5314.1514.11
SSIM↑0.6690.5840.7360.7150.4150.513
LPIPS↓0.4090.5830.4180.3850.6810.561
DG-SLAMPSNR [dB]↑13.4112.7613.2313.9811.9713.14
SSIM↑0.2630.2270.3750.5310.2030.260
LPIPS↓0.8460.9360.8550.6740.9940.831
WildGS-SLAMPSNR [dB]↑17.9315.7919.6919.0616.3216.70
SSIM↑0.6500.4990.7000.8050.5030.569
LPIPS↓0.2480.4680.3370.2450.4930.341
DL-SLAM(本文)PSNR [dB]↑19.1818.3421.0619.9318.0717.92
SSIM↑0.7640.6890.8100.8640.7150.751
LPIPS↓0.1710.2360.1750.1630.2360.197

表3:Wild-SLAM iPhone 数据集渲染性能(论文 Table 1 节选)。BONN 部分 DL-SLAM 同样在 8 条序列的 PSNR/SSIM 上全部最优。

语义地图还带来实用的交互能力:图 5 展示了 iPhone tower 序列上的交互式场景编辑——用户输入指定目标物体的提示词,系统凭借对象级语义表示定位对应实例并将其从最终地图中移除。

Interactive scene editing

图4:交互式场景编辑(论文 Fig.5,Wild-SLAM iPhone tower 序列第 171 帧)。从左到右:移除前渲染、移除后 RGB 渲染、移除后语义渲染,目标实例由用户提示词指定。

运行时、显存与消融

运行时方面(表 4),语义分割耗时 168.5ms/帧——为公平起见,论文把本文生成的语义标签同样提供给 SGS-SLAM,两者在该项持平;跟踪 139.6ms/帧,与共享高效 DBA 层的 WildGS-SLAM 并列最低(SGS-SLAM 高达 1307.1ms/帧);建图 590.4ms/帧,优于全部对比方法(WildGS-SLAM 因在线优化不确定性网络达到 995.9ms/帧)。模型尺寸 11.1MB,约为 SGS-SLAM(32.9MB)的三分之一,但 GPU 显存 11.5GB 为对比方法中最高,这是每个高斯额外存储语义标签与动态概率属性的直接代价。需要说明的是,论文未报告端到端 FPS,各环节毫秒数相加意味着系统距离实时仍有距离。

指标RoDyn-SLAMSGS-SLAMWildGS-SLAMDL-SLAM(本文)
分割 [ms/帧]↓250.0168.5168.5
跟踪 [ms/帧]↓378.41307.1139.6139.6
建图 [ms/帧]↓757.2620.3995.9590.4
模型尺寸 [MB]↓7.332.98.011.1
GPU 显存 [GB]↓5.06.510.811.5

表4:TUM RGB-D 上的运行时与显存(论文 Table 4)。加粗为各行最优,WildGS-SLAM 不使用独立分割模块。

消融实验(表 5,BONN 8 条序列平均)量化了三个核心组件的贡献。去掉像素级概率的代价最大:ATE RMSE 从 2.2cm 恶化到 4.8cm,几乎翻倍,证明概率加权是鲁棒跟踪的主因;去掉对象级概率后 ATE 升至 2.6cm、PSNR 从 19.99dB 降到 19.38dB,图 6 的定性结果显示 crowd2 序列中出现明显的动态物体残影;去掉语义修正则主要伤害渲染质量,PSNR 降至 18.74dB。三个组件各司其职:像素级保跟踪、对象级保地图、语义修正保渲染保语义。

配置ATE RMSE [cm]↓ATE S.D. [cm]↓PSNR [dB]↑
去掉像素级概率4.82.819.00
去掉对象级概率2.61.319.38
去掉语义修正2.41.118.74
DL-SLAM 完整2.21.019.99

表5:BONN 数据集消融实验(论文 Table 5)。

Rendering ablation on BONN

图5:BONN 渲染消融(论文 Fig.6,crowd2 序列第 316 帧)。从左到右:真值、去掉对象级概率的渲染、完整 DL-SLAM 渲染与局部放大。缺少对象级剪枝时动态人形残留在地图中形成残影。

DL-SLAM teaser

图6:论文题图(Fig.1)。单目动态序列下的静态地图重建对比:DL-SLAM 在 RGB 与语义两种视图下都消除了动态物体干扰,SGS-SLAM 则保留大量残影。

局限性

1. 只建模静态场景,动态物体被丢弃而非理解(作者自述)。论文结论部分明确把「显式建模动态物体轨迹、实现完整 4D 场景理解」列为未来方向。当前系统对动态物体的态度是检测并剪枝:这些物体的运动信息没有被保留,无法支持对动态障碍物的预测或交互,对需要与移动物体共处的下游任务(如人机共存环境中的导航规划)是实质性的能力缺口。

2. 距离实时仍有明显差距。论文没有报告端到端 FPS。仅看各环节耗时:分割 168.5ms、跟踪 139.6ms、建图 590.4ms(每帧计),叠加后系统在 RTX 3090 上远达不到实时。作者也承认系统依赖 RAM、Grounding DINO、MobileSAMv2、CLIP、Metric3D 一串预训练大模型,这套感知栈的推理开销是主要瓶颈之一。

3. 评测局限于室内,泛化性未验证。三个数据集(TUM、BONN、Wild-SLAM iPhone)均为室内办公类场景,动态物体以行人和搬运的箱子为主。开放词表分割链在户外、夜间、极端光照或罕见物体上的表现未经检验,而对极几何 + 光流的概率估计在大位移、快速运动场景下也可能失效。

4. 剪枝与确认机制存在延迟与调参敏感性。「连续三个关键帧超过 0.8」的时间确认协议意味着突然开始运动的物体在数帧内仍会污染地图;近因加权衰减率 $\delta=0.3$、剪枝阈值 $\tau_{prune}=0.8$ 等关键超参均为经验值,论文未提供敏感性分析。

总结与展望

DL-SLAM 的核心贡献是给动态场景 SLAM 提供了一套双粒度的概率语言:像素级概率回答「这个观测可信吗」,用于跟踪加权;对象级概率回答「这个实例是动态的吗」,用于地图剪枝;两者通过可微渲染在三维空间里互相校准。这种设计把「利用瞬时静止物体」与「保持地图纯净」这对长期矛盾拆解到不同粒度上分别解决,配合动态感知的语义修正,在三个动态基准上同时刷新了跟踪与渲染指标。对机器人系统而言,它给出的启示是:动态环境中的语义与几何不是互斥的线索,概率是把它们装进同一个框架的合适接口。作者展望的下一步是为动态物体建立显式轨迹模型,走向完整的 4D 场景理解——届时「剪枝」将升级为「建模」,动态物体从被清除的干扰变成被理解的实体。

金句

「瞬时静止的物体为位姿估计提供了宝贵的几何约束……对象级概率使得对动态高斯进行类别化剪枝成为可能,从而得到一张无伪影的静态地图。」——论文摘要。前半句解释了为什么要留下它们,后半句解释了为什么最终不能留下它们。