Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper3D Gaussian Splatting3DGS

锯齿与低纹理环境下稀疏视角视觉重定位

研究锯齿与低纹理环境下的稀疏视角视觉重定位,提出方法提升视觉定位鲁棒性,服务于机器人导航与3DGS初始化。

Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato2026年7月24日3 分钟阅读
EN
Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato
DLR · University of Zaragoza
arXiv:2607.22147 · 代码仓库

一句话总结

本文针对行星类地形(低纹理、感知锯齿、恶劣光照、前向运动致稀疏弱重叠视角)的视觉重定位,提出结构保持 3DGS:在光度损失 $\mathcal{L}_{\text{photo}}$ 之外首次结合 MVS 深度/法向一致性损失与 LiDAR 对称 Chamfer 损失监督 3D Gaussian Splatting 几何,使 Chamfer 误差降 74%、PSNR 升至 25.27,单图 6-DoF 重定位在(10m,15°)阈值下召回从 6.25% 提到 43.2%。

Figure 1. 行星类环境重定位挑战

Figure 1 — 行星类极端环境的重定位挑战。底部三图虽有重叠,但大视角变化与弱锯齿纹理对估计图所示地图内的 6-DoF 相机位姿构成巨大挑战。

1. 研究背景与动机

在 GNSS 拒止环境(如行星场景)中,可靠视觉重定位是长期机器人自主的关键——用于回环闭合与消除里程计漂移。但感知锯齿与恶劣光照严重降低传统视觉位置识别与位姿估计性能。行星漫游车以前向运动为主,视角多样性受限、连续帧间视差小、长间隔透视致外观变化大。

3DGS 提供显式可微表征,支持基于渲染的对齐与对视角变化的更好鲁棒性。但标准光度 3DGS 训练不适于漫游车户外序列:前向运动致弱多视约束→高重建误差;视角稀疏限泛化;重访大基线挑战朴素光度损失。本文首次系统结合 MVS 与 LiDAR 几何监督,证明二者互补且合成优于单独使用。

2. 核心方法

2.1 3DGS 子图

场景表征 $\mathcal{G}=\{\mathcal{G}_1,\ldots,\mathcal{G}_m\}$ 由 $m$ 子图组成,每子图 $\mathcal{G}_s=f(\mathcal{P}_s,\mathcal{I}_s,\mathcal{T}_s)$ 为一组编码几何与外观的高斯,由聚合 LiDAR 点云 $\mathcal{P}_s$、$m$ 张 RGB 图 $\mathcal{I}_s$、相机位姿 $\mathcal{T}_s\in SE(3)$ 估计。给定查询图 $\mathbf{I}_q$,先视觉位置识别检索候选子图,再直接对对应高斯表征估计 6-DoF 位姿 $\mathbf{T}_q^s$。

Figure 2. 重定位流水线概览

Figure 2 — 基于结构保持 3DGS 的重定位流水线。RGB 图与 LiDAR 分组为子图,用光度+强几何监督训练 3DGS;推理时查询图检索 top-k 候选子图,最小化对 3DGS 的渲染误差估位姿。

2.2 结构保持 3DGS 拟合

光度监督

$$\mathcal{L}_{\text{photo}}=(1-\lambda_{\text{SSIM}})\mathcal{L}_1+\lambda_{\text{SSIM}}\mathcal{L}_{\text{SSIM}}$$

取 $\lambda_{\text{SSIM}}=0.2$。

MVS 监督:用 MVSAnywhere(MVSA)预测深度图。深度对齐 $\mathcal{L}_1$ 损失:

$$\mathcal{L}_{\text{MVSD}}=\frac{1}{|\Omega|}\sum_{i\in\Omega}|d_i^{\text{GS}}-d_i^{\text{MVS}}|$$

法向一致性余弦相似度损失:

$$\mathcal{L}_{\text{MVSN}}=1-\frac{1}{|\Omega|}\sum_{i\in\Omega}{\mathbf{n}_i^{\text{GS}}}^\top\cdot\mathbf{n}_i^{\text{MVS}}$$

法向由 MVS 深度图微分得到。增强局部表面连贯性,缓解弱纹理区深度歧义。但 MVS 依赖几何视差,在稀疏视角与近线性行迹下可靠性下降。

LiDAR 监督:对称 Chamfer 损失对齐重建高斯场景与 LiDAR:

$$\mathcal{L}_{\text{Ch}}=\mathcal{L}_{\text{acc}}+\lambda_{\text{comp}}\mathcal{L}_{\text{comp}}$$

其中精度项与完备性项:

$$\mathcal{L}_{\text{acc}}=\frac{1}{|\mathcal{P}_{\text{GS}}|}\sum_{\mathbf{p}\in\mathcal{P}_{\text{GS}}}\min_{\mathbf{q}\in\mathcal{P}_s}\|\mathbf{p}-\mathbf{q}\|_2,\quad \mathcal{L}_{\text{comp}}=\frac{1}{|\mathcal{P}_s|}\sum_{\mathbf{q}\in\mathcal{P}_s}\min_{\mathbf{p}\in\mathcal{P}_{\text{GS}}}\|\mathbf{q}-\mathbf{p}\|_2$$

容忍稀疏 LiDAR 与密集高斯间大密度差、无需显式对应、完全可微。将高斯锚定到度量精确的 LiDAR,解决低视差深度并提升位姿稳定性。总损失:

$$\mathcal{L}=\mathcal{L}_{\text{photo}}+\lambda_{\text{MVSD}}\mathcal{L}_{\text{MVSD}}+\lambda_{\text{MVSN}}\mathcal{L}_{\text{MVSN}}+\lambda_{\text{Ch}}\mathcal{L}_{\text{Ch}}$$

flowchart TB
    RGB["RGB images"] --> SUB["submap G_s"]
    LIDAR["LiDAR point cloud P_s"] --> SUB
    POSE["camera poses T_s"] --> SUB
    SUB --> PHOTO["photometric loss L_photo"]
    SUB --> MVSA["MVSAnywhere depth+normals"]
    MVSA --> LMVS["L_MVSD + L_MVSN
(local surface coherence)"] SUB --> CHAM["symmetric Chamfer L_Ch
(global metric alignment)"] LIDAR --> CHAM PHOTO --> TOTAL["total loss L"] LMVS --> TOTAL CHAM --> TOTAL TOTAL --> GS["geometry-aware 3DGS"] GS --> REL["6DGS 6-DoF relocalization"] style CHAM fill:#dbeafe,stroke:#2563eb style LMVS fill:#fef9c3,stroke:#ca8a04 style REL fill:#dcfce7,stroke:#16a34a

3. 实验结果

数据:Vulcano 岛(西西里)行星模拟地形 moon_lake 序列,约 25 分钟、1.5 km 轨迹,同步 RGB+LiDAR+dGNSS 真值。Nerfstudio 框架,Photo-3DGS 30,000 迭代 Adam;几何感知变体 20,000 迭代,$\lambda_{\text{MVSD}}=0.05$、$\lambda_{\text{MVSN}}=0.1$,Chamfer 2,000 迭代后激活线性增至 8,000 达 $\lambda_{\text{Ch}}=5\times10^{-5}$。

3.1 重建质量

方法Chamfer↓PSNR↑SSIM↑LPIPS↓
3DGS3.3620.770.520.26
3DGS + MVSA4.0322.190.490.27
3DGS + LiDAR1.3223.550.670.18
3DGS + Chamfer + LiDAR1.0324.210.700.17
3DGS + MVSA + LiDAR1.0225.540.740.17
Ours (+MVSA+LiDAR+Chamfer)0.8825.270.720.18

LiDAR 初始化降几何误差 61%,加 Chamfer 监督降约 74%。MVS+LiDAR 合成比单独任一更准。几何改进不损光度保真——度量一致性而非仅光度重建质量是高质量表征的关键。

3.2 重定位召回

方法召回 (10m, 15°)召回 (2m, 10°)
PnP (SuperPoint+SuperGlue)0.160.00
3DGS6.250.00
3DGS + LiDAR2.100.00
3DGS + MVSA22.906.20
3DGS + MVSA + LiDAR31.206.20
3DGS + Chamfer + LiDAR28.266.52
Ours43.206.80

宽松阈值下 PnP/3DGS/3DGS+LiDAR 召回极低(0.16%/6.25%/2.10%),本文达 43.2%——几何感知地图使位姿优化器能成功精修中度失配检索候选。严格阈值下基线全 0,本文 6.80%。PnP 因可靠对应少致大平移误差;光度 3DGS 旋转误差大(视觉相似候选对应错误空间对齐);本文大幅降旋转误差(中位 <25°)并保竞争性平移精度。

Figure 5. 渲染质量 vs 几何精度

Figure 5 — 渲染质量(纵)对几何精度(横)。几何监督提升度量一致性同时维持光度保真。

4. 主要贡献

  • 结构保持 3DGS:首次结合 MVS 深度/法向与 LiDAR 对称 Chamfer 损失监督 3DGS 几何,证明互补且合成优于单独。
  • 行星类重定位流水线:视觉位置识别检索子图 + 6DGS 直接对高斯地图估计 6-DoF 位姿。
  • 度量一致性关键:几何改进(Chamfer 降 74%)不损光度保真,度量一致性是高质量表征关键。
  • 召回大幅提升:(10m,15°) 从 6.25% 提到 43.2%,旋转误差中位 <25°。

5. 局限与展望

作者自述:6DGS 不经光度对齐而靠稀疏几何射线对应估位姿,故渲染可能有光度伪影;子图边界附近 3DGS 局部不准致真值位姿渲染与查询图不完全匹配。

分析判断:仅 moon_lake 单序列评测,泛化到其他行星模拟/真实场景未验证。严格 (2m,10°) 召回仅 6.80%,说明任务仍极难。MVS 监督依赖 MVSAnywhere 跨域泛化,其在其他地形的质量未知。Chamfer 权重与激活调度为经验设定。6DGS 不做光度精修是设计选择,结合 iNeRF 式渲染-比较优化或可进一步提升但增复杂度。

6. 总结

本文针对行星类地形(低纹理、感知锯齿、前向运动稀疏视角)的视觉重定位,提出结构保持 3DGS:在光度损失外首次结合 MVS 深度/法向一致性损失与 LiDAR 对称 Chamfer 损失,首次系统证明二者互补且合成优于单独——Chamfer 误差降 74%、PSNR 升至 25.27,且不损光度保真。在 Vulcano moon_lake 序列上,单图 6-DoF 重定位召回在(10m,15°)从光度 3DGS 的 6.25% 提到 43.2%,严格(2m,10°)从 0% 提到 6.80%,旋转误差中位降至 <25°。核心结论:度量一致性而非仅光度重建质量是高质量表征与稳健重定位的关键,几何监督使位姿优化器能精修中度失配候选。

光度保真不够——度量一致性才是重定位的基石;MVS 与 LiDAR 几何监督互补,让 3DGS 在行星类极端地形真正可用。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日