Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper3D Gaussian Splatting3DGS

探索至关重要:逃离3D高斯泼溅模糊陷阱

针对3D高斯泼溅中的模糊陷阱问题,提出探索策略逃离该陷阱,提升3DGS新视角合成的清晰度与质量。

Chengbo Wang, Guozheng Ma, Jinhong Wu, Tie Ji, Yizhen Lao2026年7月20日3 分钟阅读
EN
论文标题:Exploration Matters for Escaping the Blur Trap in 3D Gaussian Splatting
作者:Chengbo Wang, Guozheng Ma, Jinhong Wu, Tie Ji, Yizhen Lao
机构:湖南大学、南洋理工大学
项目主页:chengbo-wang.github.io/ExploreGS
关键词:3D 高斯泼溅、模糊陷阱、探索-利用平衡、可微渲染、新视角合成
一句话概括:本文从数学上证明了 3DGS 优化中存在一个系统性缺陷——"模糊陷阱"(Blur Trap),它源于梯度对视角方向的正交性和 α 混合导致的梯度衰减;作者仅用两个极简的随机探索算子(随机播种 + 随机分裂)就成功逃离该陷阱,在五个基准数据集上达到 SOTA。
Blur Trap 概览图
图 1:通过随机探索逃离模糊陷阱。远侧模糊陷阱(左)由深度梯度缺失引发,近侧模糊陷阱(右)由 2D 梯度衰减引发。随机播种和随机分裂分别解决这两个子类型。

一、研究背景与动机

3D 高斯泼溅(3D Gaussian Splatting, 3DGS)通过各向异性高斯基元进行显式场景表示,在实时渲染和真实感新视角合成方面取得了突破性进展。与 NeRF 等隐式神经表示不同,3DGS 的每个高斯基元直接由相机投影模型推导出的梯度更新,中间没有神经网络。这种物理驱动的设计带来了高效率,但同时也埋下了一个根本性的隐患。

在实践中,研究者和用户反复观察到一种系统性失效模式:无论提供多少训练视角,场景中某些特定区域始终模糊不清。这些模糊区域并非随机分布,而是集中出现在两类位置——远处的背景内容(如山脉、天际线)和被遮挡的近场区域(如架子后面的草地)。这种模糊在充足的监督信号下仍然持续存在,说明问题不在于数据不足,而在于优化过程本身。作者将这一系统性失效命名为模糊陷阱(Blur Trap)。

现有改进 3DGS 的工作大致分为三条路线,但都未能触及问题根源:第一条路线优化致密化判据(如 AbsGS、Pixel-GS),但这些方法仍然依赖同一个带有偏差的梯度信号;第二条路线(如 HoGS)通过齐次坐标重参数化来更好地表示远场内容,但并未引入深度方向的新优化信号;第三条路线(如 3DGS-MCMC)向高斯位置注入 Langevin 噪声,虽然精神上最接近本文,但噪声被均匀施加于整个场景,并未针对两种不同的失效根源进行诊断和区分。

二、模糊陷阱的数学根源

2.1 2D 梯度主导效应

3DGS 中高斯基元的位置更新由三个梯度分支组成:2D 投影位置梯度、2D 协方差梯度和球谐系数梯度。作者通过实验发现,2D 位置分量在整个训练过程中比其他两个分量大两到三个数量级,因此 3D 位置更新实际上完全由 2D 重投影误差所主导。这意味着优化器本质上只在做屏幕空间的贪心优化。

2.2 梯度正交性定理

核心发现:通过严格推导相机投影管线,作者证明了从 2D 梯度推导出的 3D 位置梯度始终正交于从相机中心到高斯基元的视角方向。换言之,优化器只能在垂直于视角方向的平面内移动基元,永远无法沿视角射线的深度方向移动。这就是远侧模糊陷阱(Far-Side Blur Trap)的数学根源。

具体而言,设 $\mathbf{P}_{\mathrm{3D}}$ 为高斯基元的世界坐标,$\mathbf{P}_{\mathrm{cam}}$ 为相机位置,渲染管线经过视图变换 $\mathbf{V}$、投影变换 $\mathbf{P}$、透视除法和视口变换四个阶段。2D 位置梯度可分解为三个雅可比矩阵的乘积:

$$ \mathbf{g}_{\mathrm{2d}}=\frac{\partial L^{2D}}{\partial\mathbf{P}_{\mathrm{3D}}}=\frac{\partial L}{\partial\mathbf{p}_{\mathrm{2D}}}\frac{\partial\mathbf{p}_{\mathrm{2D}}}{\partial\mathbf{p}_{\mathrm{ndc}}}\frac{\partial\mathbf{p}_{\mathrm{ndc}}}{\partial{}^{h}\mathbf{p}}\frac{\partial{}^{h}\mathbf{p}}{\partial\mathbf{P}_{\mathrm{3D}}} $$

其中视口变换雅可比矩阵 $\frac{\partial\mathbf{p}_{\mathrm{2D}}}{\partial\mathbf{p}_{\mathrm{ndc}}}$ 的第三列恒为零,而透视除法雅可比矩阵的零空间恰好包含齐次坐标向量 ${}^{h}\mathbf{p}$。这两个几何事实的叠加导致梯度与视角方向的内积严格为零:

$$ \frac{\partial L^{2D}}{\partial\mathbf{P}_{\mathrm{3D}}}\cdot\mathbf{D}_{\mathrm{C2G}}=\frac{\partial L^{2D}}{\partial\mathbf{P}_{\mathrm{3D}}}(\mathbf{P}_{\mathrm{3D}}-\mathbf{P}_{\mathrm{cam}})=0 $$

这个定理深刻地揭示了:3DGS 的可微渲染公式本身就没有提供任何沿深度方向的优化信号。基元无法通过梯度下降移动到正确的深度位置,远处区域的几何结构因此陷入永久模糊。

2.3 α 混合导致的梯度衰减

第二个失效机制来自 α 混合管线。在 3DGS 的前向渲染中,像素颜色由按深度排序的高斯基元累积混合而成:

$$ C_{p}=\sum_{i=1}^{N}c_{i}\alpha_{i}T_{i},\quad T_{i}=\prod_{j=1}^{i-1}(1-\alpha_{j}) $$

其中 $T_i$ 是前 $i-1$ 个基元的累积透射率。由于 $T_i$ 随排序索引 $i$ 的增大而单调递减,排在后面的被遮挡基元对最终像素颜色的贡献极小,其回传梯度也被严重衰减。作者进一步证明了 2D 位置梯度幅值的上界:

$$ \left|\frac{\partial\hat{\mathbf{c}}_{c}}{\partial\alpha_{m}}\right|\leq T_{m-1}=\prod_{j=1}^{m-1}(1-\alpha_{j}) $$

由于每个 $\alpha_j \in [0,1]$,透射率序列单调非递增:$T_0=1\geq T_1\geq T_2\geq\cdots\geq T_N\geq 0$。这意味着越靠后的基元收到的梯度信号越弱,其周期性统计的梯度幅值始终无法达到致密化阈值 $\tau_{\text{split}}$,导致致密化失败。这就是近侧模糊陷阱(Near-Side Blur Trap)的形成机制——被遮挡区域的基元因为梯度被 α 混合衰减而无法获得致密化机会。

梯度幅值与深度分布
图 5:中心像素贡献基元的 2D 梯度幅值与相机空间深度。排在前面的基元梯度幅值远大于后面排队的基元,且贡献基元跨越三个不同深度区间。

2.4 模糊陷阱的形成

综合屏幕空间梯度主导、深度梯度缺失和混合致密化失败三重因素,3DGS 的优化形成了一个"纯利用"(exploitation-only)的动态过程。确定性梯度下降无法逃离这个局部最优盆地,因为所需的深度探测信号在渲染公式的数学结构层面就被压制了。这种系统性优化停滞不是暂时的优化阶段,而是可微渲染管线的固有后果。

充分监督下的模糊陷阱
图 6:即使提供充足的训练视角,远处区域(山脉)和被遮挡区域(长椅下方)仍存在持续性模糊。虚线框表示针对模糊区域的密集监督视角分布。

三、方法:两个最小探索算子

3.1 设计原则

模糊陷阱的根因在于可微渲染管线的物理公式。参数更新和自适应致密化都完全依赖回传梯度,优化过程继承了系统性偏差。要打破这一僵局,核心设计原则是:绕过纯梯度驱动的利用过程,注入与 2D 梯度幅值无关的显式探索。

作者刻意采用最简单的算子来验证探索本身的内在有效性。对于远侧模糊陷阱,探索需要建立沿深度轴的更新通路;对于近侧模糊陷阱,探索需要主动触发梯度低于阈值 $\tau_{\text{split}}$ 的基元的致密化。这种最小化设计的哲学是:证明 3DGS 优化缺失的是探索原则本身,而非精密的工程改进。

3.2 随机播种(Random Seeding)

随机播种算子在每次致密化迭代中,在所有现有高斯基元的最小包围盒内均匀采样 $N_{\text{seed}}=20$ 个候选位置,将新的种子高斯注入到现有基元集合中。这些种子直接探测梯度更新无法到达的深度区间,绕过了视角梯度正交性约束。

这个算子的精妙之处在于其自清理机制:落在无效或空白区域的种子无法降低光度损失,会被原生的不透明度剪枝机制自动移除;而落在几何合理区域的种子则被标准 2D 重投影损失引导,在垂直于视角方向的平面内精炼位置,最终触发自适应致密化。这形成了一个互补优化循环:随机播种提供全局深度探索,确定性梯度驱动局部平面利用。

$$ \mathbf{P}_{\text{seed}}^{(k)} \sim \mathcal{U}\big(\mathbf{B}_{\min},\,\mathbf{B}_{\max}\big),\quad k=1,\ldots,N_{\text{seed}},\quad N_{\text{seed}}=20 $$

3.3 随机分裂(Random Splitting)

随机分裂算子绕过依赖梯度的致密化判据,主动在整个场景中针对大尺度高斯基元进行探索性分裂。具体而言,根据基元的平均尺度进行采样,每次迭代只分裂一小部分($N_{\text{split}}=20$)以保持训练稳定性。这使得被遮挡区域能够绕过 2D 梯度的压制,主动参与致密化过程。

$$ \mathcal{S}_{\text{split}}=\text{RandomSample}\big(\{G_m:\text{scale}_m>\bar{s}\},\,N_{\text{split}}\big),\quad N_{\text{split}}=20 $$

一旦这些区域被更细的基元填充,它们会在无遮挡训练视角下快速收敛到最优配置。随机分裂直接解决了 3DGS 的根本限制:在遮挡区域,α 混合衰减稀释了 2D 位置信号,使基元无法达到统计分裂阈值。随机分裂通过将结构精炼与梯度幅值解耦来恢复这一能力。

随机探索算子示意
图 7:逃离模糊陷阱的随机探索。上方:物理推导的 3D 位置梯度正交于视角方向,随机播种直接注入基元探测未探索深度。下方:α 混合衰减使梯度低于致密化阈值,随机分裂通过概率性分裂恢复细节。

四、实验结果

4.1 跨数据集重建质量

作者在 Mip-NeRF 360、Tanks & Temples、Deep Blending、OMMO 和 DL3DV 五个基准上进行了全面评估。结果显示,种子探索和分裂探索一致地提升了重建保真度,两者的组合在大多数基准上达到最优性能。

方法Mip-360 PSNR↑Mip-360 LPIPS↓T&T PSNR↑T&T LPIPS↓DB PSNR↑OMMO PSNR↑DL3DV PSNR↑
3DGS27.520.21523.730.16929.8030.4927.16
HoGS (50K)27.550.20124.230.16029.2130.6628.16
Seed Exp.27.680.21424.300.16329.7830.8527.74
Split Exp.27.950.19224.300.13930.0131.2928.47
Seed & Split27.960.19524.370.13929.9831.2728.43

从数据中可以观察到几个重要模式:种子探索在无界场景(如 T&T)中提升明显,因为它能有效探测远处深度;分裂探索在遮挡区域(如 OMMO)表现突出,PSNR 从 30.49 提升到 31.29,LPIPS 从 0.142 降到 0.121。两者的组合在大多数场景下达到最优,验证了两种模糊陷阱可以被同时解决。

4.2 高斯基元分配

方法Mip-360T&TDBOMMODL3DV
3DGS2.72M1.57M2.48M1.78M1.14M
HoGS (50K)4.40M2.16M2.43M2.01M1.61M
Seed Exp.2.62M1.51M2.33M1.68M1.11M
Split Exp.2.58M2.13M0.86M1.77M2.13M
Seed & Split2.53M2.11M0.79M1.77M2.11M

这个表格揭示了一个关键洞察:在 Deep Blending 数据集上,分裂探索使高斯数量减少了 65%(从 2.48M 降到 0.86M),同时保持更优的几何保真度。而在复杂场景(T&T、DL3DV)中,策略自适应地增加基元分配以解决精细几何细节。这种自适应分配减少了简单区域的冗余,同时精炼复杂结构,体现了"将计算分配到最能提升保真度的地方"的原则。

4.3 4D 高斯泼溅的模糊陷阱

由于共享优化管线,模糊陷阱自然地从 3DGS 传播到 4D 高斯泼溅(4DGS)。在 Neu3D 数据集上,尽管有充分的多视角覆盖,遮挡易感区域仍然严重模糊——如透过窗户可见的远处建筑、室内瓶子上的文字、被火焰动态遮挡的牛排纹理。作者仅将 $N_{\text{split}}=5$ 的极稀疏随机分裂整合进 4DGS 框架,就成功绕过了模糊陷阱。

方法PSNR↑SSIM↑MS-SSIM↑LPIPS-vgg↓LPIPS-alex↓
4DGS30.5750.93140.96590.15070.0602
Split Exp.30.8200.93690.96890.13800.0488
Split & Seed31.0850.93790.97020.13770.0483

增益在感知保真度(LPIPS)上最为显著,从 0.1507 降到 0.1377。这种极小强度的干预就能解决严重模糊,证实了标准分裂机制因严格依赖 2D 位置梯度而受到信号衰减的根本性瓶颈。

4.4 消融实验:深度监督 vs 随机探索

为了验证深度方向信号的关键作用,作者使用 Depth Anything V2 生成伪深度图,并将深度正则化项 $\mathcal{L}_{\text{Depth}}$ 集成到标准 3DGS 管线中。结果显示,虽然伪深度监督一致地提升了保真度,证实了深度监督缺失是远侧模糊陷阱的主要驱动因素,但其增益仍不如稀疏随机播种。更关键的是,将 $\mathcal{L}_{\text{Depth}}$ 与随机探索结合反而产生了收益递减——不准确的深度信号确定性地约束了优化器,主动压制了随机探索动态。

另一个消融实验比较了随机分裂与简单降低阈值 $\tau_{\text{split}}$ 的效果。降低阈值无法带来有意义的保真度提升,反而引入了大量冗余基元。相比之下,即使稀疏应用随机分裂也能高效提升重建质量,同时保持显著更精简的基元分配。这证实性能增益来源于有针对性的结构探索,而非暴力致密化。

五、方法工作流

flowchart TD A["3DGS 标准优化循环"] --> B{"梯度分析"} B -->|"2D 梯度正交于视角方向"| C["远侧模糊陷阱\n深度梯度缺失"] B -->|"α 混合衰减透射率"| D["近侧模糊陷阱\n致密化失败"] C --> E["随机播种\n均匀采样 N_seed=20 个深度位置"] D --> F["随机分裂\n随机选取 N_split=20 个大尺度基元"] E --> G["无效种子 → 不透明度剪枝移除"] E --> H["有效种子 → 2D 梯度精炼 → 致密化"] F --> I["被遮挡基元获得致密化机会"] H --> J["逃离模糊陷阱\nSOTA 保真度"] I --> J style C fill:#ffe0b2 style D fill:#ffcdd2 style J fill:#c8e6c9

六、局限性与讨论

局限一:种子采样的空间分布策略。 当前随机播种采用均匀分布,在最小包围盒内采样候选位置。对于极端非均匀的场景(如大部分空间为空旷天空的户外场景),均匀采样可能导致大量种子落在无效区域而被剪枝,浪费计算资源。更具启发式的采样策略(如基于深度先验的非均匀分布)可能进一步提升效率,但这也偏离了"最小化设计"的验证初衷。
局限二:超参数敏感性。 虽然默认值 $N_{\text{seed}}=20$ 和 $N_{\text{split}}=20$ 在大多数场景下表现良好,但论文未系统地探索这些参数对极端场景(如极小室内场景或极大规模户外场景)的影响。此外,4DGS 中仅使用 $N_{\text{split}}=5$ 的极端稀疏设置,其泛化性到其他动态场景数据集尚未验证。
局限三:远侧与近侧的协同优化。 在 Deep Blending 数据集上,Split & Seed 组合的 LPIPS 略逊于单独 Split Exp.(0.249 vs 0.248),暗示两种算子在某些场景下可能存在轻微的相互干扰。论文未深入分析这种边际退化的原因,也没有提出自适应调度策略来动态平衡两种探索的强度。

七、总结与启示

本文最重要的贡献不在于两个具体算子本身,而在于诊断:它从数学上证明了 3DGS 的模糊陷阱源于渲染管线的物理公式——视角梯度正交性和 α 混合衰减系统性压制了深度方向信号。两个极简的随机探索算子(随机播种和随机分裂)的成功证明了一个深刻的结论:重建瓶颈源于优化动态而非模型容量。

这一发现对整个可微渲染领域具有方法论意义:它将"探索-利用"平衡这一强化学习中的经典概念引入了 3D 重建优化,表明确定性梯度下降在非凸优化中存在系统性盲区,显式探索是可微渲染的必要组成部分。未来的工作可以在此基础上设计更精巧的探索策略,但本文已经证明了:即使是最简单的随机探索,也足以打破 3DGS 优化中的根本性僵局。

"重建瓶颈源于优化动态,而非模型容量。显式探索是可微渲染的必要组成部分,我们需要从纯利用转向探索-利用平衡的优化范式。"

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日