PAPER DEEP DIVE
QIRF:面向3D高斯泼溅的量子启发非正交函数空间压缩
提出QIRF量子启发的非正交函数空间压缩方法,降低3D高斯泼溅的存储与计算开销,服务于3DGS高效渲染。
QIRF:面向3D高斯泼溅的量子启发非正交函数空间压缩
论文:QIRF: Quantum-Inspired Non-Orthogonal Function-Space Compression for 3D Gaussian Splatting
作者:Shizeng Jiang, Hao Zhang, Xuerui Ma, Ying Hu, Tao Zhang
一句话总结
QIRF 将邻近高斯基函数建模为局部非正交基,通过构建高斯重叠矩阵和辐射响应密度矩阵(RRDM),用广义特征分解识别主导局部函数子空间并选择代表性高斯基元,在13个场景上平均减少71.7%高斯数量(3.54倍压缩),同时PSNR平均提升0.10dB,渲染速度提升34.3%。
研究背景与动机
3D高斯泼溅(3DGS)通过数百万各向异性高斯基元实现高质量实时渲染,但复杂场景的高斯基元数量巨大,导致存储和渲染开销高昂。现有压缩方法主要通过逐基元剪枝、属性量化、聚类或神经编码减少冗余,但强重叠和非正交高斯基函数引起的函数空间冗余尚未被充分探索。两个高斯可能各自获得高重要性分数,却跨越几乎相同的局部场景函数——这种结构性冗余无法被独立评分捕获。
图1:QIRF管线总览。局部重叠和辐射响应密度矩阵引导GNSO子空间选择。
方法详解
1. 问题定义与自适应分区
3DGS场景由$N$个高斯基元$\mathcal{G} = \{\mathcal{G}_i\}_{i=1}^N$表示,目标是找到紧凑代表子集$\mathcal{A} \subseteq \{1, \ldots, N\}$,$|\mathcal{A}| \ll N$。场景被划分为自适应体素块,块稀疏比$\rho_{\text{block}} = N_{\text{blocks}} / N_{\text{Gaussians}}$决定体素大小。
2. 局部函数空间建模
在每个体素块内,邻近高斯基元被解释为非正交空间基函数。构造局部重叠矩阵:
$$ S_{ij} = \int_{\mathbb{R}^3} \phi_i(\mathbf{x})\, \phi_j(\mathbf{x})\, d\mathbf{x} $$正则化为$\widetilde{\mathbf{S}} = \mathbf{S} + \epsilon\mathbf{I}$($\epsilon = 10^{-4}$)。同时构造辐射响应密度矩阵(RRDM),融合渲染响应(可见性、合成贡献、残差加权贡献、投影alpha质量)和优化响应(位置/缩放/不透明度/外观梯度):
$$ \mathbf{P} = \eta \frac{H_r H_r^\top}{\text{tr}(H_r H_r^\top) + \epsilon} + (1-\eta) \frac{H_o H_o^\top}{\text{tr}(H_o H_o^\top) + \epsilon}, \quad \eta = 0.75 $$3. 广义自然场景轨道压缩(GNSO)
求解广义特征值问题识别主导局部函数模式:
$$ \mathbf{P}\mathbf{u}_k = \lambda_k\, \widetilde{\mathbf{S}}\,\mathbf{u}_k $$特征向量$\mathbf{u}_k$定义广义自然场景轨道(GNSO),特征值$\lambda_k$衡量各局部响应模式的占据强度。保留满足能量阈值的最小模式数$r$:
$$ \frac{\sum_{k=1}^{r} \lambda_k}{\sum_{k=1}^{m} \lambda_k} \geq \tau, \quad \tau = 0.95 $$通过占据加权参与分数映射回原始高斯基元:
$$ q_i = \sum_{k=1}^{r} \lambda_k\, |u_{ik}|^2 $$
图2:QIRF与3DGS、MaskGaussian、Compact3DGS的定性视觉对比。
4. 细节感知保护与后剪枝优化
为保护薄结构和高频纹理,为非活跃高斯分配细节分数:
$$ d_i = g_i^\gamma\, v_i^\nu\, s_i^{-\rho}\, \alpha_i^\delta $$逆尺度项$s_i^{-\rho}$偏向小高斯基元(更可能表示精细几何结构)。从GNSO非活跃候选中保留前$K_{\text{detail}} = \lfloor 0.05N \rfloor$个,最终代表集$\mathcal{A} = \mathcal{A}_{\text{GNSO}} \cup \mathcal{A}_{\text{detail}}$。
硬剪枝后,保留基元在禁用致密化的条件下优化:
$$ \mathcal{L} = \mathcal{L}_{\text{3DGS}} + \lambda_{\text{MSE}}\, \mathcal{L}_{\text{MSE}}, \quad \lambda_{\text{MSE}} = 2 $$
flowchart TD
A["3DGS场景
N个高斯基元"] --> B["自适应体素分区
稀疏比决定体素大小"]
B --> C["局部函数空间建模"]
C --> D["高斯重叠矩阵 S
基函数间空间重叠"]
C --> E["辐射响应密度矩阵 P
渲染+优化响应"]
D --> F["广义特征分解
Pu = λSu"]
E --> F
F --> G["GNSO模式选择
能量阈值τ=0.95"]
G --> H["参与分数排序
选择代表性基元"]
H --> I["细节感知保护
保留5%高频结构"]
I --> J["硬剪枝+后优化
禁用致密化"]
J --> K["紧凑3DGS表示
71.7%压缩, PSNR+0.10dB"]
style C fill:#e1f5fe
style F fill:#fff3e0
style K fill:#e8f5e9
实验结果
定量对比
| 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | #GS (M) | PLY (MB) |
|---|---|---|---|---|---|
| 3DGS | 27.21 | 0.815 | 0.214 | 3.46 | 816 |
| Compact3DGS | 27.35 | 0.830 | 0.202 | 1.09 | 258 |
| MaskGaussian | 27.43 | 0.812 | 0.224 | 1.23 | 287 |
| QIRF (Ours) | 27.44 | 0.806 | 0.241 | 0.95 | 225 |
QIRF在Mip-NeRF 360上以最少高斯数量(0.95M vs 3DGS的3.46M,减少72.5%)实现最高PSNR(27.44dB,+0.23dB),存储从816MB降至225MB(3.63倍压缩)。在Tanks&Temples和Deep Blending上同样达到最优PSNR。
消融实验
| 配置 | PSNR ↑ | #GS (M) | 说明 |
|---|---|---|---|
| 基线剪枝 | 27.10 | 0.95 | 无函数空间分析 |
| + GNSO | 27.35 | 0.95 | 子空间选择 |
| + GNSO + Detail | 27.44 | 0.95 | 完整QIRF |
表1:三个基准数据集的定量对比结果。
图3:消融实验分析。GNSO和细节保护各组件的贡献。
图4:渲染速度对比和压缩效率分析。
与PCA的区别
QIRF的广义特征分解与传统PCA或协方差分解有本质区别。PCA假设欧几里得内积空间,直接对数据协方差矩阵进行特征分解;而QIRF显式地将高斯重叠矩阵$\widetilde{\mathbf{S}}$作为局部基空间的度量,通过广义特征问题$\mathbf{P}\mathbf{u} = \lambda \widetilde{\mathbf{S}}\mathbf{u}$同时考虑渲染相关性($\mathbf{P}$)和函数冗余($\widetilde{\mathbf{S}}$)。这种设计受到量子化学中原子轨道理论的启发——分子轨道由原子轨道的非正交线性组合构成,广义特征分解在此非正交基上识别主导轨道。在3DGS中,每个高斯基元类比为一个"原子轨道",重叠矩阵描述它们的空间耦合,RRDM描述它们的"占据数"(渲染贡献),GNSO则是由此产生的"分子轨道"。
实现细节
所有实验在单张NVIDIA RTX 4090 GPU上进行30,000训练迭代。标准3DGS致密化执行至13,000迭代,随后进行RRDM累积。硬剪枝在15,000迭代时应用,之后保留基元在禁用致密化条件下优化。默认保留比率0.22、细节保护比率0.05、GNSO能量阈值0.95。RRDM维度8、密度混合系数0.75、指数衰减因子0.995。基础体素大小0.03,稀疏场景自适应增大至0.06。除自适应体素大小外,所有超参数在所有场景间共享,无需逐场景调参。
实验在三个公开基准上评估:Mip-NeRF 360(室内外360°场景)、Tanks&Temples(大规模场景)和Deep Blending(复杂光照场景),共13个场景。评估指标包括PSNR、SSIM、LPIPS(重建质量)和高斯数量、PLY存储大小、FPS(表示效率)。
局限性
- 体素分区粒度权衡:体素大小影响局部子空间估计的稳定性与精度,虽然自适应策略缓解了这一问题,但极端稀疏或密集场景仍可能需要手动调整。
- 后优化时间:硬剪枝后的优化阶段需要额外训练迭代(约10000步),增加了总训练时间约30-50%。
- RRDM描述子维度固定:8维响应描述子可能不足以捕获所有渲染相关特征,更丰富的描述子可能提升选择质量但增加计算开销。
总结与展望
QIRF首次将非正交函数空间冗余作为3DGS压缩的显式目标,通过量子启发的广义特征分解在函数空间层面识别代表性高斯基元,实现71.7%压缩(3.54倍)同时PSNR提升0.10dB、渲染速度提升34.3%。这表明非正交函数空间冗余是显式高斯辐射场中一个重要但未被充分探索的表示冗余来源。
金句:「两个高斯可能各自获得高重要性分数却跨越几乎相同的局部函数——这种结构性冗余无法被逐基元独立评分捕获,但广义特征分解能在函数空间层面识别并消除它。」



