PAPER DEEP DIVE
GrainGS:面向高效动态新视角合成的梯度解耦高斯泼溅
GrainGS提出梯度解耦的高斯泼溅方法,用于高效的动态场景新视角合成,分离静态和动态梯度提升质量。
GrainGS:梯度解耦高斯泼溅用于高效动态新视角合成
论文:GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis
作者:Jiahao He, Yihua Shao, Zhengkai Zhao, Pan Gao, Fei Ma, Jingcai Guo, Hao Tang, Nicu Sebe, Qi Tian
机构:南京航空航天大学 / 中科院自动化所 / 港理工 / 北京大学 / 特伦托大学
一句话总结
GrainGS 通过静态预热阶段建立时间无关的规范锚点-高斯支架,在联合训练中用 stop-gradient 操作阻断变形场对规范几何的梯度干扰,同时允许每个高斯独立预测位置/旋转/尺度的时序偏移实现细粒度局部运动,并以规范-残差外观分解建模帧依赖光度变化,在 D-NeRF 合成基准上达到 36.98 dB PSNR、435.6 FPS 渲染速度和 4.67 MB 存储的高效动态新视角合成。
研究背景与动机
动态真实场景的捕获与任意视角渲染对自由视角视频和视觉特效至关重要。神经辐射场(NeRF)为新视角合成提供了原理性框架,但其体渲染成本限制了实时应用。3D 高斯泼溅(3DGS)通过可微高斯基元的光栅化实现了高质量实时渲染,但将其扩展到动态场景面临三大挑战:细粒度运动建模、结构稳定性和紧凑表示的平衡。
现有动态 3DGS 方法分两类。逐基元方法为每个高斯提供灵活的局部变形,但常受冗余基元增长困扰——缺乏结构约束导致高斯数量膨胀,存储和计算成本失控。锚点方法通过层级结构改善空间规整性,但以抑制局部变化运动为代价——单个锚点将统一变形广播到所有子高斯,无法表达锚点邻域内的局部差异运动。
核心问题在于梯度纠缠:规范几何与变形场通过共享梯度路径更新,产生相互干扰。变形梯度会反向传播到规范几何,使其为适应帧特定运动而漂移,而非维持时间无关的参考。GrainGS 的核心洞察是:需要一个几何稳定的规范参考,并通过显式梯度隔离阻止变形场干扰它。
图1:质量-效率对比。GrainGS 在平均 PSNR vs 渲染速度上达到帕累托前沿。
方法详解
1. 规范锚点-高斯支架
图4:GrainGS 概览。管线构建规范锚点支架,DeformNet 预测逐高斯时序偏移,stop-gradient 隔离规范几何。
遵循 Scaffold-GS,锚点位置从 SfM 稀疏点云初始化,经体素下采样获得空间均匀分布。每个锚点 $i$ 参数化为可学习元组:
$$ \mathcal{A}_{i}=\bigl\{\mathbf{x}_{a}^{(i)}\in\mathbb{R}^{3},\;\mathbf{s}_{a}^{(i)}\in\mathbb{R}^{3},\;\mathbf{f}_{a}^{(i)}\in\mathbb{R}^{d_{f}}\bigr\} $$其中 $\mathbf{x}_a^{(i)}$ 为锚点位置,$\mathbf{s}_a^{(i)}$ 控制局部生成半径,$\mathbf{f}_a^{(i)}$ 为编码局部几何和外观信息的可学习特征嵌入。每个锚点产生 $k$ 个子高斯,第 $j$ 个子高斯的规范位置为:
$$ \mathbf{x}_{\text{can}}^{(i,j)}=\mathbf{x}_{a}^{(i)}+\mathbf{s}_{a}^{(i)}\odot\bm{\epsilon}_{j}^{(i)} $$共享 Static MLP 从锚点特征和子偏移预测其余规范几何属性(四元数旋转 $\mathbf{r}_{\text{can}}$ 和对数尺度 $\boldsymbol{\rho}_{\text{can}}$)。不同子高斯携带不同偏移,因此 Static MLP 为同一锚点的 $k$ 个高斯产生不同属性。
2. 静态预热
图3:静态预热。前 $T_w$ 次迭代仅优化规范支架,DeformNet 冻结。
前 $T_w=3000$ 次迭代仅优化锚点参数和 Static MLP,DeformNet 和外观残差场冻结。训练图像跨所有时间戳均匀采样,使规范支架必须覆盖物体运动的完整空间范围而非收敛到单帧构型。预热的目的不同于现有方法(通常用于从 SfM 引导点云初始化)——它是建立几何稳定的规范支架,使后续梯度解耦在可靠几何参考上运行。
3. 逐高斯变形与 stop-gradient 隔离
预热后,DeformNet 从规范位置和时间预测独立的逐高斯几何偏移。关键创新是规范位置在传入 DeformNet 前通过 stop-gradient 操作符 $\mathrm{sg}(\cdot)$ 从计算图中分离:
$$ \bigl(\Delta\mathbf{x},\;\Delta\mathbf{r},\;\Delta\bm{\rho}\bigr)=\mathrm{DeformNet}\!\left(\mathrm{sg}\!\bigl(\mathbf{x}_{\text{can}}^{(i,j)}\bigr),\;\gamma(t)\right) $$其中 $\gamma(t)$ 为时间戳的位置编码。这使每个高斯获得独立偏移,捕捉锚点邻域内的局部变化运动。$t$ 时刻的变形位置为加法组合 $\mathbf{x}(t) = \mathbf{x}_{\text{can}} + \Delta\mathbf{x}(\mathbf{x}_{\text{can}}, t)$。对 $\mathbf{x}_{\text{can}}$ 应用链式法则:
$$ \frac{\partial\mathcal{L}}{\partial\mathbf{x}_{\text{can}}}=\underbrace{\frac{\partial\mathcal{L}}{\partial\mathbf{x}(t)}}_{\text{重建}}+\underbrace{\frac{\partial\mathcal{L}}{\partial\mathbf{x}(t)}\cdot\frac{\partial\Delta\mathbf{x}}{\partial\mathbf{x}_{\text{can}}}}_{\text{变形}} $$第二项通过共享变量 $\mathbf{x}_{\text{can}}$ 将梯度耦合到 DeformNet 和 Static MLP,使 $\mathbf{x}_{\text{can}}$ 不仅为减少光度误差而移动,还为最小化 DeformNet 需预测的变形量而移动——这破坏了时间无关参考。stop-gradient 将 $\partial\Delta\mathbf{x}/\partial\mathrm{sg}(\mathbf{x}_{\text{can}}) = \mathbf{0}$,消除第二项:
$$ \frac{\partial\mathcal{L}}{\partial\mathbf{x}_{\text{can}}}\bigg|_{\text{w/ sg}}=\frac{\partial\mathcal{L}}{\partial\mathbf{x}(t)} $$规范支架只接收光度重建信号,解耦了 Static MLP 和 DeformNet 的优化。消融证明这是最大单项改进(+1.34 dB)。
4. 解耦外观模型与训练目标
规范-残差外观分解将帧依赖光度变化建模为独立于几何变形的外观残差。总损失为:
$$ \mathcal{L}=\mathcal{L}_{\text{pho}}+\lambda_{1}\mathcal{L}_{\text{temp}}+\lambda_{2}\mathcal{L}_{\text{def}}+\lambda_{3}\mathcal{L}_{\text{res}} $$其中 $\mathcal{L}_{\text{pho}}$ 为光度损失(L1 + D-SSIM),$\mathcal{L}_{\text{temp}}$ 惩罚帧间位置偏移不连续性,$\mathcal{L}_{\text{def}}$ 将变形偏移正则化趋零,$\mathcal{L}_{\text{res}}$ 惩罚大外观残差保持时序分支从属于规范基:
$$ \mathcal{L}_{\text{temp}}=\sum_{t}\bigl\|\Delta\mathbf{x}(t+1)-\Delta\mathbf{x}(t)\bigr\|_{2}^{2},\quad \mathcal{L}_{\text{def}}=\|\Delta\mathbf{x}\|_{2}^{2}+\|\Delta\mathbf{r}\|_{2}^{2}+\|\Delta\bm{\rho}\|_{2}^{2} $$
flowchart TD
A["SfM 稀疏点云"] --> B["锚点初始化 + 体素下采样"]
B --> C["规范锚点-高斯支架
Static MLP 预测规范属性"]
C --> D["静态预热 T_w=3000
仅优化支架, DeformNet冻结"]
D --> E["联合训练阶段"]
E --> F["DeformNet 预测逐高斯偏移
sg(x_can) 阻断梯度"]
F --> G["变形位置 x(t) = x_can + Delta_x"]
G --> H["解耦外观模型
规范基 + 残差分支"]
H --> I["光度损失 L_pho"]
I --> J["规范支架仅接收重建梯度
变形场独立优化"]
style D fill:#e1f5fe
style F fill:#fff3e0
style J fill:#e8f5e9
实验结果
合成 D-NeRF 基准
图5:D-NeRF 数据集定量对比表。
| 方法 | 类型 | 平均PSNR↑ | 平均SSIM↑ | 平均LPIPS↓ |
|---|---|---|---|---|
| D-NeRF | NeRF | 30.03 | 0.952 | 0.049 |
| D-3DGS | 逐基元 | 34.82 | 0.978 | 0.020 |
| 4D-GS | 逐基元 | 35.81 | 0.982 | 0.017 |
| SC-GS | 锚点 | 36.73 | 0.986 | 0.015 |
| MoDec-GS | 紧凑分解 | 36.45 | 0.985 | 0.016 |
| GrainGS | 锚点+逐高斯 | 36.98 | 0.987 | 0.014 |
GrainGS 在 8 个场景的 24 项指标中全部排名前三,22 项第一或第二。在 Jumping Jacks 场景达到 38.51 dB(SC-GS 38.07 dB,D-3DGS 36.83 dB),在 Mutant 上达到最佳 SSIM(0.9945)和 LPIPS(0.0066)。这些场景涉及快速肢体关节运动,需要逐高斯变形粒度——锚点广播方法的统一变形偏置限制了 SC-GS,而 D-3DGS 缺乏结构先验导致几何不稳定。
图6:D-NeRF 数据集定性对比。GrainGS 忠实恢复锐利细节。
消融研究
| 消融变体 | PSNR↑ | 下降 | 关键发现 |
|---|---|---|---|
| 完整模型 | 36.98 | - | - |
| w/o stop-gradient | 35.64 | -1.34 | 最大单项损失,变形梯度腐蚀规范几何 |
| w/o $\mathcal{L}_{\text{temp}}$ | 36.21 | -0.77 | 时序不连续导致模糊 |
| Single MLP(合并Static+Deform) | 36.20 | -0.78 | 失去规范-时序分离 |
| w/o Canonical branch | 35.83 | -1.15 | 失去时间无关参考,几何与运动同时重建 |
| w/o $\mathcal{L}_{\text{def}}$ | 36.46 | -0.52 | 偏移幅度不受约束 |
| w/o Residual branch | 36.51 | -0.47 | 光照变化被迫进入几何变形 |
| w/o $\mathcal{L}_{\text{res}}$ | 36.65 | -0.34 | 外观残差覆盖规范基 |
stop-gradient 隔离产生最大单项改进(+1.34 dB)。无 stop-gradient 时变形梯度传播到规范支架,导致 Static MLP 吸收帧特定运动为永久几何畸变。移除规范分支(-1.15 dB)是第二大损失——模型失去时间无关参考,必须同时重建几何和运动。
图2:梯度纠缠。无架构隔离时,变形梯度通过共享变量腐蚀规范几何分布。
局限性
- 单 GPU 训练成本:30,000 次迭代需在单张 RTX 4090 上完成,锚点增长和剪枝机制增加了实现复杂度,对大规模长时序场景的可扩展性未充分验证。
- 预热阶段依赖:静态预热的 $T_w$ 设为固定 3000,对运动剧烈程度差异大的场景可能不是最优——运动范围大的场景可能需要更长预热建立完整规范支架。
- 数据集覆盖有限:评估仅限于 D-NeRF(合成单目)和 DG-Mesh(真实多视角),未测试更具挑战性的非刚性大运动或野外无约束场景。
总结与展望
GrainGS 通过静态预热和 stop-gradient 隔离减少了规范几何与时序变形间的梯度干扰,在紧凑锚点支架内用逐高斯变形捕捉细粒度局部运动,并用规范-残差外观分解为时序光度变化提供显式容量。在 D-NeRF 和 DG-Mesh 上达到竞争力的 SOTA 重建质量(36.98 dB),同时保持实时渲染(435.6 FPS)和紧凑存储(4.67 MB)。
金句:「stop-gradient 操作阻断变形场对规范几何的梯度回传——规范支架只接收光度重建信号,使时间无关参考不被帧特定运动腐蚀,这是结构约束与局部运动自由度共存的关键。」



