Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

3DGS动态场景新视角合成

GrainGS:面向高效动态新视角合成的梯度解耦高斯泼溅

GrainGS提出梯度解耦的高斯泼溅方法,用于高效的动态场景新视角合成,分离静态和动态梯度提升质量。

Jiahao He, Yihua Shao, Zhengkai Zhao, Pan Gao, Fei Ma, Jingcai Guo, Hao Tang, Nicu Sebe, Qi Tian2026年7月23日3 分钟阅读
EN

GrainGS:梯度解耦高斯泼溅用于高效动态新视角合成

论文:GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis

作者:Jiahao He, Yihua Shao, Zhengkai Zhao, Pan Gao, Fei Ma, Jingcai Guo, Hao Tang, Nicu Sebe, Qi Tian

机构:南京航空航天大学 / 中科院自动化所 / 港理工 / 北京大学 / 特伦托大学

链接arXiv:2607.21448


一句话总结

GrainGS 通过静态预热阶段建立时间无关的规范锚点-高斯支架,在联合训练中用 stop-gradient 操作阻断变形场对规范几何的梯度干扰,同时允许每个高斯独立预测位置/旋转/尺度的时序偏移实现细粒度局部运动,并以规范-残差外观分解建模帧依赖光度变化,在 D-NeRF 合成基准上达到 36.98 dB PSNR、435.6 FPS 渲染速度和 4.67 MB 存储的高效动态新视角合成。


研究背景与动机

动态真实场景的捕获与任意视角渲染对自由视角视频和视觉特效至关重要。神经辐射场(NeRF)为新视角合成提供了原理性框架,但其体渲染成本限制了实时应用。3D 高斯泼溅(3DGS)通过可微高斯基元的光栅化实现了高质量实时渲染,但将其扩展到动态场景面临三大挑战:细粒度运动建模、结构稳定性和紧凑表示的平衡。

现有动态 3DGS 方法分两类。逐基元方法为每个高斯提供灵活的局部变形,但常受冗余基元增长困扰——缺乏结构约束导致高斯数量膨胀,存储和计算成本失控。锚点方法通过层级结构改善空间规整性,但以抑制局部变化运动为代价——单个锚点将统一变形广播到所有子高斯,无法表达锚点邻域内的局部差异运动。

核心问题在于梯度纠缠:规范几何与变形场通过共享梯度路径更新,产生相互干扰。变形梯度会反向传播到规范几何,使其为适应帧特定运动而漂移,而非维持时间无关的参考。GrainGS 的核心洞察是:需要一个几何稳定的规范参考,并通过显式梯度隔离阻止变形场干扰它。

质量-效率对比

图1:质量-效率对比。GrainGS 在平均 PSNR vs 渲染速度上达到帕累托前沿。


方法详解

1. 规范锚点-高斯支架

GrainGS概览

图4:GrainGS 概览。管线构建规范锚点支架,DeformNet 预测逐高斯时序偏移,stop-gradient 隔离规范几何。

遵循 Scaffold-GS,锚点位置从 SfM 稀疏点云初始化,经体素下采样获得空间均匀分布。每个锚点 $i$ 参数化为可学习元组:

$$ \mathcal{A}_{i}=\bigl\{\mathbf{x}_{a}^{(i)}\in\mathbb{R}^{3},\;\mathbf{s}_{a}^{(i)}\in\mathbb{R}^{3},\;\mathbf{f}_{a}^{(i)}\in\mathbb{R}^{d_{f}}\bigr\} $$

其中 $\mathbf{x}_a^{(i)}$ 为锚点位置,$\mathbf{s}_a^{(i)}$ 控制局部生成半径,$\mathbf{f}_a^{(i)}$ 为编码局部几何和外观信息的可学习特征嵌入。每个锚点产生 $k$ 个子高斯,第 $j$ 个子高斯的规范位置为:

$$ \mathbf{x}_{\text{can}}^{(i,j)}=\mathbf{x}_{a}^{(i)}+\mathbf{s}_{a}^{(i)}\odot\bm{\epsilon}_{j}^{(i)} $$

共享 Static MLP 从锚点特征和子偏移预测其余规范几何属性(四元数旋转 $\mathbf{r}_{\text{can}}$ 和对数尺度 $\boldsymbol{\rho}_{\text{can}}$)。不同子高斯携带不同偏移,因此 Static MLP 为同一锚点的 $k$ 个高斯产生不同属性。

2. 静态预热

静态预热

图3:静态预热。前 $T_w$ 次迭代仅优化规范支架,DeformNet 冻结。

前 $T_w=3000$ 次迭代仅优化锚点参数和 Static MLP,DeformNet 和外观残差场冻结。训练图像跨所有时间戳均匀采样,使规范支架必须覆盖物体运动的完整空间范围而非收敛到单帧构型。预热的目的不同于现有方法(通常用于从 SfM 引导点云初始化)——它是建立几何稳定的规范支架,使后续梯度解耦在可靠几何参考上运行。

3. 逐高斯变形与 stop-gradient 隔离

预热后,DeformNet 从规范位置和时间预测独立的逐高斯几何偏移。关键创新是规范位置在传入 DeformNet 前通过 stop-gradient 操作符 $\mathrm{sg}(\cdot)$ 从计算图中分离:

$$ \bigl(\Delta\mathbf{x},\;\Delta\mathbf{r},\;\Delta\bm{\rho}\bigr)=\mathrm{DeformNet}\!\left(\mathrm{sg}\!\bigl(\mathbf{x}_{\text{can}}^{(i,j)}\bigr),\;\gamma(t)\right) $$

其中 $\gamma(t)$ 为时间戳的位置编码。这使每个高斯获得独立偏移,捕捉锚点邻域内的局部变化运动。$t$ 时刻的变形位置为加法组合 $\mathbf{x}(t) = \mathbf{x}_{\text{can}} + \Delta\mathbf{x}(\mathbf{x}_{\text{can}}, t)$。对 $\mathbf{x}_{\text{can}}$ 应用链式法则:

$$ \frac{\partial\mathcal{L}}{\partial\mathbf{x}_{\text{can}}}=\underbrace{\frac{\partial\mathcal{L}}{\partial\mathbf{x}(t)}}_{\text{重建}}+\underbrace{\frac{\partial\mathcal{L}}{\partial\mathbf{x}(t)}\cdot\frac{\partial\Delta\mathbf{x}}{\partial\mathbf{x}_{\text{can}}}}_{\text{变形}} $$

第二项通过共享变量 $\mathbf{x}_{\text{can}}$ 将梯度耦合到 DeformNet 和 Static MLP,使 $\mathbf{x}_{\text{can}}$ 不仅为减少光度误差而移动,还为最小化 DeformNet 需预测的变形量而移动——这破坏了时间无关参考。stop-gradient 将 $\partial\Delta\mathbf{x}/\partial\mathrm{sg}(\mathbf{x}_{\text{can}}) = \mathbf{0}$,消除第二项:

$$ \frac{\partial\mathcal{L}}{\partial\mathbf{x}_{\text{can}}}\bigg|_{\text{w/ sg}}=\frac{\partial\mathcal{L}}{\partial\mathbf{x}(t)} $$

规范支架只接收光度重建信号,解耦了 Static MLP 和 DeformNet 的优化。消融证明这是最大单项改进(+1.34 dB)。

4. 解耦外观模型与训练目标

规范-残差外观分解将帧依赖光度变化建模为独立于几何变形的外观残差。总损失为:

$$ \mathcal{L}=\mathcal{L}_{\text{pho}}+\lambda_{1}\mathcal{L}_{\text{temp}}+\lambda_{2}\mathcal{L}_{\text{def}}+\lambda_{3}\mathcal{L}_{\text{res}} $$

其中 $\mathcal{L}_{\text{pho}}$ 为光度损失(L1 + D-SSIM),$\mathcal{L}_{\text{temp}}$ 惩罚帧间位置偏移不连续性,$\mathcal{L}_{\text{def}}$ 将变形偏移正则化趋零,$\mathcal{L}_{\text{res}}$ 惩罚大外观残差保持时序分支从属于规范基:

$$ \mathcal{L}_{\text{temp}}=\sum_{t}\bigl\|\Delta\mathbf{x}(t+1)-\Delta\mathbf{x}(t)\bigr\|_{2}^{2},\quad \mathcal{L}_{\text{def}}=\|\Delta\mathbf{x}\|_{2}^{2}+\|\Delta\mathbf{r}\|_{2}^{2}+\|\Delta\bm{\rho}\|_{2}^{2} $$
flowchart TD
    A["SfM 稀疏点云"] --> B["锚点初始化 + 体素下采样"]
    B --> C["规范锚点-高斯支架
Static MLP 预测规范属性"] C --> D["静态预热 T_w=3000
仅优化支架, DeformNet冻结"] D --> E["联合训练阶段"] E --> F["DeformNet 预测逐高斯偏移
sg(x_can) 阻断梯度"] F --> G["变形位置 x(t) = x_can + Delta_x"] G --> H["解耦外观模型
规范基 + 残差分支"] H --> I["光度损失 L_pho"] I --> J["规范支架仅接收重建梯度
变形场独立优化"] style D fill:#e1f5fe style F fill:#fff3e0 style J fill:#e8f5e9

实验结果

合成 D-NeRF 基准

D-NeRF定量结果

图5:D-NeRF 数据集定量对比表。

表1:D-NeRF 数据集定量对比——GrainGS 平均 PSNR 36.98 dB,排名第一
方法类型平均PSNR↑平均SSIM↑平均LPIPS↓
D-NeRFNeRF30.030.9520.049
D-3DGS逐基元34.820.9780.020
4D-GS逐基元35.810.9820.017
SC-GS锚点36.730.9860.015
MoDec-GS紧凑分解36.450.9850.016
GrainGS锚点+逐高斯36.980.9870.014

GrainGS 在 8 个场景的 24 项指标中全部排名前三,22 项第一或第二。在 Jumping Jacks 场景达到 38.51 dB(SC-GS 38.07 dB,D-3DGS 36.83 dB),在 Mutant 上达到最佳 SSIM(0.9945)和 LPIPS(0.0066)。这些场景涉及快速肢体关节运动,需要逐高斯变形粒度——锚点广播方法的统一变形偏置限制了 SC-GS,而 D-3DGS 缺乏结构先验导致几何不稳定。

D-NeRF定性对比

图6:D-NeRF 数据集定性对比。GrainGS 忠实恢复锐利细节。

消融研究

表2:消融研究总结——各组件对 PSNR 的贡献(D-NeRF)
消融变体PSNR↑下降关键发现
完整模型36.98--
w/o stop-gradient35.64-1.34最大单项损失,变形梯度腐蚀规范几何
w/o $\mathcal{L}_{\text{temp}}$36.21-0.77时序不连续导致模糊
Single MLP(合并Static+Deform)36.20-0.78失去规范-时序分离
w/o Canonical branch35.83-1.15失去时间无关参考,几何与运动同时重建
w/o $\mathcal{L}_{\text{def}}$36.46-0.52偏移幅度不受约束
w/o Residual branch36.51-0.47光照变化被迫进入几何变形
w/o $\mathcal{L}_{\text{res}}$36.65-0.34外观残差覆盖规范基

stop-gradient 隔离产生最大单项改进(+1.34 dB)。无 stop-gradient 时变形梯度传播到规范支架,导致 Static MLP 吸收帧特定运动为永久几何畸变。移除规范分支(-1.15 dB)是第二大损失——模型失去时间无关参考,必须同时重建几何和运动。

梯度纠缠

图2:梯度纠缠。无架构隔离时,变形梯度通过共享变量腐蚀规范几何分布。


局限性

  1. 单 GPU 训练成本:30,000 次迭代需在单张 RTX 4090 上完成,锚点增长和剪枝机制增加了实现复杂度,对大规模长时序场景的可扩展性未充分验证。
  2. 预热阶段依赖:静态预热的 $T_w$ 设为固定 3000,对运动剧烈程度差异大的场景可能不是最优——运动范围大的场景可能需要更长预热建立完整规范支架。
  3. 数据集覆盖有限:评估仅限于 D-NeRF(合成单目)和 DG-Mesh(真实多视角),未测试更具挑战性的非刚性大运动或野外无约束场景。

总结与展望

GrainGS 通过静态预热和 stop-gradient 隔离减少了规范几何与时序变形间的梯度干扰,在紧凑锚点支架内用逐高斯变形捕捉细粒度局部运动,并用规范-残差外观分解为时序光度变化提供显式容量。在 D-NeRF 和 DG-Mesh 上达到竞争力的 SOTA 重建质量(36.98 dB),同时保持实时渲染(435.6 FPS)和紧凑存储(4.67 MB)。

金句:「stop-gradient 操作阻断变形场对规范几何的梯度回传——规范支架只接收光度重建信号,使时间无关参考不被帧特定运动腐蚀,这是结构约束与局部运动自由度共存的关键。」

相关论文

WilLaGS:潜变量条件3D外观场实现鲁棒的野外高斯泼溅重建

WilLaGS:潜变量条件3D外观场实现鲁棒的野外高斯泼溅重建

针对无约束图像集合重建中剧烈外观变化与瞬态遮挡物两大难题,WilLaGS提出统一框架:用β-VAE学习连续的全局外观流形,由潜变量条件化的3D神经外观场生成动态Tri-Plane特征,建模空间变化的局部光照;再用自监督Teacher-Student(EMA)感知掩码自动识别并抑制瞬态区域。在Photo Tourism与NeRF-OSR上全面刷新纪录:Sacre Coeur场景PSNR达25.84 dB,比最强对手AsymGS高2.28 dB;单场景训练仅0.9 GPU小时,渲染58 FPS,并支持外观迁移、插值与无条件外观合成。

3DGSGaussian Splatting新视角合成2026年8月28日
DL-SLAM:基于双层概率的动态环境高保真高斯泼溅SLAM

DL-SLAM:基于双层概率的动态环境高保真高斯泼溅SLAM

3D高斯泼溅(3DGS)推动了稠密动态SLAM的进展,但主流方法直接丢弃预定义的动态物体,忽略了瞬时静止物体对位姿估计的几何约束价值;WildGS-SLAM用逐像素不确定性图利用这类物体,却会把它们融进静态地图留下持久伪影,且纯几何的不确定性在物体边界处含糊不清。DL-SLAM提出双层概率框架:像素级结合语义与几何信息计算动态概率,作为稠密束调整的自适应权重;像素概率被提升到三维高斯属性并按实例聚合为对象级动态概率,用于类别化剪枝动态高斯,得到无伪影的静态地图;纯净的静态地图再渲染出几何一致的概率图,贝叶斯式地反哺像素级估计。配合动态感知的语义标签修正,DL-SLAM在TUM RGB-D、BONN与Wild-SLAM iPhone三个动态数据集上将跟踪精度最多提升13%,同时生成高保真语义地图。

动态环境Dynamic EnvironmentsSLAM2026年7月2日
VLK:在重建场景中合成人类交互,学习人形机器人移动操作

VLK:在重建场景中合成人类交互,学习人形机器人移动操作

本文提出视觉-语言-运动学(VLK)框架:在 3D 高斯泼溅重建的真实室内场景中合成导航与物体交互轨迹,并事后渲染第一人称观测,自动生成 4.8 万条视觉-语言-运动学配对数据,训练出预测 Unitree G1 全身运动轨迹的策略,经接触感知全身跟踪器执行,实现 sim-to-real 的感知驱动人形移动操作。

humanoid人形机器人loco-manipulation2026年6月29日
TRACE:主动场景重建的遍历轨迹优化

TRACE:主动场景重建的遍历轨迹优化

将主动重建建模为遍历覆盖问题,使传感器轨迹的时空统计匹配由地图不确定性和可见性导出的目标信息分布,通过核遍历视界规划器与梯度流和足迹耗散计算轨迹,闭合建图与轨迹优化环路,在 Replica 数据集上 PSNR 提升 1.5dB。

主动感知轨迹优化遍历覆盖2026年8月3日