Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper3D Gaussian Splatting3DGS

GenSplatCodec:通过一步扩散的前馈高斯泼溅压缩

提出GenSplatCodec,通过一步扩散实现前馈3D高斯泼溅压缩,降低存储与传输开销,服务于3DGS高效部署。

Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang2026年7月27日4 分钟阅读
EN

GenSplatCodec:通过一步扩散的前馈高斯泼溅压缩

论文:GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion
作者:Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang
机构:上海交通大学
链接arXiv:2607.24403

一句话总结

GenSplatCodec 将低比特率前馈 3DGS 压缩重新表述为几何引导生成解码,用双流编码(紧凑高斯结构流 + 轻量参考外观流)和一步几何引导生成解码器,在 DL3DV 上以仅 0.376 MB/场景达到与 YoNoSplat 6.508 MB 相当的重建质量,存储减少约 17 倍。

研究背景与动机

沉浸式多媒体应用(如自由视点视频、AR/VR、远程呈现和数字孪生)推动了从传统 2D 媒体到交互式 3D 内容的转变。这些应用需要在严格的带宽、存储和延迟约束下实现照片级真实新视角渲染。3D 高斯泼溅(3DGS)以其显式场景表征和实时渲染能力成为沉浸式媒体的有吸引力表征。然而传统神经渲染方法通常依赖昂贵的逐场景优化来达到高保真重建,限制了其向多样场景的可扩展性。

前馈 3D 重建方法通过直接从稀疏输入视图恢复场景几何或神经表征缓解了这一瓶颈。在前馈 3DGS 方面,pixelSplat、MVSplat、DepthSplat、AnySplat、YoNoSplat 等方法直接从稀疏视图预测可渲染高斯表征而无需测试时优化,大幅提升重建效率和可扩展性。后续方法通过增强深度估计、跨视图特征聚合、位姿鲁棒性和几何感知正则化改进前馈高斯预测。然而这些方法的主要目标是渲染质量而非紧凑传输,预测的高斯表征通常密集且高维,导致可观的存储和传输开销。以 YoNoSplat 为例,每个场景的高斯表征约需 6.5 MB,在带宽受限的多媒体场景中难以部署。

为降低前馈高斯表征的存储和传输成本,近期方法探索了紧凑表征和学习压缩方案。SOGS 和 FCGS 等方法通过减少高斯冗余或熵编码中间潜特征来提升实用性。然而它们仍主要依赖从压缩表征的确定性重建——在足够低的比特率下,高频纹理、视图依赖外观和弱观测细节容易从比特流中移除,使确定性高斯渲染不足。FCGS 在 DL3DV 上将 DepthSplat 的存储从 20.5 MB 降至 1.76 MB,但 PSNR 从 19.35 dB 降至 18.23 dB,LPIPS 从 0.272 恶化至 0.415——低比特率下确定性重建的质量退化严重。

一个直接的补救是对解码渲染应用生成增强。近期工作将生成先验纳入前馈高斯渲染,恢复高频细节、退化纹理和宽基线新视角。然而这些方法聚焦重建增强而非 3D 场景压缩——生成模块附加在高斯预测或渲染之后,未与比特流形成、率分配或熵约束表征设计联合优化。因此生成的细节可能与传输的 3D 结构不一致,使整体框架在带宽受限传输中次优。此外多步迭代扩散采样在实时多媒体应用中不实用。

从 3DGS 压缩研究来看,现有方法主要通过高斯剪枝、球谐缩减、属性量化、向量量化和紧凑神经表征减少冗余。HAC 使用哈希网格辅助上下文模型捕获空间相关性,ContextGS 结合锚级自回归建模和超先验特征实现更高效熵编码。这些方法虽然在高压缩比下保持渲染质量,但假设高质量高斯表征已通过逐场景优化获得,不直接处理前馈预测的高斯。前馈场景的高斯预测不经过优化,质量和分布与优化后的不同,直接套用这些压缩器效果有限。此外这些方法都是确定性重建,在极低比特率下无法恢复被丢弃的高频信息。 GenSplatCodec 因此重新审视前馈高斯压缩的公式化。它不要求紧凑高斯表征确定性地保留每个视觉细节,而是论证低比特率编码应保留可靠的场景结构和紧凑外观证据,同时通过几何引导生成恢复缺失细节。这将前馈高斯压缩从确定性表征恢复转变为几何引导生成解码。在此公式下,紧凑高斯编码和生成重建在编解码器内统一,使生成先验在提升感知质量的同时受到传输场景结构的显式约束——生成解码器是编解码器的有机组成部分而非外部后处理。

方法详解

GenSplatCodec 采用双流编码架构:从稀疏输入视图 $\mathcal{I}=\{(I_i, \pi_i)\}_{i=1}^N$ 产生两个比特流——紧凑高斯结构流 $B_G$ 和轻量参考外观流 $B_R$,$(B_G, B_R)=\mathcal{E}(\mathcal{I})$。高斯流通过细节感知前馈高斯预测、率失真引导高斯压缩和几何-属性解耦编码生成,携带紧凑 3D 结构、可见性和粗略外观。参考流在 VAE 潜域编码选定参考视图,提供在紧凑高斯域中难以保留的互补外观线索。解码端用几何引导一步生成解码器 $\tilde{I}_q=\mathcal{D}(B_G, B_R, \pi_q, \pi_r)$ 联合利用两流重建高保真新视角。核心思想是将结构编码与细节合成分离。

图0:GenSplatCodec 概览。低比特率编码保留可靠场景结构,生成解码器在几何约束下恢复高频细节。

图1:双流编码架构。(a) 高斯结构流:率失真引导剪枝 + 几何-属性解耦编码产生 $B_G=\{B_\mu, B_m, B_h\}$。(b) 参考外观流:VAE 潜域量化熵编码产生 $B_R$。

细节感知前馈高斯编码。前馈预测网络 $\Phi_\theta$ 从输入视图直接推断可渲染高斯 $G=\{g_j\}_{j=1}^M$,每个 $g_j=\{\boldsymbol{\mu}_j, \mathbf{s}_j, \mathbf{q}_j, \alpha_j, \mathbf{c}_j\}$(中心、各向异性尺度、旋转四元数、不透明度、RGB 颜色)。从稀疏观测可靠预测高斯需要跨视图结构推理和细粒度外观建模。然而用于对应推理的深度聚合特征可能削弱局部纹理和高频外观线索。因此采用双分支特征路径:结构分支通过局部-全局注意力骨干聚合局部图像证据和跨视图上下文,提供连贯特征用于高斯中心预测;细节分支从预训练 DINO 骨干通过轻量 MLP 提取细粒度外观信息。两分支非对称融合——中心从结构聚合特征预测,细节特征仅注入属性预测头。这种设计增强细粒度属性预测而不干扰跨视图中心估计。DINO 骨干在大规模数据上预训练,其特征天然包含丰富的局部纹理和高频外观信息,通过轻量 MLP 投影后直接注入属性预测头,避免了在结构分支中经过多层注意力后这些细粒度信息被平滑掉的缺陷。使用零阶球谐使每个高斯携带紧凑视图无关 RGB 向量。为便于量化和率估计,将属性变换到编码友好域:$\mathbf{a}_j=[\mathbf{c}_j, \mathrm{logit}(\alpha_j), \log\mathbf{s}_j, \mathbf{q}_j]\in\mathbb{R}^{11}$,logit 变换将有界不透明度映射到无约束域,对数变换减小正尺度参数的动态范围。

率失真引导高斯压缩。前馈预测通常生成密集基元确保覆盖,但直接编码效率低——基元的视觉贡献和编码成本差异大。对第 $j$ 个高斯估计视觉贡献分数 $v_j$(基于不透明度和空间覆盖)和属性编码成本 $b_j^a$(基于学习熵模型),计算保留优先级:

$$p_j^{\mathrm{RD}}=\frac{v_j}{b_j^a+\epsilon}$$

较大的 $p_j^{\mathrm{RD}}$ 表示相对于估计属性编码成本更高的视觉回报。按 $p_j^{\mathrm{RD}}$ 排序保留 top 候选实现压缩。这种贪心剪枝移除低编码价值基元同时避免昂贵组合优化。压缩后中心和非几何属性分别编码:中心先量化再用 G-PCC 压缩利用空间占用结构产生几何比特流 $B_\mu$;属性按 Morton 码排序后量化并分层熵编码(主潜码 $B_m$ + 超先验 $B_h$)。参考外观流将选定参考视图编码到 VAE 潜域再量化和熵编码产生 $B_R$。选择参考视图的策略基于与查询视图的视角重叠度——重叠越大越能提供有用外观线索。$B_R$ 的比特率显式计入总率,不引入未计入的外观边信息。因此 $B_G$ 提供紧凑结构锚,$B_R$ 提供在紧凑高斯域中难以保留的互补外观线索,两流联合条件生成解码器。总比特率为 $R_{total}=R_G+R_R$,解码端不依赖原始参考图像或未计入边信息。

几何引导一步生成解码。解码端先恢复紧凑高斯 $\hat{G}=Dec_G(B_G)$ 和参考外观潜码 $\hat{\boldsymbol{z}}_r=ED_R(B_R)$。从 $\hat{G}$ 渲染查询视图 RGB 锚和几何线索:$(\hat{I}_q^g, \hat{D}_q^g)=\mathcal{R}(\hat{G}, \pi_q)$,以及参考视图几何 $\hat{D}_r^g=\mathcal{R}_d(\hat{G}, \pi_r)$。查询分支由编码低速率高斯渲染初始化 $\boldsymbol{z}_q=E_{vae}(\hat{I}_q^g)$,参考分支直接使用解码参考潜码。分层几何控制模块将渲染深度图归一化并映射到 VAE 潜分辨率,再由几何控制器转为多级控制信号:

$$\mathbf{g}_q=\rho(\nu(\hat{D}_q^g)),\quad \{\Delta\mathbf{H}_q^\ell\}_{\ell=1}^L=C_\phi(\mathbf{g}_q)$$

在每个潜阶段注入几何控制信号 $\mathbf{H}_v^\ell=U_\omega^\ell(\mathbf{H}_v^{\ell-1})+\Delta\mathbf{H}_v^\ell$。这允许不同空间尺度的几何线索约束潜处理层级同时与潜生成过程对齐。查询和参考分支通过共享一步多视图生成 U-Net 处理,注意力层中两分支潜 token 拼接为共享序列由参考混合层实现跨视图潜交互——查询分支从参考分支聚合互补纹理和外观模式,注入的几何控制调节信息解释和传输,减少结构漂移和空间不合理细节合成。最终查询潜码 $\tilde{\boldsymbol{z}}_q$ 经 VAE 解码为最终图像 $\tilde{I}_q=D_{vae}(\tilde{\boldsymbol{z}}_q)$。整个解码过程一步完成无需迭代扩散采样。

graph LR
  A[稀疏输入视图] --> B[双分支高斯预测
结构分支 + DINO细节分支] B --> C[率失真引导压缩
保留优先级剪枝] C --> D[几何-属性解耦编码
G-PCC + 分层熵编码] D --> E[高斯结构流 B_G] A --> F[参考外观流 B_R
VAE潜域量化熵编码] E --> G[解码高斯 + 渲染锚/几何] F --> H[解码参考潜码] G --> I[一步生成解码
分层几何控制 + 跨视图交互] H --> I I --> J[高保真新视角] style C fill:#fff3cd,stroke:#856404,stroke-width:2px style I fill:#e3f2fd,stroke:#1565c0,stroke-width:2px

图2:GenSplatCodec 工作流。双流编码后,一步生成解码(蓝色)联合利用高斯结构和参考外观重建新视角。

三阶段优化。阶段1:无编码约束训练细节感知高斯预测网络,用渲染重建损失 $\mathcal{L}_{ff}=\mathcal{L}_{mse}+\lambda_{ssim}(1-\mathrm{SSIM})$ 监督。阶段2:冻结高斯预测器,优化压缩模块,用保真度损失 $\mathcal{L}_{fid}=\lambda_{mse}\|\hat{I}_q^g-I_q\|_2^2+\lambda_{ssim}[1-\mathrm{SSIM}]$ 和率损失 $\mathcal{L}_{rate}=\frac{R_m+R_h}{M_r D_a}$。阶段3:固定高斯编码路径,训练生成解码器适配编解码器导出的结构和外观条件,用保真度-感知损失 $\mathcal{L}_{gen}=\lambda_2\|\tilde{I}_q-I_q\|_2^2+\lambda_{lpips}\mathcal{L}_{LPIPS}$。分阶段优化避免从头联合优化的不稳定性,确保每个下游模块用其实际上游路径输出优化。

实验结果

在 DL3DV 和 RealEstate10K 两个基准上评估,224×224 分辨率,与 DepthSplat、AnySplat、YoNoSplat 及其级联压缩变体(+SOGS、+FCGS)比较。使用 PSNR、SSIM、LPIPS、FID、MUSIQ、MANIQA 评估质量,平均总比特流大小(MB/场景)评估压缩效率。

定量比较。在 DL3DV 224×224 上,Ours-Low 以仅 0.206 MB 达到 19.21 dB PSNR,而 DepthSplat 需 20.5 MB 才达到 19.35 dB——存储仅需约 1%。Ours-Mid 以 0.376 MB 达到 20.02 dB,与 YoNoSplat 的 6.508 MB/20.09 dB 相当,存储减少 17.3 倍。在相似 PSNR 下(20.02 vs 20.04 dB),Ours-Mid 比 YoNoSplat+SOGS 减少 68.6% 存储同时 SSIM、LPIPS 和 FID 更优。Ours-High 在所有六个质量指标上均最优(20.76 dB PSNR、0.638 SSIM、0.184 LPIPS、50.51 FID、47.96 MUSIQ),仅需 0.830 MB。在 RealEstate10K 上,Ours-High 达到最高 23.33 dB PSNR、最低 0.125 LPIPS 和 32.45 FID,存储从 6.508 MB 降至 0.748 MB(减少 88.5%),所有质量指标均提升。相比之下,级联压缩方法在低比特率下严重退化——YoNoSplat+FCGS 的 LPIPS 从 0.201 恶化至 0.360,FID 从 54.51 恶化至 87.89,证明确定性重建在低比特率下的不足。相比之下 GenSplatCodec 的 Ours-Mid 在更低存储(0.376 MB vs 1.199 MB)下 LPIPS 更优(0.209 vs 0.213)且 FID 大幅领先(53.20 vs 58.03),说明生成解码器在低比特率下有效恢复了高频细节和感知质量。在 RealEstate10K 上同样如此——Ours-High 以 0.748 MB 在所有指标上超越 YoNoSplat 的 6.508 MB,PSNR 提升 0.02 dB 但 LPIPS 从 0.136 降至 0.125,FID 从 36.39 降至 32.45。

方法PSNR ↑SSIM ↑LPIPS ↓FID ↓大小(MB) ↓
DepthSplat19.350.5990.27257.8520.500
YoNoSplat20.090.6170.20154.516.508
YoNoSplat+SOGS20.040.6140.21358.031.199
YoNoSplat+FCGS18.550.5830.36087.891.457
Ours-Low19.210.5620.26065.300.206
Ours-Mid20.020.6190.20953.200.376
Ours-High20.760.6380.18450.510.830

表1:DL3DV 224×224 定量比较。Ours-Mid 以 17.3 倍更少存储达到与 YoNoSplat 相当的质量。

输入稀疏性鲁棒性。在 2/4/6 上下文视图设置下,GenSplatCodec 始终以最小比特流保持最佳或接近最佳质量。4 视图时以 0.989 MB 达到 24.26 dB(YoNoSplat+SOGS 1.941 MB/24.24 dB),6 视图时以 1.089 MB 达到 23.83 dB(YoNoSplat+SOGS 2.830 MB/23.76 dB)。2 视图时以 0.376 MB 达到 20.02 dB,与 YoNoSplat+SOGS 的 1.199 MB/20.04 dB 相当但存储仅为其 31%。

视图数方法PSNR ↑LPIPS ↓大小(MB) ↓
2YoNoSplat+SOGS20.040.2131.199
2Ours20.020.2090.376
4YoNoSplat+SOGS24.240.1111.941
4Ours24.260.1030.989
6YoNoSplat+SOGS23.760.1132.830
6Ours23.830.1081.089

表2:不同输入视图数下的压缩性能。GenSplatCodec 在所有设置下均以最小存储达到最佳或接近最佳质量。

图3:率失真曲线。GenSplatCodec 在 DL3DV 和 RealEstate10K 上均持续优于级联压缩方法,在低存储预算下优势尤为显著。

多视图一致性。与 MVSplat360 和 LatentSplat 比较,GenSplatCodec 在 SIFT(90.88 vs 78.90/74.11)、CLIP(0.941)、LPIPS(0.332)、MS(0.897)、BC(0.935)、SC(0.878)上均最优或接近最优,证明生成解码器产生的新视角跨视图一致——这验证了几何引导生成优于无约束后处理生成。

高斯参数化

$$ G=\Phi_{\theta}(\mathcal{I})=\{g_{j}\}_{j=1}^{M},\qquad g_{j}=\{\boldsymbol{\mu}_{j},\mathbf{s}_{j},\mathbf{q}_{j},\alpha_{j},\mathbf{c}_{j}\} $$

高斯属性向量

$$ \mathbf{a}_{j}=[\mathbf{c}_{j},\operatorname{logit}(\alpha_{j}),\log\mathbf{s}_{j},\mathbf{q}_{j}]\in\mathbb{R}^{11} $$

编码器输出

$$ (B_{G},B_{R})=\mathcal{E}(\mathcal{I}) $$

局限性

第一,生成解码器依赖预训练一步生成先验的质量。如果先验对特定场景类型(如极端光照、罕见材质、复杂透明物体)的生成能力不足,解码质量会受限。一步生成虽快但可能不如多步扩散精细,在极高比特率下确定性重建可能更优——GenSplatCodec 的优势主要体现在低比特率场景。此外生成先验的泛化能力决定了编解码器在新场景类型上的表现。

第二,当前双流架构的参考外观流仅编码单一参考视图,在需要多参考视图的复杂场景中可能不足。高斯结构流使用零阶球谐,无法表示视图依赖外观,这部分依赖生成解码器补偿但可能不完全。三阶段优化虽稳定但训练流程较长,且阶段间的冻结策略可能限制端到端联合优化的潜力。几何编码使用非可微的 G-PCC,无法直接纳入端到端率优化,其编码成本仅通过高斯压缩间接降低。此外当前评估主要在 224×224 分辨率进行,更高分辨率的扩展效果有待验证。率失真引导剪枝的保留比例需手动设置,不同场景可能需要不同值。

总结与展望

GenSplatCodec 将低比特率前馈高斯压缩从确定性恢复重新表述为几何引导生成解码,通过双流编码(紧凑高斯结构流 + 轻量参考外观流)和一步几何引导生成解码器,在 DL3DV 上以 0.376 MB 达到与 YoNoSplat 6.508 MB 相当的质量(17.3 倍压缩),在所有率失真操作点上均优于级联压缩方法。多视图一致性实验证明生成的新视角跨视图一致。

这一工作表明紧凑结构编码与生成细节恢复的统一设计优于级联方案,为带宽受限的沉浸式媒体传输提供了实用路径。未来工作可探索多参考视图编码以处理更复杂场景、更高阶球谐支持以表示视图依赖外观、可微几何编码以实现端到端率优化,以及更高效的生成先验。此外将 GenSplatCodec 扩展到高分辨率(如 518×518 或更高)和视频序列的时空压缩也是重要方向。当前方法在 518×518 分辨率上的评估也显示了优势但未充分展开。与传统视频编码标准(如 V-PCC)的对比和融合也值得探索,特别是在自由视点视频传输场景中。一步生成解码器的推理速度虽优于多步扩散但仍需进一步优化以满足实时要求。

金句

低比特率编码不应追求保留每个细节,而应保留可靠结构并让生成恢复缺失细节——这是从确定性恢复到几何引导生成的范式转变。
生成解码器不是后处理补丁而是编解码器的有机组成部分——它参与比特分配并受传输结构显式约束。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日