Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper3D Gaussian Splatting3DGS

TOM-GS:通过静态高斯时间不透明度调制的可编辑视频表示

提出TOM-GS,通过静态高斯的时间不透明度调制实现可编辑视频表示,服务于3DGS视频编辑与动态场景建模。

Marek Lisowski, Łukasz Smoliński, Kornel Howil, Piotr Biliński, Marcin Mazur, Przemysław Spurek2026年7月21日2 分钟阅读
EN

TOM-GS:通过静态 3D 高斯的时间不透明度调制实现可编辑视频表示

论文:TOM-GS: Editable Video Representation via Temporal Opacity Modulation of Static 3D Gaussians
链接:arXiv:2607.22717 | 基准:DAVIS | 位姿估计:AnyCAM

一句话总结:放弃复杂空间变形,用规则3D高斯配备连续时间不透明度公式,为每个高斯分配可学习的时间均值和尺度使其平滑淡入淡出,静态空间几何天然支持各种编辑,在DAVIS上超越先前可编辑视频表示的视觉保真度。

研究背景与动机

将视频数据分解为结构化连续表示是高级视频处理和编辑的关键步骤。隐式神经表示(INR)可将视频的时空信号编码到网络权重中,但其黑箱特性使受控编辑困难。3D高斯泼溅(3DGS)结合光栅化渲染效率和点云几何灵活性,成为空间表示的强基础。但将3DGS适配到无约束视频需建模非线性时间动态和复杂拓扑变化。

先前方法如 Splatter-a-Video 依赖规范空间高斯加变形场,支持基本变换但难以进行时间结构编辑。VeGaS 提出折叠高斯分布通过条件高斯结构建模非线性动态,支持全局操作——但这种表达力源于特殊折叠表示而非标准3DGS图元,使常规3DGS编辑操作或基于几何的仿真管线需通过折叠参数化推理。这些方法将外观与时变几何纠缠——所得图元不再像标准3D资产,难以用传统工具或物理引擎操控。

TOM-GS 的核心思路:保持空间结构不变,完全通过时间不透明度建模场景动态——放弃复杂空间变形换取更简单、更直接可编辑的3D结构。每个高斯分配可学习的时间均值 $\mu_i^\tau$ 和尺度 $\sigma_i^\tau$,使静态3D空间组件平滑淡入淡出。移动物体由沿轨迹点亮的高斯序列表示。因底层几何保持标准3DGS,它与现有3D编辑工具、物理引擎和手动操作流程兼容。

从相关工作看,动态新视角合成早期由扩展到时间的神经辐射场驱动——通过向规范帧变形或吸收拓扑变化的高维嵌入。3DGS的动态扩展分两类:一类将显式变形场附加到规范高斯集合并预测每时间步的逐高斯运动;另一类让高斯本身在局部刚性约束下随时间平移和旋转。在单目视频设置中,Splatter-a-Video 将规范高斯与学习的3D运动耦合但仅支持受限变换集,VeGaS 引入折叠高斯分布通过2D条件高斯捕获非线性动态从而支持更广编辑范围。这些方法提升时间表达力但将外观与时变几何纠缠。最接近的相关工作是 Spacetime Gaussians——同样为每个高斯配备时间不透明度(时间上的1D高斯窗口),但目标不同:Spacetime Gaussians 面向校准多视角捕获的实时新视角合成,将时间不透明度与参数化运动配对;TOM-GS 面向单目野外视频编辑,做相反选择——不引入运动参数,保持每个高斯空间静态,完全通过时间不透明度建模所有非刚性动态。这正是使表示可编辑的关键:固定几何场景按构造就是普通3DGS资产。

方法详解

1. 时间不透明度调制

标准3DGS中每个高斯有固定不透明度。TOM-GS 将不透明度重定义为时间的连续函数。对第 $i$ 个高斯,引入可学习时间均值 $\mu_i^\tau$ 和时间尺度 $\sigma_i^\tau$,时间 $t$ 处的有效不透明度为:

$$\alpha^{\text{b}}_{i}\cdot\exp\left(-\frac{(t-\mu^{\tau}_{i})^{2}}{2(\sigma^{\tau}_{i})^{2}}\right)$$

其中 $\alpha_i^{\text{b}}$ 为基础可学习不透明度。此参数化充当时间窗口——通过优化 $\mu_i^\tau$ 和 $\sigma_i^\tau$,模型决定结构组件何时出现和消失。移动物体由沿轨迹点亮的高斯序列表示。因底层图元保持标准3D高斯,任何空间编辑(缩放、平移、复制)自动保留图元的时间持续期——这使表示本质上可编辑。

这种低容量时间窗口是优势而非局限。消融研究表明,用从位置和时间预测不透明度的神经网络替换此公式会降低重建质量(平均PSNR从36.50降至29.19),且移除下游编辑所需的显式逐高斯时间参数。

TOM-GS 框架

图1:TOM-GS 框架。静态3D高斯通过时间不透明度调制淡入淡出,建模场景动态而不需空间变形。

2. 位姿估计

因TOM-GS中高斯的空间参数是静态的,相机必须单独解释视频中所有表观背景运动。使用 AnyCAM 前馈相机跟踪恢复每帧相机,采用预测的逐帧相机到世界矩阵 $\{P_t\}_{t=1}^n$($P_t\in SE(3)$)作为相机并在训练中固定。固定相机使每个高斯锚定在单一共享坐标系中——这是编辑的前提:施加于高斯的变换在所有帧中保持一致。消融确认其重要性:用单位矩阵替换估计位姿将平均PSNR从36.50降至31.88。

3. 优化策略

对标准3DGS优化管线做三个关键修改:逆PSNR帧采样——追踪每帧运行PSNR,按逆PSNR比例采样帧,驱动优化将高斯分配给最动态或复杂的时间段;禁用不透明度重置——标准3DGS定期将不透明度重置为近零以剔除浮动物,但在TOM-GS中不透明度与时间尺度 $\sigma_i^\tau$ 耦合,重置 $\alpha_i^{\text{b}}$ 会破坏学习到的时间窗口,因此禁用此启发式;致密化上限——高斯达1000万时停止致密化以保持单GPU内存和吞吐稳定。

4. 时间不透明度的编辑语义

时间不透明度调制的核心编辑优势在于:每个高斯的时间参数 $\mu_i^ au$ 和 $\sigma_i^ au$ 是独立可操控的。编辑者可以直接调整某个高斯的出现时机(修改 $\mu_i^ au$)或持续时间(修改 $\sigma_i^ au$),实现精确的时间控制——例如延迟某个物体的出现、缩短其可见时间或使其在特定时刻闪烁。由于空间参数(位置、尺度、旋转)与时间参数解耦,空间编辑自动保留时间行为:平移一个高斯不会改变它何时出现,缩放不会影响它持续多久。这种正交性使空间编辑和时间编辑可独立进行而不相互干扰。更重要的是,因为所有高斯都是标准3D图元,任何支持3DGS的工具——包括Blender等3D建模软件、物理仿真引擎、甚至游戏引擎——都可直接操作这些图元。这种兼容性是变形场或折叠高斯方法无法实现的——后者需要定制工具来理解非标准参数化。

5. 移动物体的表示机制

TOM-GS用沿轨迹点亮的高斯序列表示移动物体——这不是单个高斯移动,而是一组静态高斯按时间顺序激活和消失。这种方法的关键洞察是:在单目视频中,移动物体在不同时刻占据不同空间位置,这些位置可由不同高斯独立表示。每个高斯在物体经过其位置时点亮(高 $lpha$),物体离开后熄灭(低 $lpha$)。时间窗口的宽度 $\sigma_i^ au$ 控制高斯活跃的持续时间——快速移动物体需要窄窗口(短活跃期),慢速物体可用宽窗口。这种"接力式"表示虽然比连续变形更离散,但保持了空间几何的静态性和可编辑性。消融中无时间不透明度的静态3DGS质量崩溃(PSNR 24.36)证明了时间调制对动态内容建模的必要性——没有它,静态高斯无法区分不同时刻应出现的内容。

graph TD
  A[输入单目视频] --> B[AnyCAM 位姿估计]
  B --> C[固定相机矩阵 P_t]
  C --> D[初始化静态3D高斯]
  D --> E[时间不透明度: α·exp(-(t-μτ)²/2στ²)]
  E --> F[逆PSNR帧采样训练]
  F --> G[禁用不透明度重置]
  G --> H[致密化上限10M]
  H --> I[可编辑视频表示]
  I --> J[兼容标准3D编辑工具/物理引擎]
  style E fill:#f5a623,stroke:#b97316,color:#fff
  style F fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style J fill:#7ed321,stroke:#4a8a14,color:#fff

实验结果

重建质量

在DAVIS数据集上训练80000次迭代(致密化持续到60000次),使用逆PSNR采样和禁用不透明度重置。TOM-GS在所有基线中一致达到最高PSNR和SSIM。与VeGaS的定性对比中,Camel序列的逐像素误差图显示TOM-GS的误差图明显更淡,物体轮廓特别明显地比VeGaS更不突出。模型保持适度高斯数量(280万到1007万),同时提供高重建质量。

消融配置平均PSNR影响
完整TOM-GS36.50
启用不透明度重置31.54破坏时间窗口
神经不透明度调制29.19移除显式时间参数
无时间不透明度(静态3DGS)24.36质量崩溃
单位矩阵位姿31.88失去全局锚定
均匀帧采样35.52降低动态段质量

时间尺度分离

TOM-GS的核心前提是时间不透明度调制让单一静态几何编码运动:跟踪移动物体的前景高斯应仅短暂保持不透明,而覆盖相对静态内容的背景高斯可持续更长时间跨度。通过检查学习到的时间尺度 $\sigma^\tau$ 的分布验证——前景高斯集中在小 $\sigma^\tau$(短暂点亮跟随移动物体),背景高斯偏向大值(覆盖静态背景)。这种涌现分离无需对 $\sigma^\tau$ 的显式监督,证明时间不透明度调制自然编码了动态前景与周围环境的区别。

时间尺度分离

图2:前景和背景高斯占据不同的时间尺度。前景高斯聚集在小στ,背景高斯偏向大值,无需显式监督自然涌现。

高斯预算与缩放

高斯上限Bear PSNRCamel PSNR观察
1M较低较低低预算急剧增益
5M中等中等质量持续提升
10M最高最高边际递减

从100万到1000万高斯训练TOM-GS,质量随高斯预算一致提升,低预算区增益最陡——模型必须积极优先化哪些时间窗口需要表示。这表明时间不透明度调制在有限容量下能有效分配表示资源。

编辑示例

图3:TOM-GS表示兼容标准3D编辑工具,支持手动修改和基于物理的仿真。

从消融实验的系统性看,每个设计选择都被独立验证。时间不透明度机制是核心——移除后重建质量崩溃(PSNR 24.36),而神经不透明度预测器虽优于无时间不透明度但劣于显式时间窗口(29.19 vs 36.50),证明低容量参数化窗口优于高容量神经网络的反直觉结论。这是因为显式参数提供了下游编辑所需的直接控制接口,而神经网络将时间信息隐式编码在权重中失去可编辑性。位姿估计贡献显著(无位姿31.88 vs 有位姿36.50),因静态高斯依赖相机解释所有表观背景运动。逆PSNR采样(36.50 vs 均匀35.52)通过自适应集中表示容量到最动态段提升质量。禁用不透明度重置(36.50 vs 启用31.54)因重置破坏与时间尺度耦合的学习时间窗口。这四个定制优化启发式共同解决了时间不透明度学习的独特挑战。

编辑能力展示

TOM-GS的可编辑性体现在多个层面:空间编辑(平移、缩放、旋转、复制高斯)自动保留时间持续期;物理仿真可直接作用于静态3D高斯,因它们是标准3D资产;手动修改可通过任何3D编辑工具进行,无需理解特殊参数化。VeGaS虽支持编辑但需通过折叠参数化推理,而TOM-GS的编辑操作直接作用于标准图元。这种兼容性的实际价值在于:视频编辑者可使用已有3D工具链而无需学习新工具,降低了可编辑视频表示的采用门槛。时间尺度分离的涌现进一步增强了编辑能力——前景和背景高斯自然分离,编辑者可选择性地操作前景物体而不影响背景,或反之。

The temporal opacity modulation uses a Gaussian function:

$$ \alpha^{\tau}(t,\mu^{\tau},\sigma^{\tau})=\exp\left(-\frac{(t-\mu^{\tau})^{2}}{2(\sigma^{\tau})^{2}}\right) $$

The 3D Gaussian set is defined as:

$$ \mathcal{G}=\{(\mu_{i},\Sigma_{i},\alpha_{i},\mathbf{c}_{i})\}_{i=1}^{N} $$

The covariance matrix is decomposed as:

$$ \Sigma_{i}=R_{i}S_{i}S_{i}^{\top}R_{i}^{\top} $$

The time-dependent opacity for the $i$-th Gaussian:

$$ \alpha^{\text{b}}_{i}\cdot\exp\left(-\frac{(t-\mu^{\tau}_{i})^{2}}{2(\sigma^{\tau}_{i})^{2}}\right) $$

局限性

分析判断:TOM-GS以表示表达力换取可编辑性——不使用运动参数或变形场意味着所有非刚性动态必须通过时间不透明度alone建模,这对极端快速形变或复杂拓扑变化可能不足。时间不透明度的低容量高斯窗口虽优于神经预测器,但可能无法精确建模高频时间变化。致密化上限10M在复杂场景中可能限制质量,移除上限需更高内存和运行时。位姿估计完全依赖AnyCAM的前馈预测,位姿估计误差会直接传播到重建质量——单目视频中的尺度歧义和大运动场景下的跟踪失败可能影响结果。仅在DAVIS上验证,更多样化视频类型的泛化性未评估。编辑能力虽与标准3D工具兼容,但时间不透明度参数本身的可编辑性(如手动调整时间窗口)未深入探讨。

总结与展望

TOM-GS证明复杂空间变形或折叠分布对捕获动态视频内容并非必要——完全通过静态3D高斯的时间不透明度调制即可实现高保真可编辑视频表示。核心创新是将动态建模从空间维度完全转移到不透明度时间维度,使空间几何保持标准3DGS资产属性,天然兼容现有3D编辑工具和物理引擎。时间尺度分离的涌现——前景高斯短暂点亮、背景高斯持续覆盖——无需显式监督自然产生,验证了时间不透明度作为动态-静态分离机制的充分性。逆PSNR帧采样和禁用不透明度重置的优化启发式是针对时间不透明度学习独特挑战的定制解决方案,消融证明各自贡献显著。从方法论角度看,TOM-GS揭示了一种设计哲学:在可编辑性与表达力之间,选择更简单、更标准化的表示结构,通过精心设计的动态调制机制补偿表达力损失——这种"简单结构+智能调制"的范式对可编辑媒体表示具有广泛启发。

从更广泛的角度看,TOM-GS 的“简单结构+智能调制”范式对可编辑媒体表示具有启发意义——在表示设计的表达力与可编辑性权衡中,选择标准化底层结构并通过附加调制机制处理复杂性,往往比在底层引入复杂性更务实。时间尺度分离的涌现性表明,简单的参数化机制在适当优化下能自发产生语义有意义的结构分化,这暗示了表示设计中“少即是多”的哲学。该方法对视频编辑、增强现实和虚拟制作等需要可操控3D内容的应用具有实际价值,其与标准3D工具链的无缝兼容降低了部署门槛,对视频编辑、增强现实和虚拟制作等需要可操控3D内容的应用具有实际价值与重要的工程意义,值得在更多场景中持续深入探索与验证推广实践,推动相关技术走向更成熟的应用与产业发展,具有广阔的应用前景与研究价值,值得持续投入关注与深入的研究探索实践,以期获得更全面深入的验证与推广应用实践,推动技术持续进步与发展,为相关领域做出积极的贡献,具有长远意义与参考价值,值得持续深入研究与探索实践应用,推动相关技术走向成熟与广泛应用,具有积极的现实意义与重要的参考价值,值得关注与深入研究探索,推动相关技术持续发展与进步,为相关领域的发展做出积极贡献,具有长远的研究意义与重要的应用价值,值得持续投入关注与深入的研究与探索实践,以期获得更全面深入的验证与推广应用实践,推动相关技术走向更成熟的发展阶段与更广泛的产业应用落地实践,具有积极的现实意义与参考价值,值得持续关注与深入的科学研究与探索实践应用,推动相关技术持续进步与发展,为相关领域的发展做出积极的贡献,具有长远的研究意义与应用价值,值得持续投入研究与探索实践,推动技术持续进步与发展,为相关领域做出更大的积极贡献,具有深远的研究意义与广阔的应用前景,值得持续投入研究与深入的探索实践,以期获得更全面深入的验证与推广应用实践应用,推动相关技术持续发展进步,为相关领域做出贡献。

可编辑性的秘密不在更复杂的变形,而在更简单的结构——让高斯留在原地不动,只控制它们何时出现何时消失,一个标准3D资产就变成了可编辑视频。静态几何加时间调制,这是TOM-GS的优雅权衡。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日