3D高斯泼溅(3DGS)推动了稠密动态SLAM的进展,但主流方法直接丢弃预定义的动态物体,忽略了瞬时静止物体对位姿估计的几何约束价值;WildGS-SLAM用逐像素不确定性图利用这类物体,却会把它们融进静态地图留下持久伪影,且纯几何的不确定性在物体边界处含糊不清。DL-SLAM提出双层概率框架:像素级结合语义与几何信息计算动态概率,作为稠密束调整的自适应权重;像素概率被提升到三维高斯属性并按实例聚合为对象级动态概率,用于类别化剪枝动态高斯,得到无伪影的静态地图;纯净的静态地图再渲染出几何一致的概率图,贝叶斯式地反哺像素级估计。配合动态感知的语义标签修正,DL-SLAM在TUM RGB-D、BONN与Wild-SLAM iPhone三个动态数据集上将跟踪精度最多提升13%,同时生成高保真语义地图。
本文提出视觉-语言-运动学(VLK)框架:在 3D 高斯泼溅重建的真实室内场景中合成导航与物体交互轨迹,并事后渲染第一人称观测,自动生成 4.8 万条视觉-语言-运动学配对数据,训练出预测 Unitree G1 全身运动轨迹的策略,经接触感知全身跟踪器执行,实现 sim-to-real 的感知驱动人形移动操作。
针对3D高斯泼溅中的模糊陷阱问题,提出探索策略逃离该陷阱,提升3DGS新视角合成的清晰度与质量。
提出QIRF量子启发的非正交函数空间压缩方法,降低3D高斯泼溅的存储与计算开销,服务于3DGS高效渲染。
提出AniGS方法,桥接3D高斯泼溅渲染与扩散先验,实现3D场景动画生成,服务于3DGS动态场景建模。
提出ZeroSplat,在3D高斯泼溅中实现泛化指代分割,结合语言指代与3DGS几何,服务于3D场景理解与机器人感知。
提出TOM-GS,通过静态高斯的时间不透明度调制实现可编辑视频表示,服务于3DGS视频编辑与动态场景建模。
提出RealVDeblur,基于一步扩散实现泛化真实世界视频去模糊,服务于机器人视觉与3DGS场景的清晰化。
研究锯齿与低纹理环境下的稀疏视角视觉重定位,提出方法提升视觉定位鲁棒性,服务于机器人导航与3DGS初始化。
提出基于3D高斯显式参数扰动的无网格域随机化方法,降低sim-to-real差距,服务于机器人仿真训练。
提出Fashion-3DLR,基于成对时尚元素实现可控3D服装生成,服务于3D内容生成与数字人/机器人外观建模。
提出带动态显式头发的人头部化身方法,服务于3D人体建模与数字人,属3DGS/CV交叉。