PAPER DEEP DIVE
ZeroSplat:3D高斯泼溅中的泛化指代分割
提出ZeroSplat,在3D高斯泼溅中实现泛化指代分割,结合语言指代与3DGS几何,服务于3D场景理解与机器人感知。
ZeroSplat:3D 高斯泼溅中的泛化指代分割
论文:ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting
作者:Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si
机构:北京大学、华北电力大学、中国地质大学、InkMind.AI
链接:arXiv:2607.18801 | 项目主页
代码:已开源
一句话总结
ZeroSplat 提出泛化指代 3D 高斯泼溅分割任务(GR3DGS),支持分割任意数量目标(0/1/N),通过无训练、零特征框架将 2D VLM 先验经多视图几何约束提升到 3D 空间,实现内在点级理解,在泛化和单目标场景中均大幅超越 SOTA。
研究背景与动机
3D 高斯泼溅(3DGS)用显式 3D 高斯表征场景实现高质量实时渲染。每个高斯由均值位置、协方差矩阵(控制尺度和方向)、颜色和不透明度表征。渲染时高斯投影到图像平面并按深度排序混合,像素颜色通过 alpha 合成计算:$C(p)=\sum_{i=1}^{|\mathcal{G}_p|}c_i\alpha_i\prod_{j=1}^{i-1}(1-\alpha_j)$。超越视觉合成,近期研究开始赋予 3DGS 语义理解能力。
开放词汇 3DGS 理解方法分为像素级和点级两种范式。像素级方法采用"渲染后匹配"策略,将场景渲染为密集 2D 特征图后在图像空间推理。LEGaussians、LangSplat、Feature-3DGS 等将 2D 基础模型语义特征蒸馏到视图一致的 3D 表征中。然而这些方法将 3D 表征主要作为渲染代理,缺乏场景结构理解,无法直接识别或操作单个高斯基元。点级方法采用"匹配后渲染"范式,以 3D 高斯基元为理解基本单元。OpenGaussian 和 InstanceGaussian 用 SAM 的 2D 掩码学习 3D 一致实例特征;Dr.Splat 和 LUDVIG 直接将 2D 特征聚合或图扩散到 3D 高斯点上。然而将点级方法的优势扩展到指代 3DGS 理解仍 largely 未探索。
指代 3D 高斯泼溅(R3DGS)填补了开放词汇与自由形式语言之间的空白,通过精细文本提示分割目标。ReferSplat 使用位置感知跨模态模块将 3D 高斯与文本查询对齐。然而现有 R3DGS 范式存在关键限制:严格限于"单目标"设置,预设每条指令恰好对应一个目标。这在真实场景中严重阻碍灵活性——用户指令本质上是不确定的,常涉及多目标请求(如"找到所有红椅子")或无目标查询(即物体不存在)。当目标不存在时,单目标方法仍会输出一个分割结果,产生假阳性。
为此论文引入泛化指代 3D 高斯泼溅分割(GR3DGS)任务,要求解析指令分割任意数量目标(0、1 或 N),对语义判别和歧义鲁棒性提出更高要求。模型必须动态分割多目标、单目标或在目标不存在时输出空掩码。构建 GR-LERF(像素级评估)和 GR-ScanNet(3D 标注的点级评估)两个基准支持评估。GR-LERF 包含 Ramen、Teatime、Figurines、Waldo 四个场景,GR-ScanNet 基于 ScanNet 构建,包含复杂空间和功能查询的 3D 点标注。标注协议分三阶段:指令生成(基于外观、空间关系、功能、目标计数)、掩码标注、质量验证。
除任务公式化外,现有技术范式在 GR3DGS 上遇到两个关键瓶颈。第一,缺乏 3D 点级理解——现有 R3DGS 方法用 2D 渲染像素作为语义处理基本单元而非在离散 3D 高斯点上操作,本质上仍限于 2D 图像级理解,无法利用场景显式 3D 几何结构解决复杂空间歧义。第二,计算和内存开销过大——需要逐场景优化(通常 1-2 小时)并将高容量语义特征嵌入数百万高斯点(约 3 GB 额外存储),峰值 VRAM 达 20-28 GB,使其在实时应用和资源受限设备上不实用。
ZeroSplat 为弥合这些差距而设计——一个无训练、零特征的框架。其核心洞察是:鲁棒的 3D 语义理解不需要改变场景内在表征,而可通过几何约束将 2D 基础模型先验提升到 3D 空间实现。通过将 2D VLM 的语义线索投影到 3D 结构上,直接在原始 3D 高斯集中过滤和定位目标,无需额外特征存储或逐场景优化。这一设计存储零语义特征、支持即插即用推理,峰值 VRAM 仅约 10 GB,远低于基线方法的二十至二十八 GB,使在边缘设备和移动平台上部署三D语义理解成为可能,对具身智能体的实时场景感知具有重要意义。
方法详解
ZeroSplat 是一个三阶段端到端框架,分层级地将非结构化文本连接到 3D 几何锚点:(1) 几何引导 VLM 语义解析;(2) 2D 语义掩码生成与 3D 提升;(3) 多视图验证与空间精炼。给定从多视图图像重建的 3DGS 场景 $\mathcal{G}$ 和自由形式自然语言表达式 $\mathcal{T}$,目标是为每个高斯 $g\in\mathcal{G}$ 分配二元语义标签。
图1:ZeroSplat 方法总览。(a) 关键帧提取 + VLM 两阶段解析(语义标签提取 → 2D 定位)。(b) 多视图 2D 掩码生成与 3D 提升。(c) 多视图验证与空间精炼。
几何引导 VLM 语义解析。首先通过曲率评估选择几何关键帧——将场景体素化并计算各帧可见体素的曲率变化,贪心地选择覆盖高价值几何区域的关键帧集 $\mathcal{I}_{key}$(选取 K=10 帧),每次选择边际增益最大的帧并合并其可见体素,过滤冗余背景视图,最大化高价值几何区域覆盖同时最小化数据冗余。然后用 VLM(qwen3-vl-30b-a3b-instruct)执行两阶段交互。第一阶段语义标签提取:将指代文本 $\mathcal{T}$ 和关键帧 $\mathcal{I}_{key}$ 输入 VLM,从冗长描述中提取简洁语义标签集 $\mathcal{C}=\{C_1,\ldots,C_M\}$——这一步将复杂的自由形式语言简化为可供 2D 分割模型使用的类别标签。第二阶段 2D 几何定位:将标签 $C_j$、原文 $\mathcal{T}$ 和关键帧重新输入 VLM,输出每个关键帧中目标物体的归一化 2D 边界框 $\mathcal{B}_i$,作为后续提升阶段过滤 3D 高斯伪影的空间先验。消融显示移除语义标签提取导致严重退化(24.3 mIoU),因自由形式提示直接输入 2D 分割模型引入高歧义。
2D 语义掩码生成与 3D 提升。用 SAM3 为每个类别和帧生成多视图 2D 掩码。采用自适应视图选择策略平衡语义纯度和几何覆盖:定义高置信度阈值 $\tau_{high}=0.6$、基础阈值 $\tau_{base}=0.3$、安全阈值 $\tau_{safe}=0.15$(开放词汇数据集用 0),优先选择高置信度视图(数量达 $N_{target}=30$ 即停止),不足时回退到低阈值(最少 $N_{safe}=6$)。SAM3 常过分割物体,故将次优掩码 $m_i^{(2)}$ 与主掩码 $m_i^{(1)}$ 合并(置信度超 $\tau_{merge}=0.8$ 时),跨类别联合得到最终语义掩码 $\hat{M}_i=\bigcup_{j=1}^L M_{i,j}$。
3D 提升利用 3DGS 体渲染性质将 2D 语义分配到单个高斯。单个高斯沿射线的渲染贡献权重为:
$$w(r,g_j)=T(r,g_j)\alpha(r,g_j)$$
其中 $T(r,g_j)$ 是射线到达 $g_j$ 前的累计透射率,$\alpha(r,g_j)$ 是不透明度。对每个高斯 $g_j$,聚合所有有效视图中的多视图语义响应,计算前景($k=1$)和背景($k=0$)全局分数:
$$W_k(g_j)=\sum_{I_i\in\mathcal{I}_{sel}}\sum_{r\in\mathcal{R}_i}\mathbb{I}(M_i(r)=k)w_i(r,g_j)$$
前景分数严格高于背景分数($W_1(g_j)>W_0(g_j)$)的高斯归入前景集 $\mathcal{G}_{fg}$,否则为背景。这种基于渲染贡献的加权聚合确保被遮挡或边缘的高斯获得较低的语义置信度,减少噪声。
跨视图背景裁剪。对前景集中每个高斯,计算其在所有有效视图中投影到背景区域的冲突比:
$$\rho_g=\frac{N_{conflict}(g)}{N_{val}(g)+\epsilon}$$
若 $\rho_g$ 超过阈值 $\tau_{conf}=0.8$,该高斯被视为几何伪影,标签修正为背景。此机制利用密集多视图共识显著减少边界噪声——一个高斯若在多数视图中被投影到背景区域,很可能本身是背景而非目标。
graph LR A[3DGS 场景 + 文本指令] --> B[几何关键帧选择
曲率评估 K=10] B --> C[VLM 两阶段解析
标签提取 + 2D 边界框] C --> D[SAM3 多视图掩码生成
自适应视图选择] D --> E[3D 提升
体渲染权重分配] E --> F[跨视图背景裁剪
冲突比过滤] F --> G[多视图验证
边界框外比例过滤] G --> H[3D KNN 空间扩散
k=40 近邻填补空洞] H --> I[3D 高斯分割结果] style E fill:#e3f2fd,stroke:#1565c0,stroke-width:2px style C fill:#fff3cd,stroke:#856404,stroke-width:2px
图2:ZeroSplat 工作流。VLM 解析(黄色)提供语义先验,3D 提升(蓝色)利用体渲染性质将 2D 语义映射到高斯点。
多视图验证与空间精炼。利用关键帧集的 2D 边界框 $\mathcal{B}_i$ 验证每个前景高斯。将高斯 $g$ 投影到关键帧 $I_i$ 得 2D 像素坐标 $\mathbf{u}_{g,i}$,计算跨视图有效观测频率 $N_{vis}(g)$ 和越界频率 $N_{out}(g)$(投影在视口内但落在边界框外)。跨视图越界比为 $R_{out}(g)=\frac{N_{out}(g)}{N_{vis}(g)+\epsilon}$。若 $N_{vis}(g)\geq\tau_{views}=8$ 且 $R_{out}(g)\geq\tau_{box}=0.8$ 则移除该高斯。这避免了单视图遮挡或 2D 定位误差导致的过度裁剪。最后用 3D KNN 空间扩散算法修复因视图遮挡导致的内部空洞——对每个背景高斯检查其 k=40 近邻中前景高斯的比例,若超可靠性阈值 $\tau_{knn}=0.8$ 则转为前景。消融显示 KNN 扩散比固定半径搜索更优(41.2 vs 39.8 mIoU),因高斯密度跨场景差异大,固定半径无法平衡稀疏和密集区域。
实验结果
论文构建两个新基准:GR-LERF(4 个场景:Ramen、Teatime、Figurines、Waldo,像素级评估)和 GR-ScanNet(基于 ScanNet 的 3D 点级评估)。在 GR3DGS、单目标 R3DGS 和开放词汇三个设置下评估,与像素级方法(LangSplat、GOI、ReferSplat 等)和点级方法(OpenGaussian、InstanceGaussian、Dr.Splat、LUDVIG)比较。
泛化指代 3DGS 分割。ZeroSplat 在 GR-LERF 上达到 50.8 mIoU,大幅领先次优 GS-Grouping 的 28.3 和 LUDVIG 的 23.8。在 GR-ScanNet 上达到 41.2 mIoU,领先 InstanceGaussian 的 24.5 和 OpenGaussian 的 19.8。在 Ramen 场景上达到 46.5 mIoU(次优 LUDVIG 25.3),Figurines 上 52.1(次优 LUDVIG 23.9)。定性分析显示基线方法在多目标场景中常合并或遗漏附近实例(过度平滑的嵌入所致),而 ZeroSplat 用 VLM 组合推理准确分割所有文本指定目标,召回率显著更高。InstanceGaussian 和 Dr.Splat 表现出严重过分割,频繁渗入无关背景区域;OpenGaussian 无法有效定位目标,预测稀疏或缺失。
| 方法 | 类型 | GR-LERF mIoU | GR-ScanNet mIoU |
|---|---|---|---|
| LangSplat | 像素 | 18.6 | - |
| GOI | 像素 | 31.6 | - |
| GS-Grouping | 像素 | 28.3 | - |
| ReferSplat | 像素 | 8.8 | - |
| OpenGaussian | 点 | 7.9 | 19.8 |
| InstanceGaussian | 点 | 9.9 | 24.5 |
| LUDVIG | 点 | 23.8 | 15.1 |
| ZeroSplat (本文) | 点 | 50.8 | 41.2 |
表1:GR-LERF 和 GR-ScanNet 上的定量结果。ZeroSplat 在两个基准上均大幅领先(GR-LERF +19.2,GR-ScanNet +16.7)。
单目标 R3DGS。在 Ref-LERF 标准测试集上,ZeroSplat 达到 32.7 mIoU,超越完全监督的 ReferSplat(29.2 mIoU,+3.5),尽管 ZeroSplat 完全无训练。在 Teatime 场景上达 41.4(ReferSplat 31.3),Figurines 上 37.8(25.7)。这证明几何引导的 3D 提升在单目标场景中同样有效,甚至优于专门训练的方法。
| 方法 | Ramen | Teatime | Figurines | Waldo | 平均 |
|---|---|---|---|---|---|
| GOI | 27.1 | 22.9 | 16.5 | 15.7 | 20.5 |
| ReferSplat | 35.2 | 31.3 | 25.7 | 24.4 | 29.2 |
| ZeroSplat | 30.4 | 41.4 | 37.8 | 21.3 | 32.7 |
表2:Ref-LERF 单目标指代分割结果。ZeroSplat 无训练即超越完全监督的 ReferSplat。
开放词汇 3D 分割。在 ScanNet 上,ZeroSplat 在 19 类达到 44.5 mIoU(次优 InstanceGaussian 40.7),在 10 类达到 49.7。在 LERF 开放词汇物体选择上达到 52.4 mIoU,优于多数点级方法。这表明 ZeroSplat 在非指代任务上也具竞争力。
值得注意的是,ZeroSplat 在 GR-LERF 的 Waldo 场景上表现相对较弱(48.4 mIoU),因为该场景目标较小且分散,VLM 的 2D 边界框定位对小目标精度不足。但在 Ramen、Teatime、Figurines 等中大目标场景上分别达到 46.5、56.3、52.1 mIoU,显著领先所有基线。这表明 ZeroSplat 的优势在中大目标上最为明显,小目标分割仍需改进。在 GR-ScanNet 上,ZeroSplat 的优势不仅体现在 mIoU 数值上,更体现在分割质量上——基线方法的过分割导致大量背景噪声,而 ZeroSplat 的分割结果边界清晰、语义纯度高,更适合下游机器人操作和交互任务。
从范式对比来看,像素级方法受限于 2D 渲染视角,无法利用 3D 几何结构解决空间歧义——例如当两个物体在某个视角下重叠时,像素级方法难以区分。点级方法虽在 3D 空间操作,但需要逐场景优化嵌入语义特征,且大多设计用于开放词汇而非指代任务。ZeroSplat 同时具备点级理解的 3D 几何优势和零训练的效率优势,是唯一在泛化指代场景中有效的框架。
效率分析。ZeroSplat 是唯一支持泛化指代(0/1/N)的方法,且无需逐场景优化、无训练时间、零额外特征存储、峰值 VRAM 仅约 10 GB(基线多为 20-28 GB)。像素级方法如 LangSplat 需约 2 小时优化和 3 GB 额外存储,点级方法如 OpenGaussian 需约 1 小时优化。这一即插即用设计为资源受限设备上的 3D 语义理解提供了实用路径。
图3:GR-LERF 上的定性结果。ZeroSplat 准确分割多目标,基线方法常合并或遗漏实例。
图4:GR-ScanNet 上的定性结果。基线方法过分割或无法定位目标,ZeroSplat 精确隔离查询实例,边界清晰、语义纯度高。
消融实验。基线掩码提升仅 24.7 mIoU;加入 VLM 空间锚定提升至 38.6(+13.9),有效修剪跨视图假阳性;单独 KNN 扩散提升至 26.2(+1.5);两者结合达最佳 41.2 mIoU,证明全局语义定位和局部几何精炼高度互补。移除语义标签提取导致严重退化(24.3 mIoU)。随机关键帧选择降至 39.6,证实几何引导关键帧选择的必要性。移除边界框过滤降至 40.1,确认其作为空间先验抑制误分类背景高斯的必要性。固定半径搜索降至 39.8,KNN 动态适应局部点密度更优。
像素颜色alpha混合
$$ C(p)=\sum_{i=1}^{|\mathcal{G}_{p}|}c_{i}\alpha_{i}\prod_{j=1}^{i-1}(1-\alpha_{j}) $$
透射率计算
$$ T_{i}=\prod_{j=1}^{i-1}(1-\alpha_{j}) $$
局限性第一,ZeroSplat 依赖 2D VLM 和 SAM3 的先验质量,若这些模型在特定场景或罕见物体上失败,3D 分割质量会受影响。VLM 的 2D 边界框定位精度直接影响 3D 验证的准确性——边界框过大会保留过多背景高斯,过小会裁剪有效目标几何。此外 VLM 推理本身有计算开销,虽无需逐场景优化但每条查询仍需运行 VLM。
第二,多视图几何约束在纹理稀少或遮挡严重的区域可能不足。KNN 空间扩散虽能填补部分空洞,但在极端遮挡下仍可能遗漏内部区域。无训练设计意味着无法通过特定场景优化进一步提升性能,与需要优化的方法相比在某些精细任务上可能存在差距。论文也指出在 Waldo 场景(目标较小且分散)上表现相对较弱(GR-LERF 48.4 vs 其他场景 46-56),提示小目标分割仍是挑战。此外,当场景中存在大量相似物体时(如仓库中的同款箱子),VLM 的语义标签提取可能无法区分个体,需要更强的细粒度属性描述能力。跨视图验证的边界框策略在目标被严重遮挡时也可能失效——若目标在多数关键帧中被遮挡,有效观测不足 $ au_{views}=8$ 会导致无法确认其存在。这些都是在真实部署中需要关注的边界情况。
总结与展望
ZeroSplat 引入 GR3DGS 任务并通过零特征、无训练框架解决,将 2D VLM 先验经多视图几何约束提升到 3D 空间,实现内在点级理解。在泛化、单目标和开放词汇三个场景中均大幅超越 SOTA——GR-LERF 50.8 mIoU(次优 28.3)、GR-ScanNet 41.2 mIoU(次优 24.5)、Ref-LERF 32.7 mIoU(超越监督方法),同时保持即插即用效率:零训练时间、零额外存储、约 10 GB 峰值 VRAM。GR-LERF 和 GR-ScanNet 两个基准为未来研究提供了评估基础。
这一框架为具身 AI 和交互式 3D 场景理解提供了实用路径,证明鲁棒 3D 语义理解不需要改变场景内在表征或昂贵的逐场景优化,而可通过几何约束将二维先验提升到三维空间来实现,这一思路对未来的三维场景理解研究具有启发意义。未来工作可探索更高效的 VLM 推理(如蒸馏到更小模型)、更强的小目标分割能力(如多尺度特征融合),以及与机器人操作的下游集成——精确的 3D 指代分割是机器人抓取和操作的前提条件。此外,扩展到动态场景和实时增量分割也是重要方向,当前框架针对静态重建的 3DGS 场景,在动态环境中需要持续更新语义分配。
金句
鲁棒的 3D 语义理解不需要改变场景的内在表征——将 2D 先验经几何约束提升到 3D 空间即可。
真实世界的指令从不保证恰好一个目标——泛化指代(0/1/N)才是 3D 场景理解的真实设定。



