Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

3D感知3D-Aware视觉语言模型

3D感知视觉语言模型:隐式与显式几何融合

现有视觉语言模型大多缺乏3D感知,本文融合隐式与显式几何构建3D感知VLM。

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang2026年7月23日4 分钟阅读
EN
Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang
NTU Singapore · Alibaba DAMO Academy
arXiv:2607.21595 · 代码仓库

一句话总结

VLM-IE3D 给仅用 RGB 输入的视觉语言模型注入 3D 归纳偏置:用隐式几何 token(IGT,来自 AnySplat 融合解码器)提供粗粒度全局空间先验,用显式几何 token(EGT,从重建深度/点云/高斯经轻量 MLP 编码)提供细粒度局部结构,经隐式-显式注意力(IEA)对齐融合再与 2D 视觉 token 相加,在 3D 视频检测、3D 视觉定位、3D 密集描述、空间推理上一致优于仅隐式基线。

Figure 1. 隐式 vs 隐式+显式几何

Figure 1 — (a) 现有 VLM 仅学隐式几何,得到粗"3D 认知地图"。(b) 本文再加显式几何 token,提供含细粒度局部几何的"3D 重建地图",与隐式表示互补,再与 2D 视觉线索融合。

1. 研究背景与动机

视觉语言模型(VLM)在空间理解与推理任务上潜力巨大,但大多数基于 2D 视觉输入的模型在需要细粒度空间理解的 3D 任务上力不从心。一类有前景的工作尝试直接从 2D RGB 视频学 3D 表示,避免对专用 3D 传感器(点云)的依赖。

主流做法是给 VLM 加一个 3D 几何编码器(如 VGGT、AnySplat),从视频序列学隐式 3D 表示。但隐式表示通常只捕获粗粒度、全局的场景布局——其压缩潜变量形式让语言模型难以解读定量几何属性,即使信息隐含其中,精细几何也"够不着"。

本文动机来自认知科学与机器人学的对比:人类形成抽象"3D 认知地图"做粗略场景感知;机器人系统则依赖显式 3D 表示(深度图、点云)构成结构化"3D 重建地图",让定量几何数据可直接用于精细任务。本文要把两种表示都给 VLM——全局先验(认知地图)+ 细粒度结构(重建地图)。

2. 核心方法

给定 RGB 视频 $\{I^i\}_{i=1}^{f}$ 与查询 $Q$:2D 视觉编码器出 $T_{2D}\in\mathbb{R}^{f\times n\times c}$;AnySplat 3D 几何编码器出隐式几何 token $T_I$ 与重建 3D 属性;3D 显式嵌入模块把重建属性编码为显式几何 token $T_E$;3D-aware adapter 融合三者得 $T_{3D}$;Qwen2.5-VL 骨干取 $T_{3D}$ 与 $Q$ 生成回答。其中 $I^i\in\mathbb{R}^{h\times w\times 3}$,$n=\lfloor h/p\rfloor\times\lfloor w/p\rfloor$,$p$ 为 patch 大小。

Figure 2. VLM-IE3D 总览

Figure 2 — VLM-IE3D 总览。2D 视觉 token、隐式几何 token(IGT)、显式几何 token(EGT)经 3D-aware adapter 融合为 3D 感知视觉 token,送入 VLM 骨干。

2.1 隐式几何 token IGT

采用 AnySplat 作 3D 几何编码器,取其融合解码器输出的隐式表示作为 IGT $T_I\in\mathbb{R}^{f\times n\times c}$。它编码高层 3D 空间先验与全局场景理解范围,如房间整体布局、物体间空间关系("电视挂在墙上,沙发在电视前")。这种表示泛化强,能快速适配不同场景的 3D 结构建模,无需显式 3D 输入。

2.2 显式几何 token EGT

隐式表示压缩潜变量形式难以让语言模型解读定量几何。EGT 直接从重建显式 3D 属性编码:从 AnySplat 预测头取深度图、相机位姿、3D 高斯泼溅;点图由深度图用重建位姿反投影到 3D 坐标得到。属性 $X_E\in\mathbb{R}^{f\times h\times w\times c'}$($c'$ 随属性类型变化:深度 1、点图 3、高斯 86)经一层 patch 嵌入 + 两层 MLP 嵌入为 $T_E\in\mathbb{R}^{f\times n\times c}$。刻意不用重骨干(如 DepthAnything V2),保持轻量。

EGT 是显式 3D 结构数据的潜表示,带空间定量测量,提供与 IGT 互补的显式几何先验,聚焦细粒度 3D 结构细节。

2.3 3D-aware adapter 与 IEA

三种 token 先按 Qwen2.5-VL 的空间合并策略,把 $2\times 2$ 相邻特征拼接后过两层 MLP,得压缩 token $\{\tilde{T}_{2D},\tilde{T}_I,\tilde{T}_E\}\in\mathbb{R}^{f\times m\times c}$,$m=\lfloor h/2p\rfloor\times\lfloor w/2p\rfloor$。

隐式-显式注意力(IEA)模块用多头交叉注意力(MCA)对齐融合 IGT 与 EGT,点积注意力:

$$\mathrm{Attention}(Q,K,V)=\mathrm{Softmax}\!\left(QK^{T}/\sqrt{d}\right)V$$

其中 $Q\in\mathbb{R}^{n_q\times d}$、$K\in\mathbb{R}^{n_k\times d}$、$V\in\mathbb{R}^{n_v\times d}$。每帧 $i$ 以压缩 IGT $\tilde{T}_I^i$ 为 query、压缩 EGT $\tilde{T}_E^i$ 为 key/value,输出融合的 3D token $\tilde{T}_{3D}$,再与压缩 2D token 逐元素相加:

$$T_{3D}=\tilde{T}_{2D}+\tilde{T}_{3D}$$

该设计同时利用隐式与显式 3D 空间关系,并保留 2D 视觉语义。

Figure 3. 3D-aware adapter 架构

Figure 3 — 3D-aware adapter。输入 IGT、EGT 与 2D token,输出最终 3D 感知视觉 token(token 压缩略)。

flowchart LR
    RGB["RGB video"] --> ENC2D["2D visual encoder
(frozen)"] RGB --> GEOM["AnySplat 3D encoder
(frozen)"] GEOM --> IGT["IGT: implicit
global priors"] GEOM --> ATTR["reconstructed
depth/points/gaussians"] ATTR --> EMB["lightweight MLP
(0.008B params)"] EMB --> EGT["EGT: explicit
fine-grained structure"] IGT --> IEA["IEA: cross-attention
align+fuse"] EGT --> IEA ENC2D --> T2D["2D tokens"] IEA --> T3Dbar["fused 3D tokens"] T2D --> ADD["element-wise add"] T3Dbar --> ADD ADD --> VLM["Qwen2.5-VL backbone
(trainable)"] style IGT fill:#dbeafe,stroke:#2563eb style EGT fill:#dcfce7,stroke:#16a34a style IEA fill:#fef9c3,stroke:#ca8a04

3. 实验结果

骨干 Qwen2.5-VL-3B,AnySplat 为 3D 几何编码器,2D 编码器同 Qwen2.5-VL。训练 1 epoch,Adam 优化器 warmup 比 0.03,学习率升到 1e-5 后衰减到零,batch=1/GPU,8×H100 80G。输入缩放裁剪到 $392\times 518$,$p=14$,$c=2048$,最大帧 $f=32$,$n=1036$,压缩后 $m=252$。默认 EGT 用深度图(最易从 RGB-D 传感器获取)。

3.1 3D 场景理解

多任务训练,评测三任务:

Scan2Cap(3D 密集描述):检测 3D 物体提案并生成描述,用 Mask3D 检测提案。

方法3D 场景输入C@0.5↑M@0.5↑
Scan2Cap39.122.0
LL3DA65.226.0
LEO72.427.9
LLaVA-3D79.230.2
Video-3D LLM80.028.5
Qwen2.5-VL-3B58.026.9
VG LLM78.628.6
VLM-IE3D (Ours)80.428.8

仅 RGB 输入即超越需要 3D 场景输入的 Video-3D LLM(80.0→80.4 C@0.5)。

3D 视频检测(EmbodiedScan):预测连续帧中可见物体的 3D 包围框,IoU=0.25。

方法P25↑R25↑F1_25↑可训练参数FPS
Qwen2.5-VL-3B32.130.130.93.13B7
VG LLM41.735.738.23.13B7
VLM-IE3D (Ours)44.241.942.83.23B6

比基线 Qwen2.5-VL 提升 +12.1/+11.8/+11.9,比 VG LLM 提升 +2.5/+6.2/+4.6。仅增 0.10B 参数(3.2%),推理仅慢 1 FPS。

Figure 5. 3D 视频检测定性对比

Figure 5 — 3D 视频检测定性对比。VLM-IE3D 包围框形状对齐与空间定位更准,缓解了仅隐式基线(VG LLM)的尺度失配与漂浮预测。

3.2 空间推理(VSI-Bench)

用 SPAR-7M 子集(234K,3%)+ LLaVA-Hound(63K,25%)训练,评测 VSI-Bench。

方法参数平均↑物体计数↑相对距离↑
Gemini-1.5-Pro-45.4--
LLaVA-NeXT-Video-72B72B40.9--
VG LLM4B46.066.044.6
VLM-IE3D (Ours)4B47.667.547.7

4B 参数即超 Gemini-1.5-Pro(45.4→47.6)和 72B 的 LLaVA-NeXT-Video(40.9→47.6)。相对距离上 +3.1 over VG LLM,说明显式结构对几何感知关键任务尤其有效。

3.3 消融

IGT vs EGT(3D 视频检测 F1_25):基线 30.9 → +EGT 34.7 → +IGT 40.5 → +IGT+EGT 42.8。IGT 增益更大(编码更通用先验),两者互补联合最佳(+2.3 over IGT-only)。

融合策略:Concat 41.5 / Addition 42.4 / Weighted 41.2 / 提出的 IEA 42.8——动态信息交换最佳。

显式属性:深度 42.8 / 点图 42.6 / 高斯 42.5——只要提供物理意义的空间测量即可,深度最易获取故为默认。

3D 显式嵌入设计:None 40.5 / Pooling 42.0 / 位置编码 42.5 / 深编码器(DepthAnything V2) 35.9 / 提出的轻量 MLP 42.8——深编码器反而更差,因其过处理输入提取的抽象语义与 IGT 冗余;显式几何需直接空间坐标映射。

4. 主要贡献

  • 隐式+显式几何:首次在 RGB-only VLM 中同时引入隐式(全局先验)与显式(细粒度结构)3D 几何,互补覆盖粗认知地图与细重建地图。
  • 3D-aware adapter + IEA:用交叉注意力对齐融合 IGT/EGT 再与 2D token 相加,轻量(+0.008B 参数)且高效(仅慢 1 FPS)。
  • 一致领先:仅 4B 参数在 3D 密集描述、3D 视频检测、3D 视觉定位、VSI-Bench 空间推理上一致优于仅隐式基线,甚至超越需要 3D 场景输入的方法。
  • 轻量设计洞察:显式几何应直接映射空间坐标,深编码器反而因语义冗余而劣化——一个反直觉但有据可查的结论。

5.

标准注意力计算

$$ \operatorname{Attention}(Q,K,V)=\operatorname{Softmax}\left(QK^{T}/\sqrt{d}\right)V $$

3D token融合

$$ \tilde{T}_{3D}^{i}=\tilde{T}_{I}^{i}+\operatorname{MCA}(\tilde{T}_{I}^{i},\tilde{T}_{E}^{i},\tilde{T}_{E}^{i}) $$

最终3D特征

$$ T_{3D}=\tilde{T}_{2D}+\tilde{T}_{3D} $$

局限与展望

分析判断:显式几何依赖 AnySplat 重建质量,重建误差会传导到 EGT;默认用深度图,但复杂透明/反光场景的深度估计仍不准。所有评测为室内(ScanNet/EmbodiedScan),室外/大规模开放场景未验证。EGT 的"轻量 MLP 更好"结论可能在更大数据/更强骨干下变化——深编码器在本文设定下的失败是否为数据规模不足所致尚需进一步研究。3D-aware adapter 的 IEA 是单层 MCA,更深的交互是否更优未探索。

6. 总结

VLM-IE3D 的核心思想是给仅用 RGB 的 VLM 同时注入隐式与显式 3D 几何:IGT 提供粗粒度全局空间先验(像人的"3D 认知地图"),EGT 提供细粒度结构化定量几何(像机器人的"3D 重建地图"),二者经隐式-显式注意力对齐融合再与 2D 视觉相加。仅 4B 参数即超 Gemini-1.5-Pro 与 72B 开源模型的空间推理,仅 RGB 输入即超需 3D 场景输入的 Video-3D LLM。消融还揭示一个反直觉但合理的洞察:显式几何应直接映射空间坐标,深编码器反而因提取的语义与 IGT 冗余而劣化。

给 VLM 一张粗认知地图加一张细重建地图——隐式与显式几何互补,仅 RGB 即可 3D 感知。

相关论文