Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Spatial IntelligencePaper空间智能

IGGT4D:流式4D实例锚定几何Transformer

提出IGGT4D流式4D实例锚定几何Transformer,在动态4D场景中实现实例级几何理解,服务于4D场景重建与机器人感知。

Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu2026年7月21日2 分钟阅读
EN

1. 概述

真实世界的空间智能本质上是在线的、动态的。具身智能体接收连续视频流,其中物体移动、被遮挡、离开视野后重新出现。仅估计相机运动和场景几何不够——智能体还必须维护时间一致的物体身份。

本文提出 IGGT4D(Streaming Instance-Grounded Geometry Transformer),将4D场景理解重新表述为流式几何-实例预测(streaming geometry-instance prediction)问题:从连续视频流中因果性地预测相机运动、场景几何和持久物体身份。同时构建 InsScene4D-147K 大规模数据集,涵盖真实/合成、静态/动态场景,提供 RGB 图像、深度、位姿和时间一致实例掩码。

💡 核心创新:将物体身份(object identity)作为与几何同等地位的一等预测目标,在流式因果推理中联合更新——而非依赖外部2D语义提取或全序列双向推理。
IGGT4D 在线几何-实例预测

2. 相关工作

综述了流式空间基础模型(DUSt3R、VGGT、Spann3R、MUSt3R、CUT3R、Stream3R)和实例感知3D场景理解(LangSplat、LSeg、Uni3R、IGGT)。现有流式模型仍以几何为中心,缺乏时间一致的物体身份维护;而现有实例感知方法基于固定图像集和全局交叉视图注意力,无法高效处理长视频流。

3. 方法

3.1 问题形式化

给定 RGB 图像序列 $\{I_{t}\}_{t=1}^{N}$,IGGT4D 执行前馈序列推理:

$$\mathcal{F}_{\theta}:\left(I_{t},\tilde{\boldsymbol{\pi}}_{t}\right)\mapsto\left(\boldsymbol{\pi}_{t},R_{t},D_{t},S_{t}\right),\quad t=1,\ldots,N$$

输出:相机参数 $\boldsymbol{\pi}_{t}=[\mathbf{t}_{t},\mathbf{q}_{t},\mathbf{f}_{t}]\in\mathbb{R}^{9}$(平移、旋转、视场),射线图 $R_{t}=[O_{t},V_{t}]$(射线起点和方向),深度图 $D_{t}$,实例特征图 $S_{t}\in\mathbb{R}^{H\times W\times 8}$。

3.2 流式实例接地几何 Transformer

IGGT4D 架构总览

将 DA3 的统一几何 Transformer 从固定集3D预测改造为因果流式4D理解。每帧编码为图像 token 并拼接相机 token,经40层 Transformer(交替的视图内和跨视图注意力)处理,产生多尺度特征 $\{\mathbf{F}_{t}^{(l)}\}_{l=1}^{4}$。

关键改造:在跨相机和跨视图注意力上施加因果掩码(causal mask),使每帧仅关注历史帧而非未来帧。引入几何感知注意力(Geometry-Aware Attention, Geo-Attn),让实例特征从几何先验中受益。首帧几何归一化(First-Frame Geometric Normalization, FF-Norm)消除流式重建中的尺度歧义。

实例特征与掩码可视化

3.3 高效流式实例聚类

用轻量级聚类码本(clustering codebook)替代离线 HDBSCAN,逐帧余弦聚类保持恒定内存占用。当物体投影面积连续5帧急剧下降时标记为消失,防止陈旧ID传播。

3.4 4D场景理解应用

支持实例空间跟踪、开放词汇语义分割、4D QA场景接地等下游任务。实例特征可与CLIP文本特征匹配实现开放词汇查询。

3.5 训练目标

几何目标:深度 L1 损失 $\mathcal{L}_{D}=\sum_{p\in V}\min_{p'\in\mathcal{N}(p)}\|D_{t}(p)-\alpha\cdot D_{t}^{\ast}(p')\|_{1}$;射线 L1 损失 $\mathcal{L}_{R}=\|O_{t}-O_{t}^{\ast}\|_{1}+\|V_{t}-V_{t}^{\ast}\|_{1}$;3D点重建损失 $\mathcal{L}_{P}=\|P_{t}-P_{t}^{\ast}\|_{1}$($P_{t}=O_{t}+D_{t}V_{t}$);相机损失 $\mathcal{L}_{\pi}=\|\boldsymbol{\pi}_{t}-\boldsymbol{\pi}_{t}^{\ast}\|_{1}$。

实例目标:多视图对比损失,帧内拉近距离/推开不同实例中心,跨帧拉近匹配中心:

$$\mathcal{L}_{\mathrm{ins}}=\sum_{v}\Big(\lambda_{\mathrm{pull}}^{\mathrm{in}}\sum_{p\in M_{k}^{v}}\big[\|\mathbf{f}_{p}-\mu_{k}^{v}\|_{2}-\delta_{\mathrm{pull}}^{\mathrm{in}}\big]_{+}+\lambda_{\mathrm{push}}^{\mathrm{in}}\sum_{k\neq j}\big[\delta_{\mathrm{push}}^{\mathrm{in}}-\|\mu_{k}^{v}-\mu_{j}^{v}\|_{2}\big]_{+}\Big)+\text{cross-view terms}$$

最终目标:$\mathcal{L}=\mathcal{L}_{\mathrm{geo}}+\lambda_{\mathrm{ins}}\mathcal{L}_{\mathrm{ins}}$

4. InsScene4D-147K 数据集

InsScene4D-147K 数据构建流水线

147K条视频序列,覆盖四个域:静态真实(RealEstate10K、ScanNet++)、静态合成(Aria Synthetic、SceneNet、Infinigen、Hypersim)、动态真实(HOI4D、Waymo、Aria Digital Twin)、动态合成(RoboTwin 2.0、Kubric、Dynamic Replica、PointOdyssey、VKITTI2)。

几何引导标注流水线:DA3 估计多视图一致深度 → TSDF融合重建3D网格 → 投影网格顶点到图像平面形成继承图 → SAM2 生成分割掩码 → IoU匹配继承/新建ID。动态场景用动态物体标注覆盖投影伪标签。

5. 整体架构

flowchart LR
    V[视频帧序列 I_t] --> ENC[帧编码器
Image Tokens + Camera Token] ENC --> T40[40层 Transformer
交替视图内+跨视图注意力
因果掩码] T40 --> MS[多尺度特征 F_t] MS --> TDPT[Tri-DPT 头] TDPT --> GEO[几何输出
位姿π + 射线R + 深度D] TDPT --> INS[实例特征 S_t] INS --> SC[流式聚类
轻量码本+余弦] SC --> MASK[实例掩码
4D一致] GEO --> MERGE[空间-时间一致
场景表示] MASK --> MERGE MERGE --> DOWN[下游: 实例跟踪
开放词汇分割
4D QA] style T40 fill:#4f9eff,color:#fff style SC fill:#ff6b6b,color:#fff style MERGE fill:#51cf66,color:#fff

6. 实验结果

6.1 相机位姿估计与3D重建

几何基准测试结果

在 HiRoom、ETH3D、7Scenes、ScanNet++ 上评估。IGGT4D 在流式模型中取得最佳平均位姿估计(AUC@3: 0.4464),甚至超过多个全注意力基线。3D重建 F1 分数在预测位姿和真实位姿设置下均超越所有流式基线。

3D重建定性对比
方法类型AUC@3 ↑AUC@30 ↑F1(w/o p.) ↑F1(w/ p.) ↑
DA3全注意力0.60460.93520.74300.7980
Stream3R流式0.18710.79470.45510.5504
LingBot-Map流式0.30600.86470.52280.6082
IGGT4D流式0.44640.89240.66780.7225

6.2 实例空间跟踪

在 HOI4D、Waymo、ScanNet++、PointOdyssey 上评估。IGGT 在长序列上 OOM,IGGT4D 可扩展至100帧。长序列平均 T-mIoU 58.84(vs SAM2 的 55.62),T-SR 85.41(vs 76.07)。

方法长序列 T-mIoU长序列 T-SR短序列 T-mIoU短序列 T-SR
SAM255.6276.0759.2179.57
IGGTOOMOOM61.1394.83
IGGT4D58.8485.4163.4596.88

6.3 开放词汇语义分割

在 Waymo 和 ScanNet++ 上取得最高 mIoU 和 mAcc。长序列平均 mIoU 40.08(vs LSeg 31.95),mAcc 73.84(vs 48.23)。

方法长序列 mIoU长序列 mAcc短序列 mIoU短序列 mAcc
LSeg31.9548.2332.0650.54
IGGTOOMOOM31.1661.90
IGGT4D40.0873.8439.1172.25

6.4 消融与效率

移除 Geo-Attn 后实例和语义性能下降,证明实例特征从几何先验受益。移除 FF-Norm 导致尺度歧义,所有指标下降。流式聚类在100帧时仅0.7GB内存、7.43秒,而 IGGT 的 HDBSCAN 在32帧即 OOM。

聚类方法N=8 时间(s)N=8 内存(GB)N=100 时间(s)N=100 内存(GB)
IGGT (HDBSCAN)105.813.2OOMOOM
IGGT4D (流式)0.780.77.430.7

7. 总结

IGGT4D 通过因果空间-时间建模和几何接地的实例预测,联合预测相机运动、场景几何和时间一致的实例特征。InsScene4D-147K 提供了跨真实/合成和静态/动态场景的大规模几何一致实例标注。实验证明 IGGT4D 在重建、位姿估计、实例跟踪和开放词汇分割上提升物体级一致性,同时保持可扩展的流式推理。

前向映射函数

$$ \mathcal{F}_{\theta}:\left(I_{t},\tilde{\boldsymbol{\pi}}_{t}\right)\mapsto\left(\boldsymbol{\pi}_{t},R_{t},D_{t},S_{t}\right) $$

相机位姿参数化

$$ \boldsymbol{\pi}_{t}=[\mathbf{t}_{t},\mathbf{q}_{t},\mathbf{f}_{t}]\in\mathbb{R}^{9} $$

渲染输出表示

$$ R_{t}=[O_{t},V_{t}]\in\mathbb{R}^{H_{r}\times W_{r}\times 6} $$

局限在于数据覆盖仍需扩大、当前主要依赖监督学习。

💡 贡献在于将4D场景理解从"几何中心"推向"几何-实例统一":在因果流式框架中联合预测几何和物体身份,用流式聚类替代离线HDBSCAN实现O(1)内存的在线推理,并通过几何引导标注流水线填补了4D实例监督的空白。

相关论文