Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Spatial IntelligencePaper空间智能

ConsiSpace:视频空间推理中学习几何一致性至关重要

针对视频空间推理任务,提出ConsiSpace方法显式学习几何一致性,提升视频空间推理的准确性与鲁棒性。

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang2026年7月20日2 分钟阅读
EN

ConsiSpace:学习几何一致性对视频空间推理的重要性

论文:ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

作者:Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构:南京大学智能科学与技术学院、北京大学计算机学院、北京智源人工智能研究院

链接arXiv:2607.17599 | 项目ConsiSpace


一句话总结

ConsiSpace 是一个几何一致性感知的视频空间推理框架,通过几何一致记忆(GCM)组织隐式证据令牌和显式几何线索,并在SFT后使用统一一致性自监督强化学习(UC-SSRL)优化跨视角稳定性,在VSI-Bench、OSI-Bench和MMSI-Video-Bench三个基准上平均提升12.6分。


研究背景与动机

视频空间推理对导航感知和长视频问答至关重要——模型需要在变化视角下推断长时间跨度的空间关系。然而现有MLLMs以语义为中心,无法可靠地从冗余视频观测中聚合一致的空间证据,导致低效或不稳定的推理。现有方法(如SpaceR、ViLaSR、Cambrian-S)通过空间数据和训练目标改进,但缺乏将几何一致性作为证据组织原则和显式学习信号的统一框架。

ConsiSpace总览

图1:ConsiSpace框架总览。组织视觉-空间令牌和几何线索,通过GCM和UC-SSRL实现一致性推理。


方法详解

1. 特征提取

ConsiSpace基于Qwen3-VL-8B构建,使用冻结的SigLIP2作为视觉编码器、冻结的VGGT作为几何编码器。每帧提取视觉令牌$X_t$、空间令牌$S_t$、相机位姿$T_t$和深度图$D_t$。

2. 几何一致记忆(GCM)

GCM包含两个存储库:隐式证据记忆$\mathcal{M}_{\text{imp}}$存储每帧证据令牌(视觉语义+空间令牌),显式空间记忆$\mathcal{M}_{\text{exp}}$存储相机位姿和深度线索。每帧构造证据条目:

$$ e_t = \text{Pack}(X_t, S_t), \qquad g_t = (T_t, D_t) $$

几何门控写入:计算帧间运动和视角变化,仅当出现新空间证据时写入:

$$ \Delta p_t = \|p_t - p_{t-1}\|_2, \quad \Delta\theta_t = \angle(v_t, v_{t-1}) $$ $$ \text{write}(t) = \mathbb{I}\left[\Delta p_t > \tau_p \lor \Delta\theta_t > \tau_\theta\right] $$

几何一致融合:定义几何邻域$\mathcal{N}(t) = \{j: \|p_t - p_j\| < r, \angle(v_t, v_j) < \theta\}$,在语义相似度最大的邻域条目中融合:

$$ j^\star = \arg\max_{j \in \mathcal{N}(t)} \cos(k_t, k_j), \qquad k_t = W_k e_t $$ GCM生命周期

图2:GCM证据生命周期。几何门控写入→一致融合→过滤检索。

几何过滤检索:粗到精检索——先按语义相关性检索候选块,再结合几何项精炼帧级选择:

$$ s_f(i) = \alpha \cos(q_e, k_i^f) + \beta \cos(Q_{\text{topo}}, e_i^{\text{dir}}) $$

最终上下文拼接查询令牌、摘要令牌、检索证据和几何线索:

$$ Z = \text{Concat}\left([\text{TOK}(q)],\, z_{\text{topo}},\, z_{\text{metric}},\, \{z_i\}_{i \in F_{\text{topk}}},\, \{g_i\}_{i \in F_{\text{topk}}}\right) $$

3. 统一一致性自监督强化学习(UC-SSRL)

对同一问题构造两个视角的观测$o_i$和$o_j$,设计三种自监督奖励:

答案一致性(KL散度惩罚):

$$ R_{\text{KL}} = -\alpha\, \text{KL}(\pi_i \| \pi_j) $$

度量一致性(距离估计一致性):

$$ R_{\text{metric}} = -\eta\, |\hat{d}_i - \hat{d}_j| $$

拓扑一致性(关系分布对称KL):

$$ R_{\text{topo}} = -\beta\left(\text{KL}(P_i \| P_j) + \text{KL}(P_j \| P_i)\right) $$

统一奖励$R = R_{\text{KL}} + R_{\text{metric}} + R_{\text{topo}}$,用策略梯度优化,仅更新LoRA参数。

flowchart TD
    A["输入视频帧序列"] --> B["特征提取
SigLIP2(视觉)+VGGT(几何)"] B --> C["几何一致记忆 GCM"] C --> D["几何门控写入
Δp>τp ∨ Δθ>τθ"] D --> E["几何一致融合
邻域内语义最大相似度融合"] E --> F["几何过滤检索
粗到精: 语义+几何联合评分"] F --> G["上下文拼接
查询+摘要+证据+几何线索"] G --> H["视频语言模型
Qwen3-VL-8B+LoRA"] H --> I["SFT初始化"] I --> J["UC-SSRL一致性优化
答案+度量+拓扑三重奖励"] J --> K["跨视角稳定的空间推理输出"] style C fill:#e1f5fe style J fill:#fff3e0 style K fill:#e8f5e9

实验结果

VSI-Bench室内空间推理

表1:VSI-Bench结果(Avg.为总体均值)
方法类型Avg.
GPT-4oAPI34.0
Gemini-1.5 ProAPI45.4
Qwen3-VL-8B开源~48
Spatial-MLLM专用~52
VLM-3R专用~58
ConsiSpace (UC-SSRL)本文~65

MMSI-Video-Bench多视频空间推理

表2:MMSI-Video-Bench结果(Sufficient-Coverage设定)
方法Avg.
Gemini 2.5 Flash-Thinking36.7
VLM-3R42.6
ConsiSpace SFT48.4
ConsiSpace UC-SSRL57.5

ConsiSpace UC-SSRL在MMSI-Video-Bench上达57.5,比最强基线VLM-3R(42.6)提升14.9分。UC-SSRL相比纯SFT提升9.1分,证明一致性强化学习的有效性。

VSI-Bench

表1:VSI-Bench详细结果。

MMSI结果

表3:MMSI-Video-Bench详细结果。

效率分析

表4:端到端效率和长视频扩展性分析。


数据集与训练细节

SFT训练数据包括室内和户外两部分:室内使用VSI-590K作为主要指令微调源,包含590K视频空间推理问答对;户外构建了nuScenes-10K——从nuScenes数据集中基于 ego 位姿和3D标注自动生成的10K问答对。生成流程包括几何有效性过滤、答案可解析性检查、一致性检查、MLLM验证和去重,从22,518个候选中筛选出10,000对,1,000对随机抽样的手动验证显示91.6%正确率。UC-SSRL复用SFT训练池,通过双视角采样器为每个样本构造配对观测,无需额外人工标注。

架构上,ConsiSpace使用Qwen3-VL-8B-Instruct作为基座,LoRA rank 16、$lpha=32$,bfloat16精度,DeepSpeed ZeRO-3。GCM配置为$M=64$记忆令牌、特征维度512,组织为4个块、8头重采样器。层次检索在块级和帧级均使用top-$K=8$,每块8个值令牌、每帧4个值令牌。SFT训练200步,学习率$1 imes 10^{-4}$,UC-SSRL权重$10^{-2}$。所有实验在8×A100 80GB GPU上进行。

消融实验

消融分析验证了GCM各组件和UC-SSRL的贡献。移除几何门控写入导致冗余条目增加,记忆效率下降约30%。移除几何一致融合使得相似视角的证据无法合并,推理准确率降低2-3分。移除几何过滤检索中的几何项($eta=0$)使得检索仅依赖语义相关性,在方向相关问题上表现显著下降。UC-SSRL的三种奖励中,答案一致性$R_{ ext{KL}}$贡献最大(移除后降低4.2分),拓扑一致性$R_{ ext{topo}}$次之(降低2.1分),度量一致性$R_{ ext{metric}}$在距离/尺寸问题上贡献显著(降低1.8分)。

效率与可扩展性

GCM的几何门控写入策略显著降低了记忆条目数量——在典型室内视频序列中,约60-70%的帧因视角变化不足被跳过,使得64个记忆槽足以覆盖几分钟的视频。与全帧注意力相比,GCM的检索机制将推理延迟降低约40%,且在视频长度从1分钟扩展到10分钟时性能几乎不衰减,展现了良好的长视频可扩展性。相比之下,基线方法在视频超过5分钟后性能显著下降。

局限性

  1. 几何编码器依赖:依赖冻结的VGGT提供位姿和深度估计,在快速运动或纹理缺失场景中几何先验可能不可靠。
  2. 户外场景覆盖有限:SFT数据主要为室内(VSI-590K),户外仅nuScenes-10K,对复杂户外空间关系的泛化可能不足。
  3. UC-SSRL计算开销:双视角采样和三次KL散度计算增加了训练时间,虽仅更新LoRA但仍比纯SFT慢。

总结与展望

ConsiSpace将几何一致性转化为证据组织原则和显式学习信号,通过GCM实现几何门控写入、一致融合和过滤检索,通过UC-SSRL在SFT后优化跨视角稳定性。在三个空间推理基准上平均提升12.6分,为导航感知和长视频问答提供了几何感知的解决方案。

金句:「空间一致性不仅是组织证据的原则,更是显式的学习信号——当底层3D关系稳定时,不同视角的预测应当一致,这一自监督约束让模型从语义优先走向几何感知。」

相关论文