PAPER DEEP DIVE
Spatial-IQ:通过分层能力测试解构空间智能
提出Spatial-IQ分层能力测试框架,系统解构多模态模型的空间智能,通过不同层级能力测试评估空间认知。
一、研究背景与动机
空间智能是物理AI和具身智能体可靠地导航、操作和与现实物理世界交互的基本前提。考虑一个在仓库中堆叠箱子的机器人:为了安全地放置新箱子,它必须能够个体化识别托盘上的箱子、推断提供支撑的不可见箱子,并判断所得结构在重力下是否稳固。任何这些判断的误差都可能导致堆叠倒塌。
当前基础模型看似拥有空间智能——它们能识别哪个物体在另一个上面、生成3D渲染视角、描述给定图像。然而同样的模型经常生成物体缩小、膨胀或相互穿透的视频,在真实场景的空间推理上远低于人类水平,最显著的是在遮挡条件下的相同箱子计数任务上失败——这是儿童都能轻松解决的任务。这些模型失败暗示它们可能充当表面级模拟器,依赖文本和像素之间的统计关联,而非3D世界的根因因果模型。
现有基准通常以二元成功指标或多选题评估模型,限制了诊断评估的能力。例如,一个失败可能源于低级感知崩溃(如误识别物体边界)或高级认知崩溃(如未能推断隐藏几何以支撑重力),而现有基准无法区分这些。本文提出Spatial-IQ,一个将堆叠3D结构中的物体计数分解为9个感知和认知子任务的层次化诊断框架,灵感来自人类空间认知的发展阶段。

图1:人类通过层次化分解结构(列、层、可见与隐藏方块)来计数堆叠3D物体。当前MLLM计数错误;在Spatial-IQ上用层次化CoT监督微调可教会它们同样的分解方式。
二、核心贡献
本文的三个核心贡献为:(1)一个层次化诊断框架,将目标任务(3D物体计数)分解为受人类发展心理学启发的9个子任务的因果依赖图;(2)使用NVIDIA Isaac Sim程序化生成的约80,000个堆叠3D结构数据集,每个任务都有逐任务的真值标注;(3)一种两阶段训练范式——先用子任务依赖的CoT进行SFT,再用可验证奖励的强化学习——显著提升空间一致性和目标任务准确率。
三、子任务层次结构
Spatial-IQ提出两个目标任务:物体计数(T1,主任务)和心理旋转(T2,补充探针)。物体计数任务要求模型报告堆叠3D结构中的物体总数,包括为支撑可见结构而在重力下必须存在的隐藏物体。心理旋转任务给定同一结构的两个视角,要求模型报告在90°和180°旋转后哪些物体可见、哪些不可见。
围绕物体计数,设计了9个层次化子任务,从简单空间表征到更集成的结构推理:
| 子任务 | 名称 | 描述 |
|---|---|---|
| S1 | 物体个体化 | 识别结构中的独立物体 |
| S2 | 聚类 | 将物体分组为有意义的簇 |
| S3 | 列计数 | 计算结构中的列数 |
| S4 | 层计数 | 计算结构中的层数 |
| S5 | 可见物体计数 | 计算所有可见物体 |
| S6 | 顶层识别 | 识别最顶层的物体 |
| S7 | 直接支撑 | 找到顶层物体的直接支撑方块 |
| S8 | 支撑列 | 找到顶层物体的支撑列 |
| S9 | 隐藏物体计数 | 计算为支撑可见方块而必须存在的隐藏物体 |
这些子任务形成四条层次关系:内部参照链(Top Layer→Direct Support→Support Column)、可见支撑层次、隐藏支撑层次、以及求和机制(Visible Count + Hidden Count = Total Count)。求和机制的概率定义为:
$$P(\text{ObjCount correct} \mid \text{Visible correct}, \text{Hidden correct})$$
图2:左:Spatial-IQ的9个子任务(S1-S9)和2个目标任务(T1, T2)。右:一个示例场景及其逐任务的真值掩码。
四、数据集生成
使用NVIDIA Isaac Sim 5.1程序化生成场景,每个场景由单一类型物体(纹理立方体、工厂箱子、汤罐或肉罐头)组成的前景结构构成,约束在4×4×4体素网格中。物体位置被采样以产生能区分模型的目标结构大小分布,然后在重力下固化为地面支撑列。
隐藏物体通过像素级深度缓冲遮挡测试识别:仅当物体对相机可见或需要支撑上方保留物体时才保留该物体。这保证场景中每个隐藏物体都是物理支撑逻辑上必需的,而非仅仅隐藏在可见邻居后面不可恢复深度处。填充率定义为:
$$\text{Fill Ratio} = \frac{\text{total\_blocks}}{\text{num\_columns} \times \text{num\_layers}}$$完整数据集约80,000个场景,主要基准使用3,000样本评估集,训练实验使用不相交的68,000样本集。
五、三种响应模态评估
每个任务以三种响应格式提出:文本自由回答、多选题(带图像选项)、图像编辑。所有子任务和目标任务独立查询,每个任务独立评估一种能力而非链接前序子任务答案。
在多选题格式中,错误答案被构造为代表特定命名失败模式的视觉良好渲染,而非随机扰动(如将两列合并为一列、在顶层上方幻觉出虚幻方块)。对于物体计数目标任务,错误答案整数围绕偏移枢轴采样而非以正确答案为中心,打破"答案是中位数选项"的启发式。多选题的随机调整准确率定义为:
$$\text{adj\_acc} = \frac{\text{acc} - 1/k}{1 - 1/k}$$其中 $k$ 为选项数,使3CQ、4CQ和5CQ列可直接比较。

图4:文本自由回答模态的逐任务准确率。人类在物体计数上达82.1%,远超所有模型(最佳Qwen仅17.7%)。
六、文本模态主要发现
人类在物体计数上达82.1%,最佳模型Qwen仅17.7%,最差模型Qwen3B仅2.1%,相邻模型间差异均统计显著。三个关键观察:
求和机制:人类的物体计数准确率集中在"可见和隐藏都正确"的格子(90.6%),随任一组件计数错误单调衰减,精确匹配率69.1%。模型恢复求和机制不均匀且部分独立于标题准确率:Qwen最接近人类模式(88.9%双正确,64.2%精确匹配),而Gemini以明显更弱的机制达到可比标题准确率(仅48.0%双正确,18.6%精确匹配)。
| 响应者 | Obj.Count | Int.Ref.Chain | Visible | Vis.Support | Hidden | Hid.Support | Sum.Mech. |
|---|---|---|---|---|---|---|---|
| Human | 82.1 | 90.1 | 76.8 | 84.5 | 79.9 | 78.5 | 69.1 |
| Qwen | 17.7 | 50.7 | 19.2 | 78.2 | 49.2 | 47.9 | 64.2 |
| Gemini | 14.8 | 64.5 | 17.7 | 56.7 | 43.6 | 34.6 | 18.6 |
| Claude | 14.1 | 52.4 | 15.7 | 48.5 | 51.4 | 32.5 | 43.7 |
| GPT | 8.3 | 54.3 | 8.7 | 56.2 | 47.4 | 28.4 | 32.8 |
| VLA-0 | 4.2 | 16.7 | 1.2 | 0.0 | 19.0 | 7.4 | 19.9 |
值得注意的是,VLA-0(仅用机器人轨迹数据训练的VLA模型)在物体计数和支撑关系上超越了其Qwen3B骨干,暗示动作导向训练正向迁移到空间推理。
七、多选题模态发现
在五选题条件下,每个模型在物体计数上均为随机水平(19.5%-20.7%),而人类保持86.2%的良好表现。但模型并非完全缺乏空间能力——子任务准确率差异显著(如可见物体计数从GLM的20.3%到Claude的52.6%)。模型犯一致的错误:顶层和物体分类主要出现"顶层上方虚幻方块"错误,列计数主要出现"合并两列"错误,可见物体计数主要出现"合并相邻"和"遗漏部分可见方块"错误。

图5:五选题条件下的错误答案偏好。每列代表一种错误答案类型,仅显示在单侧二项检验下显著高于20%随机基线的单元格。模型表现出任务依赖的错误偏好,而人类无显著偏好。
八、难度控制验证
物体计数准确率沿五个维度变化:总物体数、隐藏物体数、层数、列数和填充率。这些难度因素对人类和模型均一致地表现:更多物体更难,更多隐藏物体更难,但填充率越高(越密)反而越容易——因为密集场景接近填充的长方体,可通过计算少量空体素来推导大量物体。

图6:文本模态下物体计数准确率随五个难度控制维度的变化。总物体、隐藏物体、层数、列数越多越难,填充率越高越容易。
九、两阶段训练范式
Spatial-IQ的层次结构暗示了自然的训练信号:训练模型在给出最终计数前走过子任务分解,应学会加法分解所依赖的前置能力。在Qwen2.5-VL-7B和32B上测试三种训练条件:
SFT-plain:仅对整数总数进行SFT,无分解。
SFT-CoT:对按加法计算所需顺序列出子任务答案的CoT目标进行SFT,以答案标签包裹的整数终止。
DAPO-tight:在10%训练数据上SFT预热后,用可验证奖励的强化学习(RLVR)优化GRPO,对剩余90%数据训练。奖励信号仅在整数总数上,但子任务答案的正确性通过CoT链间接获得强化。
GRPO的目标函数为:
$$J_{\text{GRPO}}(\theta) = \mathbb{E}\left[\frac{1}{G}\sum_{i=1}^{G}\frac{\pi_\theta(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)}\hat{A}_i - \beta D_{\text{KL}}(\pi_\theta \| \pi_{\text{ref}})\right]$$其中 $\hat{A}_i$ 为组内相对优势,$\beta$ 为KL散度惩罚系数。
十、训练实验结果
分解感知的检查点(SFT-CoT和DAPO-tight)大幅缩小了与人类天花板的差距,并成比例提升了每个层次列。
| 响应者 | Obj.Count | Int.Ref.Chain | Visible | Hidden | Sum.Mech. |
|---|---|---|---|---|---|
| Human | 82.1 | 90.1 | 76.8 | 79.9 | 69.1 |
| DAPO-tight 7B | 50.7 (+46.4) | 93.7 (+45.6) | 51.7 (+48.3) | 76.0 (+30.7) | 90.0 (+45.3) |
| SFT-CoT 7B | 40.8 (+36.5) | 93.7 (+45.6) | 41.9 (+38.5) | 76.7 (+31.4) | 89.6 (+44.9) |
| SFT-plain 7B | 39.7 (+35.4) | 0.0 (-48.1) | 29.2 (+25.8) | 0.0 (-45.3) | 0.0 (-44.7) |
| 7B zero-shot | 4.3 | 48.1 | 3.4 | 45.3 | 44.7 |
| DAPO-tight 32B | 62.6 (+59.7) | 95.0 (+53.9) | 64.5 (+62.6) | 78.2 (+27.8) | 93.3 (+42.3) |
| SFT-CoT 32B | 46.7 (+43.8) | 95.5 (+54.4) | 48.9 (+47.0) | 79.2 (+28.8) | 92.9 (+41.9) |
| SFT-plain 32B | 40.1 (+37.2) | 0.0 (-41.1) | 30.9 (+29.0) | 0.0 (-50.4) | 0.0 (-51.0) |
| 32B zero-shot | 2.9 | 41.1 | 1.9 | 50.4 | 51.0 |
两个关键观察:(1)子任务分解是有用的训练信号,且增益随规模复合——7B上SFT-CoT和SFT-plain在物体计数上基本持平(1.1点差距),但32B上分解产生6.6点优势。更重要的是SFT-plain在内部参照链、隐藏支撑层次和求和机制上崩溃至零,表明它学到了绕过分解直接到达正确总数的捷径。SFT-CoT保留了所有四条层次关系——这是子任务层次作为真实训练信号最清晰的证据。(2)RLVR在SFT-CoT之上增加实质增益——DAPO-tight在7B上比SFT-CoT高9.9点,32B上高15.9点,32B DAPO-tight达62.6%(zero-shot仅2.9%)。
十一、方法流程图
程序化场景生成"] --> B["Isaac Sim渲染
+深度缓冲遮挡测试"] B --> C["约80,000场景
逐任务真值标注"] C --> D["3,000样本评估集
+68,000训练集"] D --> E["三种模态评估
文本/MCQ/图像编辑"] E --> F["层次化诊断分析
9子任务+4层次关系"] D --> G["两阶段训练
SFT-CoT + RLVR"] G --> H["评估训练后模型
空间一致性+准确率"]
十二、图像编辑模态发现
图像编辑模态要求模型通过在参考图像上着色来回答,探测模型是否能在像素空间中定位被查询结构而非仅仅描述它。定性模式与文本和MCQ一致:内部参照链仍是最格式稳定的层次骨干,目标任务成功与局部层次遵循部分可分。Gemini Flash Image在物体计数和求和机制条件上领先。Qwen-Image-Edit给出了局部与目标任务可分性的最清晰例子——该模态中最强的内部参照链完整性(0.676),但原始可见物体计数准确率仅3.3%。
十三、心理旋转探针
心理旋转作为独立的空间认知探针,不期望子任务层次整体迁移。实验证实了这种分离:提出的层次与物体计数的对齐远强于与心理旋转的对齐,而两个旋转任务(90°和180°)主要与彼此对齐。人类在心理旋转上表现更差(90°时46.4%,180°时45.8%)限制了区分模型的余量。
十四、局限性
本文坦诚指出几个局限:(1)跨模态比较并非完全对等,因为响应格式改变了答案选择需求,且少数子任务在不同格式间略有不同的操作化;(2)单一目标诊断范围——当前框架主要围绕物体计数这一单一目标任务构建,虽心理旋转作为补充探针,但整体诊断范围有限;(3)训练实验仅在一个模型家族(Qwen2.5-VL)上进行,泛化性需进一步验证。
十五、未来方向
未来工作包括:将框架扩展到其他经典空间智能任务;更广泛地研究VLA模型中的动作导向训练是否系统性地有益于空间推理;扩展到视频和世界模型评估——当前视频生成模型常产生物理违规的视频,Spatial-IQ的层次化诊断方法可帮助定位推理在何处崩溃。
十七、层次依赖关系的形式化定义
四条层次关系以条件概率形式定义,用于量化模型是否保留了预期的依赖结构。内部参照链衡量模型是否沿Top Layer→Direct Support→Support Column保持对象引用的一致性,定义为给定高层任务正确时低层任务的条件准确率均值:
$$\text{Int.Ref.Chain} = \frac{1}{N}\sum_{i=1}^{N} P(\text{Support Column correct}_i \mid \text{Top Layer correct}_i \cap \text{Direct Support correct}_i)$$可见支撑层次和隐藏支撑层次分别衡量模型在各自分支内是否保留了预期的更高级支撑能力。求和机制则检验模型是否能将正确的可见和隐藏计数整合为正确的总数:
$$\text{Sum.Mech.} = P(\text{ObjCount correct} \mid \text{Visible correct} \cap \text{Hidden correct})$$这些条件概率指标揭示了原始目标任务准确率无法暴露的内部结构:一个模型可能通过捷径达到正确的总数,但在条件概率分析下暴露出其并未真正执行层次化推理。人类基线在内部参照链上达0.901,在可见和隐藏支撑层次上分别达0.845和0.785,而模型行保持了相同的定性排序——内部参照链始终比可见和隐藏支撑层次更清晰。这一发现表明,人类空间认知的层次结构在模型中被部分保留但不完整,为改进模型的空间推理能力提供了明确的优化方向。
十八、McNemar统计检验与模型区分度
为确保基准能可靠区分模型,所有相邻模型间的差异均通过配对McNemar检验验证,并经多重比较校正。对于4-8个物体的小型结构,模型准确率从31.7%降至大型结构(≥26个物体)的近乎为零。人类的衰减更为温和:从97.2%降至76.9%。模型和人类之间的性能梯度差异表明,模型在处理遮挡推理时的瓶颈比人类更为突出——随着隐藏物体数量增加,模型的性能衰减远比人类剧烈。从无隐藏物体(人类92.4%)到4个以上隐藏物体(人类76.1%),人类仅衰减约16个百分点,而最佳模型从约15%降至接近零。这种差异定量地揭示了当前MLLM在物理推理方面与人类直觉物理之间的根本性差距。
二十、跨模态一致性与模型行为模式
跨三种模态的评估揭示了一致的行为模式:内部参照链始终是最稳定的层次骨干,在文本、多选题和图像编辑三种格式中均保持最高的一致性。这一发现具有重要意义——它表明模型对物体参照关系的维持能力比支撑推理更为鲁棒,可能因为参照关系更接近视觉感知层面,而支撑推理需要额外的物理因果推断。
另一个跨模态一致的模式是目标任务成功与局部层次遵循的部分可分性。在图像编辑模态中这一现象最为明显:Qwen-Image-Edit在内部参照链完整性上达到0.676(该模态最高),但其可见物体计数原始准确率仅3.3%。这种局部能力与端到端性能的脱节表明,模型可能拥有某些中间空间能力却无法将其有效整合为最终的正确答案。理解这种整合失败的原因——是信息在推理链中丢失,还是模型采用了绕过层次结构的捷径——是未来提升模型空间智能的关键问题。
此外,VLA-0在物体计数和支撑关系上超越其Qwen3B骨干的发现尤为值得关注。VLA-0仅在机器人轨迹数据上训练,却获得了超越纯视觉语言模型的空间推理能力,这强烈暗示动作导向训练可能为空间理解提供了独特的归纳偏置——通过物理交互经验,模型可能发展出对支撑、遮挡和重力约束更根因的理解,而非仅仅从像素统计中学习表面关联。这一发现为未来VLA模型的空间智能研究开辟了有前景的方向。
二十一、总结
Spatial-IQ将空间智能评估重新构建为层次化分解,并证明同一层次结构既可作为诊断工具又可作为训练信号。顶级模型经常在物体计数上成功却在底层子任务上失败,揭示捷径行为。通过CoT监督结合可验证奖励强化学习的两阶段训练,大幅缩小了与人类天花板的差距——32B DAPO-tight模型从2.9%提升至62.6%,同时保持了完整的层次依赖结构。这表明分解感知训练是发展鲁棒、物理根因AI的重要路径。



