AtlasVLA:面向VLA模型的持久化世界-自我状态建模提出双记忆架构:4D持久世界状态记忆将瞬态2D观测提升为体素哈希全局空间状态解决感知遗忘,自我工作记忆跟踪任务进度。扩散Transformer基于此联合状态实现主动推理,仅用腕部相机即在LIBERO、RLBench和真实世界达到SOTA,长程任务成功率提升9.4%-17.5%。Guiyu Zhao, Longteng Guo, Yanghong Mei·2026年8月7日视觉语言动作模型物理AI世界-自我状态2026年8月7日
Geo3R:缓解多模态大模型空间推理幻觉多模态大模型在视觉理解上进展显著但存在空间推理幻觉,Geo3R 通过几何关系缓解该问题。Mingyu Wang, Weilin Jin, Wenbo Li·2026年7月23日空间推理多模态幻觉2026年7月23日
Ego Scene Augmentation:增强多模态大模型第一人称空间感知针对多模态大模型在第一人称场景中空间推理能力不足的问题,提出Ego Scene Augmentation方法,通过场景增强提升第一人称视觉问答的空间感知能力。Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu·2026年7月16日MLLM第一人称VQA2026年7月16日