PAPER DEEP DIVE
AtlasVLA:面向VLA模型的持久化世界-自我状态建模
提出双记忆架构:4D持久世界状态记忆将瞬态2D观测提升为体素哈希全局空间状态解决感知遗忘,自我工作记忆跟踪任务进度。扩散Transformer基于此联合状态实现主动推理,仅用腕部相机即在LIBERO、RLBench和真实世界达到SOTA,长程任务成功率提升9.4%-17.5%。
AtlasVLA:面向 VLA 模型的持久化世界-自我状态建模
作者:Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu
论文链接:arxiv.org/abs/2608.06729
代码状态:暂未公开
一句话总结
AtlasVLA 通过双记忆架构——4D 持久世界状态记忆和自我工作状态记忆——将 VLA 从反应式观察升级为主动推理,仅用腕部相机即在 LIBERO 达 97.6%、RLBench 达 70.8%,长程任务成功率较 π₀ 提升 17.5%。
研究背景与动机
视觉-语言-动作(VLA)模型将多模态感官输入映射到低层机器人控制命令,在具身 AI 领域取得了显著进展。然而当前 VLA 运行在根本性的反应式范式下:它们直接将即时观察映射到动作,严重依赖瞬时视觉输入。这在非结构化、部分可观测环境中暴露了两个关键瓶颈。
第一个瓶颈是感知遗忘。腕戴相机的视场随末端执行器动态移动,任务相关物体一旦离开视野就被立即遗忘。没有持久内部状态,代理失去对空间环境的追踪——"箱子在哪里?"这种问题无法回答,导致在非多视角设置下灾难性执行失败。
第二个瓶颈是任务进度遗忘。复杂任务如顺序整理物体或改变配置,要求代理执行多个子步骤同时维持清晰的进度认知。标准 VLA 缺乏记住已完成步骤的历史上下文,容易丢失在全局执行序列中的位置,导致复合错误——重复或跳过关键子步骤。
图1:当前反应式 VLA 的双瓶颈与 AtlasVLA 的优势。(A) 部分观测:腕戴 VLA 受限视场。(B) 任务进度遗忘:反应式基线缺乏时间上下文。(C) AtlasVLA 整合 4D 持久世界状态和自我工作状态确保鲁棒执行。
人类认知不依赖永远可见的全知相机与世界交互。人脑通过维持内部世界模型——一个持续跟踪物体、结构和动力学的认知地图——无缝导航部分可观测性。要实现真正自主,具身代理必须超越反应行为,发展构建和维持持久世界-自我状态的能力。
预备知识
扩散 Transformer(DiT)是本文的动作生成器。与标准扩散模型使用全局条件化不同,AtlasVLA 的 DiT 采用解耦的逐步条件化机制:在每个扩散步骤中先注入自我工作上下文再注入世界状态上下文。7B 规模的 LLM 作为语义骨干,约 300M 参数的 DiT 作为动作专家。
Depth Anything v3 提供流式深度估计,利用历史帧增强时序深度一致性。TSDF(截断符号距离函数)地图融合策略启发了本文的体素哈希世界状态更新机制——将同一物理区域的令牌特征加权聚合,实现高效的持久空间记忆。
方法详解
图2:AtlasVLA 整体架构。腕部相机图像提取 2D 令牌,通过深度和外参提升到 3D 形成瞬时世界状态,经体素哈希融合更新持久世界记忆;意图查询凝聚 ego 令牌更新工作记忆;双路径检索条件化 DiT 生成鲁棒动作。
1. 问题设定
在时间步 $t$,代理仅接收腕戴视觉观测 $O_t^w$、本体感知状态 $S_t$ 和语言指令 $L$。目标是学习映射 $\pi_\theta(\cdot)$ 生成未来动作序列:
$$A_t = [a_t, a_{t+1}, \dots, a_{t+k-1}] \sim \pi_\theta(\cdot \mid O_t^w, S_t, L)$$
其中 $A_t$ 为大小 $k$ 的动作块,每个动作 $a_t \in \mathbb{R}^7$ 是 6-DoF 末端执行器位姿加夹爪二值状态。关键约束是严格仅腕部观测——不使用任何第三人称视角。
2. 持久世界状态记忆
给定腕相机观测 $I_t^w$,用冻结的视觉编码器提取 2D 令牌。深度通过 Depth Anything v3 估计,外参通过机器人状态推导:$\mathbf{T}^{ex} = \psi(S_t) \cdot \mathbf{T}^{h2e}$,其中 $\psi(\cdot)$ 是末端执行器状态到位姿矩阵的变换,$\mathbf{T}^{h2e}$ 是手眼标定矩阵。
空间反向投影模块将 2D 令牌提升到 3D 潜空间:
$$m_t, P_t = \text{Back-Projection}(X_w^t, D_t^w, \mathbf{T}^{in}, \mathbf{T}_t^{ex})$$
其中 $m_t$ 是包含 3D 位置的 2D 潜令牌构成的瞬时世界状态,$P_t$ 为对应 3D 坐标。
为赋予世界状态精确的时空感知,引入双时空位置嵌入:3D 空间坐标和_timestamp 注入令牌:
$$\widehat{m}_t = m_t + \mathcal{E}_{spatial}(P_t) + \mathcal{E}_{temporal}(t)$$
其中 $\mathcal{E}_{spatial}(\cdot)$ 编码 3D 位置以保留几何结构,$\mathcal{E}_{temporal}(\cdot)$ 注入时序位置编码。两者均由 MLP 参数化。通过时空纠缠,瞬时世界状态从孤立观测池转变为统一的 4D 表示。
世界状态时空更新采用体素哈希策略。三维空间被划分为均匀体素,对于对应相同物理区域的输入令牌,在每个体素内加权聚合潜特征。当新世界状态 $m_t(v)$ 以置信权重 $w_t$ 投影到全局世界时,全局记忆 $\mathcal{M}_t(v)$ 更新为:
$$\mathcal{M}_t(v) = \frac{\mathcal{W}_{t-1}(v)\mathcal{M}_{t-1}(v) + w_t m_t(v)}{\mathcal{W}_{t-1}(v) + w_t}$$
其中置信权重 $w_t(v) = c_t(v)$ 来自深度估计置信度,累积权重 $\mathcal{W}_t(v) = \lambda \mathcal{W}_{t-1}(v) + w_t(v)$。高置信深度观测对全局记忆贡献更大,不确定测量被抑制。
时间上,全局记忆维护最大窗口 $W$ 的滑动窗口持续更新和遗忘。关键设计是第一帧永久锚定——第一帧通常提供最佳视场和初始状态的准确反映,其时空记忆被永久保留以提供持久全局上下文。
3. 自我工作状态记忆
意图感知查询机制定义一组可学习查询 $Q^{ego} \in \mathbb{R}^{N \times d}$,在每个决策步输入 VLM 聚合目标导向信息:
$$Z^{ego} = \text{Softmax}\left(\frac{Q^{ego} K^T}{\sqrt{d}}\right) V$$
其中 $K$ 和 $V$ 是所有令牌的键和值投影。通过将大量时空上下文凝聚为聚焦的意图令牌,模型维持连贯的全局感受野,显式防止意图遗忘。
自我工作记忆库通过冗余感知潜在整合更新。给定累计记忆 $\mathcal{M}_{t-1}^{ego}$,新提取的 ego 令牌先检索相关历史上下文并自适应融合,然后更新记忆库:
$$\mathcal{M}_t^{ego} = \text{Cons}\left(\mathcal{M}_{t-1}^{ego} \cup \{Z_t^{ego} + \mathcal{E}_{temporal}(t)\}\right)$$
其中 $\text{Cons}(\cdot)$ 合并时间相邻且语义相似的意图令牌,避免无界记忆增长和语义冗余。
4. 世界-自我引导的动作生成
当前 ego 令牌 $Z_t^{ego}$ 从整合记忆 $\mathcal{M}_t^{ego}$ 检索历史上下文:
$$C_t^{ego} = \text{CrossAttn}(Z_t^{ego}, \mathcal{M}_t^{ego}, \mathcal{M}_t^{ego})$$
然后以 ego 上下文 $C_t^{ego}$ 为查询检索任务相关的世界状态:
$$C_t^{world} = \text{AddNorm}\left(\text{FFN}\left(\text{IntentAttn}(C_t^{ego}, \mathcal{M}_t, \mathcal{M}_t)\right)\right)$$
这种 ego 引导的检索选择性提取相关世界状态并抑制空间冗余。最终,DiT 在每个扩散步骤 $k$ 先执行 ego-working 注意力再执行世界状态注意力,经 Add & Norm 层后由动作解码器输出最终动作 $A_t$。
graph TD
A["腕部相机观测"] --> B["2D视觉令牌 + 深度估计"]
B --> C["空间反向投影 → 3D"]
C --> D["时空位置嵌入 → 4D"]
D --> E["体素哈希融合 + 滑动窗口"]
E --> F["持久世界状态记忆 M"]
A --> G["意图感知查询 Q_ego"]
G --> H["Ego-Working 令牌 Z_ego"]
H --> I["冗余感知整合"]
I --> J["Ego-Working 记忆库"]
J --> K["Ego检索 C_ego"]
K --> L["世界检索 C_world"]
F --> L
L --> M["DiT逐步条件化动作生成"]
K --> M
M --> N["7-DoF 动作 A_t"]
实验结果
LIBERO 基准
在 LIBERO 五个测试套件上评估。仅用腕部相机的 AtlasVLA 达到 97.6% 平均成功率,甚至超越配备第三人称视角的基线——比 π₀ 高 3.4%。在最具挑战性的 LIBERO-Long 上达 94.6%,比 MemoryVLA 高 7.0%。MemoryVLA 去掉第三人称视角时下降 5.8%,而 AtlasVLA 显式持久世界状态建模消除了对外部空间先验的依赖。
| 方法 | 相机 | Spatial | Object | Goal | Long | 90 | 平均 |
|---|---|---|---|---|---|---|---|
| π₀ | 第三人称 | 90.8 | 91.8 | 89.6 | 80.2 | — | 88.1 |
| MemoryVLA | 第三人称 | 98.4 | 98.4 | 96.4 | 93.4 | 95.6 | 96.5 |
| π₀ | 第三人称+腕 | 96.8 | 98.8 | 95.8 | 85.2 | — | 94.2 |
| MemoryVLA | 腕 | 96.2 | 99.2 | 96.4 | 87.6 | 90.7 | 94.0 |
| AtlasVLA | 腕 | 99.4 | 99.8 | 98.2 | 94.6 | 95.8 | 97.6 |
RLBench 基准
在 RLBench 上仅用腕部相机达到 70.8% 平均成功率,超越所有 VLA 基线。比 MemoryVLA 在第三人称和腕部设置下分别高 7.5% 和 15.8%。在 sweep-to-dustpan、umbrella-out-frame-off 等高空间变化任务上优势尤为显著。
| 方法 | 相机 | 平均 |
|---|---|---|
| OpenVLA | 第三人称 | 23.3 |
| MemoryVLA | 第三人称 | 63.3 |
| CogACT | 腕 | 34.2 |
| MemoryVLA | 腕 | 55.0 |
| AtlasVLA | 腕 | 70.8 |
图3:AtlasVLA 在真实世界长程任务上的定性结果。展示多阶段操作的完整执行过程,验证持久世界状态和自我工作记忆的有效性。
真实世界评估
在 Franka 机器人上严格仅腕部相机评估。一般操作任务平均 78.7%,超越 MemoryVLA 第三人称设置 8.0%、腕部设置 16.4%。长程任务平均 69.5%,比 π₀ 高 17.5%、比 MemoryVLA 高 9.0%。
| 方法 | 一般任务 | 长程任务 |
|---|---|---|
| π₀(第三人称+腕) | 66.7 | 52.0 |
| MemoryVLA(第三人称) | 70.7 | 60.5 |
| MemoryVLA(腕) | 62.3 | — |
| AtlasVLA(腕) | 78.7 | 69.5 |
消融实验
| 变体 | LIBERO | 真实世界长程 |
|---|---|---|
| 无世界状态记忆 | 93.5 | 54.0 |
| 无自我工作记忆 | 95.0 | 56.5 |
| 无世界状态更新 | 94.6 | 58.0 |
| 无空间位置编码 | 96.4 | 67.5 |
| 无时序位置编码 | 96.8 | 65.0 |
| 无世界状态条件化 | 95.2 | 61.5 |
| 完整 AtlasVLA | 97.6 | 69.5 |
移除世界状态记忆导致真实世界任务灾难性下降(69.5%→54.0%,跌落 15.5%),证明空间地图记忆对仅腕部操作不可或缺。移除自我工作记忆下降 13.0%,验证潜在 ego 记忆对防止长程任务意图漂移至关重要。用朴素记忆累积替代时空更新下降 11.5%,证实 TSDF 体素聚合和滑动窗口的有效性。移除世界状态注意力下降 8.0%,确认注入世界状态对精确动作生成的必要性。
局限性
作者未设独立局限章节,但从方法设计和实验设定可识别多处边界。其一,世界状态记忆依赖深度估计质量——Depth Anything v3 的置信度直接影响体素融合权重,在反光、透明或低纹理表面深度估计可能不可靠,导致世界状态记忆含噪。其二,第一帧永久锚定策略假设初始帧提供最佳全局视场,若初始位姿不佳则全局上下文可能受限。其三,体素分辨率是固定参数——过粗导致空间信息丢失,过细导致计算开销增大——论文未讨论自适应体素分辨率的可能。其四,真实世界评估仅在 Franka 平台进行,未验证在人形机器人或移动平台上的迁移性。
总结与展望
AtlasVLA 证明了一个深刻洞见:将 VLA 从反应式观察升级为主动推理的关键不在于更多相机或更大模型,而在于构建持久的世界-自我状态。4D 体素哈希世界状态记忆让机器人"记住"离开视野的物体位置,自我工作记忆让机器人"知道"任务执行到了第几步——这两种记忆的协同使仅腕部相机超越了多视角系统。
从 97.6% 的 LIBERO 成绩和 17.5% 的真实世界长程提升来看,这一范式的转移比增加观测视角更具杠杆效应。移除世界状态记忆导致 15.5% 的灾难性下降进一步证明:在部分可观测条件下,持久空间记忆不是锦上添花而是不可或缺。这暗示未来 VLA 的发展方向应从"更多传感器"转向"更聪明的内部状态构建"。
未来工作可探索:自适应体素分辨率、基于学习策略轨迹的世界状态主动更新、以及向人形机器人全身体操作的扩展。将世界状态记忆与触觉反馈或力感知融合,可能进一步增强在严重遮挡场景下的操作鲁棒性。
当机器人不仅看到眼前的画面,还记住已离开视野的物体和已完成的步骤,一个腕部相机足以超越三个——因为真正的感知瓶颈从来不是视角数量,而是内部状态的持久性。



