Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

TwitterSLAM三维重建

SLAMFormer-∞:面向无界前端与后端处理的无限SLAM变换器

我们提出无限SLAM变换器(SLAMFormer-∞),首个能同时支持长程前端和后端处理且无需显式距离边界的几何变换器。SLAMFormer-∞采用记忆条件定义灵活的坐标系和尺度,而非依赖首帧锚定。基于此,前端保持高效局部计算,后端联合优化长程轨迹和场景几何,实现全局一致性。实验表明SLAMFormer-∞在大规模数据集上的轨迹估计和场景重建均取得优越或极具竞争力的性能,并能泛化到超过17公里的极长轨迹。

Zhijian Fang, Weicheng Zheng, Yijun Yuan, Weibang Wang, Zhuoguang Chen, Chang Sun, Junhao Huang, Kenan Li, Minghui Qin, Hang Zhao2026年8月4日3 分钟阅读
EN

论文:SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing
作者:Zhijian Fang*, Weicheng Zheng*, Yijun Yuan*†, Weibang Wang, Zhuoguang Chen, Chang Sun, Junhao Huang, Kenan Li, Minghui Qin, Hang Zhao†
机构:IIIS, Tsinghua University(清华大学交叉信息研究院)
链接:arXiv:2608.03429 · 项目主页
代码状态:项目主页已上线,代码尚未公开

一句话总结

SLAMFormer-$\infty$ 是首个能在任意长轨迹上同时进行前端跟踪和后端联合优化的几何变换器,通过记忆条件机制摆脱了对首帧坐标锚定的依赖,在17公里以上的城市驾驶序列上实现了全局一致的位姿估计与稠密重建。

1. 研究背景与动机

同时定位与建图(SLAM)是自主系统的基石——机器人需要在未知环境中实时定位自身并构建地图。在所有SLAM范式中,单目SLAM因其硬件简单、成本低廉而备受关注:仅需一台RGB摄像头,即可实现环境感知与导航。然而,单目SLAM面临的挑战也十分严峻:尺度模糊、快速运动下的跟踪丢失、大范围场景中的累积漂移,以及稠密重建的质量瓶颈。

单目SLAM的发展经历了清晰的代际演进。早期方法以稀疏特征为基础,如ORB-SLAM2,主要关注相机轨迹估计,虽然对定位有效,但仅能获取有限的场景几何信息。为恢复稠密三维结构,后续工作引入了稠密束调整(Dense Bundle Adjustment)或基于学习的深度预测。近年来,神经场景表示和几何基础模型显著推动了单目SLAM的发展:基于高斯溅射的方法展示了神经渲染表示在单目稠密重建中的潜力;几何变换器如DUSt3R、MASt3R、VGGT则将多视角几何回归从手工设计的匹配和三角化转变为端到端的变换器预测。

SLAM-Former进一步将变换器引入SLAM全流程——前端跟踪、建图与后端优化集成于单一模型中,通过全局注意力实现轨迹-几何联合精修,无需回环检测。这是一个重要的进步,但它有一个根本性的局限:完全数据驱动的方法依赖于训练数据的轨迹分布,长程性能受限于训练数据的规模和轨迹范围。当序列长度超出训练分布时,SLAM-Former的性能会急剧下降。

另一方面,MASt3R-SLAM和VGGT-SLAM/VGGT-Long通过以位姿为中心的优化来处理长程一致性。它们的后端主要优化相机位姿,而场景几何基本保持不变。结果是,轨迹校正与几何重建被解耦而非在统一框架内联合优化。VGGT-Long通过局部子图构建与全局位姿对齐来扩展到长序列,但其几何重建质量在长程场景中明显退化,甚至在城市级场景中完全崩溃。

SLAMFormer-$\infty$的出发点正是这两个根本局限的交汇点:能否在保留单一变换器模型的同时,既摆脱训练数据对轨迹长度的限制,又实现位姿与几何的联合优化?答案是肯定的——通过记忆条件(memory condition)机制重新定义坐标系统,使变换器能在有界注意力上下文中操作,同时保持长程位姿和几何信息。

2. 预备知识

理解SLAMFormer-$\infty$需要几个核心概念。首先是几何变换器(Geometric Transformer)——一类将多视角3D感知从手工设计的对应和优化转变为变换器驱动的几何回归的模型。DUSt3R从图像对预测稠密点图(pointmap),MASt3R增强了成对3D匹配,VGGT将这一范式扩展到前馈式多视角重建,联合预测相机参数、深度和点图。

其次是SLAM-Former的基本公式。SLAM-Former将SLAM建模为单一变换器内的推理过程:

$$p(\mathcal{X}, \mathcal{P} \mid \mathcal{I})$$

其中$\mathcal{I}$为输入图像序列,$\mathcal{X}$为相机轨迹($\mathbf{g}_n \in SE(3)$),$\mathcal{P}$为场景几何表示。前端因果地进行增量跟踪,后端对完整历史执行全局精修。这一公式将传统SLAM的多个模块统一到端到端学习框架中,但其长程性能受限于训练轨迹的分布范围。

最后是记忆条件的概念。与首帧锚定(first-frame-anchored)的全局坐标系不同,记忆条件使用条件块$(\mathcal{I}_C, \mathcal{X}_C)$定义局部参考坐标系,使变换器在有界上下文中操作的同时,通过条件信息间接保留长程几何关系。这一设计是SLAMFormer-$\infty$实现无界处理的关键。

3. 方法详解

3.1 问题形式化

给定流式单目图像序列$\mathcal{I}_{1:N} = \{\mathbf{I}_1, \dots, \mathbf{I}_N\}$,SLAM的目标是实时估计相机轨迹$\mathcal{X}_{1:N} = \{\mathbf{g}_1, \dots, \mathbf{g}_N\}$($\mathbf{g}_n \in SE(3)$)和场景几何表示$\mathcal{P}_{1:N} = \{\mathbf{P}_1, \dots, \mathbf{P}_N\}$,同时保持准确的增量跟踪和全局几何一致性。

SLAM-Former将此问题形式化为变换器内的推理,前端因果操作以实现增量跟踪,后端对完整历史执行全局精修:

$$\text{Frontend: } M_n = f_\theta^f(I_n, M_{1:n-1})$$

$$\text{Backend: } \hat{M}_{1:n} = f_\theta^b(M_{1:n})$$

其中$\mathcal{M}$表示地图token表示,位姿和几何通过头部函数解码:$(\mathcal{X}, \mathcal{P}) = f_\psi(\mathcal{M})$。然而,这一公式从根本上受限于训练轨迹的分布,无法有效泛化到长程序列。

3.2 SLAMFormer-$\infty$的条件化设计

为突破这一局限,SLAMFormer-$\infty$引入了记忆条件,将模型重新定义为:

$$p(\mathcal{X}, \mathcal{P} \mid \mathcal{I}, \mathcal{I}_C, \mathcal{X}_C)$$

其中记忆条件$(\mathcal{I}_C, \mathcal{X}_C)$定义了参考坐标系。与SLAM-Former的关键区别在于:SLAMFormer-$\infty$的前端和后端推理都在条件定义的局部坐标系中进行,而非在全局坐标系中进行。这使得变换器可以在有界注意力上下文中处理任意长序列。

具体而言,给定关键帧图$\mathcal{G} = (\mathcal{V}, \mathcal{E})$,SLAMFormer-$\infty$在局部邻域$\mathcal{N}$上操作:

$$\text{Conditional Frontend: } M_n = f_\theta^f(I_n, I_{n-k:n-1}, C_j \in \mathcal{N}(n-k))$$

$$\text{Conditional Backend: } \hat{M}_{n-w:n} = f_\theta^b(I_{n-w:n}, C_j \in \mathcal{N}(n-w))$$

其中$\mathcal{C}_\cdot$表示邻域条件上下文$(\mathcal{I}_\cdot, \mathcal{X}_\cdot)$,$w \in \mathcal{W}(n)$是从窗口集$\mathcal{W}(n)$中检索的最近锚点。在前端中,$\mathcal{I}_{n-k:n-1}$和$\mathcal{C}$通过之前后端和前端处理获得的KV缓存来辅助$\mathcal{I}_n$。这种相对化公式阻止了SLAM-Former中的直接全局全注意力推理,因此需要迭代后端来实现全局一致性。

图2:SLAM变换器对比。(a) SLAM-Former单模型全局一致位姿与地图;(b) VGGT-Long优化长程位姿并拼接地图;(c) SLAMFormer-$\infty$保留单模型同时通过条件设计获得长程全局一致的位姿与地图。

3.3 位姿-几何图优化(PGGO)

SLAMFormer-$\infty$的后端联合处理位姿和几何,将任务形式化为位姿-几何图优化(PGGO)。PGGO在位姿-几何交互图$\mathcal{G} = (\mathcal{V}, \mathcal{E})$上操作,节点集$\mathcal{V} = \mathcal{X} \cup \mathcal{P}$,其中$\mathcal{X}$和$\mathcal{P}$分别为位姿节点和几何节点。边集$\mathcal{E} = \mathcal{E}_\mathcal{X} \cup \mathcal{E}_\mathcal{P}$,其中$\mathcal{E}_\mathcal{X}$通过相对位姿约束显式连接位姿,$\mathcal{E}_\mathcal{P}$通过变换器注意力隐式捕获几何相关性。

对每帧$n$,定义联合状态变量:

$$\mathbf{x}_n = (\mathbf{g}_n, \mathbf{P}_n)$$

给定初始化$\tilde{\mathbf{x}}_n^0 = (\tilde{\mathbf{g}}_n^0, \tilde{\mathbf{P}}_n)$(从位姿图优化或前端预测获得),目标是联合精修位姿和几何以实现全局一致性:

$$\mathbf{x}^* = \arg\min_{\{\mathbf{x}_n\}} \sum_{n} \left\|\mathbf{x}_n - f_\psi \circ f_\theta(\mathcal{I}_n, \mathcal{C}_{n \in \mathcal{N}_{n-w}})\right\|^2 \tag{1}$$

这个优化目标的核心思想是:对每个节点,变换器预测的位姿-几何联合输出应该与当前估计一致。通过迭代最小化这一残差,实现全局一致的轨迹和场景几何。为求解此优化,使用迭代神经精修:

$$\hat{\mathbf{x}}_n^{k+1} = f_\psi \circ f_\theta(\mathcal{I}_n, \mathcal{C}_{n \in \mathcal{N}_{n-w}})$$

随后进行直接点图更新和阻尼位姿更新:

$$\tilde{P}_n \leftarrow \hat{P}_n^{k+1}, \quad \tilde{g}_n^{k+1} = \exp\left[(1-\alpha)\log(\tilde{g}_n^k) + \alpha\log(\hat{g}_n^{k+1})\right]$$

其中$\alpha$为阻尼因子。阻尼更新在$SE(3)$的李群结构上进行:通过对数映射到李代数,在切空间中线性组合后通过指数映射回到李群。这种设计避免了直接替换位姿可能导致的数值不稳定,同时允许新预测以可控的方式修正历史估计。简写为$\tilde{x}_n^{k+1} = h_\theta(\tilde{x}_n^k)$。

图3:SLAM管线。前端检测关键帧并提供在线跟踪轨迹。固定数量关键帧后触发局部后端精修以改善短程位姿和几何一致性。回环检测触发或序列结束时,PGGO用同一变换器函数执行全局精修。

3.4 测试时流程

测试时,SLAMFormer-$\infty$从RGB序列$\{\mathbf{I}_t\}_{t=1}^T$执行流式重建和位姿估计,关键帧为$\{\mathbf{I}_n\}_{n=1}^N$。系统维护一个全局图$\mathcal{G} = (\mathcal{V}, \mathcal{E})$,每个节点$\mathbf{x}_n$存储$(\mathbf{g}_n, \mathbf{P}_n)$。

前端:每帧$\mathbf{I}_i$要么关联到现有keyframe,要么作为新节点$\mathbf{I}_n$插入。基于局部窗口$\mathcal{W}(n)$更新边。新keyframe $\mathbf{I}_n$用3.2节的方法跟踪获得$\mathcal{M}_n$,借助之前KV缓存的辅助。

局部后端:每$c_w$个keyframe触发一次局部后端,用条件后端公式更新$\hat{\mathcal{M}}_{n-c_w:n}$,改善短程位姿和几何一致性。

全局后端:回环检测触发或最后一帧之后,给定位姿图或前端预测的图初始化,SLAMFormer-$\infty$执行PGGO进行全局精修:从$k=1$到$K$迭代,对每个节点$\mathbf{x}_n \in \mathcal{V}$执行$\tilde{\mathbf{x}}_n^{k+1} = h_\theta(\tilde{\mathbf{x}}_n^k)$。这些操作产生由学习到的SLAMFormer-$\infty$先验诱导的全局一致重建。

3.5 训练策略

SLAMFormer-$\infty$以四种共享权重模式训练,仅在注意力掩码和条件模式上有所不同,分别匹配测试时的前端、后端和精修阶段推理。训练变体从预训练的SLAM-Former模型初始化,分别适配室内和室外场景的尺度和运动统计。室内变体使用12帧片段、长边518像素;室外变体使用36帧片段、长边224像素。两个变体均在48块A100 GPU上训练10个epoch。

图4:SLAMFormer-$\infty$的四种训练模式。每种模式中,图像token被送入变换器主干$f_\theta$,帧注意力层和各种帧间注意力组合。位姿和点图通过头部$f_\psi$回归。

模式1训练在线跟踪与建图:前两帧以全注意力初始化局部坐标系,后续帧使用因果帧间注意力。模式2训练无记忆条件的后端精修:片段前半部分使用全注意力,后半部分从精修后的前缀因果解码。模式3训练有记忆条件的后端精修:使用分离的模式2预测,将前缀区间$[s, N/2)$对齐到锚点并编码为位姿注入帧,服务于剩余目标段。模式4训练有记忆条件的精修阶段:将中间目标块以前后邻域条件块为条件。

flowchart TB
    subgraph FE["Frontend: Causal Tracking"]
        I1["Image I_n"] --> FK["Frame Attention L layers"]
        KV1["KV Cache from prev"] --> FK
        C1["Memory Condition
(I_C, X_C)"] --> FK FK --> M1["Map Tokens M_n"] M1 --> HEAD1["f_psi: Pose + Pointmap"] end subgraph LB["Local Backend: every c_w frames"] M2["Map Tokens M_{n-w:n}"] --> FB["Backend Attention"] C2["Memory Condition"] --> FB FB --> M2H["Refined M_hat"] end subgraph GB["Global Backend: PGGO"] PG["Pose Graph Init"] --> ITER["Iterative h_theta
k=1..K"] ITER -->|damped update| XN["x_n = (g_n, P_n)"] XN -->|converged?| ITER XN -->|yes| OUT["Global Consistent
Trajectory + Geometry"] end FE --> LB LB -->|loop detected| GB

上图:SLAMFormer-$\infty$的三阶段处理流程。前端因果跟踪,局部后端短程精修,全局后端PGGO迭代联合优化位姿与几何。

4. 实验分析

4.1 大规模室外场景

在KITTI Odometry数据集上(见表1),SLAMFormer-$\infty$将平均ATE RMSE从VGGT-Long的26.358m降至23.011m。在排除高速序列01后的平均值上,改善同样显著。值得注意的是,许多竞争方法(CUT3R、Fast3R、VGGT)在多个序列上因显存不足(OOM)而无法完成评估,而SLAMFormer-$\infty$在所有序列上均成功运行。

表1:KITTI Odometry跟踪结果(ATE RMSE [m],越低越好)。LC表示回环闭合,OOM/TL表示显存不足/跟踪丢失。SLAMFormer-$\infty$在无需标定的情况下取得最优平均成绩。

在Waymo Open Dataset上(见表2),SLAMFormer-$\infty$将平均ATE RMSE从VGGT-Long的1.996m进一步降至1.813m,覆盖了多样化的城市驾驶场景(不同速度、长度、交通密度)。在多个具体路段上改善幅度更大,如路段371159869从3.452m降至1.464m。

方法标定需求重建类型KITTI Avg. (m)Waymo Avg. (m)
ORB-SLAM2 (w/ LC)需要稀疏54.816-
DROID-SLAM需要稠密100.2784.396
MASt3R-SLAM无需稠密-5.560
VGGT-Long无需稠密26.3581.996
SLAMFormer-$\infty$无需稠密23.0111.813

在稠密点图重建方面(见表3,Waymo),SLAMFormer-$\infty$相比VGGT-Long全面改善:精度从1.182降至0.949,完整度从2.860降至2.777,Chamfer距离从2.021降至1.863。这表明PGGO的联合优化不仅改善了位姿,也实质性提升了场景几何重建质量——这正是SLAMFormer-$\infty$相比仅优化位姿的方法(如VGGT-Long)的核心优势。

方法精度 ↓完整度 ↓Chamfer ↓
DROID-SLAM1.2018.5404.870
MASt3R-SLAM3.7723.1773.474
CUT3R3.8846.8015.343
VGGT-Long1.1822.8602.021
SLAMFormer-$\infty$0.9492.7771.863

图1展示了城市级重建的定性对比:在一个自采集的17公里城市驾驶序列上,VGGT-Long的全局位姿对齐虽然有效,但局部几何基本未精修,且在大范围地图中出现崩溃;SLAMFormer-$\infty$则联合优化了位姿和稠密几何,维持了大规模一致地图。

图1:城市级重建可视化。VGGT-Long执行全局位姿对齐但局部几何基本未精修,SLAMFormer-$\infty$联合优化位姿和稠密几何。在自采集的17公里城市驾驶序列上,SLAMFormer-$\infty$维持了一致的大规模地图,而VGGT-Long崩溃。

4.2 小型室内场景

在室内基准测试(TUM RGB-D、7-Scenes、Replica)上,SLAMFormer-$\infty$与最先进的室内SLAM系统保持可比性能,同时保留了无需标定的稠密重建能力。在7-Scenes上,相比VGGT-SLAM,ATE RMSE从0.068m降至0.046m,精度/完整度/Chamfer从0.054/0.060/0.057改善到0.029/0.049/0.039。

然而,SLAM-Former在室内基准上取得了整体最佳性能,得益于其完全端到端学习的架构。SLAMFormer-$\infty$主要为长轨迹的全局优化而设计,其全局优化并非端到端学习。因此,在短程室内基准上,它可能仍然不如专门为相同分布定制的数据驱动模型,但它优先考虑无界序列的全局优化。这一权衡是方法设计的刻意选择——牺牲短程极致性能以换取长程泛化能力。

4.3 消融实验:精修阶段(PGGO)前后

消融实验对比了有无精修阶段的SLAMFormer-$\infty$。在Replica上,精修阶段将ATE RMSE从0.061m降至0.052m,重建精度/完整度从6.11/3.39改善到6.00/3.33。TUM RGB-D和7-Scenes呈现相同趋势,表明精修阶段改善了局部几何一致性,尽管数值改善幅度有限。然而,定性效果更为显著:图5显示精修后点图表面更干净、局部漂移减少,视觉改善比分数差异更为明显。

表2:Waymo跟踪结果。在九个城市驾驶路段上报告ATE RMSE [m](越低越好)。

5. 讨论

SLAMFormer-$\infty$的核心创新在于将坐标系条件化引入几何变换器,这一视角的转变具有深远意义。传统几何变换器(VGGT、Fast3R)假设所有视角可以放入有限注意力上下文,坐标行为与训练时序列范围绑定。SLAMFormer-$\infty$将这一假设放松:固定条件块定义局部参考几何,变换器在有界上下文中操作,同时通过条件信息间接保留长程位姿和几何信息。这一设计使变换器能够处理超出训练分布的极长序列。

PGGO的设计也体现了重要的方法论转向。传统后端优化(如位姿图优化、束调整)在固定几何上优化位姿,或反之。PGGO将位姿和几何同时作为图节点,通过变换器注意力联合精修,打破了这一解耦。阻尼更新机制保证了迭代过程的数值稳定性,同时允许新预测以可控方式修正历史估计。这种"学习先验加迭代精修"的范式,与扩散模型中的去噪迭代有结构上的相似性。

训练策略的共享权重设计也值得关注。四种模式仅注意力掩码和条件模式不同,但共享同一变换器主干。这意味着模型学习的是一个统一的几何推理能力,通过不同的注意力配置适配前端跟踪、后端精修和精修阶段的不同需求。这种设计与度量学习中的共享编码器思想异曲同工。

6. 局限性分析

作者自述局限:SLAMFormer-$\infty$的PGGO需要输入预定义的图,该图来自前端和回环检测。图的连接质量影响性能,且这一连接结构并非从数据中学习。这意味着如果前端或回环检测构建的图结构不理想(如关键帧选择不当、回环检测漏检),PGGO的优化效果会受限。相比之下,SLAM-Former隐式构建帧间连接,不依赖外部图结构。

独立判断:SLAMFormer-$\infty$在短程室内场景上逊于SLAM-Former等完全数据驱动方法。这是因为全局优化非端到端学习,在训练分布内的短序列上无法充分利用数据驱动的优势。此外,虽然论文展示了17公里序列的处理能力,但训练仅使用12帧(室内)或36帧(室外)片段,从短片段训练到长序列泛化的机制仍需更深入的分析。室外变体使用224像素的长边分辨率,对于远距离场景的细粒度重建可能不足。最后,论文未报告推理速度和内存消耗的系统级评估,对于实际部署而言这是重要的缺失信息。

7. 总结与展望

SLAMFormer-$\infty$解决了SLAM变换器无法处理无界长距离序列的根本限制。基于记忆条件设计,SLAMFormer-$\infty$在前端实现了高效的在线稠密重建,在后端实现了无界长序列的轨迹-几何联合优化。该方法在大规模数据集上展示了更优性能,并展现出对超过17公里极长轨迹的泛化能力。

从更广的视角看,SLAMFormer-$\infty$代表了SLAM研究从"模块化流水线"向"统一变换器"演进的重要一步。条件化设计提供了一个通用框架,使几何变换器能够在保持单模型统一性的同时扩展到任意长序列。未来工作可能会探索:如何从数据中学习图连接结构以消除对外部图构建的依赖;如何将室内外变体统一为单一模型;以及如何在移动端实现实时推理。

条件即自由:当坐标系不再锚定于第一帧,变换器便从有限窗口的囚笼中解放,在17公里的轨迹上找到了自己的无限。

相关论文

WilLaGS:潜变量条件3D外观场实现鲁棒的野外高斯泼溅重建

WilLaGS:潜变量条件3D外观场实现鲁棒的野外高斯泼溅重建

针对无约束图像集合重建中剧烈外观变化与瞬态遮挡物两大难题,WilLaGS提出统一框架:用β-VAE学习连续的全局外观流形,由潜变量条件化的3D神经外观场生成动态Tri-Plane特征,建模空间变化的局部光照;再用自监督Teacher-Student(EMA)感知掩码自动识别并抑制瞬态区域。在Photo Tourism与NeRF-OSR上全面刷新纪录:Sacre Coeur场景PSNR达25.84 dB,比最强对手AsymGS高2.28 dB;单场景训练仅0.9 GPU小时,渲染58 FPS,并支持外观迁移、插值与无条件外观合成。

3DGSGaussian Splatting新视角合成2026年8月28日
人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日