Skip to content
RobotWorld
返回博客

GRASP:基于梯度的世界模型长程规划器

GRASP提出三种创新使世界模型的长程规划变得可行:提升状态实现时间并行优化、停止脆弱状态梯度保留动作梯度、周期性同步精化。在Push-T任务上长horizon成功率大幅领先CEM和GD。

2026年4月20日2 分钟阅读
EN

BallNav演示

GRASP 是一种新的基于梯度的学习动力学("世界模型")规划器,通过三个创新使长程规划变得可行:(1) 将轨迹提升到虚拟状态空间使优化在时间上并行;(2) 直接在状态迭代中添加随机性进行探索;(3) 重塑梯度使动作获得干净信号,同时避免通过高维视觉模型的脆弱"状态-输入"梯度。

什么是世界模型?

如今"世界模型"一词含义已被过度泛化。在不同语境下,它可以指显式动力学模型,也可以指生成模型依赖的某种隐式内部状态。在此给出一个宽松的工作定义:

假设你采取动作 $a_t \in \mathcal{A}$ 并观测状态 $s_t \in \mathcal{S}$(图像、潜向量、本体感知)。世界模型是一个学习模型,给定当前状态和未来动作序列,预测下一步会发生什么。形式上,它定义了在观测状态序列 $s_{t-h:t}$ 和当前动作 $a_t$ 条件下的预测分布:

$$P_\theta(s_{t+1} \mid s_{t-h:t}, a_t)$$

近似环境的真实条件分布 $P(s_{t+1} \mid s_{t-h:t}, a_t)$。当模型为确定性时,退化为状态映射:

$$s_{t+1} = F_\theta(s_t, a_t)$$

实际中状态 $s_t$ 通常是学习的潜表示(如从像素编码),因此模型在紧凑、可微的空间中运作。关键点是:世界模型给了你一个可微模拟器——你可以在假设的动作序列下前向展开,并通过预测反向传播。

规划:通过模型优化选择动作

给定起点 $s_0$ 和目标 $g$,最简单的规划器通过展开模型并最小化终端误差来选择动作序列 $\mathbf{a}=(a_0,\dots,a_{T-1})$:

$$\min_{\mathbf{a}} \| s_T(\mathbf{a}) - g \|_2^2, \quad \text{其中 } s_T(\mathbf{a}) = \mathcal{F}_{\theta}^{T}(s_0,\mathbf{a})$$

这里 $\mathcal{F}^T$ 是通过世界模型的完整展开的简写:

$$\mathcal{F}_{\theta}^{T}(s_0, \mathbf{a}) = F_\theta(F_\theta(\cdots F_\theta(s_0, a_0), \cdots, a_{T-2}), a_{T-1})$$

在短horizon和低维系统中,这可以相当有效。但随着horizon增长和模型变大,其弱点被放大。

为什么长程规划困难(即使一切可微)

1) 长程展开创建深度、病态的计算图

对早期动作(如 $a_0$)求导,需要通过时间反向传播(BPTT),导致梯度爆炸/消失问题。雅可比矩阵的条件数随时间 $T$ 指数增长:

$$\sigma_{\text{max/min}}(D_{a_0}\mathcal{F}_{\theta}^{T}) \sim \sigma_{\text{max/min}}(D_s F_\theta)^{T-1}$$

2) 优化景观非贪心且充满陷阱

在短horizon中,贪心解(每步直接朝目标移动)通常足够好。但长horizon中,最优轨迹往往需要先远离目标,贪心方法会陷入局部最优。

3) 学习的深度模型的脆弱梯度

深度学习模型对输入扰动存在对抗鲁棒性问题。状态-输入梯度 $D_s F_\theta$ 极其脆弱,而动作-输入梯度 $D_a F_\theta$ 相对平滑。

GRASP 的三个核心组件

组件1:提升状态实现时间并行优化

GRASP 将串行展开转化为配点优化——同时优化所有状态和动作,使梯度在时间上并行计算。引入虚拟状态 $\mathbf{s}=(s_1,\dots,s_T)$ 和一致性约束:每个虚拟状态应等于前一步的模型预测:

$$\mathcal{L}_{\text{dyn}}(\mathbf{s},\mathbf{a}) = \sum_{t=0}^{T-1} \|F_\theta(s_t, a_t) - s_{t+1}\|_2^2$$

加入随机性实现探索(类Langevin动力学),对状态添加噪声:$s_t \leftarrow s_t - \eta \nabla_{s_t} \mathcal{L} + \sqrt{2\eta/\beta} \epsilon$。

组件2:重塑梯度——停止脆弱的状态梯度,保留动作梯度

对状态使用停止梯度 $\bar{s}_t$,定义停止梯度动力学损失:

$$\mathcal{L}_{\text{dyn}}^{\text{sg}}(\mathbf{s},\mathbf{a}) = \sum_{t=0}^{T-1} \|F_\theta(\bar{s}_t, a_t) - s_{t+1}\|_2^2$$

加上密集目标项引导状态朝目标移动:

$$\mathcal{L}_{\text{goal}}^{\text{sg}}(\mathbf{s},\mathbf{a}) = \sum_{t=0}^{T-1} \|F_\theta(\bar{s}_t, a_t) - g\|_2^2$$

最终目标:

$$\mathcal{L}(\mathbf{s},\mathbf{a}) = \mathcal{L}_{\text{dyn}}^{\text{sg}}(\mathbf{s},\mathbf{a}) + \gamma \, \mathcal{L}_{\text{goal}}^{\text{sg}}(\mathbf{s},\mathbf{a})$$

组件3:周期性同步

每 $K_{\text{sync}}$ 次迭代,从 $s_0$ 用当前动作展开,在原始串行损失上做少量梯度步精化,保持状态和动作与真实轨迹对齐。

实验结果

Push-T规划演示

Push-T 任务结果:GRASP 在长horizon下不仅成功率更高,而且找到成功解的速度更快。

HorizonCEMGDLatCoGRASP
H=4061.4% / 35.3s51.0% / 18.0s15.0% / 598.0s59.0% / 8.5s
H=5030.2% / 96.2s37.6% / 76.3s4.2% / 1114.7s43.4% / 15.2s
H=607.2% / 83.1s16.4% / 146.5s2.0% / 231.5s26.2% / 49.1s
H=707.8% / 156.1s12.0% / 103.1s0.0% / —16.0% / 79.9s
H=802.8% / 132.2s6.4% / 161.3s0.0% / —10.4% / 58.9s

成功率(%) / 中位成功时间。粗体=行内最优。注意中位成功时间会因更高成功率而偏高;GRASP 在更高成功率下仍然更快。

展望

基于扩散的世界模型扩展、更精密的优化器和噪声策略、以及将 GRASP 集成到闭环系统或 RL 策略学习中,都是自然的下一步。世界模型规划器目前处于一个有趣的位置——规划和控制的背景文献极其成熟,但在现代大规模世界模型上的纯规划优化仍严重欠探索。一旦找到正确的思路,世界模型规划器很可能变得像 RL 一样普遍。

原文来源:BAIR Blog | 论文:arXiv:2602.00475

相关文章