Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

规划反应控制策略选择

何时规划:学习在反应控制与审慎规划间选择

本文研究机器人何时应使用反应控制、何时应进行审慎规划,提出学习在两种策略间自适应选择的方法,平衡效率与准确性。

Adam Labiosa, Josiah P. Hanna2026年7月17日3 分钟阅读
EN

论文:When to Plan: Learning to Select Between Reactive Control and Deliberative Planning
链接:arXiv:2607.16421v1, 2026(RLC 2026)
机构:Prediction and Action Lab (PAL), University of Wisconsin–Madison
代码状态:❌ 本文未提供公开代码

1. 摘要

本文研究元推理(meta-reasoning)问题:RL 智能体如何学习在快速反应策略和慢速决策时规划器之间动态分配计算。反应策略通过单次神经网络前向传播产生动作,但仅在训练分布内表现良好;规划器能从任意环境状态产生好的动作序列,但需额外计算时间。作者将此问题形式化为元 MDP(meta-MDP),使用选项框架(options framework),训练一个元策略(meta-policy)根据反应策略的不确定性信号选择反应动作或变深度规划。在5个运动规划和导航任务上,自适应元策略在到达目标状态的时间上优于所有固定计算基线(always-react、always-plan)。消融实验表明反应不确定性和观测历史是最关键组件。

2. 研究背景与动机

在大规模、开放环境中运行的智能体面临核心权衡:快速反应控制 vs 慢速深思熟虑规划。反应策略(单次前向传播)成本低但受训练分布约束;规划器(基于世界模型)能跨整个状态空间产生近优动作但计算昂贵。规划在反应策略训练分布外的状态最有价值。

现有方法的局限:

  • 事件触发重规划方法:假设智能体总是规划,仅学习计划何时失效,不考虑最小化计算以更快完成任务;
  • 变长度选项方法:优化动作效率而非计算分配,不显式建模反应执行与规划成本的权衡;
  • 无模型/模型基础控制仲裁方法:依赖手工设计切换规则或不确定性启发式,忽略模型基础规划所需计算;或假设规划与反应推理耗时相等。

认知科学研究(双过程理论、有界理性)表明人类在预期价值超过成本时进行深思熟虑,这直接启发了本文将规划建模为时间成本选项的思路。

3. 核心方法

3.1 元 MDP 形式化

将元推理问题形式化为元 MDP:$\tilde{\mathcal{M}}=(\tilde{\mathcal{S}},\mathcal{O},\tilde{\mathcal{P}},\tilde{r},\gamma)$,其中 $\tilde{\mathcal{S}}$ 是元状态空间,$\mathcal{O}$ 是选项空间(选项 $o\in\mathcal{O}$ 是可能在时间上延伸的选择动作),$\tilde{\mathcal{P}}$ 是元转移函数,$\tilde{r}$ 是元奖励,$\gamma$ 是折扣因子。元状态空间不需直接对应世界环境状态空间 $\mathcal{S}$。

两类选项可供选择:

  • 规划选项 $\pi_k$:使用规划器生成 horizon 为 $k$ 的计划 $p=[a_0,a_1,\dots,a_{k-1}]$,开环执行。规划成本 $c_p(k)=-\alpha k$($\alpha$ 为每步规划时间惩罚),执行成本 $c_a=-1$(每步),总奖励 $\tilde{r}_{\tilde{t}}=c_p(k)+k\cdot c_a=-\alpha k-k$。
  • 反应选项 $\pi_r$:$c_p=0$,总奖励 $\tilde{r}_{\tilde{t}}=c_a=-1$。反应策略在训练分布内 $\mathcal{S}_{ID}$ 近似最优 $V^{\pi_r}(s)\approx V^*(s)$,但在分布外 $\mathcal{S}_{OOD}$ 远逊 $V^{\pi_r}(s)\ll V^*(s)$。

3.2 元观测设计

元策略在无需搜索即可计算的内部状态 $\tilde{s}$ 上操作。观测由三部分拼接:

$$\hat{s}_{\tilde{t}}=[u_{\tilde{t}},d_{\tilde{t}},\tilde{a}_{\tilde{t}-1}]$$

其中 $u_{\tilde{t}}$ 是反应策略的不确定性分数,$d_{\tilde{t}}$ 是到目标的当前距离,$\tilde{a}_{\tilde{t}-1}$ 是上一个元动作。再提供 $n$ 步历史:

$$\tilde{s}_{\tilde{t}}=[\hat{s}_{\tilde{t}},\hat{s}_{\tilde{t}-1},\dots,\hat{s}_{\tilde{t}-(n-1)}]$$

动作空间包含反应选项和 N 个规划选项(不同 horizon):

$$\mathcal{O}=\{\pi_{\mathrm{r}},\pi_{k_{1}},\pi_{k_{2}},\dots,\pi_{k_{N}}\}$$

3.3 反应不确定性:集成方法

反应策略实现为 $M$ 个神经网络的集成。对连续控制,每个网络输出动作均值 $\mu_i\in\mathbb{R}^{D}$,集成动作和不确定性为:

$$a=\frac{1}{M}\sum_{i=1}^{M}\mu_{i},\qquad u(s)=\sum_{j=1}^{D}\mathrm{Var}_{i}\!\left[\mu_{i,j}\right]$$

对离散动作空间,每个网络输出类别分布 $\mathbf{p}_i$,平均分布 $\bar{\mathbf{P}}=\frac{1}{M}\sum_{i=1}^{M}\mathbf{p}_i$,集成动作和不确定性为:

$$a=\arg\max_{j}\,\bar{P}(j),\qquad u(s)=-\sum_{j=1}^{J}\bar{P}(j)\log\bar{P}(j)$$

高不确定性对应分布外输入,此时规划可能有益。

flowchart TD
    A[环境状态 s] --> B[反应策略集成
M=4个神经网络] B --> C[动作 a_r + 不确定性 u_t] C --> D[元观测 s_tilde
= u_t, d_t, a_prev + 历史] D --> E[元策略 π_Ω
PPO训练] E --> F{选择选项} F -->|反应 π_r| G[单步执行反应动作] F -->|规划 π_k| H[A*规划器
horizon=k] H --> I[开环执行k步计划] G --> J[环境执行] I --> J J --> A

3.4 训练流程

  • 元策略:用 PPO(Stable Baselines3,默认超参数)训练,4步历史观测;
  • 反应策略:从规划器在分布内任务上生成的轨迹通过行为克隆预训练,$M=4$ 个网络;
  • 规划器:使用给定准确世界模型的 A* 规划器,约束至最大 horizon;
  • 联合训练设置:记录规划选项产生的状态-动作对到回放缓冲区,每次 rollout 后用行为克隆训练集成成员,元策略跟踪反应策略改进。

4. 关键实验

4.1 环境套件

5个环境,每个20个任务(半数分布内、半数分布外),每个任务30个种子、300个评估回合:

图1:环境套件。Box Push、DoorKey、Fetch、Maze、Navigation,状态空间类型、任务结构和反应策略难度各异。

  • Box Push:简化版 Sokoban,6×6 网格、3个箱子,错误移动不可恢复,符号观测;
  • DoorKey:MiniGrid 多阶段任务(取钥匙→开门→到目标),符号观测;
  • Fetch:修改自 Gymnasium Robotics Fetch Reach,添加障碍物,7自由度机械臂关节空间控制,规划器在笛卡尔空间操作;
  • Maze:网格迷宫,每个障碍配置5个起/终点对,图像观测;
  • Navigation:连续导航,连续位移控制,图像观测。

左:Box Push 环境(简化Sokoban,错误不可恢复);右:Fetch 环境(7自由度机械臂,含障碍物)。

左:Maze 环境(网格迷宫);右:Navigation 环境(连续导航)。

4.2 主要结果:元策略 vs 固定计算基线

平均回合回报(含行动和规划成本,越高越好):

环境元策略Always ReactShort PlanMedium PlanLong Plan
Box Push-24.3-133.0-306.1-44.7-59.8
DoorKey-25.1-135.2-126.7-27.2-32.0
Fetch-12.2-132.4-51.0-70.7-30.0
Maze-19.3-56.2-89.6-37.8-24.5
Navigation-39.6-140.8-41.2-45.4-46.9

元策略在所有5个环境中均达到最佳(或与最佳置信区间重叠)。Box Push 错误不可恢复,元策略学会避免反应控制和短规划;Fetch 收敛到75%以上反应控制,说明反应策略部分泛化但分布外仍需规划。

4.3 消融实验:元观测组件

逐一移除观测组件(平均回合回报):

移除组件Box PushDoorKeyFetchMazeNavigation平均
(完整)-24.3-25.1-12.2-19.3-39.6-24.1
Distance-20.9-34.3-12.5-19.7-41.2-25.7
History-110.7-26.1-21.1-19.1-40.7-43.5
Previous Action-36.3-29.1-12.1-19.3-37.9-27.0
Uncertainty-73.9-27.9-16.1-25.0-41.2-36.8

HistoryUncertainty 是最关键组件。移除 History 使 Box Push 恶化4.5倍、Fetch 恶化1.7倍——无法跟踪进展则难以判断反应策略是否朝目标移动。移除 Uncertainty 在 Box Push 和 Fetch 同样大幅下降——无法直接判断分布内/外。

4.4 环境特征影响

通过改变三个环境特征分析元策略行为:

  • 分布内任务比例:随分布内比例增加,元策略转向反应控制,反应动作比例约跟踪分布内比例。全分布内时收敛到全反应控制——元策略正确解释反应策略能力。
  • 规划成本 $\alpha$:随 $\alpha$ 增加元策略更多依赖反应控制。即使反应策略在分布外产生次优动作,避免规划节省的时间在某些情况下足以获得更好回报。短/中/长规划比例大致恒定——元策略学习何时规划而非规划多长。
  • 环境随机性 $\epsilon$:无噪声到低噪声($\epsilon=0.1$)反应比例从~45%升至~70%(长规划从~20%降至~5%)。长规划受噪声影响最大因误差在计划持续期内累积。高噪声时短/中规划略有增加——分布外状态仍有用。

4.5 联合训练:跟踪改进的反应策略

在 Box Push、DoorKey、Maze 上联合训练(因计算限制排除 Fetch、Navigation)。规划选项产生的状态-动作对加入回放缓冲区,每次 rollout 后行为克隆训练集成成员。随训练进行:

  • 元策略在所有环境中转向反应控制,最终收敛到全反应执行;
  • 反应不确定性信号收敛到低分歧——集成不确定性反映反应策略强度;
  • 这创建了一个学习课程:元策略在分布外状态调用规划(产生最佳即时奖励+生成训练数据),反应策略在分布外状态训练后不确定性降低,元策略识别反应策略能力增强并停止调用规划。

5. 局限与展望

  • 完美世界模型假设:方法假设规划器使用准确世界模型,现实设置中通常不成立。认知科学表明人类在决定是否规划时考虑模型不确定性,扩展到含状态不确定性的学习世界模型是自然下一步。
  • 单智能体静态环境:环境限制为单智能体且计划创建期间静止。扩展到含动态环境和中断执行计划将测试反应-规划权衡的泛化性。
  • 手工设计特征:元观测依赖手工特征。更表达性不确定性估计(贝叶斯或流方法)或学习观测表示可改善高维空间泛化。
  • 跟踪恶化反应策略:元策略能跟踪改进的反应策略,但能否跟踪恶化(容量不足或灾难性遗忘)是开放问题。
  • 更广泛应用:LLM 中快速单次生成 vs 慢速思维链推理的结构相似性;VLA 中快速轻量模型(机器人)vs 大型慢速模型(云)的结构。

6. 总结

本文提出了一种 RL 方法,通过元推理策略学习自适应计算分配。方法以反应策略不确定性和高级状态特征为条件,在快速反应选项和规划选项间选择——规划以时间为代价提升动作质量。在运动规划和导航任务套件上,元策略在时间到目标目标上优于所有固定计算启发式基线。消融确认反应不确定性和观测历史是元状态最关键组件。元策略能适应环境特征:增加规划成本将分配转向反应控制,增加分布内覆盖将分配移离规划。最后,以不确定性信号为条件使元策略在联合训练设置中能收敛到纯反应控制——反应策略持续学习时,元策略能跟踪其改进并相应调整。这些结果表明,高级状态和反应能力信号足以让元推理策略有效跨环境和训练体制分配计算。

智能不是总用最贵的方法,而是在对的时候用对的计算——一个集成不确定性分数就够了,让元策略学会"何时该停下来想一想"。