PAPER DEEP DIVE
基于层次化动作分块的离线强化学习
本文研究层次化动作分块在离线强化学习中的应用,通过将动作序列分组为层次化块结构,提升离线RL的效率和稳定性,面向人形机器人控制。
1. 论文概览
这篇论文提出了 HiQC(Hierarchical Implicit Q-Chunking,层次化隐式 Q 分块)——一个离线目标条件强化学习算法,通过双重时间分解来对抗"地平线诅咒"(curse of horizon)。在离线目标条件 RL 中,从静态数据集中学习通用策略是一个诱人的目标,但扩展到长视野任务仍然困难——TD 学习中的价值估计偏差会通过长长的 Bellman 自举链不断累积,导致远距离目标的价值估计不可靠。
HiQC 的核心思想是将高层潜在规划与低层动作分块结合:高层规划器在潜在空间中预测子目标,低层控制器执行长度为 $k$ 的动作块。通过让低层评论家(critic)基于完整动作块进行无偏 $k$ 步价值备份,HiQC 同时压缩了规划层和执行层的地平线。在 OGBench 基准上,HiQC 取得了所有对比方法中最高的综合性能,在 humanoid-giant 等长视野导航任务上优势尤为显著。

2. 问题背景与动机
离线 RL 通过从静态数据集中推导最优策略,避免了昂贵的在线交互。但成功的主要障碍是地平线诅咒:流行的离线 RL 算法依赖 TD 学习,最小化价值估计与自举 Bellman 目标之间的误差。在离线设置中,对分布外动作的外推误差会引入偏差,随着任务地平线增加,这些偏差通过长链递归 Bellman 备份不断复合,使远距离目标的价值估计不可靠。
现有方法各有不足:
- n 步回报可以缓解偏差累积,但随着 $n$ 增大,方差也增大——尤其在随机环境中或数据分布偏离策略时。
- 层次化 RL(HRL)通过将任务分解为高层子目标序列来减少地平线,但标准层次结构依赖执行单动作到达子目标的低层策略,低层策略在子目标持续时间内仍受地平线诅咒影响。
- 动作分块在模仿学习中生成时间一致的动作序列,在 TD 学习中允许评论家在块长度上进行无偏 $n$ 步备份,但只能将地平线减少常数因子,对长视野任务可能不足。
HiQC 的关键洞察是:单独的层次化或单独的分块都不够——需要双重地平线缩减。
3. HiQC 方法详解
3.1 双层架构

HiQC 采用两层时间分解:
graph TB
A["任务目标 g"] --> B["高层规划器
潜在空间规划"]
B --> C["子目标 z
间隔c步"]
C --> D["低层控制器
动作分块"]
D --> E["动作块 a
长度k步"]
E --> F["环境执行"]
F --> D
F --> B
高层规划器每隔 $c$ 步在潜在空间中预测子目标 $z$,低层控制器执行长度为 $k$ 的动作块到达子目标。关键设计是低层评论家基于完整动作块进行无偏 $k$ 步价值备份,而非单步备份。
3.2 高层价值函数
高层价值函数通过隐式 V-Learning 训练,使用 $c$ 步回报:
$$V_H(s) = \mathbb{E}\left[\sum_{t=0}^{c-1} \gamma^t r_t + \gamma^c V_H(s_{c})\right]$$
高层每 $c$ 步自举一次,将地平线从 $T$ 压缩到 $T/c$。高层策略通过 Advantage-Weighted Regression(AWR)学习子目标预测:
$$\pi_H(z \mid s, g) \propto \exp\left(\alpha_H \, A_H(s, z, g)\right)$$
其中 $A_H$ 是高层优势函数,$\alpha_H$ 是温度参数。子目标 $z$ 在学习的潜在空间 $\phi(s)$ 中表示。
3.3 低层动作分块评论家
低层评论家是 HiQC 的核心创新——它执行 $k$ 步 Bellman 备份而非单步:
$$Q_L(s, \mathbf{a}_{0:k}) = \mathbb{E}\left[\sum_{t=0}^{k-1} \gamma^t r_t + \gamma^k Q_L(s_k, \mathbf{a}'_{0:k})\right]$$
其中 $\mathbf{a}_{0:k}$ 是长度为 $k$ 的动作块。由于动作块中所有动作都来自数据集(离线设置),这个 $k$ 步备份是无偏的——不引入分布外动作的外推误差。低层策略通过 AWR 在动作块空间上学习:
$$\pi_L(\mathbf{a}_{0:k} \mid s, z) \propto \exp\left(\alpha_L \, A_L(s, \mathbf{a}_{0:k}, z)\right)$$
低层策略使用 Conditional Flow Matching(CFM)参数化,而非标准高斯策略,能更好地捕捉轨迹数据中固有的多模态分布。
3.4 理论分析:自举链界限
论文在每步备份误差为 $\epsilon$ 的有界模型(假设 1)下推导了价值误差界限。对于标准 HIQL,$T$ 步任务的高层需要 $T/c$ 次备份(贡献 $T/c \cdot \epsilon_H$),低层每次子目标间隔需要 $c$ 次单步备份(贡献 $c \cdot \epsilon_L$):
$$\mathcal{E}_{\text{HIQL}}(T, c) \leq \frac{T}{c}\,\epsilon_H + c\,\epsilon_L$$
HiQC 的低层使用 $k$ 步块备份,每次子目标间隔只需 $c/k$ 次块备份:
$$\mathcal{E}_{\text{HiQC}}(T, c, k) \leq \frac{T}{c}\,\epsilon_H + \frac{c}{k}\,\epsilon_L$$
优化 $c$ 后,最小误差界限为:
$$\min_c \mathcal{E}_{\text{HiQC}} \leq 2\sqrt{\epsilon_H \epsilon_L}\,\sqrt{\frac{T}{k}} = \mathcal{O}\!\left(\sqrt{\frac{T}{k}}\right)$$
而 HIQL 的最优界限为 $\mathcal{O}(\sqrt{T})$。分块将低层备份次数从 $c$ 降至 $c/k$,使缩放从 $\mathcal{O}(\sqrt{T})$ 改善到 $\mathcal{O}(\sqrt{T/k})$。
4. 实验结果
4.1 OGBench 主要结果


| 任务 | BC | QC | DQC | CRL | GCIQL | HIQL | HiQC |
|---|---|---|---|---|---|---|---|
| antmaze-large | 27 | 0 | 35 | 81 | 32 | 88 | 93 |
| antmaze-giant | 0 | 0 | 1 | 14 | 0 | 68 | 68 |
| humanoid-large | 1 | 0 | 1 | 17 | 1 | 34 | 42 |
| humanoid-giant | 0 | 0 | 0 | 4 | 0 | 10 | 33 |
| pointmaze-large | 29 | 15 | 62 | 36 | 29 | 47 | 87 |
| pointmaze-giant | 1 | 0 | 35 | 33 | 1 | 44 | 80 |
| cube-triple | 1 | 0 | 8 | 4 | 1 | 3 | 9 |
| scene-play | 5 | 3 | 76 | 22 | 47 | 41 | 65 |
| puzzle-4x6 | 0 | 0 | 16 | 5 | 5 | 4 | 1 |
| 总体 | 7 | 2 | 26 | 23 | 13 | 42 | 53 |
关键发现:
- 长视野导航优势显著:在 humanoid-giant 上,HiQC 达 33% 而 HIQL 仅 10%,扁平方法几乎完全失败。在 pointmaze-giant 上 HiQC 达 80%。
- antmaze-giant 持平 HIQL:两者均 68%,因为 antmaze 使用最小块大小 $k=2$,限制了地平线压缩量。
- 操作任务结果混合:HiQC 在 cube-triple 上最好(9%),在 scene-play 上第二(65%),但 DQC 在 puzzle-4x6(16% vs 1%)和 scene-play(76% vs 65%)上优于 HiQC。
- 综合最高:HiQC 总体成功率 53%,超过 HIQL(42%)和 DQC(26%)。
4.2 消融研究

流匹配 vs 高斯策略:CFM 策略在 9 个环境中一致取得更高成功率,验证了流匹配更好地捕捉多模态分布,防止高斯策略的"平均化"伪影破坏时间扩展动作。
块大小敏感性:随着 $k$ 增大,性能先提升后趋于稳定;$c$ 的选择也影响性能,需要在高层规划频率和低层执行精度间权衡。
| 任务域 | 子目标步数 c | 块大小 k | 期望值 τ |
|---|---|---|---|
| pointmaze-* | 25 | 5 | 0.5 |
| antmaze-* | 25 | 2 | 0.5 |
| humanoidmaze-* | 100 | 5 | 0.5 |
| cube-* | 10 | 5 | 0.93 |
| scene-* | 10 | 5 | 0.9 |
| puzzle-* | 10 | 5 | 0.9 |
5. 局限性与不足
- 理论模型简化:自举链模型抽象了函数近似、采样误差和两层间交互,假设 1 在深度神经网络表示价值时可能不均匀成立。理论应视为直觉而非端到端保证。
- 操作任务劣势:在 puzzle-4x6 上仅 1%(DQC 达 16%),HiQC 的潜在子目标瓶颈可能无法编码离散物体状态(如拼图按钮状态)。
- 训练稳定性:scene-* 任务需要降低学习率($10^{-6}$)和特殊设置才能稳定训练,表明分块低层评论家在这些领域更难优化。
- 块大小选择:antmaze 使用 $k=2$ 限制了压缩量,最优 $k$ 和 $c$ 的选择依赖领域知识,缺乏自动化方法。
- 仅离线评估:未评估在线微调或 sim-to-real 迁移能力。
6. 总结
HiQC 的核心贡献在于证明了双重时间分解——在规划层用层次化子目标、在执行层用动作分块——能有效对抗离线目标条件 RL 中的地平线诅咒。通过让低层评论家基于完整动作块进行无偏 $k$ 步备份,HiQC 将价值传播的递归深度从 $\mathcal{O}(\sqrt{T})$ 压缩到 $\mathcal{O}(\sqrt{T/k})$。在 OGBench 上总体成功率 53%,长视野导航任务 humanoid-giant 从 10% 提升到 33%。
但优势集中在长视野导航,操作任务上 DQC 的解耦评论家地平线设计更优。这提示未来工作可探索将 HiQC 的层次结构与 DQC 的解耦评论家地平线结合,以及自动化超参数选择。论文诚实地承认理论分析是结构性直觉而非端到端保证,操作任务的劣势可能源于潜在子目标的信息瓶颈。



