Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

步态优化强化学习SAC

FastDSAC:通过约束探索增强策略可塑性实现可扩展人形运动

对目标动作施加均值中心 tanh 截断映射,仅用于 Bellman 备份中目标 Q 值计算,用变量替换推导一致熵项——减少极端目标动作方差放大,在 MuJoCo Playground 和 HumanoidBench 上实现更快更可靠的离策略 RL 训练。

Guanchen Lu, Yajuan Dun, Yi Zhou, Letian Tao, Jingliang Duan, Jie Li, Guofa Li2026年6月30日3 分钟阅读
EN

FastDSAC:通过约束探索增强策略可塑性实现可扩展人形运动

论文:FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion
作者:重庆大学 / 清华大学 / 北京科技大学团队
链接:arXiv:2606.31691 | 代码:github.com/luge66/FastDSAC | 基准:MuJoCo Playground + HumanoidBench

一句话总结:针对高吞吐量并行采样下离策略值方法的不稳定性,提出均值中心截断高斯约束目标动作,过滤极端动作降低 TD 目标方差,同时保持探索随机性,在人形运动任务上实现更快收敛和更高渐近性能。

研究背景与动机

可扩展强化学习推动了高吞吐量采样架构的普及,显著压缩了离策略方法在机器人运动中的训练时间。然而数据量和更新频率的快速增加削弱了基于值方法的稳定性,并降低了策略网络的可塑性。大规模并行仿真在单工作站上实现了海量并行 rollout,使墙钟效率和快速迭代成为机器人强化学习的一等目标。PPO、SAC、TD3 等常用管线越来越在高吞吐量训练体制下评估和优化。

核心问题源于目标 Q 值估计的不准确。在离策略 actor-critic 方法中,目标 Q 值用目标 Q 网络估计。高吞吐量训练时,大批量增加了从目标策略采样的目标动作数量,使极端低概率动作更可能出现,产生更高方差的目标 Q 值估计和 TD 误差。这种方差增加破坏 critic 学习稳定性并可能减缓策略改进。此外,激进的梯度更新导致策略可塑性丧失——网络失去适应新数据的能力。

现有方法如 Parallel Q-Learning 研究了分布 critic 的扩展,但依赖异步并行。FastSAC 等可扩展离策略方案虽启动快但后期学习不稳定。FastDSAC 的核心思路:解耦探索与目标 Q 值估计,仅在目标 Q 网络形成 TD 误差时对目标动作施加正则化约束——用均值中心截断高斯过滤极端目标动作,同时保留温和的探索随机性。

从相关工作看,大规模并行仿真使墙钟效率和快速迭代成为一等目标。MuJoCo Playground 简化了基于 MJX 的单 GPU 快速实验训练,HumanoidBench 引入了高维动作的全身任务暴露可扩展性瓶颈。Parallel Q-Learning 研究了分布 critic 的扩展但依赖异步并行。FastSAC 等可扩展离策略方案虽启动快但后期学习不稳定。现有快速强化学习方法多依赖离散值分布,而 FastDSAC 使用配备自适应方差调节的连续高斯表示,通过采样自信且信息丰富的转移提升值估计精度。这一区别使 FastDSAC 在保持快速收敛的同时实现更稳定的渐近性能。

方法详解

1. 高斯策略参数化

策略网络输出对角高斯分布的均值 $\mu_{\phi}(s)$ 和标准差 $\sigma_{\phi}(s)$,即 $\pi_{\phi}(a|s)\sim\mathcal{N}(\mu_{\phi}(s),\sigma_{\phi}^{2}(s))$。重参数化技巧使梯度可回传:

$$a=\mu_{\phi}(s)+\sigma_{\phi}(s)\odot\epsilon,\quad\epsilon\sim\mathcal{N}(0,I)$$

相比常用的 tanh 压缩参数化,该设计有两个优势:避免动作接近边界时 tanh 导致的梯度消失;避免 tanh 压缩引起的对数似然修正的数值问题。策略均值 $\mu_{\phi}(s)$ 约束在 $[m_{\min},m_{\max}]$ 内防止早期训练中过大均值动作,标准差 $\sigma_{\phi}(s)$ 约束在 $[\ell_{\min},\ell_{\max}]$ 内保持良好控制。

2. 均值中心截断目标动作

给定下一状态 $s'$,先采样预截断动作:

$$u^{\prime}=\mu_{\phi}(s^{\prime})+\sigma_{\phi}(s^{\prime})\odot\epsilon,\quad\epsilon\sim\mathcal{N}(0,I)$$

然后通过均值中心截断映射获得目标动作:

$$a^{\prime}=\mu_{\phi}(s^{\prime})+c\,\tanh\!\big(u^{\prime}-\mu_{\phi}(s^{\prime})\big)$$

逐元素 $\tanh(\cdot)$ 平滑压缩偏移 $u'-\mu_{\phi}(s')$,使 $a'-\mu_{\phi}(s')$ 的每个分量严格约束在 $[-c,c]$ 内。相比硬截断,该映射连续且避免边界不连续,使目标评估更平滑。此映射仅在下一状态评估目标 Q 值 $Q_{\theta'}(s',a')$ 时应用。

FastDSAC 框架总览

图1:FastDSAC 框架。均值中心截断仅在目标 Q 值评估时约束目标动作,探索动作不受影响。

3. 诱导分布的对数概率

因目标 Q 值在截断动作 $a'$ 处评估,熵项需使用对应诱导动作分布的对数概率。通过变量变换规则:

$$\log\pi_{\phi}(a^{\prime}|s^{\prime})=\log\pi_{\phi}(u^{\prime}|s^{\prime})-\log\!\left|\det\!\left(\frac{\partial a^{\prime}}{\partial u^{\prime}}\right)\right|$$

雅可比行列式为截断映射导数的乘积,保证熵项与约束后的目标动作一致。

4. Critic 与 Actor 更新

目标回报用最小 Q 值构建:

$$y=r+\gamma\big(Q_{\theta^{\prime}}^{\min}(s^{\prime},a^{\prime})-\alpha\log\pi_{\phi}(a^{\prime}|s^{\prime})\big)$$

Critic 损失在高斯参数化下最大化 $y_z$ 的似然:

$$J_{Z}(\theta)=\mathbb{E}\!\left[\frac{(y_{z}-Q_{\theta}(s,a))^{2}}{2\sigma_{\theta}^{2}(s,a)}+\log\sigma_{\theta}(s,a)\right]$$

Actor 通过最大化评论家均值目标学习:

$$J_{\pi}(\phi)=\mathbb{E}\!\left[Q_{\theta}(s,a)-\alpha\log\pi_{\phi}(a|s)\right]$$

熵温度 $\alpha$ 通过目标熵 $\mathcal{H}^{\text{target}}$ 自适应调节。

熵温度 $lpha$ 的自适应更新目标为匹配目标熵 $\mathcal{H}^{ ext{target}}$:

$$lpha\leftarrowlpha- abla_{lpha} rac{1}{|B|}\sumig(\mathcal{H}^{ ext{target}}-\mathcal{H}(s)ig)\cdotlpha$$

该更新使 $lpha$ 自动调节探索强度——当策略熵低于目标时增大 $lpha$ 鼓励探索,高于目标时减小 $lpha$ 收敛策略。

5. 连续高斯分布 Critic 的优势

与依赖离散值分布(固定区间)的 FastTD3 和 FastSAC 不同,FastDSAC 采用连续高斯分布 critic,其方差 $\sigma_{ heta}(s,a)$ 由网络自适应学习。这提升了值估计精度并减少认知不确定区域中的过度自信更新,在交互期间保留更多高回报转移。转移奖励分析显示 FastDSAC 在数据收集期间达到比所有基线更高更稳定的转移奖励 $r$,表明探索更一致地导向高回报行为且更少受极端值影响。两个设计选择共同贡献:自适应方差 critic 提升值估计精度,均值中心截断降低目标方差稳定 Q 值学习——两者协同使策略更新更可靠一致。

graph TD
  A[采样探索动作 a ~ N(μ,σ²)] --> B[环境交互 + 存入回放缓冲]
  B --> C[从缓冲采样小批量]
  C --> D[目标动作: a' = μ + c·tanh(u'-μ)]
  D --> E[目标Q值: y = r + γ(Q'min - α·logπ')]
  E --> F[更新Critic: 最小化TD误差]
  F --> G[更新Actor: 最大化Q-α·logπ]
  G --> H[更新熵温度α]
  H --> I[软更新目标网络]
  style D fill:#f5a623,stroke:#b97316,color:#fff
  style E fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style F fill:#7ed321,stroke:#4a8a14,color:#fff

实验结果

样本效率与时间效率

在 MuJoCo Playground 四个运动任务上,PPO 作为在策略基线改进缓慢且收敛于明显更低回报。FastSAC 启动极快但后期不稳定,出现可塑性降低迹象导致最终回报较低。FastTD3 和 DSAC-T 曲线稳定但改进更渐进。FastDSAC 结合快速早期增长和稳定后期学习,在所有四任务上达到最高最终回报。在更具挑战性的 G1JoystickRoughTerrain 上,FastDSAC 匹配 FastSAC 的早期进度但持续改进而无后期回退。墙钟时间方面,FastDSAC 与 FastTD3/DSAC-T 相当,且比 FastTD3 更早达到更高回报。

方法早期收敛后期稳定性最终回报墙钟效率
PPO低平台最低最慢
FastSAC最快不稳定/回退较低较快但延迟高
FastTD3渐进稳定中等与FastDSAC相当
DSAC-T渐进稳定中等偏低与FastDSAC相当
FastDSAC稳定无回退最高最优权衡

转移奖励分析是理解 FastDSAC 行为的关键诊断。在数据收集期间,FastDSAC 达到比所有基线更高更稳定的转移奖励,表明探索更一致地导向高回报行为。这与目标 Q 值方差降低直接相关——更稳定的目标使 critic 学到更准确的值函数,进而引导 actor 产生更高质量的探索动作。FastSAC 虽早期转移奖励高但后期下降,反映其 critic 在极端目标动作影响下学到的值函数逐渐偏离。FastTD3 和 DSAC-T 转移奖励更稳定但整体偏低,反映其改进较渐进。这种转移奖励与学习曲线的一致性验证了均值中心截断通过稳定值学习间接改善探索质量的作用机制。

跨基准泛化与鲁棒性

在 HumanoidBench 六个运动任务上,FastSAC 表现弱且不一致。FastDSAC 跨任务保持竞争力,学习行为更稳定,更好保持训练过程中的可塑性。FastDSAC 与 FastTD3 相当或更优,两者大幅超越 DSAC-T。动力学扰动测试中,修改质量参数和地面摩擦系数后,机器人保持稳定自然协调的行走步态,无显著姿态退化,提供策略可容忍动力学扰动的初步定性证据。

学习曲线对比

图2:MuJoCo Playground 四任务环境步学习曲线。FastDSAC 结合快速早期增长与稳定后期学习。

消融实验:截断半径 c 的影响

截断半径 $c\in\{10^{-2},10^{-3},10^{-4}\}$ 主要影响早期学习速度而最终回报相对接近。较大 $c$ 使映射更宽松保留更多目标动作变异性,可加速早期学习;较小 $c$ 产生更保守目标动作,减缓早期进度。简单环境 $c=10^{-3}$ 更好地抑制极端目标动作;复杂环境 $c=10^{-2}$ 保留额外变异性以适应复杂动力学。$c=10^{-3}$ 为稳健默认值。

消融实验:目标动作选择

对比三种目标动作选择:均值中心截断映射 $a'$、原始高斯样本 $u'$ 和确定性策略均值 $\mu_{\phi}(s')$。均值中心截断产生最佳学习行为,简单地形差异小但复杂地形差异显著。高斯样本具竞争力但复杂地形早期更慢。确定性均值表现最差,因移除随机性限制目标动作多样性并削弱探索覆盖。

截断半径敏感性

图3:截断半径 c 敏感性分析。c 在实际范围内仅适度敏感,主要影响早期学习速度。

目标动作选择早期收敛复杂地形表现最终回报
均值中心截断 a'最佳最高
原始高斯样本 u'具竞争力早期较慢中等
确定性均值 μ(s')最慢最差最低

这表明保留一定随机性对目标评估有益——完全确定性的均值丧失目标动作多样性和探索覆盖,而完全无约束的高斯样本增加方差。均值中心截断在两者间取得平衡:保留温和随机性同时限制极端值。

局限性

作者自述:结果虽表明在激进优化下改进了鲁棒性,但仅提供网络可塑性保持的间接行为证据。未来工作将引入可塑性专用诊断、表示级分析、定性行为评估和 sim-to-real 实验。

分析判断:均值中心截断虽有效降低目标 Q 值方差,但截断半径 $c$ 仍需手动调整或对数扫描,缺乏自适应机制。方法仅在目标 Q 值评估时约束动作,未解决探索策略本身的潜在问题。高斯分布 critic 虽比离散分布更准确,但在高维动作空间中方差估计的可靠性未充分验证。实验仅限仿真,sim-to-real 迁移未验证。可塑性丧失的机制分析不足——截断约束如何具体影响网络梯度和表示的动态尚需更深入研究。与最新大规模训练方法的系统性对比有限,且在策略方法在新基准上的表现可能随架构改进而变化。

总结与展望

FastDSAC 是一种轻量方法,用于稳定大规模并行采样和大批量更新下的熵正则化离策略强化学习。它将均值中心截断变换仅应用于 Bellman 备份中的目标动作,并用变换后动作分布诱导的对数概率计算熵项。通过限制极端目标动作的影响,FastDSAC 以可忽略的计算开销提升训练稳定性。实验表明其在 MuJoCo Playground 和 HumanoidBench 上实现更快更可靠的学习,后期性能回退更少,在高更新数据比下保持有效。消融研究验证了约束目标动作的重要性,在实用截断半径范围内鲁棒,并确认同一机制也使 SAC 受益。从方法论角度看,解耦探索与目标评估的核心思想——探索时保持完全随机性,目标评估时施加约束——为高吞吐量离策略学习的稳定性-可塑性权衡提供了新范式与实用解决方案,具有重要的方法论意义与工程参考价值,值得在更多任务和真实硬件上持续验证与拓展应用实践,推动相关技术走向成熟与广泛应用,具有积极的现实意义与参考价值,值得关注与深入的科学研究与探索实践应用。

探索要大胆,但评估要保守——把激进留给环境交互,把克制注入 TD 目标,这是 FastDSAC 在高吞吐量训练中兼顾稳定与可塑的关键洞察。

相关论文