DreamerV3系列基于模型的强化学习智能体在任务序列训练时灾难性遗忘,即使无限回放缓冲区保存了所有早期经验。本文研究持续RL文献假设但从未测量的问题:哪个组件遗忘最严重?提出梦境复演方法。
多智能体强化学习中,智能体间通信在部分可观测下有效提升性能。基于表示学习的方法让去中心化智能体学习基于自身观测的消息,但仅依赖当前观测。Dreamer-CPC结合世界模型进行消息学习。
针对强化学习缺乏安全保证的问题,提出基于加速度的CBF-QP约束执行方法,确保腿式机器人和机械臂在安全边界内运行,应对分布外状态导致的部署失败。