Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型多智能体强化学习

Dreamer-CPC:基于世界模型的消息学习用于去中心化多智能体强化学习

多智能体强化学习中,智能体间通信在部分可观测下有效提升性能。基于表示学习的方法让去中心化智能体学习基于自身观测的消息,但仅依赖当前观测。Dreamer-CPC结合世界模型进行消息学习。

Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi2026年7月22日3 分钟阅读
EN

Dreamer-CPC:基于世界模型的消息学习用于去中心化多智能体强化学习

论文:Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning
链接:arXiv:2607.19809 | 基础:DreamerV3 + 集体预测编码(CPC) | 环境:Observer / CatchApple

一句话总结:将基于集体预测编码的消息学习集成到 DreamerV3 世界模型的 RSSM 中,每个智能体从反映历史观测和动作的潜在状态推断和交换消息,在观测暂时缺失的 CatchApple 任务上回报达 IPPO-CPC 的 4-5 倍。

研究背景与动机

在多智能体强化学习(MARL)中,智能体间通信对提升部分可观测下的性能有效。基于表示学习的方法使去中心化智能体能从自身观测学习消息,但这些方法仅依赖当前观测,无法传达随时间累积的信息。当任务相关信息被暂时遮挡或智能体必须基于对未来状态的预测行动时,仅用当前观测生成消息是不够的。

现有方法多采用集中训练去中心化执行(CTDE),通过集中优化框架耦合智能体。虽然这些方法提升了工程性能,但常偏离自然智能体中观察到的去中心化学习。集体预测编码(CPC)将符号涌现表述为智能体观测联合生成模型中的去中心化贝叶斯推断,为表示学习方法提供了理论基础。MARL-CPC 在变分推断框架内表述自编码器消息学习,证明即使在不共享奖励的非合作场景中也可涌现协调有用的消息。但这些方法都仅基于当前观测生成消息。

Dreamer-CPC 的核心思路:将 CPC 消息学习集成到从观测和动作历史学习潜在动力学的世界模型中,将消息学习扩展到当前观测之外。每个智能体从 DreamerV3 的 RSSM 潜在状态学习消息,使通信不仅基于当前观测还基于世界模型累积的历史观测和动作。

从相关工作看,世界模型在 MARL 中的应用主要通过想象轨迹提升样本效率,但这些方法都基于 CTDE 框架。Nomura 等提出去中心化世界模型,每个智能体维护基于 RSSM 的局部模型并通过 InfoNCE 损失学习消息,但其策略通过专家演示的行为克隆学习,不涉及强化学习。Dreamer-CPC 填补了这一空白——将去中心化世界模型与基于 CPC 的消息学习和强化学习策略训练结合,使每个智能体仅从自身观测和动作历史及通信消息学习。这与自然智能体中去中心化学习的观察更一致——生物群体中的通信不是通过集中优化而是通过个体间的局部交互和信息共享涌现的。

方法详解

1. 问题表述:部分可观测马尔可夫博弈

将多智能体强化学习表述为部分可观测马尔可夫博弈 $\mathcal{G}=\langle\mathcal{I},\mathcal{S},\{\mathcal{A}^{k}\},\{\mathcal{X}^{k}\},\mu_{0},p_{\text{tr}},p_{\text{obs}},\{\rho^{k}\},\gamma\rangle$。$\mathcal{I}=\{1,...,K\}$ 为智能体集,每个智能体 $k$ 根据策略 $\pi^k$ 用局部历史选择动作 $a_t^k$。给定联合动作 $a_t$,状态转移 $s_{t+1}\sim p_{\text{tr}}(\cdot|s_t,a_t)$,观测 $x_{t+1}\sim p_{\text{obs}}(\cdot|s_{t+1},a_t)$。智能体 $k$ 的折扣回报 $G_t^k=\sum_{\ell=0}^{\infty}\gamma^{\ell}r_{t+\ell}^k$,目标是最大化:

$$J^{k}(\pi^{k};\pi^{-k})=\mathbb{E}\left[G_{0}^{k}\right]$$

2. 世界模型:RSSM

每个智能体 $k$ 维护自己的世界模型,从局部观测和动作历史及接收的消息学习环境时间动力学。RSSM 有确定性循环状态 $h_t^k$ 和随机潜在状态 $z_t^k$。每步先从前一步状态和动作计算 $h_t^k=f_{\phi^k}(h_{t-1}^k,z_{t-1}^k,a_{t-1}^k)$,再从 $h_t^k$ 生成先验预测 $\hat{z}_t^k\sim p_{\phi^k}(\cdot|h_t^k)$,从 $h_t^k$ 和观测 $x_t^k$ 推断 $z_t^k\sim q_{\phi^k}(\cdot|h_t^k,x_t^k)$。从 $h_t^k$ 和 $z_t^k$ 预测观测、奖励和继续标志。

3. 消息模块与消息增强 RSSM

每个智能体 $k$ 维护循环消息模块,消息循环状态 $\xi_t^k$ 总结先前推断消息的历史。每步从上一步消息 $\mathbf{m}_{t-1}$ 更新 $\xi_t^k=g_{\psi^k}(\xi_{t-1}^k,\mathbf{m}_{t-1})$。消息 $m_t^k$ 随机建模:先验从 $\xi_t^k$ 生成 $\hat{m}_t^k\sim p_{\psi^k}(\cdot|\xi_t^k)$,后验从 $\xi_t^k$ 和 RSSM 状态条件化 $m_t^k\sim q_{\psi^k}(\cdot|\xi_t^k,h_t^k,z_t^k)$。

消息融入 RSSM 两个组件:联合预测消息 $\hat{\mathbf{m}}_t$ 馈入循环状态转移,联合推断消息 $\mathbf{m}_t$ 作为观测预测的条件变量:

$$h^{k}_{t}=f_{\phi^{k}}(h^{k}_{t-1},z^{k}_{t-1},a^{k}_{t-1},\hat{\mathbf{m}}_{t})$$

$$\hat{x}^{k}_{t}\sim p_{\phi^{k}}(\cdot|h^{k}_{t},z^{k}_{t},\mathbf{m}_{t})$$

为实现去中心化学习,Dreamer-CPC 对其他智能体生成的消息应用停止梯度,使每个智能体可用其他智能体消息进行预测而不通过其他智能体参数反向传播梯度。

Dreamer-CPC 框架

图1:Dreamer-CPC 框架。每个智能体从 RSSM 潜在状态推断消息并交换,接收的消息融入后续状态转移和观测预测。

4. 联合学习损失

世界模型和消息模块联合最小化统一损失。预测目标的边际对数似然通过变分推断分解,变分后验为:

$$q_{\phi^{k},\psi^{k}}(z_{1:T}^{k},m_{1:T}^{k})=\prod_{t=1}^{T}q_{\phi^{k}}(z_{t}^{k}|h_{t}^{k},x_{t}^{k})\,q_{\psi^{k}}(m_{t}^{k}|\xi_{t}^{k},h_{t}^{k},z_{t}^{k})$$

损失包含预测似然项和 KL 正则项,使先验逼近后验。

5. Actor-Critic 学习与想象中的消息交换

Actor $\pi_{\theta^k}$ 和 Critic $v_{\eta^k}$ 遵循 DreamerV3 的 actor-critic 学习程序。关键区别是想象轨迹生成中加入智能体间消息交换:每个想象步骤,每个智能体从世界模型状态推断消息并与其他智能体交换,接收的消息融入后续 RSSM 转移。Actor 和 Critic 损失在结果想象 rollout 上计算,停止梯度确保接收的消息在优化中被分离。

graph TD
  A[每个智能体的局部观测/动作历史] --> B[RSSM: h_t, z_t]
  B --> C[消息模块: ξ_t → m_t 后验]
  C --> D[交换消息: 接收其他智能体 m]
  D --> E[融入 RSSM 转移: h_t = f(h,z,a,m̂)]
  D --> F[观测预测: x̂ ~ p(h,z,m)]
  E --> G[想象轨迹生成 + Actor-Critic 训练]
  F --> G
  style C fill:#f5a623,stroke:#b97316,color:#fff
  style D fill:#4a90d9,stroke:#2c5f8a,color:#fff
  style G fill:#7ed321,stroke:#4a8a14,color:#fff

实验结果

Observer 环境

Observer 是非合作信息共享任务,全局状态可通过聚合所有智能体观测在每步准确推断。obs-shared 条件达到 IQM 53.63。在无直接观测共享的设置中,Dreamer-CPC 达到最高性能:$5\times 4$ 消息配置最终 IQM 39.85(95% CI [34.22, 40.82]),$20\times 1$ 配置 19.72。相比之下 IPPO-CPC 仅达 7.31($20\times 1$)和 6.81($5\times 4$),无通信的 IPPO 和 no-comm DreamerV3 分别为 1.74 和 0.48。这表明 Dreamer-CPC 即使在观测严重受限的非合作场景中也能学到大幅超越基线的信息传输。

方法Observer IQMCatchApple IQM
obs-shared DreamerV353.6338.21
Dreamer-CPC (5×4)39.8528.53
Dreamer-CPC (20×1)19.7220.47
IPPO-CPC (5×4)6.815.52
IPPO-CPC (20×1)7.314.98
IPPO (无通信)1.744.66
no-comm DreamerV30.485.93

CatchApple 环境

CatchApple 是新引入的任务,智能体观测在某些时间步暂时缺失——即使聚合所有智能体观测也无法准确推断全局状态。Agent 1 静止观测下落物体轨迹,Agent 2 控制地面捕捉器但无法直接观测物体未来着陆列。因 Agent 2 仅在捕捉决策后才能观测物体列,必须从 Agent 1 的消息预测未来着陆列并提前移动。Dreamer-CPC 达 IQM 28.53($5\times 4$)和 20.47($20\times 1$),是 IPPO-CPC(5.52/4.98)的 4-5 倍。IPPO-CPC 与无通信的 IPPO(4.66)和 no-comm(5.93)相当,表明仅基于当前观测的消息学习在观测缺失时完全失效。

学习曲线

图2:Observer 和 CatchApple 学习曲线。Dreamer-CPC 在两个环境中均大幅超越基线。

消息通道配置分析

消息配置Observer Dreamer-CPCCatchApple Dreamer-CPC观察
5×4 (四个独立5路)39.8528.53优于20×1,多样性更高
20×1 (单个20路)19.7220.47信息容量集中

$5\times 4$ 配置(四个独立 5 路独热消息)在两个环境中均优于 $20\times 1$(单个 20 路独热消息),表明多个独立消息通道比单个大词汇表消息更有效——这可能因为独立通道允许同时编码不同类型的信息维度,而非将所有信息压缩到单个离散符号中。

CatchApple 环境

图3:CatchApple 环境。Agent 1 观测下落物体,Agent 2 必须从消息预测着陆位置并提前移动。

从结果解读看,Dreamer-CPC 在两个环境中的优势有不同机制。在 Observer 中,全局状态可通过聚合观测推断,Dreamer-CPC 的优势在于比 IPPO-CPC 更有效地学习信息传输——世界模型的潜在状态压缩了历史信息使消息更信息丰富。在 CatchApple 中,观测暂时缺失使当前观测根本无法提供任务关键信息,IPPO-CPC 基于当前观测的消息完全失效,而 Dreamer-CPC 从世界模型潜在状态推断的消息包含了对未来状态的预测——Agent 2 从 Agent 1 的消息中获取的不只是当前观测而是对未来着陆位置的预测。obs-shared 上界的存在表明消息通信仍不如直接观测共享,但直接观测共享违背了去中心化通信的约束——在真实多智能体系统中,共享原始观测的带宽和延迟成本通常不可接受,而压缩的消息是更现实的通信方式。

联合动作空间

$$ \mathcal{A}=\prod_{k\in\mathcal{I}}\mathcal{A}^{k} $$

局限性

作者自述:实验仅在两个相对简单的网格世界环境中验证,更复杂连续控制场景的适用性未验证。

分析判断:Dreamer-CPC 的去中心化设计以同步消息交换为代价——每个想象步骤所有智能体必须同步推断和交换消息,这在智能体数量增多时可能成为瓶颈。停止梯度虽实现去中心化,但阻断了智能体间梯度信息的协同优化,可能限制消息质量的联合优化上限。世界模型和消息模块的联合训练增加了优化复杂度和超参数敏感性。每个智能体维护独立世界模型,在智能体数量多时计算和内存开销线性增长。CatchApple 中 4-5 倍优势的部分原因可能是 IPPO-CPC 的基线本身在观测缺失时完全失效——无通信基线也表现极低,使得相对优势看起来更大。obs-shared 上界(38.21)仍高于 Dreamer-CPC(28.53),表明消息通信仍不如直接观测共享有效。方法的非合作设定虽生物学上更合理,但在工程应用中合作场景下可能不如 CTDE 方法高效。

总结与展望

Dreamer-CPC 将基于集体预测编码的消息学习集成到基于 RSSM 的世界模型中。每个智能体通过循环消息模块学习随机消息,接收的消息用于预测观测、奖励和继续信号。通过对其他智能体消息应用停止梯度,方法实现去中心化学习而不引入智能体间直接梯度路径。实验表明 Dreamer-CPC 在非合作设置中超越 IPPO-CPC 和无通信基线,CatchApple 结果表明通过世界模型学习的通信可在观测暂时缺失时支持有效协调。从方法论角度看,核心贡献是将消息学习的基础从当前观测扩展到世界模型的潜在动力学——消息不再仅反映"现在看到了什么",而是反映"基于历史预测了什么"。这种时间维度的扩展使智能体能在当前观测不足时通过通信补偿,为去中心化多智能体系统在部分可观测环境中的协调提供了新范式。

从更广泛的角度看,Dreamer-CPC 的去中心化设计理念对实际多机器人系统具有启发意义——在通信带宽受限或延迟不可控的真实场景中,基于世界模型预测的压缩消息比原始观测共享更可行。停止梯度机制确保了每个智能体可独立训练和部署,无需集中协调器,这对分布式机器人系统的可扩展性和鲁棒性至关重要。未来工作可探索连续控制场景、更多智能体、异步消息交换以及消息内容的可解释性分析,进一步验证世界模型驱动通信在复杂现实任务中的有效性与实用价值,推动相关技术走向更成熟的实际应用与部署实践,具有积极的现实意义与参考价值,值得持续关注与深入的科学研究与探索实践应用,以期获得更全面深入的验证与推广应用实践,推动相关技术走向成熟发展,具有广阔的应用前景与重要的研究价值,值得持续投入研究与探索实践,推动技术持续进步与发展,为相关领域做出积极的贡献,具有长远的研究意义与重要的应用价值,值得关注。

消息的价值不在于传递"现在看到了什么",而在于传递"基于历史预测了什么"——当当前观测不足时,世界模型的潜在动态成为通信的信息源泉,这是 Dreamer-CPC 在观测缺失场景中成功的核心。

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日