Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型持续学习强化学习

世界模型记得,演员遗忘:用于持续基于模型强化学习的梦境复演

DreamerV3系列基于模型的强化学习智能体在任务序列训练时灾难性遗忘,即使无限回放缓冲区保存了所有早期经验。本文研究持续RL文献假设但从未测量的问题:哪个组件遗忘最严重?提出梦境复演方法。

Gurp Nijjer2026年7月22日2 分钟阅读
EN

世界模型记忆,演员遗忘:持续模型强化学习的梦境回放

论文:The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL

作者:Gurp Nijjer

机构:Quantegra Research, Canada

链接arXiv:2607.19749 | 代码GitHub


一句话总结

本文发现DreamerV3类模型在持续学习中遗忘的不是世界模型而是演员策略——世界模型保留了旧任务的所有可测知识(奖励判别、价值估计、终止结构),但策略梯度通道无法将其转化为行为。通过在训练中交替进行梦境自我模仿(对世界模型生成的想象轨迹评分后行为克隆前25%),实现了无需任务标签、无新增参数的持续学习器:3/3种子通过四任务链(普通回放0/3)和八任务链。


研究背景与动机

持续强化学习中的灾难性遗忘是核心挑战。标准方法通过正则化参数(EWC)、增长网络或回放历史数据来缓解。在模型强化学习(MBRL)中,回放方案有天然优势——世界模型在缓冲经验上训练,DreamerV3类代理配合不清空缓冲区是领域当前的工作答案。然而,这一路线有一个从未被检验的假设:"保护世界模型,策略自然会跟随"。

本文首次在组件级别检验了这一假设,发现前提的前半部分正确(世界模型确实保留一切),但后半部分错误(演员仍然遗忘)。遗忘在此场景中不是记忆问题,而是通道问题:策略梯度学习无法将想象中可用的准确训练信号转化为行为。

恢复竞赛

图1:恢复竞赛。在冻结世界模型上,梦境自我模仿(蓝)3/3种子恢复,RL-in-imagination(橙)0/3失败。


方法详解

1. 组件级遗忘诊断

在不清空回放的条件下,对最终链检查点进行组件级探测($n=3$种子),测量各组件对旧任务的保留:

奖励知识:判别力 $D = \text{mean}(\hat{r}_{\text{success}}) - \text{mean}(\hat{r}_{\text{zero}})$,保留比 $R = D_{\text{final}} / D_{\text{own-phase}}$:

$$ R = \frac{D_{\text{final}}}{D_{\text{own-phase}}} \approx 0.99/1.06/1.01 $$

奖励头从未遗忘。在退化策略自身访问的状态上 $D=0.87$(vs 策划集上0.90),信号在需要重教的地方完好。

价值估计:评论家在旧任务状态上的均值保持高位并跨阶段上升($0.84 \rightarrow 0.91$)。

终止模型:续行头在真实终止步的判别力0.95-1.0,包括最短任务阶段之后立即测量的结果。

表示漂移:冻结动作边际探测显示旧任务动作偏好退化(边际 $-0.25$ vs $+4.5$ 和 $+2.7$),潜空间确实漂移。共训练头跟踪漂移;冻结头在漂移下衰减;演员——共训练但通过RL通道——同样衰减。

2. 从世界模型 alone 恢复

冻结整个四任务运行最终世界模型,仅重训练漂移的演员。两个教师,相同起始,相同预算(20k更新),零新环境步:

RL-in-imagination(标准DreamerV3演员-评论家更新):0/3种子通过。一个种子达到0.84后振荡回0.38,一个坍塌到0.0,一个从未超过0.57。

梦境自我模仿(采样演员滚动想象轨迹,冻结奖励/价值头评分,行为克隆前25%):3/3种子通过($0.38 \rightarrow 0.85$,$0.66 \rightarrow 0.92$,$0.66 \rightarrow 0.85$)。

3. 梦境回放(Dream Rehearsal)

在每个任务阶段结束后,将其缓冲集作为回放起点;此后每2000环境步新任务训练后,对每个先前任务运行50次梦境自我模仿更新。想象轨迹评分使用realized-first规则,基于自模仿优势门控:

$$ \text{imitate if } (R - V(s))_+ > 0 $$

仅当实现回报超过评论家估计时才模仿。选择前25%的轨迹进行行为克隆,一个活演员贯穿全程,无需任务标签、无需冻结策略、无需路由器、无新增参数。

梦境回放算法

图2:梦境回放算法(一个训练块)。每2000步训练后对每个先前任务运行50次梦境自我模仿。

flowchart TD
    A["任务A训练阶段"] --> B["不清空缓冲区
保留所有经验"] B --> C["世界模型训练
保留旧任务知识"] C --> D["任务B训练阶段"] D --> E["每2000步: 梦境回放"] E --> F["从旧任务状态想象
当前演员采样滚动H=15步"] F --> G["realized-first评分
(R-V(s))+ 优势门控"] G --> H["行为克隆前25%轨迹
更新同一个演员"] H --> D H --> I["所有任务保留
3/3种子通过"] style C fill:#e1f5fe style E fill:#fff3e0 style I fill:#e8f5e9

实验结果

四任务链结果

表1:四任务链各种子最终保留率
种子DoorKeySimpleCrossingLavaGapMultiRoom通过
10.9600.8680.8990.751
20.9610.7510.9440.800
30.9640.8250.7840.768

梦境回放3/3种子通过全部四任务。普通回放0/3(最难题SimpleCrossing仅0.37)。隔离参考(冻结头+路由器)3/5。

八任务链结果

表2:八任务链各种子最终保留率
种子DoorKey5SimpleXLavaGapMultiRmLavaCrossDistShiftDoorKey6Unlock
10.9640.9430.9470.7590.8610.9600.9150.861
20.9630.9190.9430.7460.8650.9290.9620.888
30.9010.8760.9420.7540.7940.9590.9620.740

所有3种子通过全部八任务。八任务中七个任务的跨种子范围$\leq 0.07$,展现出高度稳定性。预期中的回放稀释(早期任务随任务增多而下降)未出现。

梦境 vs 真实回放对比

与匹配的真实回放克隆(CLEAR风格)对比,梦境回放的配对差异+0.13,bootstrap 95% CI [0.07, 0.24],完全种子分离。梦境轨迹比真实回放更优,因为想象不受真实终止约束且能探索策略改进后的新轨迹。

四任务对比

图3:四任务链最终保留率对比。普通回放、隔离参考、梦境回放三种方法。

评分规则

图4:梦境评分规则分析。两种评分失败模式及realized-first修复。

八任务扩展

图5:八任务链扩展结果和稳定性分析。


梦境评分的两种失败模式

论文发现两种评分失败模式并提出了realized-first修复规则。第一种是"评论家乐观偏差"——评论家对想象的乐观估计使得低质量轨迹获得高优势分数,导致克隆了不应克隆的轨迹。第二种是"终止不感知"——想象轨迹不自然终止于真实结局,使得超长的幻觉轨迹被错误评分。realized-first规则的核心是仅使用已实现(realized)的回报而非预测回报进行评分,其选择纯度在两个任务上均达到AUC 1.0和top-quartile purity 1.0。

评分函数定义为想象轨迹$ au$的已实现回报与评论家状态价值的差:

$$ ext{score}( au) = \sum_{t=0}^{H} \gamma^t \hat{r}_t - V_\phi(s_0) $$

其中$\hat{r}_t$为世界模型奖励头在想象步$t$的预测奖励,$\gamma$为折扣因子,$V_\phi(s_0)$为评论家对初始状态的值估计,$H=15$为想象时域。仅当$ ext{score}( au) > 0$时该轨迹被纳入候选池,最终选择前$q=25\%$进行行为克隆。

终止感知的bootstrap通过续行头$c_\phi(s_t)$加权未来奖励:

$$ ext{score}_{ ext{term-aware}}( au) = \sum_{t=0}^{H} \left(\prod_{k=0}^{t-1} c_\phi(s_k) ight) \gamma^t \hat{r}_t - V_\phi(s_0) $$

这种终止感知设计确保想象中的"幻觉延续"(在真实应终止的状态后继续想象)不会贡献虚假回报。reach-probability加权进一步调整了每个想象步的贡献,使得在不确定的想象区域中生成的奖励被适当降权。

行为克隆损失为对选定高质量轨迹的动作进行监督学习:

$$ \mathcal{L}_{ ext{clone}} = - rac{1}{|\mathcal{B}_{ ext{top}}|} \sum_{ au \in \mathcal{B}_{ ext{top}}} \sum_{t=0}^{H} \log \pi_ heta(a_t | s_t) $$

其中$\mathcal{B}_{ ext{top}}$为评分前25%的轨迹集合,$\pi_ heta$为当前演员策略。该损失仅更新演员参数$ heta$,世界模型和评论家保持正常训练不受影响。

计算开销分析

梦境回放在四任务时增加约15%计算开销(每2000步训练后50×3=150次更新),在八任务时增加约350次更新/块。然而,由于后续任务的采集加速(如LavaGap在链中8-10k步学会,而非单独学习需要的更多步),整体训练时间在$n=8$时实际与无回放相当。回放开销随任务数线性增长,但采集加速部分抵消。所有实验使用单一工作站,8×A100 80GB GPU,训练时间在可接受范围内。

局限性

  1. 规模限制:实验在MiniGrid尺度上进行,世界模型仅17M参数,一个任务排序 per 链长度。$n=3$低于规模研究中常见的5-10。
  2. 回放开销线性增长:梦境回放计算随任务数线性增长(八任务时约350次更新/2000步块),虽然采集加速部分抵消,但超大规模任务链可能不可持续。
  3. 任务筛选偏差:八任务链中排除了无法在贪婪探索下自举的长时序稀疏任务,报告为"采集前沿"而非通用保证。

总结与展望

本文揭示了持续MBRL中遗忘的本质是通道问题而非记忆问题——世界模型保留一切,策略梯度通道无法转化。梦境回放通过监督自我模仿通道绕过RL通道的不稳定性,在四任务和八任务链上实现3/3全通过,无需任务标签或新增参数。所有实验预注册,每个被否定的假设都被报告。

金句:「世界模型记住了,演员遗忘了——遗忘不是记忆问题而是通道问题。策略梯度无法将想象中完好的训练信号转化为行为,但监督自我模仿可以,梦境回放正是这一洞察的直接应用。」

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日