Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型World Model生成式

持久计算状态:生成式世界模型的会话运行时

生成式世界模型日益作为模拟器使用,本文提出以会话为中心的持久计算状态运行时。

Zhen Lin2026年7月23日3 分钟阅读
EN

持久计算状态:面向生成式世界模型的会话中心运行时

论文:Persistent Computational State: A Session-Centric Runtime for Generative World Models

作者:Zhen Lin

链接arXiv:2607.21686


一句话总结

本文揭示当前视频世界模型在"离开-返回"场景中失败的根本原因不是模型缺陷而是运行时丢弃了不可重算的状态——通过定义持久计算状态(PCS)为跨请求存活的最小不可重算状态子集,构建会话中心运行时实现检查点/恢复/分叉,检查点恢复成本仅 0.012 ms(对比 1.85 s 生成步),在三个架构完全不同的模型上逐字节复现从未离开的续行,并将驻留会话从设备绑定提升至主机绑定(实测到 1024 个会话)。


研究背景与动机

生成式世界模型越来越多地被用作模拟器:规划器分叉一个状态、展开候选未来、回溯并返回先前访问过的视角。两个大规模 2026 基准——MBench(14 个模型,12 个记忆子维度)和 WRBench(23 个模型,9600 个视频,2547 个人类判定)——独立确立当前视频世界模型在此用途上失败:场景不返回先前配置,离开视野的目标不以与世界一致的方式回来。两个基准都将失败归因于模型,并开出模型侧药方:记录隐藏变化的记忆和监督它的训练目标。

本文证明这一归因不完整,对一类重要模型根本错误。关键实验:快照运行时已持有的两个对象——对马尔可夫模型是一个观测(存为 uint8)加 RNG 状态,对非马尔可夫模型是记忆库——在真实偏移后恢复它,在三个架构毫无共同点的模型上逐字节复现从未离开的续行;仅破坏 RNG 则导致退化。能力从未缺失:请求中心服务丢弃了它,继承了语言模型服务中"运行时状态可重算"的假设——但世界模型状态携带不可重算的内核。

请求中心vs会话中心

图1:请求中心 vs 会话中心。左:请求→生成→结束,状态在边界丢弃,返回时轨迹断裂。右:会话→检查点→分叉→恢复,状态跨请求持有,轨迹存活。


持久计算状态(PCS)定义

令世界轨迹为 $\tau = (o_0, a_1, o_1, a_2, o_2, \ldots)$,其中每个观测 $o_t$ 由模型 $M$ 从动作 $a_t$ 和运行时状态 $H_t$ 产生:$o_t = M(a_t, H_t)$,$H_{t+1} = \mathrm{update}(H_t, a_t, o_t)$。$H_t$ 是下一步读取的一切的并集:KV 块、潜在缓存、循环激活、采样 RNG 流、最后观测。轨迹仅在 $H_t$ 被忠实前传时才良好定义。

PCS 定义为满足语义续行约束的最小不可重算状态子集:

$$ \mathrm{PCS}(M)=\arg\min_{S\subseteq H}|S|\ \text{ s.t. }\ D(\mathrm{continue}(\mathrm{restore}(S)),\mathrm{oracle})\leq\epsilon $$

其中 $\mathrm{oracle}$ 为从未离开的续行,$D$ 为语义距离(返回一致性度量),$\epsilon=0$ 意为逐位精确。三个性质由此推出:最小性(无真子集充分,每个元素承重)、可恢复性(恢复 PCS 得到 $\epsilon$ 内续行,补集 $H \setminus \mathrm{PCS}$ 可重算)、模型依赖性(PCS 因模型而异,需测量而非假设)。

请求中心运行时在请求边界回收状态,下一个动作作为新请求到达时重建不完整的 $H'_t \subset H_t$:

$$ H'_{t} \subset H_{t},\quad o_{t+1} = M(a_{t+1}, H'_{t}) \neq M(a_{t+1}, H_{t}) $$

续行基于 $H'_t$ 条件化,偏离真实轨迹且随时间复合放大。PCS 诱导 $H = \mathrm{PCS} \uplus \mathrm{Derivable}$ 的划分。这正是前缀缓存的 LLM 直觉在世界模型上崩溃之处:RNG 流和循环/记忆内核是不可推导的,因此"通过重算缓存"的运行时不是低效而是错误——它返回一个看似合理的世界而非离开时的那个。


方法详解

1. 通过测量发现 PCS

PCS发现

图2:通过测量发现 PCS。完整运行时状态 $H$ 通过过程逐组件剥离,保留满足续行的最小子集。

PCS 不是手工工程而是通过测量发现的程序。对每个状态组件,剥离它后恢复并检查续行是否在 $\epsilon$ 内——若否则该组件承重。关键控制:仅破坏 RNG 并观察续行退化,证明快照实际承重(否则恢复测试平凡通过)。同一程序在三个内部毫无共同点的模型上各自到达最小可恢复状态。

2. 会话中心运行时

运行时架构

图3:运行时架构。规划器/代理/世界模型在上层;会话运行时在下层,管理 PCS 的检查点/恢复/分叉/删除。

运行时单元为会话——跨请求持有 $H_t$ 的抽象。API 为四个操作:

$$ c=\texttt{checkpoint}(s)\quad\cdot\quad s'=\texttt{restore}(c)\quad\cdot\quad c'=\texttt{fork}(c)\quad\cdot\quad\texttt{delete}(c) $$

分叉通过写时复制实现,每个分叉的成本以 $|\mathrm{PCS}|$ 为界而非 $|H|$:

$$ |\mathrm{checkpoint}| = |\mathrm{PCS}| \leq |H|,\quad \text{fork cost} = O(|\mathrm{PCS}|) $$

两个语义等价状态 $s_1 \approx s_2$ 定义为 $D(\mathrm{continue}(s_1), \mathrm{continue}(s_2)) \leq \epsilon$——等价基于返回一致性度量而非字节同一性。运行时保证四个不变量:往返性(恢复检查点 ≈ 原状态)、持久性(检查点为不可变快照,跨进程存活)、分叉独立性(子续行语义独立于父)、快照完整性(检查点恰好捕获 PCS)。

3. 返回一致性作为一致性测试

一致性测试

图4:一致性测试。离开→返回→恢复(PCS)→续行,然后返回一致性 $C(L)$ 对比底线→通过/失败。

返回一致性是恢复和分叉的一致性测试——比特精确性无法表达的标准,因为恢复可以在错误状态上字节完美,而合法重着陆的续行不等于锚点的字节。三种评分方式会产生自信的错误答案:返回时评分(非运行后)、丢失锚点计零分(非缺失样本)、压力必须由到达率引起(非安排)。

flowchart TD
    A["世界轨迹 tau = (o0, a1, o1, ...)"] --> B["运行时状态 H_t
KV块+缓存+RNG+观测"] B --> C["请求中心服务
丢弃H_t, 重建H'_t ⊂ H_t"] C --> D["轨迹断裂
续行偏离真实轨迹"] B --> E["会话中心运行时
跨请求持有H_t"] E --> F["发现PCS: argmin|S|
s.t. D(continue(restore(S)),oracle)≤eps"] F --> G["checkpoint(s) / restore(c)
fork(c) / delete(c)"] G --> H["设备持有1会话
其余PCS在主机"] H --> I["驱逐: 按相关性而非最近性
保留锚点帧"] I --> J["轨迹存活
逐字节复现续行"] style C fill:#ffcdd2 style E fill:#e1f5fe style F fill:#fff3e0 style I fill:#e8f5e9

实验结果

三种模型上的 PCS 发现

PCS表

图5:同一程序在三类模型上发现的 PCS。

表1:同一程序在三类模型上发现的 PCS——恢复后逐字节复现续行
模型记忆架构PCS 组件PCS 总量DINOv2 恢复替换RNG后
Cosmos3-Nano马尔可夫{obs 1.38MB, rng 8B}1.38MB1.00.9786
WorldMem非马尔可夫记忆库{bank 185KB, pose 24B, rng 8B}185KB1.00.9704
Matrix-Game 2.0地址化KV上下文{kv 973MB+649MB, x-attn 47MB, pos-idx, rng}≈1.67GBlatent-exact3% latent-exact

关键发现:尺寸不追踪丰富度,增长是关键轴。Cosmos3 的状态是完整 480×960 uint8 观测(1.38 MB),WorldMem 是压缩潜在库(185 KB)——尽管是"更丰富"的模型却小 7.5 倍。替换 RNG 后续行退化证明快照承重——否则恢复测试平凡通过。

会话扩展

会话扩展表

图6:$S$ 个会话的会话扩展表,WorldMem,真实时钟。

表2:会话扩展——设备内存恒定,主机内存线性,返回一致性稳定
会话数 S设备内存(GB)主机内存(MB)返回一致性每步(s)
14.71400.94271.864
44.7143.8540.94842.092
164.71415.4160.95311.883
10244.71438.21.0*-

*1024 点用运行时直接扫描测得设备内存恒定,256 点用模拟生成步骤测得返回一致性 1.0。

设备内存恒定 4.714 GB(模型及工作集),主机成本 0.0373 MB/会话。无 PCS 的设备绑定运行时在 108 会话处崩溃,而有 PCS 的主机绑定运行时在 64GB 主机预算下可承载约 247,000 会话——约 2,300 倍差距。

状态管理成本与驱逐

表3:检查点/恢复成本——相对生成步几乎免费
操作成本相对生成步
检查点0.012 ms1/154,298
恢复0.012 ms1/154,298
恢复 vs K步重放-1/1,173,031
生成步1.852 s1
表4:按主机预算的返回一致性——相关性键控驱逐(PCS-aware)显著优于最近性(LRU/FIFO)
主机预算anchor(PCS-aware)LRUFIFO
2 MB0.77560.21270.1186
4 MB0.95310.41100.2981
8 MB0.95310.69750.5362
16 MB0.95310.95310.9531

驱逐必须按返回相关性键控而非最近性——LLM 实践的反转。在 2 MB 预算下,anchor 策略保留 16/16 世界而 LRU 仅保留 6。更快策略恰恰是破坏最多的——仅报告延迟会将策略排名完全反转。


局限性

  1. 精确性范围有限(作者自述):逐位精确结果仅在马尔可夫模型(观测为完整可见状态)和非马尔可夫模型(通过记忆库)上成立,不声称对任意架构的精确性。
  2. 调度未声明(作者自述):运行时拥有会话语义但不声称调度优化——单服务器队列的等待时间线性增长,这是调度而非开销。
  3. 预测驱逐和准入失败(作者自述):尝试了预测驱逐和预测准入均未成功,驱逐策略仍是基于相关性评分的静态规则。

总结与展望

PCS 揭示了世界模型"离开-返回"失败的根本原因是运行时丢弃不可重算状态而非模型缺陷。通过定义 PCS 为最小不可重算状态、构建会话中心运行时、以返回一致性为一致性测试,实现了检查点恢复几乎免费(0.012 ms vs 1.85 s)、逐字节续行复现、设备内存恒定而主机线性的会话扩展(实测到 1024 会话,约 2300 倍提升),以及相关性键控驱逐优于最近性。规划器的计算从 $O(T^2)$ 重放降为 $O(T)$:

$$ \text{Replay cost: } \sum_{t=1}^{T} t = O(T^2) \quad \longrightarrow \quad \text{PCS restore: } O(T) $$

这是从能悬停中获得的收益——一个层次之上,而非分叉内。

金句:「世界模型状态携带不可重算的内核——RNG 流和记忆内核无法通过重算重建,因此'通过重算缓存'的运行时不是低效而是错误,它返回一个看似合理的世界而非离开时的那个。」

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日