PAPER DEEP DIVE
Orbis 2:驾驶分层世界模型
提出分层驾驶世界模型,在高层次预测粗略场景结构,低层次生成细节,同时实现空间推理和语义理解。
一句话总结
本文提出 Orbis 2,一个分层驾驶世界模型(hierarchical driving world model),将未来预测分解到两个抽象与时间尺度:高级预测器在 DINO 对齐的抽象潜空间以 2Hz 预测长程粗略场景结构,低级生成器在像素对齐潜空间以 10Hz 生成细节帧。采用扩散强制预训练 + 教师强制微调两阶段范式,兼得前者强表征与后者稳定 rollout,在 nuPlan/Waymo 上达 SOTA。
Figure 1 — Orbis 2 分层驾驶世界模型。抽象预测器在长时上下文上预测潜空间未来状态捕获长程动态;细节预测器以该抽象预测为条件生成短时高保真帧。
1. 研究背景与动机
当前世界模型在单一抽象层级操作,大多优先感知保真度而缺乏真实任务所需的空间推理与语义理解。两个关键局限:
- 单一时间尺度:逐帧 rollout 累积误差,限制长程场景演化推理。
- 重建目标塑造的潜空间:保留所有视觉细节(纹理、外观),但长程动态主要由粗略缓慢变化的语义属性主导。
这与认知科学原则一致:人类用简化抽象表征规划远期目标,仅在执行临近时细化细节。Orbis 2 据此将未来预测沿抽象与时间双轴分解。
2. 核心方法
2.1 流匹配基础
采用流匹配(flow matching)目标建模潜空间未来帧 $\mathbf{x}_N$ 分布。噪声插值为 $\mathbf{x}_N^\tau = (1-\tau)\mathbf{x}_N + \tau\epsilon$,速度网络回归真实速度场:
$$\mathcal{L}_{\mathrm{FM}} = \mathbb{E}_{\tau,\epsilon}\left[\left\|\mathbf{v}(\mathbf{x}_N^\tau; \mathbf{x}_{0:N-1}) - (\epsilon - \mathbf{x}_N)\right\|^2\right]$$
教师强制(teacher forcing):上下文帧总为干净真值,仅预测最后一帧速度。扩散强制(diffusion forcing):每帧独立腐蚀不同噪声级,联合预测所有帧速度:
$$\mathcal{L}_{\mathrm{DF}} = \mathbb{E}_{\tau_{0:N},\epsilon_{0:N}}\left[\left\|\mathbf{v}(\mathbf{x}_{0:N}^{\tau_{0:N}}) - (\epsilon_{0:N} - \mathbf{x}_{0:N})\right\|^2\right]$$
扩散强制产生更强内部表征(模型暴露于腐蚀上下文),但教师强制 rollout 更稳定(从干净上下文预测下一帧)。
2.2 分层世界模型
两级分解:
| 层级 | 潜空间 | 频率 | 职责 |
|---|---|---|---|
| 高级预测器 $\mathcal{F}_H$ | DINO 对齐抽象潜 $\mathbf{z}$(16 维) | 2Hz,3 秒窗口 | 预测长程粗略场景结构作为子目标 |
| 低级生成器 $\mathcal{F}_L$ | VQGAN 像素对齐潜 $\mathbf{x}$ | 10Hz,1 秒窗口 | 以抽象预测为条件生成 $k$ 帧中间细节帧 |
2.3 抽象编码器:DINO 对齐
抽象编码器 $\mathcal{E}_H$ 通过学习投影头 $\mathcal{P}$ 与冻结 DINO 嵌入对齐,加弱重建正则化:
$$\mathcal{L}_{\mathrm{abs}} = \underbrace{\left\|\mathcal{P}(\mathcal{E}_H(o)) - \mathcal{E}_{\mathrm{DINO}}(o)\right\|^2}_{\text{DINO 对齐}} + \lambda_{\mathrm{rec}} \underbrace{\left\|\mathcal{D}_H(\mathcal{E}_H(o)) - o\right\|^2}_{\text{重建正则化}}$$
其中 $\lambda_{\mathrm{rec}}=0.1$。产生仅 16 维的紧凑 DINO 对齐表征,适合流匹配目标。
Figure 2 — 模型架构细节,ST-Transformer 骨干与分层条件。
flowchart TD
O["驾驶帧 o"] --> EH["抽象编码器 E_H\n(DINO 对齐, 16 维)"]
O --> EL["细节编码器 E_L\n(VQGAN 像素对齐)"]
EH --> Z["抽象潜 z"]
EL --> X["细节潜 x"]
Z --> FH["高级预测器 F_H\n2Hz, 3 秒\n长程结构预测"]
FH -->|"预测子目标 ẑ_{N+k}"| FL["低级生成器 F_L\n10Hz, 1 秒\n细节帧生成"]
X --> FL
FL --> OUT["k 帧中间高保真帧"]
FH -->|"训练: 扩散强制\n微调: 教师强制"| TRAIN["两阶段训练范式"]
style EH fill:#dbeafe,stroke:#2563eb
style EL fill:#dcfce7,stroke:#16a34a
style FH fill:#fef9c3,stroke:#ca8a04
style FL fill:#fed7aa,stroke:#ea580c
style TRAIN fill:#ede9fe,stroke:#7c3aed
Figure M1 — Orbis 2 分层框架。驾驶帧双路编码:抽象潜(DINO 对齐 16 维)供高级预测器长程结构预测,细节潜(VQGAN)供低级生成器短时帧生成。两阶段训练:扩散强制预训练强化表征,教师强制微调稳定 rollout。
3. 实验结果
3.1 长程 Rollout 性能
Figure 3 — nuPlan-turns 上连续 4 秒窗口的长程 rollout FVD 性能,FVD-slope 捕获渐进保真度损失。
| 模型 | nuPlan FVD↓ | Waymo FVD↓ | FVD-slope↓ | 分割 mIoU↑ | 深度 RMSE↓ |
|---|---|---|---|---|---|
| Vista | 289.95 | 351.42 | 434.67 | 39.76 | 4.884 |
| GEM | 348.36 | 218.61 | 258.00 | 45.81 | 4.373 |
| Orbis (v1) | 132.25 | 180.54 | 99.67 | 52.39 | 4.321 |
| Cosmos-v2.5 | 67.74 | 116.12 | 189.34 | 43.20 | 6.384 |
| Orbis 2 | 98.97 | 98.01 | 46.45 | 58.29 | 4.157 |
Orbis 2 在 Waymo FVD、FVD-slope、分割 mIoU、深度 RMSE 上均最优。Cosmos-v2.5 虽 nuPlan FVD 更低,但模型 2 倍大、数据 3 倍多且未公开,Orbis 2 在 Waymo 上超越它,且 rollout 稳定性(FVD-slope 46.45)大幅领先。
3.2 条件轨迹评估
Table 3 — 原始与反事实轨迹上的转向评估 ADE。
| 模型 | 原始 ADE↓ | 速度×0.5 | 速度×1.5 | 偏航×0.5 | 偏航×1.5 |
|---|---|---|---|---|---|
| Orbis (v1) | 2.23 | 3.49 | 1.42 | 3.02 | 1.31 |
| Epona | 1.36 | 2.08 | 1.48 | 4.01 | 0.91 |
| Orbis 2 | 1.20 | 2.18 | 0.53 | 1.65 | 0.73 |
反事实转向(缩放速度与偏航率 0.5/1.5 倍)验证模型真正响应转向而非仅靠上下文泄露。Orbis 2 在原始轨迹和 3 个反事实情况下最优。
4. 贡献与意义
- 分层世界模型:将未来预测沿抽象与时间双轴分解,高级 DINO 对齐潜空间长程粗略预测 + 低级像素对齐潜空间短时细节生成。
- 两阶段训练范式:扩散强制预训练强化内部表征,教师强制微调稳定 rollout,兼得两者优势。
- 证明表征质量与 rollout 稳定性强相关:语义分割与深度探测更好的模型长程预测更稳定,比感知保真度更重要。
- 在 nuPlan/Waymo 上达 SOTA,Waymo FVD 和 FVD-slope 均最优,且模型仅为 Cosmos 的一半。
5.
流匹配损失
$$ \mathcal{L}_{\mathrm{FM}}=\mathbb{E}_{\tau,\,\epsilon}\big[\|\mathbf{v}(\mathbf{x}_{N}^{\tau};\,\mathbf{x}_{0:N-1})-(\epsilon-\mathbf{x}_{N})\|^{2}\big] $$
去噪流匹配损失
$$ \mathcal{L}_{\mathrm{DF}}=\mathbb{E}_{\tau_{0:N},\,\epsilon_{0:N}}\big[\|\mathbf{v}(\mathbf{x}_{0:N}^{\tau_{0:N}})-(\epsilon_{0:N}-\mathbf{x}_{0:N})\|^{2}\big] $$
局限性- 扩散强制改善表征的原因未完全研究(假设为隐式数据增强)。
- 分层依赖分离的抽象与细节潜空间,限制两层级间交互。
- 当前仅用前摄像头,多相机扩展为未来工作。
6. 总结
Orbis 2 通过分层方法有效利用抽象与细节潜空间,产生兼具高保真短时预测与长程稳定性的世界模型。高级预测器在 DINO 对齐 16 维抽象潜空间以 2Hz 预测长程结构,低级生成器在 VQGAN 像素对齐潜空间以 10Hz 生成细节帧。两阶段训练(扩散强制预训练 + 教师强制微调)兼得强表征与稳定 rollout。表征质量与 rollout 稳定性强相关——语义理解更好的模型长程预测更稳定。在 nuPlan/Waymo 上达 SOTA,反事实转向评估验证模型真正响应动作而非上下文泄露。世界模型不应只在单一层级追求感知保真——分层抽象让长程结构推理与短时细节生成各得其所,表征质量比像素保真度更决定 rollout 稳定性。
世界模型不应只在单一层级追求感知保真——分层抽象让长程结构推理与短时细节生成各得其所,表征质量比像素保真度更决定 rollout 稳定性。
— 论文核心主张



