Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界-动作模型端到端自动驾驶视频生成

SimWAM:端到端自动驾驶的简单世界-动作模型

提出将视频生成仅作为训练信号的简洁世界-动作模型,联合训练视频专家和轻量动作专家,用隔离注意力掩码使动作预测独立于未来帧,训练后丢弃视频分支保留自包含规划器直接预测轨迹,并用强化学习优化组合驾驶奖励,在 NAVSIM 上达 91.5 PDMS。

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai2026年8月7日4 分钟阅读
EN

作者:Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

机构:华中科技大学 · 东风汽车研发总院

论文arXiv:2608.07468 · 代码H-EmbodVis/SimWAM(已开源,Apache 2.0) · 模型HuggingFace

日期:2026年8月7日

一句话总结

SimWAM 将视频生成仅作为训练信号,联合训练预训练视频专家和轻量动作专家,用隔离注意力掩码使动作预测独立于未来帧,训练后丢弃视频分支保留自包含规划器直接预测轨迹,并用强化学习优化组合驾驶奖励,在 NAVSIM 上达 91.5 PDMS 且推理延迟大幅低于现有世界模型规划器。

研究背景与动机

端到端自动驾驶将原始传感器观测直接映射为规划轨迹,通过统一网络消除手工接口并减少经典感知-预测-规划管线的误差传播。近年来端到端规划器持续提升精度,但本质上仍是模仿学习策略——从记录轨迹中复现行为,仅隐式捕捉交通语义、用户意图和场景动态。

图1:SimWAM 在 NAVSIM 上以最低推理延迟达到最佳 PDMS。

视觉-语言-动作(VLA)模型通过将预训练视觉语言模型适配到驾驶来弥补语义局限。其语义知识和高级推理改善场景理解并连接轨迹生成与用户意图。然而,这些组件与动作预测松耦合,常需额外训练阶段或串行推理,运动和时序演化仅被间接建模。

世界模型通过提供环境在运动下如何演化的显式先验满足这一需求。近期的世界-动作模型(WAM)通过预训练视频生成骨干联合预测未来观测和动作。在自动驾驶中,DriveLaW 和 DriveWAM 联合训练视频预测器和规划器,让预期的场景动态引导轨迹生成。但这些方法遵循"想象后行动"范式——规划器以生成的未来帧为条件,将昂贵的视频合成置于实时规划环路中,大幅增加推理延迟。

关键洞察是:显式的未来合成对有效的世界-动作学习并非必要。Fast-WAM 表明视频共训练主要通过训练时表示学习而非测试时未来想象来惠益动作预测。基于此,SimWAM 将视频生成用作训练信号,同时保留推理时的直接轨迹预测。

预备知识

理解 SimWAM 需要几个核心概念。首先是流匹配:通过线性插值在数据和噪声之间 corrupt 样本,回归将噪声样本送回干净数据的速度场,用于视频和动作两条流。其次是世界-动作模型(WAM):将预训练视频生成模型与动作预测耦合,让视频生成学到的动态先验引导动作生成。第三是想象后行动范式:现有驾驶 WAM 先合成未来驾驶场景潜空间 $z_{t+1:t+N}$,再以此为条件生成轨迹,将视频生成置于推理环路中。

另一个关键概念是GRPO 强化学习:将确定性流 ODE 重表述为随机 SDE 以支持多样轨迹采样,用组合驾驶奖励直接优化策略质量超越模仿学习。

方法详解:SimWAM 架构

SimWAM 由三个核心设计组成:双专家联合训练、隔离注意力掩码、强化学习优化。预训练视频专家通过联合流匹配将交通动态知识转移到轻量动作专家,隔离注意力掩码使动作预测独立于未来帧,训练后丢弃视频分支,保留自包含规划器直接预测轨迹。

架构总览

flowchart TB
    subgraph Train["联合训练阶段"]
        OT[观测 o_t] --> VE[视频专家 DiT
Wan2.2-5B] NAV[导航指令 l] --> VE VE --> FUT[未来帧潜空间
流匹配去噪] OT --> AE[动作专家 DiT
1.02B, d=1024] NAV --> AE EG[自车状态 s_t] --> AE AE --> TRA[轨迹预测
流匹配去噪] VE -.->|共享注意力
隔离掩码| AE end subgraph Infer["推理阶段"] OT2[观测 o_t] --> AE2[动作专家 DiT
仅保留] NAV2[导航指令] --> AE2 EG2[自车状态] --> AE2 AE2 --> TRA2[直接轨迹输出] end subgraph RL["强化学习阶段"] AE3[动作专家] --> SDE[SDE 随机采样] SDE --> CAND[多样轨迹候选] CAND --> REW[组合驾驶奖励] REW --> GRPO[GRPO 优化] GRPO --> AE3 end

上图展示了 SimWAM 的三阶段流程。联合训练阶段,视频专家和动作专家通过 MoT 共享注意力联合学习,但隔离掩码限制动作 token 仅访问当前观测。推理阶段仅保留轻量动作 DiT,视频分支完全丢弃。强化学习阶段用 SDE 采样多样轨迹,通过 GRPO 优化组合驾驶奖励。

问题形式化

给定前摄像头观测 $o_t$、自车状态 $s_t$(速度、加速度、yaw 率)和导航指令 $l$,规划器预测自车坐标系下的轨迹 $a_{t+1:t+H} = (a_{t+1}, \ldots, a_{t+H})$,每个路点 $a_i = (x_i, y_i, \theta_i)$ 指定规划位置和朝向。

现有驾驶 WAM 采用"想象后行动"分解:

$$p_\theta(a_{t+1:t+H} \mid o_t, s_t, l) = \int p_\theta(z_{t+1:t+N} \mid o_t, s_t, l)\, p_\theta(a_{t+1:t+H} \mid o_t, s_t, l, z_{t+1:t+N})\,\mathrm{d}z_{t+1:t+N}$$

先合成未来驾驶场景潜空间 $z_{t+1:t+N}$,再以此为条件生成轨迹。这将昂贵的视频生成置于实时规划环路中。SimWAM 改为保留简单的直接策略接口:

$$p_\theta(a_{t+1:t+H} \mid o_t, s_t, l) = p_\theta(a_{t+1:t+H} \mid z(o_t), s_t, l)$$

其中 $z(o_t)$ 是从当前观测产生的表示。交通动态知识完全在训练中获取,推理时既不需要未来场景潜空间也不需要辅助运动模块。

双专家架构

视频专家是初始化自 Wan2.2-5B 的视频扩散变换器,连同其视频 VAE 和 T5 文本编码器。VAE 将每帧驾驶画面映射为潜空间 token,导航指令通过 T5 交叉注意力进入。当前帧作为干净条件,N 个未来帧被噪声化并用流匹配重建。这一标准视频生成目标为动作专家提供交通感知的运动先验,无需引入驾驶特定的预测模块。

动作专家是隐藏维度 $d_a = 1024$ 的轻量扩散变换器。条件于 $c = \{z(o_t), s_t, l\}$,通过流匹配预测轨迹速度场 $v_{\theta_a}(a^\tau_{t+1:t+H}, \tau, c)$,小 MLP 嵌入自车状态。积分 ODE 将噪声映射为规划轨迹。推理时仅保留轻量动作专家,丢弃视频 DiT。

联合训练:两专家仅通过共享注意力交互并保留各自原始架构。视频和轨迹模态上的联合流匹配使未来场景预测能塑造用于规划的观测表示。联合目标为:

$$\mathcal{L} = \mathcal{L}_{\text{FM}}^{\text{act}} + \lambda\,\mathcal{L}_{\text{FM}}^{\text{vid}}$$

其中 $\mathcal{L}_{\text{FM}}^{\text{act}}$ 和 $\mathcal{L}_{\text{FM}}^{\text{vid}}$ 分别在动作轨迹和未来帧潜空间上实例化流匹配损失,$\lambda$ 平衡两项。

隔离注意力掩码

隔离注意力掩码是 SimWAM 实现高效推理的关键设计。在 MoT(Mixture-of-Transformers)架构中,视频和动作 DiT 通过共享注意力交互。隔离掩码限制动作 token 仅访问当前观测 $z(o_t)$,不能访问未来帧 token。这确保动作预测独立于未来帧生成,使得训练后整个视频分支可被移除,仅保留自包含的动作 DiT。

消融实验表明,双向注意力和动作→视频注意力都将动作预测与未来视频 token 耦合,使视频分支在部署时不可或缺。而隔离掩码虽然依赖结构更简单,却达到最佳 PDMS(90.3),且 NC 和 TTC 最强——暴露动作分支于视频 token 在此设置下无可测量收益。

架构灵活性

因两专家不共享参数且仅通过统一注意力接口交互,SimWAM 具有双重灵活性。视频骨干灵活性:动作专家仅访问共享观测表示,与视频专家、VAE 解码器和生成帧无关,视频生成器仅作为训练时动态监督的来源。替换为更新或更驾驶相关的模型不影响动作专家、轨迹目标和推理管线。规模灵活性:视频和动作专家提供两个独立的容量控制——更大的视频生成器可在训练时提供更丰富运动先验而不增加部署成本,动作 DiT 可根据目标延迟调整宽度和深度。

强化学习优化

模仿学习阶段后,SimWAM 引入强化学习直接优化驾驶质量。确定性流 ODE 被重表述为随机 SDE 以支持多样轨迹候选采样。采用 GRPO 优化组合驾驶奖励——超越轨迹模仿的安全、合规和进度综合目标。消融表明 SDE 采样(保持分布边际)优于随机噪声扰动:SDE 探索多样且合理的轨迹同时提供可处理的转移似然,达到 91.5 PDMS。

RL 训练动态分析揭示:在模仿 PDMS 低于 90 的困难子集上训练一致优于在全部 navtrain 上训练,困难场景暴露候选轨迹间更清晰差异,提供更有信息量的奖励信号。RL 在 15K 步达到 91.5 PDMS 峰值,之后收益递减。

代码对应

SimWAM 代码已开源,核心模块与论文方法直接对应。`scripts/train.py` 实现联合流匹配训练(视频专家+动作专家),对应 $\mathcal{L} = \mathcal{L}_{\text{FM}}^{\text{act}} + \lambda\,\mathcal{L}_{\text{FM}}^{\text{vid}}$。`scripts/train_grpo.py` 实现 GRPO 强化学习阶段,将流 ODE 重表述为 SDE 采样多样轨迹并用组合驾驶奖励优化。`scripts/preprocess_action_dit_backbone.py` 处理动作 DiT 骨干预训练。`navsim/` 目录包含 NAVSIM 基准评估代码。模型权重在 HuggingFace `H-EmbodVis/SimWAM` 发布。

实验结果

NAVSIM 主实验

表1:NAVSIM navtest 基准上的最新规划器对比。SimWAM 以单前摄像头达到 91.5 PDMS。
方法传感器PDMS ↑
UniAD6×C83.4
DiffusionDrive3×C+L88.1
DriveLaW1×C89.1
ExploreVLA1×C90.4
DriveWAM1×C90.1
SGDrive1×C91.1
SimWAM(本文)1×C91.5

表1:NAVSIM navtest 上的 PDMS 对比(部分代表性方法)。

SimWAM 仅用单前摄像头即达 91.5 PDMS,超越所有基于世界模型的规划器(DriveWAM 90.1、DriveLaW 89.1)和 VLM 基规划器(SGDrive 91.1),且推理延迟大幅低于需要在线视频生成的 WAM 方法。PDMS 由无碰撞(NC)、可驾驶区域合规(DAC)两个二元惩罚因子与自车进度(EP)、碰撞时间(TTC)、舒适度(C)三个加权质量项组合而成:

$$\text{PDMS} = \prod_{m \in \{\text{NC, DAC}\}} r_m \times \frac{\sum_{m \in \{\text{EP, TTC, C}\}} w_m \cdot r_m}{\sum_{m \in \{\text{EP, TTC, C}\}} w_m}$$

组件分析

表2:组件分析。视频共训练提升 3.7 PDMS,RL 再提升 1.2 PDMS。
配置NCDACEPTTCPDMS
仅动作97.695.781.792.686.6
+视频98.798.083.995.990.3
+RL98.498.786.495.591.5

表2:组件分析。视频共训练和 RL 贡献互补增益,总计提升 4.9 PDMS。

仅动作 DiT 建立基线 86.6 PDMS。与视频专家联合训练一致提升所有指标,PDMS 升至 90.3(+3.7),证明未来视频监督有效将交通动态先验转移到共享观测表示中。RL 进一步提升至 91.5(+1.2),直接优化超越轨迹模仿的驾驶质量。视频共训练和 RL 贡献互补增益。

注意力掩码分析

掩码NCDACEPTTCPDMS
双向98.498.084.795.190.2
动作→视频98.597.884.395.590.1
隔离98.798.083.995.990.3

表3:注意力掩码分析。隔离掩码达到最佳 PDMS 且支持高效推理。

双向和动作→视频注意力都将动作预测与未来视频 token 耦合,使视频分支在部署时不可或缺。隔离掩码虽依赖结构更简单,却达到最佳 PDMS(90.3)和最强 NC/TTC,且实现训练后丢弃视频分支的高效推理。

视频骨干灵活性

视频模型PDMS
LTX-Video88.7
Wan2.1-1.3B90.2
Cosmos2.590.4
Wan2.2-5B90.3

表4:视频骨干灵活性。SimWAM 兼容多种预训练视频生成器。

Wan2.1-1.3B 和 Wan2.2-5B 达到可比 PDMS(90.2 vs 90.3),确认方法不绑定特定骨干。Cosmos-Predict2.5 因在驾驶视频上预训练提供更强驾驶相关动态先验,达最佳 90.4。轻量 LTX-Video 仅 88.7,表明视频先验质量仍然重要。SimWAM 可无缝吸收更强且更领域相关的视频生成先验。

零样本跨数据集泛化

将 NAVSIM 训练的 SimWAM 直接在 nuScenes 开环基准上评估(无微调)。SimWAM 达到最低平均碰撞率 0.04%,平均 L2 误差 0.96m 与最强零样本基线可比。碰撞率更直接衡量与交通的安全交互——强安全性能表明学到的动态先验可迁移到训练基准之外。

局限分析

论文未设独立局限章节,但从方法设计和实验中可推断若干局限。首先,评估仅在 NAVSIM 非反应式规划基准上进行——虽然零样本迁移到 nuScenes,但闭环反应式交通场景中其他车辆对自车行为的响应未被测试。其次,仅用单前摄像头,多视角和 LiDAR 信息的潜在价值未被利用。第三,RL 的组合驾驶奖励设计需要人工设定权重,不同场景下最优权重可能不同。

从独立判断角度,非反应式基准的局限值得关注。NAVSIM 是非反应式基准——其他车辆不响应自车行为,这与真实闭环交通不同。在反应式场景中,自车的保守或激进行为可能引发其他车辆的不同响应,影响规划效果。此外,视频先验到动作的迁移机制缺乏深入分析——视频共训练如何具体改善观测表示的哪些方面(如运动方向预测、速度估计)未被量化拆解。

总结与展望

SimWAM 证明训练时世界建模可支持强实时规划,无需昂贵的测试时想象。通过联合流匹配将预训练视频专家的交通动态先验转移到轻量动作专家,用隔离注意力掩码解耦动作预测与未来帧,训练后丢弃视频分支保留直接轨迹规划。这一设计使视频骨干可替换、两专家可独立扩展,强化学习进一步将独立规划器与驾驶质量对齐。仅用单前摄像头即在 NAVSIM 达 91.5 PDMS 且零样本迁移到 nuScenes。

这项工作为世界-动作模型提供了一个简洁而坚实的基线,展示了视频生成模型在自动驾驶中的实用价值不在于推理时生成未来,而在于训练时塑造动态先验。这一"训练时建模、推理时直连"的范式对移动机器人的实时导航同样具有借鉴意义——园区巡检机器人的自主导航可从视频预训练中获取环境动态理解,而推理时仅保留轻量规划器。

"不必在推理时想象未来才能学好规划——训练时让视频专家教会动作专家理解动态,推理时只留动作专家直接行动。世界模型的价值在训练,不在部署。"

相关论文