SimWAM:端到端自动驾驶的简单世界-动作模型提出将视频生成仅作为训练信号的简洁世界-动作模型,联合训练视频专家和轻量动作专家,用隔离注意力掩码使动作预测独立于未来帧,训练后丢弃视频分支保留自包含规划器直接预测轨迹,并用强化学习优化组合驾驶奖励,在 NAVSIM 上达 91.5 PDMS。Zongchuang Zhao, Xin Zhou, Tianyang Xu·2026年8月7日NAVSIMSimWAM世界动作模型2026年8月7日