PAPER DEEP DIVE
HyWorldVLA:面向自动驾驶的混合世界建模视觉语言动作模型
VLA模型增强世界建模是端到端自动驾驶的有前景范式。像素级未来预测提供细粒度时空推理但在噪声场景下鲁棒性不足;隐式世界建模鲁棒但缺乏细粒度推理。本文提出HyWorldVLA,采用混合世界建模同时利用两种优势。
HyWorldVLA:混合世界建模的视觉-语言-动作模型用于自动驾驶
机构:比亚迪汽车新技术研究院 | arXiv:2607.20988v1
一句话总结
HyWorldVLA提出混合世界-VLA框架,统一像素级监督和潜在表示学习:预训练阶段同时预测视频潜在特征和重建视频帧,共微调阶段仅预测潜在特征并馈入动作专家生成轨迹,在NAVSIM v1/v2基准上达到SOTA,并在雨雾噪声场景下展现出卓越鲁棒性。
研究背景与动机
端到端自动驾驶将感知、推理和控制统一在单一管线中。视觉-语言-动作(VLA)模型整合视觉场景感知、语言语义理解和低层动作预测,相比传统模块化系统(存在级联误差和长尾场景泛化受限),提供了更强的自适应决策能力。
为增强时空推理和场景泛化,近期工作为VLA增加世界建模能力——预测未来场景状态。现有范式存在固有矛盾:像素级世界模型通过完整未来帧重建提供密集几何和物理约束,但对环境变化(噪声、光照)高度敏感;潜在世界模型缓解了噪声敏感性,但缺乏像素级接地导致可解释性和表示退化。
图1:像素级世界模型提供细粒度时空推理但对噪声敏感,潜在世界模型鲁棒但缺乏像素级接地。
问题定义
HyWorldVLA在每个时间步 $t$ 接收前视相机图像序列 $\mathbf{V}_{t-H:t} = \{v_{t-H}, \dots, v_t\}$(含当前和前 $H$ 帧)、历史车辆航点 $\mathbf{W}_{t-H:t} = \{w_{t-H}, \dots, w_t\}$(其中 $w_t = (x_t, y_t, \theta_t)$ 表示位置和航向角)以及历史导航指令 $\mathbf{L}_{t-H:t}$(如直行、右转)。基于这些输入,模型输出未来 $T$ 步航点序列 $\mathbf{W}_{t+1:t+T}$:
$$\mathbf{W}_{t+1:t+T} = f(\mathbf{V}_{t-H:t}, \mathbf{W}_{t-H:t}, \mathbf{L}_{t-H:t})$$方法详解
文本引导的潜在特征学习
采用视频变分自编码器(VAE)将未来帧编码为紧凑潜在特征。视频段 $\mathbf{v} \in \mathbb{R}^{C \times T \times H \times W}$ 经空间编码器(基于Stable Diffusion图像VAE + 3D卷积,8×空间下采样)得到 $\mathbf{z}_1 \in \mathbb{R}^{c \times T \times \frac{H}{8} \times \frac{W}{8}}$,再经轻量时间自编码器(3D ResNet块,4×时间压缩)得到 $\mathbf{z}_2 \in \mathbb{R}^{c' \times \frac{T}{4} \times \frac{H}{8} \times \frac{W}{8}}$。
图2:HyWorldVLA三阶段训练——视频VAE训练、世界模型预训练、共微调。
VAE通过多分量损失优化,平衡重建损失、对抗损失和KL正则化:
$$\mathcal{L}_{\text{vae}} = \mathcal{L}_{\text{rec}} + \lambda_{\text{GAN}} \mathcal{L}_{\text{GAN}} + \lambda_{\text{KL}} \mathcal{L}_{\text{KL}}$$为增强重建质量,在每个块内嵌入多层文本交叉注意力,将Flan-T5文本嵌入作为键,视觉patch作为查询和值。文本语义先验有效抑制运动鬼影、边缘模糊和时序闪烁。
预训练阶段
预训练同时进行像素级和潜在级世界建模。引入可学习潜在查询 $Q$ 聚合信息并预测未来潜在特征。预训练损失结合视觉token预测(权重 $\lambda_1$)和潜在运动预测(权重 $\lambda_2$):
$$\mathcal{L}_{\text{pre}} = \lambda_1 \mathcal{L}_{\text{pixel}} + \lambda_2 \mathcal{L}_{\text{latent}}$$实验表明 $\lambda_1 = 0.5$、$\lambda_2 = 0.1$ 时效果最优。$\lambda_1$ 过高(1.0)导致分数从90.59降至89.83,表明视觉token预测权重不宜过大。
共微调阶段
共微调阶段模型仅预测潜在特征,通过联合注意力机制馈入动作专家生成轨迹。VLM骨干的隐藏状态、预测未来视觉潜在特征和历史运动共同条件化动作生成。共微调中保留潜在监督(权重 $\lambda_3$)以防止预训练语义的语义坍缩:
$$\mathcal{L}_{\text{co-ft}} = \mathcal{L}_{\text{action}} + \lambda_3 \mathcal{L}_{\text{latent-sup}}$$$\lambda_3 = 0.1$ 最优——适当的监督防止性能退化,但过强监督(1.0)阻碍模型自主学习与动作最相关的潜在语义。
graph TD
A["视频VAE训练
文本引导的空间-时间压缩"] --> B["预训练阶段
像素级+潜在级世界建模"]
B --> C["可学习查询Q预测未来潜在"]
B --> D["同时重建视频帧
提供像素级接地"]
C --> E["共微调阶段
仅预测潜在特征"]
D --> E
E --> F["动作专家
VLM隐藏状态+未来潜在+历史运动"]
F --> G["输出未来航点 W_{t+1:t+T}"]
实验结果
NAVSIM基准对比
| 方法类型 | 代表方法 | PDMS (v1) ↑ | EPDMS (v2) ↑ |
|---|---|---|---|
| 端到端 | DiffusionDrive | 88.1 | 84.5 |
| VLA | ReCogDrive-8B | 90.5 | 83.6 |
| 像素级WM | DriveVLA-W0 | 90.2 | 86.1 |
| 潜在级WM | Latent-WAM | — | 87.7 |
| HyWorldVLA | 本文 | 90.59 | 89.71 |
HyWorldVLA在v1和v2基准上均达到SOTA,显著优于像素级WM基线(DriveVLA-W0)和潜在级WM基线(Latent-WAM)。性能提升归因于混合世界建模范式,调和了像素级的细粒度时空建模与潜在级的高层语义表示能力。
消融实验
| 配置 | PDMS ↑ | 说明 |
|---|---|---|
| Pure LWM(去像素回归) | 87.50 | 时空建模能力缺失,最低分 |
| Pure WAM(去潜在表示) | 89.91 | 高层语义学习受限 |
| 去语言引导 | 90.35 | 语言引导规划相关语义 |
| 去动作专家潜在条件 | 90.29 | 未来信息显式利用有益 |
| 去共微调潜在监督 | 90.17 | 防止语义坍缩重要 |
| 完整模型 | 90.59 | 所有组件协同最优 |
场景噪声鲁棒性
在655个含雨雾非均匀噪声的测试案例上,HyWorldVLA达到86.87 PDMS,而WoTE仅60.65、DriveLaW仅67.49、DriveVLA-W0仅61.18。Pure WAM和去潜在监督配置分别为69.95和73.18,进一步证明潜在表示设计是噪声鲁棒性的关键来源。定性分析表明HyWorldVLA在光照变化下行为一致,而DriveVLA-W0表现出严重不稳定。
图3:混合世界建模提升场景噪声鲁棒性——DriveVLA-W0在光照变化下行为不稳定,本文方法保持一致性。
从信息论角度,混合世界建模的优势可理解为像素级和潜在级监督提供互补信息。设像素级监督提供的信息量为 $I_{ ext{pixel}}$,潜在级监督提供的信息量为 $I_{ ext{latent}}$,则混合模型的总信息量为:
$$I_{ ext{hybrid}} = I_{ ext{pixel}} + I_{ ext{latent}} - I_{ ext{overlap}}$$其中 $I_{ ext{overlap}}$ 为两种监督的冗余信息。预训练阶段同时使用两种监督最大化 $I_{ ext{hybrid}}$,而共微调阶段仅保留潜在监督以减少噪声敏感的像素级冗余。这解释了为何共微调阶段去除像素级监督反而提升性能——在推理时噪声会放大像素级预测的误差,而潜在空间编码天然过滤了高频噪声。
噪声鲁棒性还可从VAE压缩的角度理解。VAE将视频压缩到 $c' imes rac{T}{4} imes rac{H}{8} imes rac{W}{8}$ 的潜在空间,压缩比约为原始视频的 $rac{1}{256}$。这一 aggressive 压迫使噪声被平均化到更粗粒度的表示中,类似于低通滤波器的效果。设原始视频帧的噪声方差为 $\sigma^2_{ ext{pixel}}$,潜在空间的等效噪声方差约为:
$$\sigma^2_{ ext{latent}} pprox rac{\sigma^2_{ ext{pixel}}}{K}, \quad K = 8 imes 8 imes 4 = 256$$即潜在空间的噪声方差降低约256倍,解释了为何HyWorldVLA在雨雾场景下PDMS仅下降约3.7分(90.59→86.87),而像素级方法DriveVLA-W0下降约29分(90.2→61.18)。
局限性
- 基于单目相机的框架尚未扩展到多模态传感器(如LiDAR、环视相机)
- 潜在动力学与关键交通要素的耦合有待加强
- 噪声鲁棒性测试集仅涵盖雨雾场景,其他噪声类型(雪、夜间低光)未充分验证
- 视频VAE的文本交叉注意力增加了训练复杂度
总结与展望
HyWorldVLA提出混合自动驾驶世界模型,结合像素级方法的细粒度时空建模与潜在变体的噪声鲁棒性。像素级重建保留详细空间和动态信息,VAE空间中的潜在预测固有地提升噪声韧性。NAVSIM v1/v2实验达到SOTA,雨雾噪声输入进一步验证了鲁棒性。未来方向包括扩展到多模态传感器和加强潜在动力学与关键交通要素的耦合。
金句:像素级世界建模提供细粒度时空推理但惧怕噪声,潜在世界建模鲁棒但缺乏接地——混合两者是自动驾驶VLA的最优解。



