Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLA世界模型自动驾驶

HyWorldVLA:面向自动驾驶的混合世界建模视觉语言动作模型

VLA模型增强世界建模是端到端自动驾驶的有前景范式。像素级未来预测提供细粒度时空推理但在噪声场景下鲁棒性不足;隐式世界建模鲁棒但缺乏细粒度推理。本文提出HyWorldVLA,采用混合世界建模同时利用两种优势。

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma2026年7月23日2 分钟阅读
EN

HyWorldVLA:混合世界建模的视觉-语言-动作模型用于自动驾驶

机构:比亚迪汽车新技术研究院  |  arXiv:2607.20988v1


一句话总结

HyWorldVLA提出混合世界-VLA框架,统一像素级监督和潜在表示学习:预训练阶段同时预测视频潜在特征和重建视频帧,共微调阶段仅预测潜在特征并馈入动作专家生成轨迹,在NAVSIM v1/v2基准上达到SOTA,并在雨雾噪声场景下展现出卓越鲁棒性。


研究背景与动机

端到端自动驾驶将感知、推理和控制统一在单一管线中。视觉-语言-动作(VLA)模型整合视觉场景感知、语言语义理解和低层动作预测,相比传统模块化系统(存在级联误差和长尾场景泛化受限),提供了更强的自适应决策能力。

为增强时空推理和场景泛化,近期工作为VLA增加世界建模能力——预测未来场景状态。现有范式存在固有矛盾:像素级世界模型通过完整未来帧重建提供密集几何和物理约束,但对环境变化(噪声、光照)高度敏感;潜在世界模型缓解了噪声敏感性,但缺乏像素级接地导致可解释性和表示退化。

图1:像素级vs潜在世界模型的权衡

图1:像素级世界模型提供细粒度时空推理但对噪声敏感,潜在世界模型鲁棒但缺乏像素级接地。

问题定义

HyWorldVLA在每个时间步 $t$ 接收前视相机图像序列 $\mathbf{V}_{t-H:t} = \{v_{t-H}, \dots, v_t\}$(含当前和前 $H$ 帧)、历史车辆航点 $\mathbf{W}_{t-H:t} = \{w_{t-H}, \dots, w_t\}$(其中 $w_t = (x_t, y_t, \theta_t)$ 表示位置和航向角)以及历史导航指令 $\mathbf{L}_{t-H:t}$(如直行、右转)。基于这些输入,模型输出未来 $T$ 步航点序列 $\mathbf{W}_{t+1:t+T}$:

$$\mathbf{W}_{t+1:t+T} = f(\mathbf{V}_{t-H:t}, \mathbf{W}_{t-H:t}, \mathbf{L}_{t-H:t})$$

方法详解

文本引导的潜在特征学习

采用视频变分自编码器(VAE)将未来帧编码为紧凑潜在特征。视频段 $\mathbf{v} \in \mathbb{R}^{C \times T \times H \times W}$ 经空间编码器(基于Stable Diffusion图像VAE + 3D卷积,8×空间下采样)得到 $\mathbf{z}_1 \in \mathbb{R}^{c \times T \times \frac{H}{8} \times \frac{W}{8}}$,再经轻量时间自编码器(3D ResNet块,4×时间压缩)得到 $\mathbf{z}_2 \in \mathbb{R}^{c' \times \frac{T}{4} \times \frac{H}{8} \times \frac{W}{8}}$。

图2:HyWorldVLA框架总览

图2:HyWorldVLA三阶段训练——视频VAE训练、世界模型预训练、共微调。

VAE通过多分量损失优化,平衡重建损失、对抗损失和KL正则化:

$$\mathcal{L}_{\text{vae}} = \mathcal{L}_{\text{rec}} + \lambda_{\text{GAN}} \mathcal{L}_{\text{GAN}} + \lambda_{\text{KL}} \mathcal{L}_{\text{KL}}$$

为增强重建质量,在每个块内嵌入多层文本交叉注意力,将Flan-T5文本嵌入作为键,视觉patch作为查询和值。文本语义先验有效抑制运动鬼影、边缘模糊和时序闪烁。

预训练阶段

预训练同时进行像素级和潜在级世界建模。引入可学习潜在查询 $Q$ 聚合信息并预测未来潜在特征。预训练损失结合视觉token预测(权重 $\lambda_1$)和潜在运动预测(权重 $\lambda_2$):

$$\mathcal{L}_{\text{pre}} = \lambda_1 \mathcal{L}_{\text{pixel}} + \lambda_2 \mathcal{L}_{\text{latent}}$$

实验表明 $\lambda_1 = 0.5$、$\lambda_2 = 0.1$ 时效果最优。$\lambda_1$ 过高(1.0)导致分数从90.59降至89.83,表明视觉token预测权重不宜过大。

共微调阶段

共微调阶段模型仅预测潜在特征,通过联合注意力机制馈入动作专家生成轨迹。VLM骨干的隐藏状态、预测未来视觉潜在特征和历史运动共同条件化动作生成。共微调中保留潜在监督(权重 $\lambda_3$)以防止预训练语义的语义坍缩:

$$\mathcal{L}_{\text{co-ft}} = \mathcal{L}_{\text{action}} + \lambda_3 \mathcal{L}_{\text{latent-sup}}$$

$\lambda_3 = 0.1$ 最优——适当的监督防止性能退化,但过强监督(1.0)阻碍模型自主学习与动作最相关的潜在语义。

graph TD
    A["视频VAE训练
文本引导的空间-时间压缩"] --> B["预训练阶段
像素级+潜在级世界建模"] B --> C["可学习查询Q预测未来潜在"] B --> D["同时重建视频帧
提供像素级接地"] C --> E["共微调阶段
仅预测潜在特征"] D --> E E --> F["动作专家
VLM隐藏状态+未来潜在+历史运动"] F --> G["输出未来航点 W_{t+1:t+T}"]

实验结果

NAVSIM基准对比

方法类型代表方法PDMS (v1) ↑EPDMS (v2) ↑
端到端DiffusionDrive88.184.5
VLAReCogDrive-8B90.583.6
像素级WMDriveVLA-W090.286.1
潜在级WMLatent-WAM87.7
HyWorldVLA本文90.5989.71

HyWorldVLA在v1和v2基准上均达到SOTA,显著优于像素级WM基线(DriveVLA-W0)和潜在级WM基线(Latent-WAM)。性能提升归因于混合世界建模范式,调和了像素级的细粒度时空建模与潜在级的高层语义表示能力。

消融实验

配置PDMS ↑说明
Pure LWM(去像素回归)87.50时空建模能力缺失,最低分
Pure WAM(去潜在表示)89.91高层语义学习受限
去语言引导90.35语言引导规划相关语义
去动作专家潜在条件90.29未来信息显式利用有益
去共微调潜在监督90.17防止语义坍缩重要
完整模型90.59所有组件协同最优

场景噪声鲁棒性

在655个含雨雾非均匀噪声的测试案例上,HyWorldVLA达到86.87 PDMS,而WoTE仅60.65、DriveLaW仅67.49、DriveVLA-W0仅61.18。Pure WAM和去潜在监督配置分别为69.95和73.18,进一步证明潜在表示设计是噪声鲁棒性的关键来源。定性分析表明HyWorldVLA在光照变化下行为一致,而DriveVLA-W0表现出严重不稳定。

图3:噪声鲁棒性对比

图3:混合世界建模提升场景噪声鲁棒性——DriveVLA-W0在光照变化下行为不稳定,本文方法保持一致性。

从信息论角度,混合世界建模的优势可理解为像素级和潜在级监督提供互补信息。设像素级监督提供的信息量为 $I_{ ext{pixel}}$,潜在级监督提供的信息量为 $I_{ ext{latent}}$,则混合模型的总信息量为:

$$I_{ ext{hybrid}} = I_{ ext{pixel}} + I_{ ext{latent}} - I_{ ext{overlap}}$$

其中 $I_{ ext{overlap}}$ 为两种监督的冗余信息。预训练阶段同时使用两种监督最大化 $I_{ ext{hybrid}}$,而共微调阶段仅保留潜在监督以减少噪声敏感的像素级冗余。这解释了为何共微调阶段去除像素级监督反而提升性能——在推理时噪声会放大像素级预测的误差,而潜在空间编码天然过滤了高频噪声。

噪声鲁棒性还可从VAE压缩的角度理解。VAE将视频压缩到 $c' imes rac{T}{4} imes rac{H}{8} imes rac{W}{8}$ 的潜在空间,压缩比约为原始视频的 $ rac{1}{256}$。这一 aggressive 压迫使噪声被平均化到更粗粒度的表示中,类似于低通滤波器的效果。设原始视频帧的噪声方差为 $\sigma^2_{ ext{pixel}}$,潜在空间的等效噪声方差约为:

$$\sigma^2_{ ext{latent}} pprox rac{\sigma^2_{ ext{pixel}}}{K}, \quad K = 8 imes 8 imes 4 = 256$$

即潜在空间的噪声方差降低约256倍,解释了为何HyWorldVLA在雨雾场景下PDMS仅下降约3.7分(90.59→86.87),而像素级方法DriveVLA-W0下降约29分(90.2→61.18)。

局限性

  1. 基于单目相机的框架尚未扩展到多模态传感器(如LiDAR、环视相机)
  2. 潜在动力学与关键交通要素的耦合有待加强
  3. 噪声鲁棒性测试集仅涵盖雨雾场景,其他噪声类型(雪、夜间低光)未充分验证
  4. 视频VAE的文本交叉注意力增加了训练复杂度

总结与展望

HyWorldVLA提出混合自动驾驶世界模型,结合像素级方法的细粒度时空建模与潜在变体的噪声鲁棒性。像素级重建保留详细空间和动态信息,VAE空间中的潜在预测固有地提升噪声韧性。NAVSIM v1/v2实验达到SOTA,雨雾噪声输入进一步验证了鲁棒性。未来方向包括扩展到多模态传感器和加强潜在动力学与关键交通要素的耦合。

金句:像素级世界建模提供细粒度时空推理但惧怕噪声,潜在世界建模鲁棒但缺乏接地——混合两者是自动驾驶VLA的最优解。

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日