Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLA混合专家组合泛化

MoE-VLA中的涌现组合技能

混合专家视觉语言动作模型(VLA)在规模扩展时展现涌现的组合技能。本文研究MoE-VLA架构中组合泛化能力的涌现机制及其对机器人操作的影响。

Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali2026年7月22日4 分钟阅读
EN

研究背景与动机

视觉-语言-动作模型(VLA)在广泛的机器人操作任务中展现了出色的泛化能力,如 RT-2、OpenVLA、Octo 和 $\pi_0$ 等模型。然而,现有 VLA 通常以单体策略(monolithic policy)形式训练和部署,难以识别可复用技能、层次化组合行为或在不变动整个模型的前提下适应部分策略。与此相对,许多机器人任务天然可分解为可复用的行为模式——如接近、抓取、放置。如果策略能显式学习这种模块化技能结构,可以在保持 VLA 广泛任务能力的同时提升可解释性、组合性和鲁棒性。本文研究的核心问题是:这种模块化结构能否直接从数据中涌现,而非依赖预定义的分解或手动构建的技能库?

值得注意的是,MoE 在自然语言处理领域已有广泛应用(如 Mixtral、GShard),但将其迁移到机器人 VLA 需要解决独特挑战。NLP 中的 MoE 通常逐 token 路由——每个 token 独立选择专家,因为不同 token 可能需要不同处理。但机器人动作具有时序连贯性——一个抓取动作的多个时间步应由同一专家处理以保持行为一致性。本文的"整次前向传播路由"正是针对这一差异的关键设计:一次路由决策贯穿整个动作块生成过程,确保技能连贯性。此外,NLP 中专家通常从零训练,而机器人 VLA 已有强大的预训练骨干,本文利用 LoRA 增量在骨干基础上添加专家而非从头训练,保留了预训练知识的同时实现特化。

已有的层次化 VLA 系统通常施加固定的规划器-控制器分割(planner-controller split),需要预定义技能库或子任务标签。本文提出了不同的思路:在 VLA 的动作专家(action expert)上构建混合专家(MoE)架构,端到端地从专家演示中学习组合策略,不施加任何任务分解或层次结构的先验假设。路由器(router)根据当前观测和语言指令选择专家,隐式地扮演高层控制器角色,而专家则特化为低层行为模式,形成涌现的层次结构。关键发现是:即使是最简单的 MoE 动作专家架构,也能产生可区分的、可解释的、可跨任务复用的专家技能,同时匹配单体基线的任务性能。

核心方法:LoRA 混合专家架构

MoE 架构设计

方法构建在两个预训练 VLA 骨干网络之上——$\pi_0$ 和 SmolVLA,两者均使用流匹配(flow matching)进行动作生成。每个骨干由视觉-语言模块(编码摄像头视图和语言为上下文 token)和动作专家(transformer 解码器,处理本体感知状态 token 和加噪动作块)组成。MoE 仅替换动作专家中每个层的 FFN 子层,自注意力在所有专家间共享:

$$\text{FFN}_\ell(x) = \text{FFN}_\ell^{\text{base}}(x) + \sum_{e \in \mathcal{R}} w_e \left(\text{FFN}_\ell^{(e)}(x) - \text{FFN}_\ell^{\text{base}}(x)\right)$$

其中 $\mathcal{R}$ 为路由专家集(仅 top-$k$ 选中的专家具有非零权重 $w_e$),每个专家仅通过秩为 $r=16$ 的 LoRA 增量与基座不同:$\Delta W = (\alpha/r) BA$。$B$ 矩阵零初始化确保策略在训练第零步精确复现预训练骨干,使特化围绕强先验涌现而非从零学习。这一设计选择至关重要——它保证了 MoE 训练不会退化骨干网络已学到的通用操作能力,而是在其基础上添加可组合的技能变体。

从技术细节看,LoRA 增量的设计有几个关键考量。增量矩阵 $\Delta W = (lpha/r) BA$ 中,$A \in \mathbb{R}^{r imes d}$ 和 $B \in \mathbb{R}^{d imes r}$ 为低秩分解矩阵,$d$ 为 FFN 隐藏维度,$r=16$ 为秩。缩放因子 $lpha/r$ 控制增量相对于基座的强度。$B$ 矩阵零初始化意味着训练初始时 $\Delta W = 0$,即 $ ext{FFN}^{(e)}(x) = ext{FFN}^{ ext{base}}(x)$,所有专家退化为基座——这保证训练从预训练骨干的最优点出发,避免随机初始化的专家破坏已有能力。随着训练进行,$A$ 和 $B$ 逐渐学习到使每个专家特化的增量。相比直接训练完整 FFN 作为专家,LoRA 增量的参数量仅为 $2rd$(远小于 $d^2$),大幅降低了多专家的参数开销,同时低秩约束起到正则化作用防止过拟合。

整次前向传播路由

路由在每个策略前向传播中仅执行一次,并在所有 $L$ 个动作专家层间共享,这与标准 MoE Transformer 逐 token 逐层路由不同。共享单一 (indices, weights) 对使得每个专家成为连贯的端到端行为(即"技能"),而非 $L$ 个独立的逐层路由决策。MLP 路由器 $g_\phi$ 接收编码智能体视觉、语言和本体感知状态的上下文向量:

$$c = \left[\text{MeanPool}\left(\text{VLM}(I, \ell, s)\right) \| W_s s\right]$$

其中 $I, \ell, s$ 分别为摄像头观测、指令和本体感知状态,$W_s$ 与动作专家共享。路由器输出 $E$ 个专家的 logits,取 top-$k$ 并重归一化 softmax 权重,该选择均匀应用于每个 MoE FFN。推理时,路由器每个动作块触发一次。这种"一次路由、全程执行"的设计确保了技能的连贯性——一个抓取专家在整个抓取动作期间持续生效,而非在每一层独立决策可能产生不连贯的行为。

路由器的 top-$k$ 选择机制也值得关注。给定 $E$ 个专家的 logits $z_1, \ldots, z_E$,标准 softmax 会为所有专家分配非零权重,但 MoE 中仅 top-$k$ 专家被激活以控制计算量。设被选中的 top-$k$ 集为 $\mathcal{R}$,则重归一化权重为 $w_e = ext{softmax}(z_e) / \sum_{e' \in \mathcal{R}} ext{softmax}(z_{e'})$($e \in \mathcal{R}$),$w_e = 0$($e otin \mathcal{R}$)。

专家选择的重归一化权重计算可形式化为:

$$w_e = \frac{\exp(z_e)}{\sum_{e' \in \mathcal{R}} \exp(z_{e'})}, \quad e \in \mathcal{R}; \quad w_e = 0, \quad e \notin \mathcal{R}$$

这种稀疏激活使得每次前向传播仅计算 $k$ 个专家的 FFN,计算复杂度从 $O(Ed^2)$ 降低到 $O(kd^2)$。更重要的是,共享路由决策跨所有 $L$ 层进一步将路由开销从 $O(LE)$ 降低到 $O(E + Lk)$,使路由器成为轻量的高层决策模块。

flowchart TD
    I["摄像头观测 I"] --> VLM["视觉-语言模块 VLM"]
    L["语言指令 ℓ"] --> VLM
    S["本体感知 s"] --> VLM
    VLM --> MP["MeanPool 上下文"]
    S --> WS["投影 W_s·s"]
    MP --> C["上下文向量 c"]
    WS --> C
    C --> R["MLP 路由器 g_φ"]
    R -->|top-k 选择"| E1["专家 A: 放置"]
    R -->|top-k 选择"| E2["专家 B: 释放缩回"]
    R -->|top-k 选择"| E3["专家 C: 接近抓取"]
    E1 --> FFN["FFN 子层
base + LoRA 增量"] E2 --> FFN E3 --> FFN FFN --> AC["动作块 â_{t:t+H}
K 步流匹配"]

从工程实现角度看,该方法的骨干无关性(backbone-agnostic)设计具有实用价值——同一 MoE 架构可无缝应用于 $\pi_0$ 和 SmolVLA 等不同 VLA 骨干,无需针对特定骨干调整。这意味着未来新 VLA 骨干出现时可直接复用 MoE 模块获得模块化技能,降低了技术迁移成本。此外,LoRA 增量的低参数量使得在资源受限设备上部署多专家策略成为可能——16 个专家的额外参数量仅相当于一个中等规模 FFN,远低于训练 16 个完整专家的开销。

流匹配(flow matching)是 $\pi_0$ 和 SmolVLA 的核心动作生成机制,理解它对把握本文方法至关重要。流匹配通过学习将噪声分布转化为动作分布的速度场来生成动作:给定加噪动作块 $a_ au$ 和流匹配时间步 $ au$,动作专家预测速度 $v_ heta(a_ au, au, c)$,通过 $K$ 步去噪生成最终动作块 $\hat{a}_{t:t+H}$。

流匹配的速度预测和动作生成过程可形式化为:

$$\hat{a}_{t:t+H} = a_K = a_0 + \frac{1}{K} \sum_{j=1}^{K} v_\theta(a_{j-1}, \tau_j, c), \quad a_0 \sim \mathcal{N}(0, I)$$

MoE 替换的是动作专家中的 FFN 子层,因此不同专家实质上学习不同的速度场修正——专家 A 的速度场倾向于将动作引向放置轨迹,专家 C 的速度场倾向于引向接近抓取轨迹。这种将技能特化嵌入流匹配速度场的方式比直接输出离散动作更平滑,因为流匹配的迭代去噪过程天然提供了动作的时序连贯性。

训练目标

完整目标结合骨干的流匹配行为克隆损失与负载均衡辅助项:

$$\mathcal{L} = \mathcal{L}_{\text{FM}} + \lambda_{\text{LB}} \mathcal{L}_{\text{LB}}$$

其中 $\mathcal{L}_{\text{FM}}$ 为骨干在加噪动作块上的流匹配速度预测损失,$\mathcal{L}_{\text{LB}}$ 为标准负载均衡项(Fedus et al., 2022),防止路由坍缩到单一专家。$\lambda_{\text{LB}}$ 为负载均衡权重。

负载均衡损失的标准形式为:

$$\mathcal{L}_{\text{LB}} = E \sum_{e=1}^{E} f_e \cdot P_e, \quad f_e = \frac{1}{N}\sum_{i=1}^{N} \mathbb{1}[e \in \mathcal{R}_i], \quad P_e = \frac{1}{N}\sum_{i=1}^{N} \frac{\exp(z_e^{(i)})}{\sum_{e'} \exp(z_{e'}^{(i)})}$$

其中 $f_e$ 为专家 $e$ 被选中的批次频率,$P_e$ 为平均路由概率,$E$ 为专家总数。该损失鼓励所有专家被均匀使用,防止路由器将所有输入集中到少数专家。当某专家的 $f_e$ 和 $P_e$ 同时偏高时,乘积 $f_e P_e$ 增大从而增加损失,驱动路由器分散选择。

负载均衡机制至关重要——没有它,路由器可能将所有输入路由到单一专家,使其他专家不被训练而退化。实验观察到模型自主丢弃任务分布实际不需要的容量:16 个专家中有 6 个几乎不被使用,说明 MoE 架构能自适应地分配容量到真正需要多样化的行为模式上。

实验结果

专家技能定性分析

在 LIBERO-10 基准上训练后,路由器选择出三个代表性专家,每个对应质上不同的低层行为:专家 A 处理操作的最终运输阶段——当一个物体已被抓取后激活,将其放置到最终位置;专家 B 释放物体并向上缩回手臂,通常在放置完成后触发;专家 C 接近并抓取薄把手物体(如锅把手、杯子把手),负责初始的接近和抓握动作。这些专家行为是通过自监督涌现的,没有任何预定义的技能标签或子任务标注。

图1:专家A放置已抓取物体到最终位置

图2:专家B释放物体并向上缩回

图3:专家C接近并抓取薄把手物体

可复用 vs 任务特化技能

检查每个活跃专家在 LIBERO-10 上的选择频率揭示了两种截然不同的角色:可复用专家(如专家 A 和 B)各在 35-45% 的频率上被五个不同任务选择,在其他任务上几乎为零。两者覆盖几乎相同的任务集(T0, T1, T4, T6, T7),检查个体轨迹发现路由器在单条轨迹内交替使用它们。任务特化专家(如专家 C 和 D)集中在单一任务上——专家 C 在 T5 上 66%,专家 D 在 T2 上 66%。这些专家合理地吸收了仅一两个任务需要的特殊行为,使可复用专家保持简洁而不被边缘情况污染。

专家类型 代表专家 选择频率 行为描述
可复用A, B35-45% 跨5任务放置/释放缩回,多任务共享
任务特化C, D66% 单任务接近抓取/特殊操作,单一任务集中
未使用6/16≈0%自主丢弃冗余容量

技能组合解决长程任务

轨迹分析显示训练好的 MoE 策略在 LIBERO-10 任务 T2、T4、T5 上展现了清晰的原始技能组合序列。例如任务 T5 中,先用专家 C 抓取书本,再用专家 A 放置到最终位置;任务 T2 中,用专家 C 抓取炉灶旋钮,再用专家 A 将手臂移到把手上。任务 T4 展示了不同现象:策略失败时表现为已知原始技能的重复应用而非退化行为——例如重复执行抓取-释放循环试图恢复,这种"失败也是可解释的"特性是模块化策略的重要优势。路由器作为高层序列器,通过以不同顺序拼接相同原始技能来解决长程任务,如"先抓后放"模式在摩卡壶、杯子和书本任务中复用。

图4:按每步所选专家标注的轨迹示例,不同技能按序组合完成长程任务

手动路由实验

为验证专家是否真正导致行为差异(而非仅因路由器位置),作者进行了手动路由实验:在推理时强制选择特定专家。结果显示手动路由实现了更好的技能拼接,并暗示了分布外泛化能力——即强制使用某专家在新场景中产生了该专家特有的行为模式,证明专家学到了因果性的行为而非偶然关联。

LIBERO 性能对比

骨干网络 方法 训练步数 性能对比
$\pi_0$MoE vs 密集基线20K性能相当
SmolVLAMoE vs 密集基线20K性能相当

MoE 和基线均从相同预训练检查点初始化,以相同优化配置微调 20K 步,唯一区别是动作专家 FFN 是否替换为 MoE。MoE 在匹配密集基线任务性能的同时学习了有意义的特化专家,说明简单 MoE 架构在不牺牲任务能力的前提下驱动了技能特化。

从更广阔的视角看,本文工作代表了机器人学习从"端到端黑箱"向"涌现模块化"转变的趋势。传统单体 VLA 虽然性能强大但不可解释——无法知道模型内部如何分解任务、哪些参数负责哪些行为。MoE 架构通过路由决策将策略分解为可识别的专家模块,每个专家的行为可通过强制路由实验单独检验,使策略具备了某种程度的"可解释性"。更重要的是,这种模块化是涌现的而非设计的——模型仅通过模仿学习加负载均衡就从数据中发现了任务的自然分解结构,这暗示了操作任务本身可能存在某种内在的组合性结构。对于长程任务规划,涌现的模块化策略天然支持技能复用和重组合——新任务可能只需已有技能的新序列,而非全新学习。这一发现对未来机器人学习系统的设计具有深远启示:或许不需要显式设计技能库,而是通过适当的架构诱导让模型自主发现和组合技能。

局限性与未来方向

局限一:专家数量固定且部分未使用。 16 个专家中有 6 个几乎不被使用,表明固定容量分配存在浪费。未来可探索动态专家数量或专家生成/回收机制,根据任务分布复杂度自适应调整容量。

局限二:仅在仿真基准验证。 实验在 LIBERO-10 仿真基准上进行,未在真实机器人上验证涌现技能的泛化性。真实环境的感知噪声和动力学复杂性可能影响路由决策和专家行为的稳定性。此外,专家语义标签是事后人为赋予的,路由器学到的技能边界是否与人类直觉一致仍需更系统的定量验证。

总结与启示

本文证明了使用 MoE 动作专家训练的 VLA 能将操作任务分解为一小组模块化技能,在不同任务间复用,无需预定义层次、技能库或子任务标签。核心技术贡献包括:LoRA 增量专家 $\Delta W = (\alpha/r)BA$($r=16$,$B$ 零初始化)围绕预训练骨干强先验构建特化;整次前向传播路由 $c = [\text{MeanPool}(\text{VLM}(I,\ell,s)) \| W_s s]$ 使每个专家成为连贯端到端技能而非逐层独立决策;负载均衡损失 $\mathcal{L} = \mathcal{L}_{\text{FM}} + \lambda_{\text{LB}}\mathcal{L}_{\text{LB}}$ 防止路由坍缩同时允许自主丢弃冗余容量。在 $\pi_0$ 和 SmolVLA 两种骨干上,MoE 匹配密集基线性能的同时涌现出可区分的专家技能——放置、释放缩回、接近抓取等,可复用专家跨 5 任务 35-45% 频率共享,任务特化专家集中在单一任务 66%。路由器作为高层序列器通过不同顺序拼接相同原始技能解决长程任务,甚至失败也表现为已知技能的重复而非退化。该工作朝向从数据中涌现的模块化、可解释机器人策略迈出了重要一步,对长程规划、技能迁移和策略可解释性具有启示意义。

从工程实现角度看,该方法的骨干无关性(backbone-agnostic)设计具有实用价值——同一 MoE 架构可无缝应用于 $\pi_0$ 和 SmolVLA 等不同 VLA 骨干,无需针对特定骨干调整。这意味着未来新 VLA 骨干出现时可直接复用 MoE 模块获得模块化技能,降低了技术迁移成本。此外,LoRA 增量的低参数量使得在资源受限设备上部署多专家策略成为可能——16 个专家的额外参数量仅相当于一个中等规模 FFN,远低于训练 16 个完整专家的开销。

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日