Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLAPaperVision-Language-Action

MulRobBench:面向安全与安全策略合规的决策级基准

提出MulRobBench,面向多机器人安全与安全策略合规的决策级基准,评估多机器人系统的安全决策能力。

Belal S. Alsinglawi, Weizheng Wang, Junyi Wu, Yi Jiang, Lianhai Lin, Merouane Debbah, Izzat Alsmadi2026年7月26日2 分钟阅读
EN

MulRobBench:安全策略合规的多模态UAV智能体决策级基准

机构:Zayed University, Adelaide University, 应急管理大学, Khalifa University, Texas A&M  |  arXiv:2607.23870v1


一句话总结

MulRobBench是一个面向智慧城市VLA UAV智能体的离线、协议条件化决策级基准,将真实UAV多模态观测、协议级安全策略约束和动作级网络物理安全评估统一在单一可审计决策合同中,包含3,024个样本、17个任务分类节点和12个评分维度,揭示当前最佳模型的协议决策得分仅0.5141。


研究背景与动机

智慧城市空域正将无人机从被动感知平台转变为网络物理决策者——必须在降级观测和模糊语言下坚持操作规则。现有UAV和多模态基准覆盖感知、导航、协作和任务推理,但很少检验物理证据、协议约束和动作风险在关键决策点是否保持耦合。

MulRobBench填补了这一空白:在单一可审计决策合同中链接真实UAV多模态观测、协议级安全策略约束和动作级网络物理安全评估。核心问题:当物理证据、协议规则和动作风险在决策点耦合时,当前多模态模型能否做出可靠的安全合规决策?

图1:MulRobBench概览

图1:MulRobBench基准概览——物理观测+协议语义+安全动作的耦合决策。

基准设计

层次化任务设计

每个样本 $x_i$ 具有三层决策结构加动作标签包:

$$x_i = (O_i, C_i, R_i, \Gamma_i), \quad \Gamma_i = (A_i^\star, \mathcal{A}_i^+, \mathcal{A}_i^-)$$

其中 $O_i$ 为物理观测(真实UAV多模态数据),$C_i$ 为协议语义和任务规则条件,$R_i$ 为观测降级和语言扰动压力。动作标签包 $\Gamma_i$ 包含标准安全动作 $A_i^\star$、可接受安全替代 $\mathcal{A}_i^+$ 和禁止动作 $\mathcal{A}_i^-$。

评分维度定义为能力轴而非样本桶:

$$D_d = (\mathcal{Y}_d, \pi_d, s_d), \quad d = 1, \ldots, 12$$

其中 $\mathcal{Y}_d$ 为维度 $D_d$ 的归一化输出空间,$\pi_d(x_i) = g_{id}$ 将样本投影到维度级真值,$s_d(\cdot, \cdot) \in [0,1]$ 给出受控语义得分。

整个基准可形式化为:

$$\mathcal{B} = (\mathcal{X}, \mathcal{D}, \mathcal{A}, \mathcal{E}), \quad \mathcal{E} = (\mathcal{E}_{sem}, \mathcal{E}_{str})$$

其中 $\mathcal{X}$ 为评估样本集,$\mathcal{D}$ 为评分维度集,$\mathcal{A}$ 为受控动作集,$\mathcal{E}_{sem}$ 和 $\mathcal{E}_{str}$ 分别为语义评分和严格诊断程序。

图2:四评估链接

图2:四个评估链接——操作上下文理解、多模态证据仲裁、降级感知推理、风险感知动作规划。

四评估链接

12个评分维度分为四个评估链接:

$$\mathcal{G}_{\text{ctx}} = \{D_1, D_2, D_3\}, \quad \mathcal{G}_{\text{ev}} = \{D_5, D_7, D_8, D_9\}$$ $$\mathcal{G}_{\text{deg}} = \{D_4, D_6\}, \quad \mathcal{G}_{\text{act}} = \{D_{10}, D_{11}, D_{12}\}$$

模型级度量向量为:

$$M_m = (P_m, \text{SA}_m, \text{UR}_m, \text{PACS}_m, Z_m)$$

其中 $P_m$ 为协议决策得分,$\text{SA}_m$ 为安全动作准确率,$\text{UR}_m$ 为不安全动作率,$\text{PACS}_m$ 为协议感知合规得分,$Z_m$ 为严格维度准确率。

graph TD
    A["样本 x_i = (O_i, C_i, R_i, Γ_i)"] --> B["物理观测 O_i
真实UAV多模态数据"] A --> C["协议语义 C_i
安全策略约束"] A --> D["降级压力 R_i
观测退化+语言扰动"] A --> E["动作标签 Γ_i
标准/可接受/禁止"] B --> F["四评估链接"] C --> F D --> F E --> F F --> G["ctx: 操作上下文理解 D1-D3"] F --> H["ev: 多模态证据仲裁 D5,D7-D9"] F --> I["deg: 降级感知推理 D4,D6"] F --> J["act: 风险感知动作规划 D10-D12"] G --> K["语义评分 + 严格诊断"] H --> K I --> K J --> K

实验结果

总体结果

17个多模态模型统一审计结果显示:语义协议决策得分、严格维度准确率和动作安全性不同步提升。按协议决策得分排名,Qwen3-VL 8B最高(0.5141),但按语义均值维度得分排名,Qwen3.5 9B最优(0.4815),且严格维度准确率也最高(0.1599)。没有单一模型在所有维度上占优。

模型协议决策 ↑均值维度 ↑安全动作 ↑不安全率 ↓严格维度 ↑
Qwen3-VL-8B0.51410.47770.81020.06510.1428
Qwen3-VL-4B0.50660.43580.83860.05460.1308
Qwen3.5-9B0.49780.48150.71790.09760.1599
Qwen2.5-VL-7B0.44990.37980.79370.00000.1300
图3:模型排行榜

图3:17个模型的排行榜和动作审计视图。

模态移除消融

20锚点模态移除研究显示,每个模型改变4-15个动作选择,证明视觉和文本输入都影响决策形成,但最强输入条件因度量而异。这揭示了多模态UAV决策中视觉和语言信息的互补性。

图4:逐维度结果

图4:D1-D12逐维度结果结构——局部化模型差异到具体评估链接。

错误案例分析

错误案例可分为:(1) 协议违反——模型忽视安全策略约束选择禁止动作;(2) 格式不合规——输出无法解析;(3) 降级敏感——观测退化导致推理失败;(4) 证据冲突——多模态证据矛盾时仲裁失败。人类参考基线在分层子集上达到显著更高的语义、结构和动作复合值,标定了模型差距。

图5:多维度权衡视图

图5:多维度权衡视图——语义理解vs结构合规vs动作安全。

条件组分析

条件组评估重点关键发现
高降级压力观测退化+语言模糊模型性能下降15-30%
严格协议约束多重安全规则冲突不安全动作率上升2-5倍
多模态证据冲突视觉与文本矛盾模型倾向于文本或随机选择
长时序推理多步决策链错误随步数累积放大

表2:条件组分析结果——不同压力条件下模型表现的系统性差异。

从评估方法论角度,MulRobBench的创新在于将语义评分和严格诊断分离。语义评分 $s_d(\hat{y}_{im}, g_{id}) \in [0,1]$ 衡量模型输出与真值的语义相似度,而严格诊断检查格式合规性、安全策略遵循和动作可解析性。这种分离揭示了模型"看似正确实则不合规"的情况——例如模型可能语义上理解了任务要求但选择了格式错误或违反协议的动作。严格维度准确率 $Z_m$ 的计算:

$$Z_m = rac{1}{12} \sum_{d=1}^{12} \mathbf{1}\{s_d(\hat{y}_{im}, g_{id}) \geq au_d \land ext{format}(\hat{y}_{im}) = ext{valid}\}$$

其中 $ au_d$ 为维度 $d$ 的通过阈值。$Z_m$ 远低于语义得分(0.1599 vs 0.5141)表明格式和协议违规是主要瓶颈。归一化失败率(normalization failure rate)进一步过滤了无法解析的输出——失败率超过5%的模型不具备动作指标最佳标记资格。这一设计确保了排行榜的可比性和公平性。

模态移除消融的20锚点设计使每个模型在移除视觉、移除文本或移除特定模态组合下分别评估,改变4-15个动作选择。这一发现对UAV系统设计有直接指导意义:视觉和文本输入不是简单的冗余备份而是互补信息源——不同评估维度依赖不同模态。例如操作上下文理解更依赖文本协议描述,而多模态证据仲裁更依赖视觉观测。这种互补性意味着VLA UAV系统必须同时维护高质量视觉感知和准确的协议文本理解,不能简单以单一模态替代。

局限性

  1. 基准为离线评估,未涵盖在线交互和实时决策延迟
  2. 3,024个样本虽覆盖17个分类节点,但真实城市空域场景更多样
  3. 协议约束基于特定智慧城市规范,不同地区法规可能不同
  4. 17个模型评估虽全面,但新兴模型和专用UAV模型未纳入

总结与展望

MulRobBench是首个将物理观测、协议语义和安全动作耦合在决策点评估的UAV多模态基准。3,024个样本、17个分类节点和12个评分维度提供了多维度诊断矩阵。17个模型的评估揭示当前系统远未达到可靠的协议条件化UAV决策——最佳协议决策得分仅0.5141,严格维度准确率仅0.1599。语义理解、结构合规和动作安全不同步提升,表明多模态模型在安全关键决策中存在系统性差距。模态移除研究证明了视觉和文本输入的互补性。该基线为未来VLA UAV智能体的安全合规研究提供了严格评估框架。

金句:语义理解好不等于安全决策好——当前最佳多模态模型的协议决策得分仅0.5141,揭示物理证据、协议约束和动作风险在决策点耦合时存在系统性差距。

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日