Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

航空Aerial多模态大模型

航空多模态大模型智能体的零样本任务级评估

多模态大模型正成为航空任务的核心,本工作提出零样本任务级评估框架。

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano2026年7月24日3 分钟阅读
EN

MissionBench:空中MLLM代理的任务级零样本评估基准

作者:Suman Navaratnarajah 等8人  |  机构:纽伦堡工业大学 & Fraunhofer IVI & THWS & AIST  |  arXiv:2607.22014v1  |  主页:gomtae.github.io/publications/missionbench


一句话总结

MissionBench是一个评估冻结MLLM在空中3D环境中执行任务级指令的基准,包含5个仿真环境、4种任务类型共120个任务。22个MLLM中最强者成功率仅34.8%,而人类达84.4%,揭示了多步具身任务的巨大挑战,同时发现模型缩放带来一致的零样本能力提升。


研究背景与动机

多模态大语言模型(MLLM)正成为具身代理的核心推理模块,但通用模型能否从单一高层指令解决长horizon具身任务仍不清楚。现有基准只提供部分证据:视觉语言导航(VLN)评估路径级指令跟随,物体导航聚焦定位目标,ALFRED等任务驱动基准仍依赖步级子目标。这些设定不直接评估冻结MLLM能否协调感知、规划、控制和报告。

Figure 1: MissionBench概览

图1:MissionBench在5种环境、4种任务类型(报告、检查、操作、巡逻)上评估MLLM的任务级空中推理能力。

空中环境是特别苛刻的测试平台,因为UAV任务对视点敏感且开放式。成功通常需要到达信息丰富的姿态、保持视觉接触、随时间适应行动并报告任务特定结果。现有空中基准主要关注路径跟随或物体搜索,尚未联合评估冻结MLLM在多种任务类型上的连续幅度姿态控制、任务特定成功标准和显式报告。


MissionBench设计

任务形式化

将任务建模为具身指令跟随问题。任务开始时,代理接收任务指令 $M$(如"报告红色车的车牌号")、通用任务信息和初始自我中心RGB图像 $I_0$,位于姿态 $p_0 = (x_0, y_0, z_0, \psi_0)$,其中 $(x,y,z)$ 为3D位置,$\psi$ 为偏航角。代理输出结构化响应,包含边界框、推理、动作原语及幅度、报告信息和DONE标志。

代理从8个方向原语(前进/后退/左右平移/上升/下降/左右转)中选择,每个有可允许幅度(最大 $d_{\max}$ 米或 $3d_{\max}$ 度)。在步骤 $t$,代理接收当前图像 $I_t$、最多两张前序图像和动作历史,循环直到DONE或步预算 $T_{\max}$ 耗尽。

四种任务类型

  • 报告(Reporting, 37.5%):侦察任务,从自我中心观测中提取并报告信息(读文本、数物体、识别场景属性)。
  • 检查(Inspection, 26.7%):基础设施检查和搜救,到达观测就绪构型使目标清晰可见。
  • 操作(Manipulation, 13.3%):着陆、载荷投放、样本采集,识别并接近空间位置后执行物理动作。
  • 巡逻(Patrol, 47.5%):周界安全、交通监控、环境监测,沿环境结构跟随路线。
Figure 2: 闭环评估流水线

图2:MissionBench闭环评估流水线。MLLM接收任务指令和自我中心图像,输出结构化响应,动作被解析为可执行航点。

仿真环境

基于Unreal Engine 5和Cosys-AirSim构建,包含5种高保真环境:社区、城市、森林、热带草原和AirSimNH。涵盖不同物体密度、光照条件和地形复杂度。真值轨迹长度从13米到4171米,中位数93米,均值260米。


评估指标

成功率(SR):任务完成而非仅距离。检查任务要求最终位置满足 $\|p_i - p^*\| < \tau_d$($\tau_d = 5$m)和方向 $|\psi_i - \psi^*| < \tau_\psi$($\tau_\psi = 15°$):

$$\text{SR}_{\text{insp}} = \mathbb{1}[\|p_i - p^*\| < \tau_d \wedge |\psi_i - \psi^*| < \tau_\psi]$$

报告任务评估提取信息是否正确(LLM-as-judge软匹配)。操作任务要求空间阈值和任务特定动作成功。巡逻任务计算真值与生成轨迹的20m缓冲区IoU:

$$\text{SR}_{\text{patrol}} = \mathbb{1}[\text{IoU}_{\text{buffer}} > 0.5]$$

Oracle成功率(OSR):代理是否在任一时刻通过目标 $\tau_d$ 范围内。OSR与SR对比可区分导航失败(低OSR)还是最后一步感知/报告失败(高OSR低SR)。

任务进度(MP):连续进度信号:

$$\text{MP} = \max\left(0, \frac{\sum_{t=1}^{T}(d_{t-1} - d_t)}{d_0}\right)$$

步效率(Eff):$\text{Eff} = 1 - T_{\text{used}}/T_{\max}$。碰撞率(CR):发生碰撞的步数比例。

步预算 $T_{\max}$ 按任务类型设置:巡逻任务 $T_{\max}=50$,其余 $T_{\max}=20$。每步可允许幅度 $d_{\max}$ 自动设为起始到终止姿态距离的1/4:

$$d_{\max} = \frac{1}{4} \| p_{\text{start}} - p_{\text{goal}} \|$$

这确保每个任务在最大允许时间范围内可解,同时允许灵活控制以从错误中恢复。Oracle差距定义为:

$$\Delta_{\text{oracle}} = \text{OSR} - \text{SR}$$

$\Delta_{\text{oracle}} > 0$ 表示代理到达目标但未完成任务——导航成功但最后一步感知/报告失败。感知与任务性能的相关性为:

$$r_{\text{mIoU,MP}} = 0.463, \quad r_{\text{RMSE,MP}} = -0.315$$

这表明单帧空间感知准确度仅为任务级成功的中等预测因子,证实MissionBench捕获了超越单帧感知的能力。

flowchart TD
    A["任务指令 M + 初始图像 I₀"] --> B["MLLM代理推理"]
    B --> C["结构化输出:
边界框 + 推理 + 动作 + 报告 + DONE"] C --> D{"DONE?"} D -- "否" --> E["解析动作为航点"] E --> F["仿真器执行→新观测 I_t"] F --> B D -- "是" --> G["评估: SR/MP/OSR/CR/Eff"] D -- "步预算耗尽" --> G

实验结果

评估22个开源和闭源MLLM,无空中特定微调。每个任务执行3次取平均。30任务测试集。

模型SR(%)↑MP↑OSR(%)↑CR(%)↓Eff(%)↑
随机基线0.05.73.30.164.8
Gemini 3.1 Pro34.873.317.24.353.6
Gemini Robotics 1.632.270.317.81.613.6
Gemma-4-31B-IT26.759.311.14.716.6
GPT-5.42.045.00.05.025.7
Claude Opus 4.63.318.910.04.017.9
Qwen 3.5 27B10.053.28.90.036.0
人类(键盘控制)84.494.251.1
人类(VLM接口)70.079.036.7
Figure 3: 轨迹示例

图3:人类真值(绿色)与三个MLLM轨迹对比。绿色圆圈=成功,红色叉=失败。

关键发现

  • 任务级零样本空中控制极具挑战:最强模型仅34.8%成功率,多数模型低于10%。
  • 缩放带来一致提升:Gemini 3.1 Pro大幅超越Flash Lite(73.3 vs 24.0 MP),Qwen 3.5从2B到27B的MP从18.1升至53.2。
  • Oracle差距:OSR > SR模式(如Gemini 3 Flash: 20.2% vs 7.9%)表明代理到达目标但未能完成最后感知/报告。
  • 感知不足以解释成功:单帧空间感知与任务性能仅中等相关(Pearson $r_{\text{mIoU,MP}} = 0.463$),任务级成功需要协调多能力。
Figure 4: 消融实验

框架消融

消融项变体SR(%)MP
采样温度T=0.0 / 0.7 / 1.040.0 / 57.1 / 46.768.1 / 68.4 / 59.8
输入分辨率SD / HD / FHD42.9 / 50.0 / 57.175.3 / 72.8 / 68.4
历史长度1 / 3 / 5张前序图28.6 / 57.1 / 30.833.1 / 68.4 / 69.6
结构化输出默认 / 无BBox / 无推理57.1 / 42.9 / 20.068.4 / 70.2 / 58.9

推理字段对成功至关重要——移除后SR从57.1%降至20.0%。3张历史图最优,更多反而稀释相关信息。高分辨率主要提升任务完成而非粗略进度。

缩放行为详解

在Qwen 3.5稠密模型系列中,从2B到27B的缩放效果一致:MP从18.1稳步提升至53.2,SR从0.0%提升至10.0%。Gemini系列中,3.1 Pro大幅超越Flash Lite(73.3 vs 24.0 MP)和Gemini 2.5 Pro(54.2 MP)。Gemini Robotics从1.5到1.6也有显著提升(35.9→70.3 MP,0.0%→32.2% SR)。然而缩放并非严格单调:Claude系列中Sonnet 4.6在MP和SR上均优于Opus 4.6,Qwen 3.6变体未全面超越Qwen 3.5。这表明虽然缩放是强驱动因素,但架构和训练差异也起重要作用。

空间感知分析

为测试任务性能是否主要由单帧3D空间感知能力解释,在隔离感知设定中评估MLLM:给定Proxy分割的初始图像 $I_0$,预测目标边界框和距离。结果显示感知准确度与端到端任务性能仅中等相关。Gemini Robotics 1.6达到最高mIoU且任务性能较强,但Claude Opus 4.6达到最低RMSE却任务表现不佳,Gemini 2.5 Pro在近乎零mIoU下仍达到非平凡的MP和SR。这证实静态感知准确度不足以解释任务级成功——成功需要将感知与指令跟随、空间推理和序列决策相整合。


失败模式分析

  1. 过早终止:代理在前几步即声明任务完成,尽管远离目标。
  2. 漂移和振荡:代理耗尽步预算在地标附近盘旋而不收敛。
  3. 任务目标未满足:代理到达目标附近但错误识别物体或属性(如将犀牛误认为大象)。

局限性

  1. 仅评估冻结MLLM,未考虑微调或特定训练的空中模型。
  2. 5种环境虽多样但可能未覆盖所有真实世界场景。
  3. 人类基线样本量较小(N=2-3)。
  4. 闭环仿真计算成本较高,限制了大规模评估。

总结与展望

MissionBench是首个在空中3D环境中联合评估冻结MLLM任务级能力的基准,涵盖4种任务类型和5种环境。22个模型中最强者仅完成约1/3任务,单帧空间感知不足以解释成功——任务级能力需要协调感知、规划、控制和报告。缩放带来一致的零样本提升,既显示机遇也引发对可靠性、安全性和非受控能力涌现的担忧。

金句:"任务级能力需要协调多种能力超越空间感知,包括多步规划和自适应推理。"——MissionBench揭示了通用MLLM在长horizon具身任务中的根本挑战,为闭环评估和缩放驱动的改进提供了基准。


深度解读由 RobotWorld paper-detail-generator 基于全文精读生成 | arXiv:2607.22014v1