Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

具身智能PaperEmbodied AI

LabRobFail:化学自助实验室中机器人失效分析基准

提出LabRobFail,化学自助实验室中机器人失效分析基准,评估具身agent在安全关键化学实验中的可靠性与失效应对。

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang2026年7月26日3 分钟阅读
EN

LabRobFail:化学自驾驶实验室中的机器人失败分析基准

论文:LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

作者:Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

链接arXiv:2607.23704 | 代码GitHub


一句话总结

LabRobFail 是一个面向化学自驾驶实验室的失败中心框架,通过 LabRobFail-Sim 在控制/物理/语义三个层级注入可控失败,构建了包含 20,000+ 轨迹、11 种细粒度失败类型的数据集,并开发了六维评估基准和领域专用视觉语言模型 LabRobFail-VLM,在已见环境中达到 90.83% 失败检测准确率和 77.21% 时间定位准确率,作为实时监督器可将下游任务成功率提升 4-16 个百分点。


研究背景与动机

具身智能体在自驾驶实验室中的部署可以加速科学发现,但其可靠性受到化学实验不可逆和安全关键特性的制约。现有进展受限于失败数据稀缺和细粒度评估协议的缺失。现有机器人失败检测数据集(如 RLBench-Fail、AHA、RoboFAC)均不支持化学实验室环境和专用实验仪器,且缺乏细粒度纠正、时间定位和严重性评估能力。

化学实验室场景的特殊性在于:透明玻璃器皿、反射性液体表面、不可逆的有害混合物等,使得失败检测比家庭场景更具挑战性。LabRobFail 正是为填补这一空白而设计。

框架总览

图1:LabRobFail 框架总览。高保真仿真平台自动注入五类失败:感知(PF)、抓取(GF)、运动(MF)、逻辑(LF)和安全(SF)。


方法详解

1. LabRobFail-Sim:多层级失败注入

LabRobFail-Sim 在三个层级注入可控失败,以生成多样化的失败轨迹。

控制级扰动($\Phi_{ctrl}$):通过向关键帧参数注入随机噪声模拟执行错误。对平移 $\mathbf{p}_i$ 施加高斯扰动,对旋转 $\mathbf{R}_i$ 施加李代数噪声:

$$ \tilde{p}_i = p_i + \xi_{trans}, \quad \tilde{R}_i = R_i \cdot \text{Exp}(\xi_{rot}) $$

其中 $\xi \sim \mathcal{N}(0, \Sigma)$。夹爪命令以失败概率 $\lambda_{grip}$ 被破坏,模拟执行器故障。

物理级扰动($\Phi_{phy}$):动态调整仿真动力学参数 $\Psi = \{\mu, m, \nu, \dots\}$(摩擦系数、质量、粘度等),通过均匀缩放诱导滑动或抓取不稳定等涌现性失败:

$$ \tilde{\psi} = \psi \cdot (1 + \delta), \quad \delta \sim \mathcal{U}(-\alpha, \alpha) $$

语义级扰动($\Phi_{sem}$):引入任务逻辑错误,建模为序列索引上的排列算子 $\pi$ 模拟步骤逆转或跳过($\tilde{\tau}_{seq} = \{T_{\pi(1)}, \dots\}$),以及目标对象替换映射 $\mathcal{M}(o_i)$(如选择错误试剂),导致安全约束违规。

仿真框架

图2:LabRobFail-Sim 框架。(a) 多级失败生成器;(b) LLM驱动的语义标注管线。

2. LabRobFail-Data 数据集

基于 LabRobFail-Sim 构建的大规模数据集,包含 20,000+ 交互轨迹,覆盖 70+ 实验室任务场景。任务按复杂度分为三个层级:

  • 短时任务($\leq 10$ 帧):原子操作如 pick、place、pour,失败通常为瞬时执行错误
  • 中时任务(10-30 帧):链式 2-3 个原子操作,检验关键动作转换处的失败检测
  • 长时任务($> 50$ 帧):复杂多阶段工作流,需要层次化规划和精确故障定位

失败分类体系覆盖 5 大类 11 种细粒度类型:感知失败(PF)、抓取失败(GF)、运动失败(MF)、逻辑失败(LF)和安全失败(SF)。数据集还生成配对的成功-失败轨迹以最小化混淆因素。

数据集与基准

图3:LabRobFail-Data 和 LabRobFail-Bench。(a) 任务复杂度分布;(b) 失败类型分布;(c) 六维评估基准。

3. LabRobFail-Bench 六维评估基准

将失败分析任务定义为从多模态观测到结构化诊断报告的映射。给定输入 $\mathcal{X} = \langle\mathcal{V}, \mathcal{Q}\rangle$(RGB视频流 $\mathcal{V}$ 和任务指令 $\mathcal{Q}$),模型预测复合失败状态 $\mathcal{Y}$:

$$ \mathcal{Y} = \langle \underbrace{y_{task}}_{L1},\, \underbrace{y_{dete},\, y_{loca}}_{L2},\, \underbrace{y_{type},\, y_{risk},\, y_{corr}}_{L3} \rangle $$

涵盖任务状态 $y_{task}$、检测标志 $y_{dete}$、时间定位 $y_{loca}$、失败类型 $y_{type}$、风险严重性 $y_{risk}$ 和可执行纠正策略 $y_{corr}$,分为三个递进认知层级。

4. LabRobFail-VLM 视觉语言模型

基于 Qwen3-VL 构建的专业模型,由视觉编码器 $E_\phi$、模态投影器 $P_\psi$ 和语言解码器 $D_\theta$ 组成。给定输入 $\mathcal{X} = (X_{\text{grid}}, \mathcal{Q}_{\text{instruct}})$,提取视觉和文本表示:

$$ Z_v = P_\psi(E_\phi(X_{\text{grid}})), \quad Z_t = \text{Tokenizer}(\mathcal{Q}_{\text{instruct}}) $$

然后自回归预测失败输出:

$$ P(\mathcal{Y} \mid \mathcal{X}) = \prod_{j=1}^{L} D_\theta(y_j \mid y_{<j}, Z_v, Z_t) $$

混合微调策略:将参数分为视觉相关 $\Theta_V = \{\phi, \psi\}$ 和语言相关 $\Theta_L = \{\theta\}$。视觉编码器和投影器全参数微调(学习率 $2 \times 10^{-6}$ 和 $1 \times 10^{-5}$),语言解码器使用 LoRA(rank 64, scaling 128, dropout 0.05, 学习率 $1 \times 10^{-4}$)适配。训练目标为:

$$ \min_{\phi, \psi, \Delta\theta} \sum_{(\mathcal{X}, \mathcal{Y}) \in \mathcal{D}} -\log P(\mathcal{Y} \mid \mathcal{X};\, \phi, \psi, \theta_0 + \Delta\theta) $$ VLM架构

图4:LabRobFail-VLM 概览。时间索引的多视角关键帧由混合微调的 Qwen3-VL 处理。

flowchart TD
    A["化学实验室仿真环境"] --> B["LabRobFail-Sim
三级失败注入"] B --> B1["控制级: 高斯噪声+李代数
平移/旋转/夹爪扰动"] B --> B2["物理级: 动力学参数缩放
摩擦/质量/粘度"] B --> B3["语义级: 步骤排列+对象替换
逻辑错误+安全违规"] B1 --> C["LabRobFail-Data
20K+轨迹, 11种失败类型"] B2 --> C B3 --> C C --> D["LLM语义标注管线
GPT-5.4 VQA"] D --> E["LabRobFail-Bench
六维评估"] E --> F["LabRobFail-VLM
Qwen3-VL混合微调"] F --> F1["视觉: 全参数微调"] F --> F2["语言: LoRA适配"] F1 --> G["结构化失败诊断+纠正"] F2 --> G G --> H["下游策略恢复
成功率+4-16pp"] style B fill:#e1f5fe style F fill:#fff3e0 style G fill:#e8f5e9

实验结果

主实验结果(已见环境)

表1:LabRobFail-Bench 主实验结果(已见环境,准确率%)
方法Q1 任务理解Q2 失败检测Q3 时间定位Q4 严重性Q5 分类Q6 ROUGE-L
Qwen3-VL-8B47.4559.505.5947.8435.880.2976
LLaVA-1.6-13B35.8052.9613.2433.5331.180.2598
Gemini-2.5-flash38.9257.1315.5348.8439.680.1231
GPT-5.445.1652.3415.8847.0638.540.1520
LabRobFail-VLM94.4590.8377.2183.1873.210.7542

LabRobFail-VLM 在所有维度大幅领先通用 VLM:失败检测准确率 90.83%(vs GPT-5.4 的 52.34%),时间定位 77.21%(vs 15.88%),纠正策略 ROUGE-L 0.7542(vs 0.1520)。

消融实验

表2:消融实验(已见分割)
变体Q2 检测Q3 定位Q5 分类Q6 ROUGE-L
全参数微调85.2472.2470.240.7142
冻结视觉81.1360.2161.240.4529
无时间索引86.4570.5869.240.6471
LabRobFail-VLM (完整)90.8377.2173.210.7542

混合微调优于全参数微调(Q2: 90.83 vs 85.24),冻结视觉导致 Q6 从 0.7542 降至 0.4529,证明视觉全微调对实验室特定感知线索的关键作用。

下游策略恢复

表3:下游策略恢复任务成功率
任务策略基线(%)+Ours(%)提升
PickOpenVLA7684+8%
PourOpenVLA1628+12%
PourACT3248+16%
Open drying ovenOpenVLA2840+12%
安全失败示例

图5:安全失败示例——协议违规(有害混合物)。


局限性

  1. 仿真到真实差距:训练完全依赖合成数据,真实世界部署存在视觉域差距,透明器皿和反射液体的渲染保真度可能不足。
  2. 确定性动作字典限制:纠正策略通过确定性 Action Dictionary 转换为控制原语,限制了恢复灵活性,无法处理开放性语言纠正。
  3. 困难任务绝对成功率仍低:Pour 任务即使在 +16pp 提升后仅 48%,可靠实验室恢复仍是开放挑战。

总结与展望

LabRobFail 提供了化学实验室机器人失败分析的完整框架:物理仿真平台(Sim)、20K+ 轨迹数据集(Data)、六维评估基准(Bench)和专业 VLM 模型。LabRobFail-VLM 在失败推理上大幅超越通用基线,并通过闭环恢复将下游任务成功率提升 4-16pp,为可靠的自主科学发现铺路。

金句:「化学实验的不可逆性和安全关键性使得失败理解不再是可选项——LabRobFail 通过三级可控失败注入和六维结构化诊断,将失败从不可预测的黑箱事件转化为可检测、可定位、可纠正的工程化对象。」

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
ABot-N1:通用视觉语言导航基础模型

ABot-N1:通用视觉语言导航基础模型

高德ABot-N1是一个慢快双系统视觉语言导航基础模型:4B慢系统输出思维链与Target/Affordance双像素目标,2B快系统经QFormer动作查询解码连续SE(2)轨迹点,用统一像素接口覆盖坐标点、物体、POI、指令跟随与人员跟随五类任务。3000万样本预训练+GRPO安全感知后训练,并发布ABotN-PointBench与ABotN-POIBench两个闭环基准。五基准全部SOTA:POI入口到达77.3%(+35.0个百分点),室外/室内坐标点导航92.9%/95.4%,并部署于途途四足机器人Jetson AGX Orin。

视觉语言导航VLN导航基础模型2026年7月11日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日