PAPER DEEP DIVE
LabRobFail:化学自助实验室中机器人失效分析基准
提出LabRobFail,化学自助实验室中机器人失效分析基准,评估具身agent在安全关键化学实验中的可靠性与失效应对。
LabRobFail:化学自驾驶实验室中的机器人失败分析基准
论文:LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory
作者:Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang
链接:arXiv:2607.23704 | 代码:GitHub
一句话总结
LabRobFail 是一个面向化学自驾驶实验室的失败中心框架,通过 LabRobFail-Sim 在控制/物理/语义三个层级注入可控失败,构建了包含 20,000+ 轨迹、11 种细粒度失败类型的数据集,并开发了六维评估基准和领域专用视觉语言模型 LabRobFail-VLM,在已见环境中达到 90.83% 失败检测准确率和 77.21% 时间定位准确率,作为实时监督器可将下游任务成功率提升 4-16 个百分点。
研究背景与动机
具身智能体在自驾驶实验室中的部署可以加速科学发现,但其可靠性受到化学实验不可逆和安全关键特性的制约。现有进展受限于失败数据稀缺和细粒度评估协议的缺失。现有机器人失败检测数据集(如 RLBench-Fail、AHA、RoboFAC)均不支持化学实验室环境和专用实验仪器,且缺乏细粒度纠正、时间定位和严重性评估能力。
化学实验室场景的特殊性在于:透明玻璃器皿、反射性液体表面、不可逆的有害混合物等,使得失败检测比家庭场景更具挑战性。LabRobFail 正是为填补这一空白而设计。
图1:LabRobFail 框架总览。高保真仿真平台自动注入五类失败:感知(PF)、抓取(GF)、运动(MF)、逻辑(LF)和安全(SF)。
方法详解
1. LabRobFail-Sim:多层级失败注入
LabRobFail-Sim 在三个层级注入可控失败,以生成多样化的失败轨迹。
控制级扰动($\Phi_{ctrl}$):通过向关键帧参数注入随机噪声模拟执行错误。对平移 $\mathbf{p}_i$ 施加高斯扰动,对旋转 $\mathbf{R}_i$ 施加李代数噪声:
$$ \tilde{p}_i = p_i + \xi_{trans}, \quad \tilde{R}_i = R_i \cdot \text{Exp}(\xi_{rot}) $$其中 $\xi \sim \mathcal{N}(0, \Sigma)$。夹爪命令以失败概率 $\lambda_{grip}$ 被破坏,模拟执行器故障。
物理级扰动($\Phi_{phy}$):动态调整仿真动力学参数 $\Psi = \{\mu, m, \nu, \dots\}$(摩擦系数、质量、粘度等),通过均匀缩放诱导滑动或抓取不稳定等涌现性失败:
$$ \tilde{\psi} = \psi \cdot (1 + \delta), \quad \delta \sim \mathcal{U}(-\alpha, \alpha) $$语义级扰动($\Phi_{sem}$):引入任务逻辑错误,建模为序列索引上的排列算子 $\pi$ 模拟步骤逆转或跳过($\tilde{\tau}_{seq} = \{T_{\pi(1)}, \dots\}$),以及目标对象替换映射 $\mathcal{M}(o_i)$(如选择错误试剂),导致安全约束违规。
图2:LabRobFail-Sim 框架。(a) 多级失败生成器;(b) LLM驱动的语义标注管线。
2. LabRobFail-Data 数据集
基于 LabRobFail-Sim 构建的大规模数据集,包含 20,000+ 交互轨迹,覆盖 70+ 实验室任务场景。任务按复杂度分为三个层级:
- 短时任务($\leq 10$ 帧):原子操作如 pick、place、pour,失败通常为瞬时执行错误
- 中时任务(10-30 帧):链式 2-3 个原子操作,检验关键动作转换处的失败检测
- 长时任务($> 50$ 帧):复杂多阶段工作流,需要层次化规划和精确故障定位
失败分类体系覆盖 5 大类 11 种细粒度类型:感知失败(PF)、抓取失败(GF)、运动失败(MF)、逻辑失败(LF)和安全失败(SF)。数据集还生成配对的成功-失败轨迹以最小化混淆因素。
图3:LabRobFail-Data 和 LabRobFail-Bench。(a) 任务复杂度分布;(b) 失败类型分布;(c) 六维评估基准。
3. LabRobFail-Bench 六维评估基准
将失败分析任务定义为从多模态观测到结构化诊断报告的映射。给定输入 $\mathcal{X} = \langle\mathcal{V}, \mathcal{Q}\rangle$(RGB视频流 $\mathcal{V}$ 和任务指令 $\mathcal{Q}$),模型预测复合失败状态 $\mathcal{Y}$:
$$ \mathcal{Y} = \langle \underbrace{y_{task}}_{L1},\, \underbrace{y_{dete},\, y_{loca}}_{L2},\, \underbrace{y_{type},\, y_{risk},\, y_{corr}}_{L3} \rangle $$涵盖任务状态 $y_{task}$、检测标志 $y_{dete}$、时间定位 $y_{loca}$、失败类型 $y_{type}$、风险严重性 $y_{risk}$ 和可执行纠正策略 $y_{corr}$,分为三个递进认知层级。
4. LabRobFail-VLM 视觉语言模型
基于 Qwen3-VL 构建的专业模型,由视觉编码器 $E_\phi$、模态投影器 $P_\psi$ 和语言解码器 $D_\theta$ 组成。给定输入 $\mathcal{X} = (X_{\text{grid}}, \mathcal{Q}_{\text{instruct}})$,提取视觉和文本表示:
$$ Z_v = P_\psi(E_\phi(X_{\text{grid}})), \quad Z_t = \text{Tokenizer}(\mathcal{Q}_{\text{instruct}}) $$然后自回归预测失败输出:
$$ P(\mathcal{Y} \mid \mathcal{X}) = \prod_{j=1}^{L} D_\theta(y_j \mid y_{<j}, Z_v, Z_t) $$混合微调策略:将参数分为视觉相关 $\Theta_V = \{\phi, \psi\}$ 和语言相关 $\Theta_L = \{\theta\}$。视觉编码器和投影器全参数微调(学习率 $2 \times 10^{-6}$ 和 $1 \times 10^{-5}$),语言解码器使用 LoRA(rank 64, scaling 128, dropout 0.05, 学习率 $1 \times 10^{-4}$)适配。训练目标为:
$$ \min_{\phi, \psi, \Delta\theta} \sum_{(\mathcal{X}, \mathcal{Y}) \in \mathcal{D}} -\log P(\mathcal{Y} \mid \mathcal{X};\, \phi, \psi, \theta_0 + \Delta\theta) $$
图4:LabRobFail-VLM 概览。时间索引的多视角关键帧由混合微调的 Qwen3-VL 处理。
flowchart TD
A["化学实验室仿真环境"] --> B["LabRobFail-Sim
三级失败注入"]
B --> B1["控制级: 高斯噪声+李代数
平移/旋转/夹爪扰动"]
B --> B2["物理级: 动力学参数缩放
摩擦/质量/粘度"]
B --> B3["语义级: 步骤排列+对象替换
逻辑错误+安全违规"]
B1 --> C["LabRobFail-Data
20K+轨迹, 11种失败类型"]
B2 --> C
B3 --> C
C --> D["LLM语义标注管线
GPT-5.4 VQA"]
D --> E["LabRobFail-Bench
六维评估"]
E --> F["LabRobFail-VLM
Qwen3-VL混合微调"]
F --> F1["视觉: 全参数微调"]
F --> F2["语言: LoRA适配"]
F1 --> G["结构化失败诊断+纠正"]
F2 --> G
G --> H["下游策略恢复
成功率+4-16pp"]
style B fill:#e1f5fe
style F fill:#fff3e0
style G fill:#e8f5e9
实验结果
主实验结果(已见环境)
| 方法 | Q1 任务理解 | Q2 失败检测 | Q3 时间定位 | Q4 严重性 | Q5 分类 | Q6 ROUGE-L |
|---|---|---|---|---|---|---|
| Qwen3-VL-8B | 47.45 | 59.50 | 5.59 | 47.84 | 35.88 | 0.2976 |
| LLaVA-1.6-13B | 35.80 | 52.96 | 13.24 | 33.53 | 31.18 | 0.2598 |
| Gemini-2.5-flash | 38.92 | 57.13 | 15.53 | 48.84 | 39.68 | 0.1231 |
| GPT-5.4 | 45.16 | 52.34 | 15.88 | 47.06 | 38.54 | 0.1520 |
| LabRobFail-VLM | 94.45 | 90.83 | 77.21 | 83.18 | 73.21 | 0.7542 |
LabRobFail-VLM 在所有维度大幅领先通用 VLM:失败检测准确率 90.83%(vs GPT-5.4 的 52.34%),时间定位 77.21%(vs 15.88%),纠正策略 ROUGE-L 0.7542(vs 0.1520)。
消融实验
| 变体 | Q2 检测 | Q3 定位 | Q5 分类 | Q6 ROUGE-L |
|---|---|---|---|---|
| 全参数微调 | 85.24 | 72.24 | 70.24 | 0.7142 |
| 冻结视觉 | 81.13 | 60.21 | 61.24 | 0.4529 |
| 无时间索引 | 86.45 | 70.58 | 69.24 | 0.6471 |
| LabRobFail-VLM (完整) | 90.83 | 77.21 | 73.21 | 0.7542 |
混合微调优于全参数微调(Q2: 90.83 vs 85.24),冻结视觉导致 Q6 从 0.7542 降至 0.4529,证明视觉全微调对实验室特定感知线索的关键作用。
下游策略恢复
| 任务 | 策略 | 基线(%) | +Ours(%) | 提升 |
|---|---|---|---|---|
| Pick | OpenVLA | 76 | 84 | +8% |
| Pour | OpenVLA | 16 | 28 | +12% |
| Pour | ACT | 32 | 48 | +16% |
| Open drying oven | OpenVLA | 28 | 40 | +12% |
图5:安全失败示例——协议违规(有害混合物)。
局限性
- 仿真到真实差距:训练完全依赖合成数据,真实世界部署存在视觉域差距,透明器皿和反射液体的渲染保真度可能不足。
- 确定性动作字典限制:纠正策略通过确定性 Action Dictionary 转换为控制原语,限制了恢复灵活性,无法处理开放性语言纠正。
- 困难任务绝对成功率仍低:Pour 任务即使在 +16pp 提升后仅 48%,可靠实验室恢复仍是开放挑战。
总结与展望
LabRobFail 提供了化学实验室机器人失败分析的完整框架:物理仿真平台(Sim)、20K+ 轨迹数据集(Data)、六维评估基准(Bench)和专业 VLM 模型。LabRobFail-VLM 在失败推理上大幅超越通用基线,并通过闭环恢复将下游任务成功率提升 4-16pp,为可靠的自主科学发现铺路。
金句:「化学实验的不可逆性和安全关键性使得失败理解不再是可选项——LabRobFail 通过三级可控失败注入和六维结构化诊断,将失败从不可预测的黑箱事件转化为可检测、可定位、可纠正的工程化对象。」



