PAPER DEEP DIVE
通过物理代理解决通用机器人的编排鸿沟
通用机器人需要推理自身行为,融合感知、世界知识、规划、成功检测、恢复和底层控制。现有方法试图通过大规模预训练将所有能力融入学习策略。我们提出将这些能力分解为语言条件控制代理和高层编排器。Pigey编排器在推理时闭环运行:前沿VLM规划子目标、选择冻结后端执行、验证结果、失败时恢复。在LIBERO-PRO上提升4倍(12.8%→53.3%),在真实机器人上将冻结策略从近零提升到90%以上,无需额外数据采集或训练。
一句话总结
Pigey 是一个推理时编排器,用前沿 VLM 闭环驱动冻结的 TAMP 抓取器和 π0.5 VLA 策略,在 LIBERO-PRO 上将成功率从 12.8% 提升至 53.3%(4 倍),在真实机器人上将冻结策略从近零提升到 90% 以上,无需额外数据采集或训练。
1. 研究背景与动机
通用机器人需要推理自身行为——融合感知、世界知识、规划、成功检测、恢复和底层控制。想象这样一个指令:"有孩子要来——把玩具放盘子上,不安全的东西放盒子里。"一个有能力的视觉运动策略可能会失败:它需要区分玩具和危险品(世界知识),找到被遮挡的物品(感知),在抓取滑落时恢复(闭环控制),并只在桌面真正安全时才停止——而非看起来整洁时。通用操作是一个完整技术栈,难点很少在于运动本身。
当前实现泛化的主导路线是扩展机器人数据。VLA 策略(π0、π0.5、OpenVLA、GR00T、DROID)在更大规模数据集上训练,学习越来越强的视觉运动技能。这些数据不可或缺:接触、抓取和具身特定的控制必须从交互中学习。但机器人数据昂贵,且不是教授任务级能力(如否定、进度跟踪、恢复)的最直接方式。当策略在"把所有东西放盘子上,杯子除外"这类指令上失败时,缺失的要素往往不是底层运动本身,而是否定推理、世界知识、任务分解、进度跟踪或失败识别。
已有工作分别处理技术栈的不同部分,但很少覆盖完整闭环。VLA 扩展强化了控制和接地,但直接提示仍要求单一网络在一次前向传播中完成感知、推理、规划、验证、恢复和执行。代码即策略和任务规划器增加了结构,但依赖符号 API、手工原语或特权仿真状态。推理型 VLA 将更多推理推入策略本身,但需要额外训练,且仍将成功检测和恢复留在闭环之外。缺失的不是更好的运动策略或单一推理模块,而是一个过程——决定做什么、检查是否成功、失败时修复。
Pigey 的核心洞察是:将这些能力在推理时分解,而非烘焙进学习权重。一个前沿 VLM 在固定指令上运行闭环代理:读取当前观测和交互历史,发出一次工具调用,整合结果,再次决策——直到声明任务完成或达到工具调用预算。代理提供任务级闭环:将指令分解为短子目标,维护已执行操作的记忆,选择冻结后端执行每个子目标,从传感器和视觉反馈验证结果,失败时恢复。它从不直接发出运动命令——所有动作都委托给后端。
2. 预备知识
理解 Pigey 需要两个基础概念。首先是VLA 策略的形式化。设 $\mathcal{I}$ 为自然语言指令空间,$\mathcal{O}$ 为观测空间,$\mathcal{A}_{\mathrm{motor}}$ 为连续运动动作空间。VLA 策略是一个函数:
$$\pi: \mathcal{O} \times \mathcal{S} \rightarrow \mathcal{A}_{\mathrm{motor}}$$
其中 $\mathcal{S} \subset \mathcal{I}$ 是短、具体、视觉接地的子目标子空间——策略在这些子目标上可靠。用户指令 $I \in \mathcal{I}$ 在最终世界状态满足任务特定成功谓词时被视为解决:
$$\mathbb{1}_I(\mathrm{scene}) = 1$$
标准方法将解释、规划和执行折叠为单次 VLA 调用 $\pi(o, I)$。当 $I$ 已经是 VLA 可理解的时这有效,但当 $I$ 需要中间推理时退化。Pigey 转而将解释、规划和验证分解为推理时过程,操作于同一观测通道。
其次是编排鸿沟的概念。我们将冻结运动策略单独直接提示与通过代理循环调用时的成功率差异定义为"编排鸿沟"。这个差距量化了推理时编排——而非新的运动学习——带来的增益。
3. 方法详解
3.1 系统概览
Pigey 的代理 $\phi$ 在固定指令 $I$ 上运行闭环:每步读取当前观测和交互历史,发出一个工具调用,整合结果,再次决策。形式化地:
$$\phi: \mathcal{O} \times \mathcal{H} \times \mathcal{I} \rightarrow \mathcal{T}$$
代理将观测 $o \in \mathcal{O}$、历史 $h \in \mathcal{H}$ 和指令 $I \in \mathcal{I}$ 映射到工具调用。每个冻结后端执行短子目标:
$$\pi_b: \mathcal{O} \times \mathcal{S} \rightarrow \mathcal{A}_{\mathrm{motor}}, \quad b \in \{\textsc{tamp}, \textsc{vla}\}$$
后端只接收子目标 $s$,从不接收完整指令 $I$。代理提供任务级闭环:分解 $I$ 为短子目标,维护已做操作的记忆,选择冻结后端执行每个子目标,从传感器和视觉反馈验证结果,失败时恢复。
图1:Pigey 启用的推理行为示例:障碍推理(推断目标被隐藏并移除遮挡)、安全推理(识别并移除危险品)、清除已占用目标(先清空容器再填充)、长时记忆(记忆场景并在遮挡后恢复)、空间推理(从大到小堆叠容器以保持稳定)。所有面板均为单次未剪辑的真实机器人执行;编排器驱动冻结技能,无新训练。
3.2 工具与接地
代理通过五个工具行动:Perceive(返回相机视图、机器人状态和检测到的物体标签集合)、Pick($\ell$) 和 DropAbove($\ell$)(通过 TAMP 后端抓取/放置标记物体)、VLARollout($s$)(通过 VLA 后端执行子目标)和 Done(终止)。
每次调用后,代理接收腕部图像、末端执行器位姿、夹爪开合度、从夹爪宽度传感器读取的 is_grasped 二进制标志,以及开放词汇检测器返回的物体标签集合。这些标签是代理的词汇表——每个 Pick/DropAbove 参数必须是其中之一,迫使代理将指令中的语义类别("不安全的"、"素食的"、"最小的")接地到具体检测到的物体,而非编造名称。后端还返回类型化失败——未找到抓取、运动规划失败、不可达、步数预算耗尽——使代理了解步骤失败的原因,而非仅仅知道失败了。
3.3 验证机制
验证是区分代理与开环提示的关键。它依赖两个互补信号。第一是确定性的:Pick 仅在夹爪宽度传感器读取 is_grasped 为真时才算成功,运动规划失败以显式标志呈现。第二是视觉的:动作后的腕部图像返回给 VLM $\phi$,确认目标物体在夹爪中且已离开桌面。两者保守组合——如果后端报告成功但传感器读取空夹爪,步骤被覆盖为失败,防止乐观后端误导代理。
只有验证通过的结果推进计划;未验证的触发恢复。特别是,放置(DropAbove)仅在前序抓取验证后才发出——代理从不运送和释放抓取失败的物体。这种"先验证后放置"的设计将 TiPToP 的开环抓取-放置转化为闭环,是 Pigey 相对 TiPToP 增益的直接来源。
3.4 规划与恢复
Pigey 按子目标选择后端,验证,失败时升级。关键策略包括:
按物体类型路径规划:刚性的桌面物体走 TAMP;可变形或缆线状物体、容器内或堆叠物体直接走 VLA——几何抓取规划对这些不可靠。
验证-重试-升级:未验证的 Pick 重试一次(重新感知并在物体当前位姿重新规划);第二次失败升级到 VLA。升级是双向的:如果 VLA 执行无进展,代理回退到在重新感知场景上的 TAMP Pick。
恢复:错误物体抓取时代理将物体放回桌面(绝非目的地)并重试目标物体;目标隐藏时将可见物体视为遮挡物并移除;目的地包含不属于目标状态的物品时先清除。
表1:模块化操作系统的操作配置。可审计性:决策过程是否以显式工具调用暴露。Pigey 在不增加训练的情况下提供了上下文记忆、状态跟踪、重试和验证四项能力。
flowchart TB
subgraph AGENT["Pigey: Frontier VLM Orchestrator"]
OBS["Read observation o
+ history h"]
OBS --> REASON["Reason: decompose I
into subgoal s"]
REASON --> SELECT["Select backend:
TAMP or VLA?"]
SELECT --> CALL["Emit tool call"]
CALL --> VERIFY{"Verify outcome:
sensor + visual"}
VERIFY -->|success| NEXT["Next subgoal
or Done?"]
VERIFY -->|failure| RECOVER["Recover:
retry / escalate
/ clear / uncover"]
RECOVER --> OBS
NEXT -->|not done| OBS
NEXT -->|done| SUCCESS["Task complete"]
end
subgraph BACKENDS["Frozen Motor Backends"]
TAMP["TAMP: Pick/DropAbove
(rigid objects)"]
VLA["VLA: VLARollout
(deformable / recovery)"]
end
CALL -->|Pick/DropAbove| TAMP
CALL -->|VLARollout| VLA
TAMP -->|views + flags| VERIFY
VLA -->|views + flags| VERIFY
style AGENT fill:#e8f0fe,stroke:#2563eb
style BACKENDS fill:#fef3c7,stroke:#d97706
上图:Pigey 的闭环编排流程。VLM 读取观测 → 推理分解子目标 → 选择后端 → 发出工具调用 → 验证 → 成功则继续或完成,失败则恢复。两个冻结后端(TAMP/VLA)互补执行。
4. 实验分析
4.1 LIBERO-PRO 仿真基准
在 LIBERO-PRO 上,Pigey 以零样本协议(无任务特定记忆、参考种子探索或微调)在六个扰动套件上取得最高平均成功率,将冻结 π0.5-LIBERO 基线从 12.8% 提升至 53.3%——超过 4 倍。π0 基线在所有套件上均为 0%,CaP-Agent0 仅 18.2%。
| 方法 | Obj. swap | Obj. task | Sp. swap | Sp. task | Goal swap | Goal task | 平均 |
|---|---|---|---|---|---|---|---|
| π0-LIBERO | 0 | 0 | 0 | 0 | 0 | 0 | 0 |
| π0.5-LIBERO | 17 | 1 | 20 | 1 | 38 | 0 | 12.8 |
| CaP-Agent0 | 22 | 18 | 12 | 14 | 26 | 17 | 18.2 |
| Pigey (ours) | 54 | 54 | 66 | 80 | 44 | 22 | 53.3 |
值得注意的是,即使 LIBERO-PRO 需要的推理量有限,Pigey 的错误恢复和提供的工具仍能编排弱基线策略走向成功。这表明编排鸿沟不仅存在于高推理需求任务,也存在于需要鲁棒性和恢复的扰动场景。
4.2 真实机器人:编排鸿沟
在 30 个 DROID 真实机器人任务上,Pigey 将冻结 π0.5-DROID 策略的整体成功率从 16.7% 提升至 97.3%。TiPToP 为 48.7%。增益集中在推理受限任务上:
| 能力探针 | 任务数 | π0.5-DROID | TiPToP | Pigey |
|---|---|---|---|---|
| 简单抓取放置 | 4 | 95 | 80 | 100 |
| 世界知识 | 4 | 0 | 90 | 100 |
| 条件逻辑 | 4 | 0 | 95 | 100 |
| 多步推理 | 4 | 0 | 25 | 100 |
| 空间推理 | 4 | 20 | 75 | 100 |
| 障碍/安全推理 | 4 | 0 | 0 | 90 |
| 错误恢复 | 4 | 10 | 0 | 90 |
| 长时记忆 | 2 | 0 | 0 | 100 |
| 总体 | 30 | 16.7 | 48.7 | 97.3 |
在推理受限探针上,原始 VLA 平均仅 4.6%,而 Pigey 达到 96.9%——使用同一 VLA。这表明主要瓶颈在于指令解释、分解、记忆和恢复,而非底层控制。在简单抓取放置任务上,绝对提升仅 5 个百分点(95→100%),编排补充了缺失的推理,并未降低已容易任务的成功率。
表2:LIBERO-PRO 六个扰动套件的成功率(%)。全程使用同一冻结 π0.5-LIBERO 权重;仅推理时过程改变。
4.3 Pigey 对比 TiPToP:编排视觉运动策略
另一个独立于高层推理的维度来自代理如何使用底层原语。TiPToP 使用相同的开放词汇接地和运动规划,但将抓取-放置作为单一开环原语运行:它对执行盲目,滑落或错位抓取可导致失败。Pigey 将抓取和放置暴露为两个独立工具并在其间验证——仅在抓取传感器确认后才提交放置。
开环的代价在接地简单时也可见:在简单抓取放置控制上,TiPToP 仅 80%——低于原始 VLA——因为细微控制失误可导致失败,而闭环检测空夹爪并重试达到 100%。当引入对抗扰动时差距扩大:目标在规划后被推动时,开环计划抓取物体原来的位置;目标初始隐藏时,计划从不适应。Pigey 观察变化中的世界,重新感知并重新规划,将必然失败转为成功。
5. 讨论
Pigey 的核心贡献在于将通用机器人操作从"全栈端到端学习"重新框定为"推理时分解+闭环编排"。这一视角的转变具有深远意义。传统方法将感知、推理、规划、验证、恢复和控制全部折叠进单一网络的前向传播,当失败时无法定位缺失了哪个组件。Pigey 将这些能力显式分离:冻结的运动后端负责"怎么做",VLM 编排器负责"何时做、为什么做、以什么顺序、用哪个技能做"。
验证机制的"确定性+视觉"双信号设计是 Pigey 可靠性的根基。确定性信号(夹爪宽度传感器)提供客观的二值判断,不受 VLM 幻觉影响;视觉信号(VLM 确认)补充语义层面的验证。两者保守组合——任一信号为否即判定失败——避免了乐观后端或幻觉推理导致的假阳性传播。这种设计可直接迁移到其他机器人编排场景。
双向升级机制也体现了重要的设计智慧。TAMP 和 VLA 各有长短:TAMP 给出几何精度和可验证抓取信号但缺乏闭环鲁棒性;VLA 提供闭环鲁棒性但几何规划不可靠。Pigey 不预设哪个后端更优,而是根据物体类型选择初始路径,失败时双向升级——TAMP 失败升级到 VLA,VLA 无进展回退到 TAMP。这种"竞争性后端"设计使系统整体能力超过任一后端单独的上限。
6. 局限性分析
作者自述局限:Pigey 受限于它编排的技能——虽然能补偿弱策略,但存在底层工具"支撑"设定的能力天花板。验证也不完美——遮挡导致的部分可观测性可能隐藏糟糕的抓取,使假成功向下游传播。最后,由于 Pigey 依赖对前沿模型的 API 调用进行编排,它增加了每步延迟和成本,使其难以适用于低延迟或高速应用场景。
独立判断:Pigey 的效果严重依赖前沿 VLM 的推理质量。论文虽然测试了 7 种不同推理器并证明效果跨模型成立,但所有推理器均为大规模闭源模型,未验证开源小模型是否能胜任编排。编排器的工具集(5 个工具)相对有限,更复杂的任务可能需要更丰富的动作空间。此外,30 个真实任务和 LIBERO-PRO 均为桌面操作场景,Pigey 在导航、移动操作或双手协作等场景的适用性未经验证。论文提出可将成功轨迹蒸馏到更小编排器,但这一方向尚未实现,当前仍依赖在线 API 调用。
7. 总结与展望
Pigey 提出了一个推理时编排器,通过前沿 VLM 闭环驱动冻结的 TAMP 和 VLA 后端,在不采集新数据或不训练策略的情况下,将冻结技能的成功率大幅提升——LIBERO-PRO 上 4 倍提升,真实机器人上从 16.7% 到 97.3%。论文将这一增益定义为"编排鸿沟",即冻结运动技能单独直接提示与在代理循环内调用时的成功率差异。
从更广的视角看,Pigey 代表了机器人学习中"推理时分解"路线的重要验证。它证明了一个从未为具身训练的前沿 VLM,仅凭通用预训练就能将其推理接地到实时相机观测中——区分完成的抓取和失败的抓取、存在的物体和隐藏的物体、完成的任务和未完成的任务。这一发现对机器人 AI 的发展路线具有指导意义:与其将所有能力烘焙进单一网络,不如将推理与控制分离,在推理时通过闭环过程组合。未来工作可能探索将成功轨迹蒸馏为小模型以降低推理成本,以及扩展到更丰富的动作空间和更多样的机器人场景。



