Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

视觉语言模型PaperVision-Language Model

试一次即最优:跨回合探索的去冗余过程记忆

提出去冗余过程记忆方法,支持跨回合探索的试一次即最优,提升agent在长时程任务中的探索与决策效率。

Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang2026年7月26日2 分钟阅读
EN

IOM:去冗余程序记忆实现跨episode探索摊销

作者:Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang  |  机构:清华大学 & DISCOVER Robotics  |  arXiv:2607.23702v1


一句话总结

本文提出 IOM(Instance-Oriented Memory),一个以物体为中心的记忆框架:从单次揭示隐藏状态的交互中蒸馏出去冗余操作程序,以物体可识别特征为键存储,后续遇到同一物体时直接调用而非重新探索。在四个铰接物体任务上减少16–30%操作数,成功率不降反升,且用现成VLM无需训练即可恢复69–88%的Oracle收益。


研究背景与动机

许多日常物体带有机器人触碰前无法观察的隐藏内部状态(如微波炉的锁扣是否锁上)。操作这类物体需要"探测"——通过交互揭示状态后才能选择正确操作。探测在首次不可避免,但此后每次重复遇到同一物体时都是纯开销。一个已打开过特定微波炉的机器人不应每天早晨都谨慎地释放一个它已知道是松开的锁扣。

Figure 1: IOM框架概览

图1:首次交互探测隐藏状态 → 蒸馏出去冗余程序 → 以物体特征 $\phi(x)$ 为键写入记忆 → 后续交互识别物体并直接调用程序。

现有跨episode记忆以任务成功率为目标、以状态为组织维度,而非以物体为中心以效率为目标。它们按当前观测检索动作片段或先验,无法识别重复出现的特定物体实例并跳过不再需要的探索。IOM采用以物体为中心的视角:机器人应记住它操作过的物体及操作方法。


问题形式化

考虑物体类 $\mathcal{C}$ 和定义其上的操作任务 $\tau$。任务由原子操作序列完成。设 $\mathcal{P}$ 为所有完成 $\tau$ 的序列集合,$\mathcal{R} \subseteq \mathcal{P}$ 为无重试序列。物体实例 $x \in \mathcal{C}$ 带有隐藏状态 $s(x)$。相对该状态,无重试序列对 $x$ 是非冗余的当且仅当不能从中删除任何操作仍能完成 $\tau$:

$$\mathcal{K}^{\star}(x)=\kappa\bigl(s(x)\bigr)\subseteq\mathcal{K}$$

其中 $\mathcal{K}=\{K_1,\dots,K_m\} \subseteq \mathcal{R}$ 是任务的有限去冗余程序集,$\kappa$ 是从内部状态到程序的映射。每个交互执行序列 $p \in \mathcal{P}$,其代价 $c(p)$ 为冗余操作数:

$$c(p) = 0 \iff p \text{ 是非冗余的}$$

揭示性序列 $\mathcal{U}$ 是通过尝试能完全确定 $s(x)$ 的序列。无记忆agent每次交互都重新探测并反复产生冗余。IOM 从首次揭示性交互中发现 $s(x)$ 并复用:后续每次交互执行 $K \in \mathcal{K}^\star(x)$,使 $c(p_i)=0, \forall i>0$。


方法:三大模块

1. 程序蒸馏

从首次交互的可能冗余序列中恢复紧凑程序:

$$\mathcal{D}:(\xi,g)\mapsto\hat{K}\in\mathcal{K}$$

其中 $\xi$ 是交互记录,$g$ 是跨实例共享的任务先验(含模糊指令、候选集 $\mathcal{K}$ 和提示)。蒸馏由揭示而非完成驱动——即使任务失败但只要揭示了 $s(x)$,就产生相同的 $\hat{K}$。本文用预训练VLM实例化 $\mathcal{D}$:将交互呈现为RGB视频和动作轨迹,$g$ 作为语言提示,VLM返回 $\hat{K} \in \mathcal{K}$,无需任务特定训练。

2. 实例键控记忆

部分映射 $\mathcal{M}$ 从物体可识别特征 $\phi(x)$ 到存储程序:

$$\mathcal{M}\bigl(\phi(x)\bigr)=\begin{cases}\hat{K},&\text{if }x\text{ has been written}\\u,&\text{otherwise}\end{cases}$$

其中 $u \in \mathcal{U}$ 是揭示性探测。记忆与策略分离,可跨任务共享。用预训练VLM实现:写入时将物体首帧与程序 $\hat{K}$ 关联;后续交互时判断是否见过该物体,是则返回关联程序,否则返回空串触发探测。

3. 程序条件化策略

策略需满足两个要求:接受检索到的 $K$ 作为条件输入;因动作分布常为多模态,须依赖历史而非无记忆。策略映射为:

$$a_{t:t+H}\sim\pi\bigl(\cdot\mid o_t,\,h_t,\,K,\,z\bigr),\qquad K\in\mathcal{K}\cup\mathcal{U}$$

本文改编AdaManip策略,将扩散策略替换为流匹配,添加携带 $K$ 的语言条件通道。$K$ 由预训练文本编码器嵌入,投影到低维后与展平观测特征拼接。

软偏置条件训练

对交互 $\xi$ 中执行的序列 $p$,收集以 $p$ 首次重试前的操作开头但其余不受限制的条件集 $\mathcal{K}^\circ(p)$,训练时从中随机采样 $K$。策略学会在开头跟随 $K$,但依赖反馈在其后恢复——执行正确的 $K \in \mathcal{K}^\star(x)$,当执行偏离时通过重试恢复。

flowchart TD
    A["首次交互: 探测序列 u ∈ U"] --> B["揭示隐藏状态 s(x)"]
    B --> C["程序蒸馏 D: (ξ,g) → K̂"]
    C --> D["写入记忆: M[φ(x)] ← K̂"]
    D --> E["后续交互: 识别物体 φ(x)"]
    E --> F{"记忆中有?"}
    F -- "命中" --> G["调用 K̂ 作为软偏置"]
    F -- "未命中" --> A
    G --> H["策略 π(·|o_t, h_t, K, z)"]
    H --> I["执行: 正确则直接完成
错误则通过反馈恢复"]

实验结果

在两个仿真任务(微波炉、门)和两个真实机器人任务(瓶子、柜子)上评估,共4个铰接物体任务。仿真用90个实例(50+40)各5个episode;真实机器人用AIRBOT Play臂和Azure Kinect DK环境相机,每个任务从锁定/解锁状态各5次试验。记忆变体:Random(无记忆基线)、GT(Oracle真值程序)、VLM(GPT-5.5生成的程序)。

任务记忆操作数 ↓vs Random成功率 ↑
微波炉(仿真)Random1.961.000
GT1.37-30.2%0.980
VLM1.44-26.5%1.000
门(仿真)Random2.540.975
GT2.13-16.2%0.975
VLM2.26-11.1%0.975
瓶子(真实)Random2.120.80
GT1.56-26.8%0.90
VLM1.67-21.6%0.90
柜子(真实)Random1.860.70
GT1.56-16.2%0.90
VLM1.62-12.5%0.80
Figure 2: 四个实验任务

图2:四个铰接物体任务及操作序列。隐藏状态(锁扣、把手方向、瓶盖是否已拧松)无法从初始视图观察。

关键发现

  • 框架价值:Oracle记忆在全部4个任务上减少16–30%操作,成功率不降(真实机器人反而提升)。
  • 训练免费实例化:VLM恢复69–88%的Oracle收益,无需任何任务特定训练。
  • 鲁棒性:约12%的门实例收到错误程序,但成功率不变——软偏置于反馈驱动策略上优雅降级,错误仅表现为额外操作而非失败。
  • 重复交互集中收益:排除首次无记忆交互后,Oracle在仿真中的per-repeat减少升至20–33%。
  • 以召回替代精细感知:瓶子瓶盖是否已松仅表现为细微缝隙,图像难以可靠判读;IOM通过首次交互中的动作解决状态,此后按实例键召回,将脆弱的感知判断变为查找。
任务非冗余程序 $\mathcal{K}$揭示探测 $\mathcal{U}$含重试序列
微波炉[open], [release, open][open][open, release, open]
[cw, open], [ccw, open][cw, open][cw, ccw, open]
瓶子[lift], [unscrew, lift][lift][lift, unscrew, lift]
柜子[pull], [release, pull][pull][pull, release, pull]
Figure 3: 实验任务操作序列

图3:四个任务的原子操作序列与隐藏状态示意。


局限性

  1. 记忆键 $\phi(x)$ 基于外观,当不同物体外观相似但需不同操作时会产生感知混叠,导致召回错误程序。
  2. 当前无法自修复错误记忆条目——需要元记忆监控召回结果并重新蒸馏。
  3. 仅测试了重置设定(隐藏状态在交互间重置),持久设定下的历史依赖最优程序留待未来。

总结与展望

IOM是一个模块化、以物体为中心的框架,通过记录单次揭示性交互中的去冗余程序并在后续遇到同一物体时直接调用,将操作探索在重复交互间摊销。三个可互换模块(程序蒸馏、实例键控记忆、程序条件化策略)用现成组件实现,无需任务特定训练。在四个铰接物体任务上减少16–30%操作数,成功率不降。

金句:"尝试一次,然后最优。"——将脆弱的在线感知判断转化为一次揭示后的高效查找,是IOM的核心价值主张。未来工作将探索更具判别力的记忆键(扩展到场景上下文)和自校正元记忆。


深度解读由 RobotWorld paper-detail-generator 基于全文精读生成 | arXiv:2607.23702v1

相关论文