PAPER DEEP DIVE
面向注意力:基于视觉-语言模型的语言条件再感知
提出语言条件的再感知方法,基于视觉-语言模型实现注意力引导的再感知,服务于机器人视觉感知与VLM。
一句话总结
本文区分了行为标注地图的两种用途:空间导航(路径规划,闭环执行下收益微弱约 4%)与资源分配注意力(再感知调度,记忆收益显著)。将预算化再感知建模为注意力决策,证明持久地图的变化历史生成的再感知调度匹配 oracle,而无记忆的按需 VLM 先验是劣调度器。记忆收益恰等于根波动方差 $\mathrm{Var}(\sqrt{\lambda})$,随场景异质性增长。
Figure 1 — 预算化再感知作为注意力。地图保存每个元素的变化历史,从按需类别先验(VLM)或地图观测历史(记忆)形成速率估计 $\hat{\lambda}_i$,$\sqrt{\cdot}$ 律调度设定再检查频率。
1. 研究背景与动机
携带持久行为标注地图(如视觉-语言-运动地图 VLMM)的机器人面临两种截然不同的规划问题,而地图记忆只对其中一个有用。
- 空间导航问题:如何在房间中绕行?行为感知规划器成本在规划时目标上降低约 35%(28 个 AI2-THOR 场景),但在闭环执行下真实收益几近消失(约 4%),按需 VLM 也能做到同样好。
- 资源分配问题:在有限感知预算下,机器人现在应该关注什么来保持地图新鲜?将再感知重构为这个注意力决策——哪些地图元素要重新观察、多久一次——持久地图的记忆(变化历史甚至仅最后目击的时近性)生成最佳再感知调度。
地图的价值不在于告诉机器人如何绕行房间,而在于告诉它该关注什么。
2. 核心方法论
2.1 注意力决策建模
地图持有 $N$ 个元素。元素 $i$ 以速率 $\lambda_i$ 的泊松过程变化;若每 $\tau_i$ 步重新观察,其时间平均过时性(staleness,地图条目过时概率)为:
$$g(\lambda_i \tau_i) = 1 - \frac{1 - e^{-\lambda_i \tau_i}}{\lambda_i \tau_i} \approx \frac{1}{2} \lambda_i \tau_i, \quad \lambda_i \tau_i \ll 1$$
元素 $i$ 携带重要性 $w_i$(脆弱或任务相关对象过时时代价更高)。在每步 $K$ 次再观察预算下,注意力策略选择再检查频率 $f_i = 1/\tau_i$(约束 $\sum_i f_i = K$)以最小化价值加权过时性 $S = \sum_i w_i\, g(\lambda_i \tau_i)$。
2.2 命题一:$\sqrt{\cdot}$ 律注意力
最小化 $S \approx \sum_i w_i \lambda_i / (2f_i)$ 在 $\sum_i f_i = K$ 约束下给出最优频率:
$$f_i^\star \propto \sqrt{w_i \lambda_i}, \quad S^\star = \frac{\left(\sum_i \sqrt{w_i \lambda_i}\right)^2}{2K}$$
即再检查频率与重要性和变化率的几何均值成正比——频繁变化且重要的元素应更频繁地被检查。
2.3 命题二:速率误差导致的注意力损失
用估计 $\hat{\lambda}_i$ 时策略使用 $f_i \propto \sqrt{w_i \hat{\lambda}_i}$。令 $a_i = \sqrt{w_i \hat{\lambda}_i}$, $b_i = \sqrt{w_i \lambda_i}$,实际代价为 $S(\hat{\lambda}) = \frac{1}{2K}(\sum_i a_i)(\sum_i b_i^2 / a_i)$。超额 $(\sum_i a_i)(\sum_i b_i^2/a_i)/(\sum_i b_i)^2$ 是一个柯西-施瓦茨缺陷(Cauchy–Schwarz defect),随 $\hat{\lambda}$ 偏离 $\lambda$ 增长。
2.4 推论一:新鲜度差距 = 根波动方差
对均匀重要性,无记忆基线均匀扫描($f_i = K/N$)产生代价 $\propto \mathbb{E}[\lambda]$,而 $\sqrt{\cdot}$ 律最优产生 $\propto (\mathbb{E}\sqrt{\lambda})^2$。两者差距恰为根波动方差:
$$\mathrm{Error}_{\mathrm{VLM}} - \mathrm{Error}_{\mathrm{Map}} \propto \mathbb{E}[\lambda] - (\mathbb{E}\sqrt{\lambda})^2 = \mathrm{Var}\!\left(\sqrt{\lambda}\right) \geq 0$$
记忆的价值等于场景动力学的异质性,以 $\mathrm{Var}(\sqrt{\lambda})$ 度量。当所有实例共享同一速率时消失,随扩散线性(而非指数)增长。
2.5 速率估计来源
- 按需 VLM:返回类别可运动性先验 $\rho_i$——每物体类型一个值。
- 地图记忆:积累每个元素的观测变化历史,形成贝叶斯速率 $\hat{\lambda}_i = (m_i + \kappa\rho_i)/(t_i + \kappa)$,其中 $m_i$ 为 $t_i$ 时间内的观测变化次数,$\kappa$ 为伪计数。
2.6 异质性旋钮
用 $h \in [0,1]$ 建模异质性:$\lambda_i = \lambda_{\max}[(1-h)\rho_i + h\, u_i]$,$u_i \sim \mathrm{U}(0,1)$。$h=0$ 时每个实例等于其类别先验(记忆无补充);$h=1$ 时实例速率独立于类别(只有历史能知道)。
flowchart TD
MAP["持久地图\nN 个元素 + 变化历史"] --> EST["速率估计 λ̂_i"]
VLM["按需 VLM\n类别先验 ρ_i"] --> EST
EST -->|"√律调度\nf_i ∝ √(w_i·λ̂_i)"| SCHED["再检查调度\n预算 K"]
SCHED --> REOBS["重新观察 K 个元素"]
REOBS -->|"更新历史"| MAP
SCHED --> SCORE["评分:价值加权过时性 S"]
EST -.->|"空间成本(路径规划)\n细节平均化,先验足够"| SPATIAL["路径规划\n(记忆无优势)"]
EST -.->|"注意力决策(每实例)\n记忆获胜"| ATT["资源分配注意力\n(记忆有优势)"]
style MAP fill:#dbeafe,stroke:#2563eb
style VLM fill:#fed7aa,stroke:#ea580c
style SCHED fill:#dcfce7,stroke:#16a34a
style ATT fill:#fef3c7,stroke:#d97706
Figure M1 — 注意力决策框架。地图变化历史或 VLM 类别先验形成速率估计,$\sqrt{\cdot}$ 律调度设定再检查频率。双粒度:同一估计也供路径规划空间成本(细节平均化,先验足够),但注意力决策是每实例的,记忆获胜。
3. 实验结果
在 AI2-THOR 中,从 40 个场景汇集 951 个可移动物体实例。参数:$\lambda_{\max}=0.12$,视野 $T=400$,预算 $K=6\%$ 每步。使用留出估计:变化历史在一个实现上积累并冻结,作为静态调度应用于独立实现。
3.1 记忆优于按需先验
Figure 2 — 随异质性增长,留出历史将价值加权过时性降至按需先验之下。
| 异质性 $h$ | 0 | 0.25 | 0.5 | 0.75 | 1.0 |
|---|---|---|---|---|---|
| 先验(VLM) | .294 | .290 | .284 | .275 | .263 |
| 记忆(历史) | .289 | .285 | .277 | .265 | .246 |
| 优势 (%) | 1.7 | 1.9 | 2.3 | 3.4 | 6.5 |
| 记忆归因 (%) | 0.0 | 0.2 | 0.6 | 1.7 | 4.9 |
3.2 对竞争调度器:先验是弱环
Figure 3 — 竞争调度器在线运行(偏斜重要性)。按需 VLM 先验甚至被无记忆的最旧优先击败;基于历史的策略(Thompson、记忆)获胜且记忆匹配 oracle。
添加竞争调度器后发现:(1) 按需 VLM 先验是弱环——甚至无记忆的最旧优先也在所有 $h$ 上击败它;(2) 基于历史的策略获胜:Thompson 追踪记忆,记忆匹配 oracle($h=1$ 时 0.248 vs 0.248)。
3.3 Whittle 指标消除调度下限
预算化再感知是不安分多臂老虎机(restless multi-armed bandit),Whittle 指标为闭式:
$$W_i(\tau) = w_i\left[\frac{1 - (1-\lambda_i)^\tau}{\lambda_i} - \tau(1-\lambda_i)^\tau\right]$$
Whittle 策略击败 $\sqrt{\cdot}$ 律(真实速率下低 4.1% 过时性)。在正确指标下,记忆仅在异质性真实时击败先验($h=0$ 时 -1.2% 升至 $h=1$ 时 +4.5%),无需减去下限。
| 异质性 $h$ | 0 | 0.25 | 0.5 | 0.75 | 1.0 |
|---|---|---|---|---|---|
| Whittle 先验 | .282 | .278 | .271 | .259 | .237 |
| Whittle 记忆 | .285 | .282 | .275 | .264 | .243 |
| 记忆 vs 先验 (%) | -1.2 | -0.9 | -0.3 | +0.9 | +4.5 |
3.4 语言条件任务的独特价值
当任务是语言条件时(告知要追踪什么),VLMM 接地相关物体(开放词汇)并追踪其变化(记忆),击败强基线:+2.5% vs 相关性加权时近基线,+8.9% vs 按需 VLM。运动通道在最后目击时间戳之外增加价值。
4. 贡献与意义
- 区分行为标注地图的两种用途:空间导航路径塑形(闭环评估下边际,无需记忆)与资源分配注意力(记忆收益显著)。
- 将预算化再感知形式化为注意力决策,推导 $\sqrt{\cdot}$ 律最优调度。
- 证明记忆对先验的新鲜度差距恰为 $\mathrm{Var}(\sqrt{\lambda})$——根波动方差,随场景异质性线性增长。
- 引入 Whittle 指标调度消除 $\sqrt{\cdot}$ 律启发式下限,更清晰地展示记忆归因效果。
- 语言条件任务中 VLMM 运动通道超越最后目击时间戳。
5.
模糊核函数
$$ g(\lambda_{i}\tau_{i})=1-\tfrac{1-e^{-\lambda_{i}\tau_{i}}}{\lambda_{i}\tau_{i}}\approx\tfrac{1}{2}\lambda_{i}\tau_{i} $$
局限性- $\sqrt{\cdot}$ 律是连续代理的最优解,非离散预算调度的精确最优。
- 无记忆 VLM 基线建模为返回类别均值,实际 VLM 可能更好或更差。
- 泊松过程假设下建立,虽在其他过程(突发、相关、周期)下鲁棒但突发性减弱效果。
6. 总结
本文区分了行为标注地图的两种规划用途。在空间导航中,闭环执行下行为感知路径塑形的收益几近消失(~4%),按需 VLM 同样有效——地图记忆在此无用武之地。但在资源分配注意力中,记忆的变化历史生成匹配 oracle 的再感知调度,而按需 VLM 先验是劣调度器。记忆对先验的新鲜度差距恰等于根波动方差 $\mathrm{Var}(\sqrt{\lambda})$,随场景异质性线性增长。在语言条件任务中,VLMM 的开放词汇接地与变化追踪使其超越最后目击时间戳和按需 VLM。地图的价值不在于告诉机器人如何绕行房间,而在于告诉它该关注什么——记忆在注意力分配中挣得其存在意义。
地图的价值不在于告诉机器人如何绕行房间,而在于告诉它该关注什么——记忆在注意力分配中挣得其存在意义。
— 论文核心主张



