PAPER DEEP DIVE
物理空间中相邻集合的动作优于世界模型中的最佳预测
研究在世界模型中,物理空间相邻集合的动作策略优于最佳预测,为世界模型动作生成提供新视角。
ASAR:物理空间相邻集动作重建优于世界模型最佳预测
作者:Liangyu Li, Qingwen Liu, Mingqing Liu | 机构:同济大学 | arXiv:2607.23602v1
一句话总结
本文发现基于采样和潜在世界模型的控制器存在"提议过度生成"问题——增大候选池反而降低最小代价选择的可行性,并提出ASAR(相邻集动作重建):在低代价候选中通过前缀距离识别相邻集,加权重建新动作序列。在Carry-and-Release评估上,ASAR在72/144/288提议下分别比最小代价选择提升28.0/24.0/18.7个百分点。
研究背景与动机
基于采样和潜在世界模型的控制器为每个候选动作序列分配预测终端代价,选择最小者执行首个动作块并重规划。这一规则即使终端代价完美反映真实任务目标也可能失败:残差预测误差可能给不可行序列异常低的代价,更大的提议池给这类错误更多超越可行替代方案的机会。
图1:最小代价序列(红)在标准化前缀空间中孤立,闭环执行后方块距目标21.2cm;12个低代价序列(绿)形成相邻集,Kernel ASAR重建序列(蓝)执行后方块距目标仅3.8cm。
提议过度生成:在Cube候选执行审计中,提议预算从72增至288时,最小潜在代价选择的可行性从.375降至.062(位置目标)和.344降至.031(位置+yaw目标),尽管每个更大池都包含可行序列。
问题形式化
编码器 $e$ 将观测映射到潜在空间 $\mathbf{z}_t = e(o_t)$,目标到 $\mathbf{z}_g = e(o_g)$。候选动作序列 $\mathbf{A}_i = (\mathbf{a}_{i,0}, \ldots, \mathbf{a}_{i,H-1}) \in \mathcal{A}^H$。学习预测器产生终端预测:
$$\hat{\mathbf{z}}_{i,H}=\hat{f}_{H}(\mathbf{z}_{t},\mathbf{A}_{i})$$控制器分配终端代价 $q_i = Q(\hat{\mathbf{z}}_{i,H}, \mathbf{z}_g)$。潜在代价条件 $Q(\hat{\mathbf{z}}, \mathbf{z}_g) = \|\hat{\mathbf{z}} - \mathbf{z}_g\|_2^2$;可达性代价条件使用TRM的轨迹代价。可行集定义:
$$\mathcal{E}_{\epsilon}(\mathbf{x}_{t},o_{g})=\{\mathbf{A}\in\mathcal{A}^{H}:\ell_{H}(F_{H}(\mathbf{x}_{t},\mathbf{A}),o_{g})\leq\epsilon\}$$排名阻塞器是不可行提议 $b$,其代价低于所有可行提议的最低代价:
$$q_{b}<\min_{i:Y_{i}=1}q_{i}$$提议缩放与模型误差
top-$k$可行性事件分解:
$$\Pr(T_{B,k})=\Pr(P_{B})\,\Pr(T_{B,k}\mid P_{B})$$第一因子测量提议覆盖,第二因子测量可行序列在评分后是否保持在顶部。在有限池中,条件分数分布下不可行提议的最小代价概率:
$$\Pr\!\left(\min_{b:Y_{b}=0}q_{b}\leq t\right)=1-\left(1-F_{-}(t)\right)^{n_{-}}$$对任意 $0 < F_{-}(t) < 1$,概率随 $n_-$ 严格增加。更好的代价可降低 $F_{-}(t)$,但更大 $n_-$ 下尾部残差概率仍相关。
| 目标族 | 代价 | B=72 Top-20 | B=288 Top-20 | B=72 阻塞器 | B=288 阻塞器 |
|---|---|---|---|---|---|
| 位置 | 潜在 | .969 | .656 | 4.31 | 16.91 |
| 位置 | 可达性 | .875 | .750 | 6.66 | 16.66 |
| 位置+yaw | 潜在 | .969 | .625 | 4.34 | 18.31 |
| 位置+yaw | 可达性 | .906 | .719 | 7.59 | 17.75 |
图2:Top-20可行序列比例从72到288提议下降,平均阻塞器计数增加。可达性代价改变曲线水平但未消除大池效应。
ASAR方法
相邻集识别
设 $\mathcal{R}_M(Q)$ 为代价最低的 $M$ 个候选。对每个候选,向量化前 $h$ 个模型动作块为前缀 $\mathbf{p}_i$,稳健标准化。局部前缀隔离分数为到 $K$ 个最近前缀的平均距离:
$$u_{i}=\frac{1}{K}\sum_{j\in\mathcal{N}_{K}(i)}\|\mathbf{p}_{i}-\mathbf{p}_{j}\|_{2}$$$u_i$ 越小表示前缀在竞争池中越不孤立。半径支撑 $S_r(i)$ 的Hoeffding界:若可行候选 $e$ 的 $\mathbb{E}S_r(e) \geq p_+$ 且不可行阻塞器 $b$ 的 $\mathbb{E}S_r(b) \leq p_-$,则:
$$\Pr(S_{r}(e)\leq S_{r}(b))\leq 2\exp\!\left[-\frac{n(p_{+}-p_{-})^{2}}{2}\right]$$全动作序列重建
Kernel ASAR选择隔离分数最小的候选 $c$,识别其周围相邻集 $\mathcal{S}$,分配权重:
$$w_{i}\propto\exp\!\left(-\frac{\|\mathbf{p}_{i}-\mathbf{p}_{c}\|_{2}^{2}}{\tau_{d}}-\lambda\tilde{q}_{i}\right),\quad i\in\mathcal{S}$$重建算子产生全动作序列:
$$\mathbf{A}_{\mathrm{rec}}=(1-\alpha)\sum_{i\in\mathcal{S}}w_{i}\mathbf{A}_{i}+\alpha\mathbf{A}_{Q}$$第一项为加权局部序列,第二项为最小代价序列的轻锚($\alpha=0.10$)。条件包含性:若 $\mathcal{S}$ 中每个序列在半径 $R$ 内且 $D=\|\mathbf{A}_Q - \mathbf{A}_c\|$,则:
$$\|\mathbf{A}_{\mathrm{rec}}-\mathbf{A}_{c}\|\leq(1-\alpha)R+\alpha D$$
flowchart TD
A["CEM生成候选池
B个动作序列"] --> B["世界模型预测终端
ẑ_i,H = f̂_H(z_t, A_i)"]
B --> C["终端代价排序
q_i = Q(ẑ_i,H, z_g)"]
C --> D["保留M个最低代价
R_M(Q)"]
D --> E["前缀隔离分数
u_i = KNN均值距离"]
E --> F["选最小u_i的候选c
识别相邻集S"]
F --> G["Kernel加权重建
A_rec = (1-α)Σw_i·A_i + α·A_Q"]
G --> H["执行A_rec首个动作块
重规划"]
实验结果
使用OGBench的Cube操控仿真,固定预训练LeWM编码器/预测器和CEM生成器。提议预算72/144/288。Kernel ASAR保留80个最低代价序列,取12个最近序列,$\alpha=0.10$。
Carry-and-Release(75查询,44种子)
| 提议数 | 潜在-最小代价 | 潜在-最不孤立 | 潜在-ASAR | 可达-最小代价 | 可达-ASAR |
|---|---|---|---|---|---|
| 72 | .067 | .187 | .347 | .147 | .333 |
| 144 | .053 | .213 | .293 | .133 | .333 |
| 288 | .133 | .147 | .320 | .133 | .307 |
潜在代价下ASAR比最小代价选择提升28.0/24.0/18.7个百分点(95% CI均不含0)。可达性代价下提升18.7/20.0/17.3个百分点。
重建优于现有候选选择
73查询定向测试:最不孤立现有序列环境成功率.493,Kernel ASAR重建.630,提升13.7个百分点(CI [1.9, 23.8])。独立训练世界模型权重下ASAR也保持优势(.738 vs .717)。
ASAR帮助的场景
288提议下ASAR救援19个最小潜在代价失败的查询,损失5个。在42个含抓取-举起-运输-下降-释放的长查询上,ASAR成功率.048低于基线.119——单一相邻前缀集无法提供这些更长查询缺失的多个不同行为。
局限性
- ASAR在需要多个不同行为的长horizon查询上效果有限——单一相邻集无法替代多阶段规划。
- 条件包含性是局部条件,不扩展到任意提议池。
- 仅在Cube操控环境验证,更复杂任务的可扩展性待研究。
- 前缀隔离分数是密度代理而非可行性标签,无法保证重建序列一定可行。
总结与展望
本文识别了世界模型控制中的提议过度生成问题——增大候选池在残差模型误差下反而降低最小代价选择的可靠性。ASAR通过在低代价候选的前缀空间中识别相邻集并加权重建新动作序列,在不修改世界模型、提议生成器或终端代价的情况下显著提升性能。重建序列无需存在于采样池中,提供了现有候选选择无法实现的中间行为。理论分析给出了下尾排名误差、局部支撑分离和序列包含性的形式化保证。
金句:"物理空间相邻集的动作重建优于世界模型最佳预测"——当残差预测误差使最小代价选择不可靠时,利用候选池内部的前缀距离关系识别局部规律区域并重建动作,是比改进预测器或增大候选池更直接的解决路径。
深度解读由 RobotWorld paper-detail-generator 基于全文精读生成 | arXiv:2607.23602v1



