PAPER DEEP DIVE
策略性扩展:通过偏置感知评估和数据采集学习组合泛化
组合泛化对机器人执行多样指令至关重要。预训练策略已知会走捷径依赖显著线索而非语言基础。本文提出诊断框架定位组合泛化失败到个别指令因素,并通过偏置感知数据采集策略性扩展。
一句话总结
本文提出指令因子偏置(instruction factor bias)诊断框架:将语言指令分解为颜色、动词、物体、尺寸、空间五个因子,用因子优势率(FDR)和因子优势层级(FDH)量化策略对哪些因子过度依赖,再用偏置感知数据采集策略向"弱因子"倾斜——在真实机器人上仅用一半示教即超越基线。
Figure 1 — (a) 将语言指令分解为可复用因子。(b) 微调策略会对某些因子过拟合(如只认"蓝色"而忽略动词)。(c) 用 FDR 做两两因子偏置度量,FDH 聚合为全局排序。(d) 诊断指导偏置感知数据采集,提升样本效率与泛化能力。
1. 研究背景与动机
组合泛化(compositional generalization)是机器人执行多样语言指令的核心能力——策略需将已学的语义原语(semantic primitives)重新组合以应对未见过的指令组合。然而,大规模预训练的机器人策略(foundation policies)虽在统计意义上"成功",却常走捷径(shortcut):它并非真正理解了语言,而是依赖训练数据中最显著的视觉线索猜对了动作。
例如,当指令是"抓起蓝色方块"时,策略可能根本没解析"抓起"这个动词,只是看到蓝色物体就执行抓取——若场景里换成"推动蓝色方块",它仍会去抓。现有评测多报告聚合成功率(aggregate success rate),只能告诉你"策略失败了",却不说"它依赖了哪个因子、忽略了哪个因子"。
本文要回答三个问题:策略究竟依赖指令的哪一部分?依赖多强?以及如何修复?
2. 核心方法
本文的贡献是一条从诊断到行动的完整链路:因子分解 → 因子相关训练 → 偏置度量(FDR) → 全局排序(FDH) → 偏置感知数据采集。
2.1 指令因子分解
每条桌面操作指令被分解为五个可复用、语义独立的因子,遵循模板"[Verb] the [Size] [Color] [Object] on the [Spatial Attribute] of the table",例如"Grasp the smallest red cube on the left of the table"。
| 因子 | 类型 | 取值 |
|---|---|---|
| Verb(动词) | 动作中心 | grasp, lift, push, pull, rotate, slide |
| Color(颜色) | 物体中心 | red, yellow, blue, orange, green, black |
| Object(物体) | 物体中心 | cube, sphere, cup, car, pyramid, star |
| Size(尺寸) | 物体中心 | small, large, smaller, larger, smallest, largest |
| Spatial(空间) | 物体中心 | left, right, middle, front, behind |
五因子的笛卡尔积定义了 $6 \times 6 \times 6 \times 6 \times 5 = 6{,}480$ 条唯一指令,每个场景还随机加入最多三个干扰物体。实验在 ManiSkill 中用 Panda 臂完成。
Figure 2 — ManiSkill 仿真环境。多任务桌面操作,每条指令从五因子空间采样。
2.2 因子优势率 FDR
要测量一对因子 $(f_1, f_2)$ 之间的偏置,先在训练分布中故意将二者相关联(对角绑定,如红色总配方块),其余因子随机化;再在未见过的非对角组合上评测,观察策略过拟合到哪个因子。
推理场景按因子类型分两种构造方式(见 Figure 3):
- 动词 vs 物体中心因子:场景放两个同色物体——指令目标(如"汽车")和训练时与动词配对的物体(如"球")。若策略去抓球,说明它依赖动词;若对汽车施加训练动词(如"拉"),说明它依赖物体。
- 两个物体中心因子:故意给不可能指令(如"抓蓝色杯子"),场景只有训练配对的蓝色星和红色杯子。抓蓝色星→依赖颜色,抓红色杯→依赖物体。
打分不用规则成功率(无法归因),而用 Gemini-2.5-Flash 对每个 rollout 分类为"成功/过拟合到 $f_1$/过拟合到 $f_2$"。设 $N_{f_1}, N_{f_2}$ 为两种过拟合计数,FDR 定义为:
$$\text{FDR}(f_1, f_2) = \frac{N_{f_1} - N_{f_2}}{N_{f_1} + N_{f_2} + \epsilon} \in (-1, 1), \quad \epsilon \to 0$$
正值表示 $f_1$ 占优,负值表示 $f_2$ 占优,接近零则两因子接地均衡。
Figure 3 — 因子相关实验。(a) 动词-物体设置:同色两物体,看策略跟动词还是跟物体。(b) 颜色-物体设置:给不可能指令,看策略跟颜色还是跟物体。
2.3 因子优势层级 FDH
将两两 FDR 聚合为全局排序,用 Copeland 排名:每个因子 $f_i$ 的 Copeland 分数为:
$$C(f_i) = \sum_{j \neq i} \mathbb{1}\!\left[\text{FDR}(f_i, f_j) > \tau\right]$$
其中 $\tau$ 为平局阈值(本文取 $\tau = 5\%$)。每场两两胜利得 $+1$,输或平局得 $0$,按 $C(f_i)$ 降序排列即得 FDH。
2.4 偏置感知数据采集
FDH 的实践价值在于指导数据采集。指令空间随因子数组合爆炸,穷举不可行。本文提出 V 策略:对每对因子,固定被判定为"弱接地"的因子 $f_1$(满足 $\text{FDR}(f_2, f_1) > \tau$),沿另一因子变化采集一整列,并加入对角线与次对角线。三因子以上时,按 FDH 从弱到强依次为每个弱因子加一列。
flowchart TB
A["Instruction: Verb+Size+Color+Object+Spatial"] --> B["Decompose into 5 factors"]
B --> C["Train on diagonal
correlate factor pairs"]
C --> D["Eval on off-diagonal
OOD combinations"]
D --> E["Classify rollouts:
success / overfit-f1 / overfit-f2"]
E --> F["Compute FDR per pair"]
F --> G["Copeland ranking
=> FDH global order"]
G --> H["Bias-aware data collection V
allocate demos to weak factors"]
H --> I["Better compositional
generalization"]
style F fill:#dbeafe,stroke:#2563eb
style G fill:#dbeafe,stroke:#2563eb
style H fill:#dcfce7,stroke:#16a34a
3. 实验结果
3.1 FDR 逐对比
在六个基础策略($\pi_{0.5}$, $\pi_0$, OpenVLA-oft, GR00T-N1.7, XVLA, Genie-Envisioner)上各做 400 次 OOD rollout,得到 FDR 矩阵:
| 因子对 | $\pi_{0.5}$ | $\pi_0$ | OpenVLA-oft | GR00T-N1.7 | XVLA | Genie-Env. |
|---|---|---|---|---|---|---|
| (verb, color) | -4.0 | -6.0 | -6.2 | -6.8 | -1.0 | -22.0 |
| (verb, object) | -9.2 | -16.7 | 16.0 | -25.3 | -19.0 | -25.0 |
| (verb, size) | 26.3 | 41.3 | 4.5 | 25.1 | 38.0 | 32.6 |
| (verb, spatial) | -7.4 | -2.1 | 4.5 | -12.2 | -5.0 | -14.2 |
| (color, object) | 57.3 | 42.1 | 17.5 | 22.8 | 31.0 | 22.2 |
| (color, size) | 54.0 | 52.4 | 33.6 | 52.4 | 56.0 | 30.9 |
| (color, spatial) | 38.6 | 32.6 | 39.5 | 8.4 | 19.0 | 36.5 |
| (object, size) | 22.0 | 31.2 | 1.6 | 52.4 | 29.0 | 11.4 |
| (object, spatial) | -3.8 | -2.9 | 17.0 | 9.5 | 9.0 | 20.9 |
| (size, spatial) | -7.9 | -13.0 | 19.8 | -11.0 | -32.0 | -23.7 |
正值表示第一个因子占优。颜色对物体/尺寸的大正值说明颜色主导一切。
3.2 FDH 全局排序
| 模型 | 因子优势层级(FDH) |
|---|---|
| $\pi_{0.5}$ | color > object > spatial > verb > size |
| $\pi_0$ | color > object > spatial > verb > size |
| OpenVLA-oft | color > object > verb > size > spatial |
| GR00T-N1.7 | color > object > spatial > verb > size |
| XVLA | color > object > spatial > verb > size |
| Genie-Envisioner | color > object > spatial > verb > size |
三大发现:①颜色始终最占优——它是低级视觉显著线索,易被视觉编码器捕获并形成捷径。②动词和尺寸最被忽视——尺寸依赖相对几何关系,现有数据集多样性不足。③跨架构一致——除 OpenVLA-oft 外,层级几乎相同:color $\geq$ object $\geq$ spatial $\geq$ verb $\geq$ size。
3.3 真实机器人实验
在 UR5(夹爪 + RealSense D455 + FLIR 手内相机,用 GELLO 采集示教)上做三个日常任务:Bun(颜色-空间)、Pizza(空间-物体)、Cup(动词-颜色),每个任务 16 种指令变体。用 GR00T-N1.7 在 $f=12$、$n=100$ 和 $n=200$ 下对比 V、Random、L 策略,各评测 48 次 rollout:
| 方法 | Bun(100) | Bun(200) | Pizza(100) | Cup(100) |
|---|---|---|---|---|
| L | 22.9%(11/48) | 37.5%(18/48) | 35.4%(17/48) | 37.5%(18/48) |
| Random | 37.5%(18/48) | 47.9%(23/48) | 50.0%(24/48) | 47.9%(23/48) |
| V (ours) | 54.2%(26/48) | 64.6%(31/48) | 62.5%(30/48) | 66.7%(32/48) |
V 平均比 L 高 +28.7 个百分点、比 Random 高 +16.7。关键:Bun 上 V 用 $n=100$(54.2%)已超过 L 和 Random 的 $n=200$——偏置感知分配用一半示教即更强。
Figure 4 — 仿真结果。各面板展示不同因子变化 $f$ 或示教预算 $n$ 下的成功率,三随机种子各 200 rollout。
4. 主要贡献
- 发现因子偏置:首次将语言指令捷径定位到单个因子层面,揭示这是预训练策略组合泛化的系统性瓶颈。
- 量化框架:提出 FDR(两两偏置)和 FDH(全局排序),在六个基础策略上发现一致的 color $\geq$ object $\geq$ spatial $\geq$ verb $\geq$ size 层级。
- 偏置感知采集:向弱因子倾斜的 V 策略在仿真和真实机器人上均优于基线,真实场景下用一半示教即超越。
5.
功能距离比率
$$ \text{FDR}(f_{1},f_{2})=\frac{N_{f_{1}}-N_{f_{2}}}{N_{f_{1}}+N_{f_{2}}+\epsilon}\in(-1,1) $$
功能冲突计数
$$ C(f_{i})=\sum_{j\neq i}\mathbb{1}\!\left[\mathrm{FDR}(f_{i},f_{j})>\tau\right] $$
功能空间大小
$$ \prod_{i=1}^{N_{f}}k_{i} $$
局限与展望作者自述局限:
- 实验限于桌面操作的受控因子空间,能否推广到开放世界、多步任务尚属未知。
- V 策略只是偏置感知分配的一种实例,并非全局最优;未来可用主动学习或课程设计做原则性搜索。
分析判断:评测依赖 Gemini-2.5-Flash 做 rollout 分类(虽与人工标注一致),引入了 LLM 判断的不确定性。FDH 的跨模型一致性很惊人,但样本仍以 tabletop 为界——颜色主导或许部分源于这类场景颜色信号本就强。V 策略在弱因子上的"列采样"思想简洁有效,但当因子数增多时列的选取与对角线的权重仍需更系统的理论支撑。
6. 总结
本文的核心洞察是:与其盲目扩大数据量,不如按诊断出的因子偏置重新分配数据。预训练策略对颜色等显著因子过度依赖、对动词和尺寸弱接地,这一偏置在六种架构上出奇一致。基于此,将有限示教预算向弱因子倾斜的 V 策略,在真实 UR5 机器人上用一半示教即超越随机和 L 策略——说明数据分布的形状比数据量更能决定组合泛化。



