Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Spatial IntelligencePaper空间智能

FloAff-Kitchen:通过规范与渐进楼层可供性学习桥接导航与操作

提出FloAff-Kitchen方法,通过规范与渐进楼层可供性学习桥接导航与操作,提升厨房等室内场景下移动操作的连贯性。

Ping Zhong, Manling Teng, Tao Wu, Bolei Chen, Jiazhi Xia, Jianxin Wang2026年7月27日2 分钟阅读
EN

1. 论文概览:用规范与渐进的地面可供性学习桥接导航与操作

FloAff-Kitchen 由中南大学 Ping Zhong、Manling Teng、Tao Wu、Bolei Chen、Jiazhi Xia、Jianxin Wang 于 2026 年 7 月提出,是一个从自中心多模态感知预测 FloAff(Floor Affordance,地面可供性)的统一框架。移动操作(MoMa)需机器人确定使下游操作成功的底盘放置,而非仅保证导航可行。FloAff 预测是目标条件的局部空间推理问题,但现有方法受表示模糊困扰——无关空间上下文与任意物体朝向导致不一致点云表示,且跨异构操作技能纠缠共享与任务特定知识。本文提出 CFAR(Canonical Floor Affordance Representation)学习规范交互几何,保留可供性相关局部结构同时消除无关空间变化;PFAL(Progressive Floor Affordance Learning)从基础操作任务学习可迁移 FloAff 先验并渐进适配异构下游技能。并建立首个跨场景、多视角的 FloAff-Kitchen 基准。实验在三种设置上一致超越强基线。

侧视与正视 MoMa 示例

2. 核心问题:FloAff 预测的表示模糊与迁移困境

移动操作要求机器人确定使下游操作成功的底盘放置区域。FloAff 预测需从自中心观测估计支持成功操作的底盘放置区域,是桥接导航与操作的基础能力。现有学习方法直接从完整场景观测预测 FloAff,存在两个局限:(1) FloAff 主要由操作目标周围的局部交互几何决定,远端结构引入无关空间上下文;(2) 可供性等价场景在不同目标朝向下产生不一致点云表示,导致表示模糊。模型须同时识别可供性相关几何并学习朝向不变性。此外,异构操作技能(铰链门、抽屉、抓取放置)有各自交互动力学,多任务学习将可迁移空间推理与任务特定交互模式纠缠,限制跨技能泛化。

3. 方法:CFAR 与 PFAL

3.1 规范地面可供性表示(CFAR)

CFAR 是目标条件的场景表示,保留可供性相关局部几何同时对无关空间上下文与目标朝向不变。不直接学 $f_\theta(\mathcal{P}, \mathcal{S})$,先做规范变换:

$$\hat{\mathcal{A}} = f_\theta\!\left(\mathcal{T}(\mathcal{P}, \mathcal{S})\right) \tag{3}$$

其中 $\mathcal{T}(\cdot)$ 为规范变换,$\mathcal{P}$ 为点云,$\mathcal{S}$ 为目标规范。CFAR 满足两性质:可供性相关性(保留 FloAff 预测所需几何、移除无关上下文)与朝向一致性(将可供性等价场景映射为一致表示)。

消除无关空间上下文:FloAff 主要依赖目标周围局部交互几何,故构建以目标 $\mathbf{t}=(x_t, y_t, z_t)$ 为中心的球内点集:

$$\mathcal{P}_{\text{local}} = \left\{\mathbf{p}_i \in \mathcal{P} \,\middle|\, \|\mathbf{p}_i - \mathbf{t}\|_2 \leq r\right\} \tag{4}$$

其中 $r$ 为裁剪半径。消除朝向模糊:局部几何虽提取,但同一可供性模式可能因目标朝向不同对应不同点云。CFAR 通过 AxisNet 将任意朝向的交互几何变换到规范朝向,使几何等价交互映射为一致表示。

CFAR 与 PFAL 示意

3.2 渐进地面可供性学习(PFAL)

异构 MoMa 任务虽有不同交互动力学,但共享底盘放置的公共空间需求(可达性、无碰撞执行、可见性、可操作性),统称共享 FloAff 先验;不同技能引入任务特定可供性约束(铰链方向、滑动方向)。假设1:跨异构技能,FloAff 预测可受益于捕获任务无关空间推理的可迁移潜在表示,任务特定知识可通过表示适配渐进学习。PFAL 概念分解潜在表示为:

$$\mathbf{z} = \Phi(\mathbf{z}_s, \mathbf{z}_t), \quad \theta_{\text{pnp}} \to \theta_{\text{door,drawer}}$$

其中 $\mathbf{z}_s$ 编码共享 FloAff 先验,$\mathbf{z}_t$ 捕获任务特定约束。通过递增 FloAff 复杂度的课程渐进近似该分解:先在抓取放置(基础任务)上建立可迁移空间推理,再适配到铰链与滑动相关 FloAff 模式。共享先验学习:用抓取放置数据集 $\mathcal{D}_{\text{pnp}}$ 优化:

$$\theta_{\text{pnp}} = \arg\min_\theta \frac{1}{|\mathcal{D}_{\text{pnp}}|} \sum_{(\hat{\mathcal{P}}, \mathcal{S}, \mathcal{A}) \in \mathcal{D}_{\text{pnp}}} \mathcal{L}_{\text{aff}}\!\left(f_\theta(\hat{\mathcal{P}}, \mathcal{S}), \mathcal{A}\right) \tag{6}$$

渐进适配:从 $\theta_{\text{pnp}}$ 初始化,在门/抽屉任务上微调,分离可迁移空间推理与任务特定模式。渐进适配的目标为:

$$\theta_{\text{door,drawer}} = \arg\min_\theta \frac{1}{|\mathcal{D}_{\text{task}}|} \sum \mathcal{L}_{\text{aff}}\!\left(f_\theta(\hat{\mathcal{P}}, \mathcal{S}), \mathcal{A}\right), \quad \theta_0 = \theta_{\text{pnp}}$$

4. FloAff-Kitchen 基准

建立首个跨场景、多视角 FloAff-Kitchen 基准,覆盖多样操作技能、场景布局、家具风格与视角。数据收集含三阶段:场景生成、候选底盘位姿生成、碰撞感知过滤、基于 rollout 的可供性标注、多视角观测收集。

数据收集流程

5. 实验

5.1 FloAff 预测对比

方法RMSE↓logMSE↓PCC↑SIM↑
PointNet++0.1640.01420.5650.589
VoteNet0.1670.01430.5430.570
H3DNet0.1740.01560.5030.522
NavAff0.1470.01150.6800.696
本文(MoMa-Kitchen)0.0730.00280.7960.794
本文(FloAff-Kitchen Styles)0.0290.00040.8630.862
本文(FloAff-Kitchen Layouts)0.0350.00060.7380.721

在 MoMa-Kitchen 上,RMSE 从 0.147 降至 0.073,PCC 从 0.680 升至 0.796。在 FloAff-Kitchen Styles 上 PCC 达 0.863,Layouts 上 PCC 达 0.738——Styles 仅外观变化、Layouts 改变交互几何更难,但方法仍稳健。

FloAff 预测定量评估表 FloAff 预测定性结果

5.2 下游 MoMa 性能

FloAff-Kitchen 上的 MoMa 成功率:Styles 上 $SR_{\text{all}}$ 与 Layouts 上 $SR_{\text{all}}$ 均显著超越 NavAff 基线。NavAff 在 Styles 上 $SR_{\text{all}}=0.37$、Layouts 上 $SR_{\text{all}}=0.225$。

FloAff-Kitchen MoMa 性能对比表
基准NavAff SR_all本文 SR_all提升
FloAff-Kitchen Styles0.37更高显著
FloAff-Kitchen Layouts0.225更高显著

6. 局限性

  • 裁剪半径 $r$ 敏感:CFAR 的局部球裁剪半径需预设,过小会丢失交互几何、过大会引入无关上下文。
  • 规范变换依赖 AxisNet:朝向规范化的准确性依赖 AxisNet,对未见物体形状的泛化能力有限。
  • 课程顺序固定:PFAL 的 pnp→door/drawer 课程顺序预设,其他异构技能的最佳课程顺序待探索。
  • 仅仿真评估:FloAff-Kitchen 为仿真基准,真实 MoMa 场景的迁移能力未验证。
  • 任务类型有限:当前覆盖门/抽屉/抓取放置,更多操作技能(如倒水、折叠)的适配有待扩展。

7. 总结

本文提出 FloAff 预测的统一框架:CFAR 通过目标条件表示变换学习规范交互几何,消除无关空间上下文与朝向模糊;PFAL 通过渐进适配从基础任务获取可迁移 FloAff 先验并适配异构技能。建立首个跨场景、多视角 FloAff-Kitchen 基准。在 MoMa-Kitchen 与 FloAff-Kitchen 上,FloAff 预测与下游 MoMa 性能均一致提升,证明了有效性与泛化能力。核心洞见是:可供性预测的精度取决于表示的规范性与迁移的渐进性——先把局部交互几何"摆正"再"裁剪",再把可迁移的空间推理先固化再适配,模糊与纠缠便自然消解。

flowchart TD
    A["自中心多模态观测 P,S"] --> B["CFAR 规范变换 T"]
    B --> C["消除无关上下文: 球裁剪 P_local"]
    B --> D["消除朝向模糊: AxisNet 规范化"]
    C --> E["规范表示 P̂"]
    D --> E
    E --> F["PFAL 渐进学习"]
    F --> G["阶段1: 抓取放置基础任务
学共享 FloAff 先验 θ_pnp"] G --> H["阶段2: 适配门/抽屉
任务特定约束"] H --> I["FloAff 预测 Â"] I --> J["底盘放置决策"] J --> K["导航+操作执行"]
可供性预测的精度取决于表示的规范性与迁移的渐进性——先把局部交互几何摆正再裁剪,再把可迁移的空间推理先固化再适配,模糊与纠缠便自然消解。

相关论文