Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

灵巧操作PaperManipulation

NEO:一次NeRF建模,多次编辑的连续物体操作

提出NEO方法,一次NeRF建模后支持多次物体编辑,服务于连续物体操作任务的表征与编辑,降低重复建模成本。

Mikołaj Zieliński, David Hall, Dominik Belter, Peyman Moghadam2026年7月27日3 分钟阅读
EN

1. 论文概览:NEO——一次 NeRF 多次编辑的连续物体操作

NEO 由 Mikołaj Zieliński、David Hall、Dominik Belter 和 Peyman Moghadam 于 2026 年 7 月提出,是一个为机器人操作提供语言引导 NeRF 编辑的统一框架。核心思想是"NeRF 一次,编辑多次"——通过单次场景扫描训练 NeRF+语言场,随后在不重新扫描的情况下反复编辑以预测机器人操作后的未来场景状态。NEO 引入三阶段编辑管线:(i) 结合神经场重采样与多视角一致渐进修复的语言引导物体移除;(ii) 利用知识蒸馏的直接 NeRF 权重编辑方法,通过教师-学生模型组合原始与编辑后 NeRF,在机器人执行动作前连贯建模未来场景状态;(iii) 首个适合机器人操作的 NeRF 场景编辑定量评估基准 NEO-Dataset。NEO 在场景编辑任务中超越 SOTA 基线,产生视觉连贯且几何一致的编辑,减少先前方法常见的伪影,并在多阶段装配任务中保持持久 NeRF+语言场表征,无需额外场景重扫描即可迭代预测未来场景。

NEO 装配任务示例

2. 核心问题:NeRF 编辑的鲁棒性与一致性

NeRF 作为隐式神经场景表征已广泛应用于机器人领域,但现有 NeRF 编辑方法虽产生吸引人的视觉效果,却往往达不到机器人操作所需的鲁棒性和一致性。关键挑战在于:机器人需要能够可靠且永久地更新场景、避免重新扫描的方法。现有方法如 DFF 通过抑制射线上物体区域密度值来移除物体,但稀疏采样在物体后方产生浮动伪影;NeRFiller 在被移除区域局部修复但引入更多背景伪影;Seal-3D 在桌面残留许多伪影。更关键的是,现有方法缺乏多视角一致的渐进修复和直接 NeRF 权重编辑能力,无法在操作前连贯建模未来场景状态。这些局限凸显了对支持重复物体操作的场景表征的需求。

3. 方法:NEO 框架

3.1 神经场重采样

网络 $F_\Theta$ 在机器人单次扫描的图像集 $\mathcal{I}=\{I_j\}_{j=1}^N$ 及对应相机位姿 $\Omega=\{\Omega_j\}_{j=1}^N$ 上训练,学习联合神经表征——场景场 $\mathcal{S} \in \mathbb{R}^4$ 与关联语言场 $\mathcal{L} \in \mathbb{R}^{d_l}$:

$$(\mathcal{S}, \mathcal{L}) = F_\Theta(\mathcal{I}, \Omega) \tag{1}$$

给定用户提示 $p$ 描述的操作目标,用语言场定位目标物体区域 $\mathcal{O} \subset \mathbb{R}^3$:计算文本嵌入 $\phi(p) \in \mathbb{R}^{d_l}$ 与表面点 $\mathbf{x}$ 处语言特征 $\mathcal{L}(\mathbf{x})$ 的余弦相似度,聚类高相关点并用最大簇拟合有向包围盒 $b = (\mathbf{c}, \theta)$,其中 $\mathbf{c} \in \mathbb{R}^3$ 为中心,$\theta \in \mathrm{SO}(2)$ 为绕垂直轴的偏航旋转。与 DFF 抑制密度的做法不同,NEO 的重采样方法直接跳过物体区域采样,将采样集中在其他区域:

$$\mathcal{O}' = \mathcal{O} \setminus \{b\}, \quad \text{sample}(\mathbf{r}) \cap b = \emptyset \tag{2}$$

其中 $b$ 为物体包围盒,采样避开该区域。这避免了 DFF 中稀疏采样导致的浮动伪影,提供了更可靠的背景表示。

NEO 架构

3.2 多视角一致渐进修复

物体移除后,需重建被遮挡的背景区域。NEO 采用多视角一致渐进修复:对被移除物体的视角,用 2D 修复模型填充缺失区域,再以多视角一致的方式将修复结果蒸馏回 NeRF 权重。修复损失为:

$$\mathcal{L}_{ ext{inpaint}} = \sum_{j=1}^{N} \|I_j^{ ext{inpaint}} - ilde{F_\Theta}(\Omega_j)\|^2 ag{4}$$

其中 $I_j^{ ext{inpaint}}$ 为视角 $j$ 的 2D 修复结果,$ ilde{F_\Theta}(\Omega_j)$ 为从位姿 $\Omega_j$ 渲染的图像。该过程迭代进行:先在 2D 域修复,再将修复后的图像作为监督信号重新训练 NeRF $\tilde{F_\Theta}$,确保多视角间的几何和外观一致性。多视角一致性通过共享 3D 表征约束:

$$\mathcal{L}_{ ext{mvs}} = \sum_{j,k} \| ilde{F_\Theta}(\Omega_j) - \mathcal{W}_{jk}( ilde{F_\Theta}(\Omega_k))\|^2 ag{5}$$

其中 $\mathcal{W}_{jk}$ 为视角 $k$ 到 $j$ 的扭曲变换。

神经场重采样对比

3.3 知识蒸馏场景重配置

场景重配置模块通过组合原始训练 NeRF 与编辑后 NeRF 实现物体移位建模。采用教师-学生模型:教师为原始 NeRF $F_\Theta$,学生为编辑后 NeRF $\tilde{F_\Theta}$。知识蒸馏损失为:

$$\mathcal{L}_{\text{distill}} = \sum_{\mathbf{r}} \|F_\Theta(\mathbf{r}) - \tilde{F_\Theta}(\mathbf{r})\|^2 + \lambda \mathcal{L}_{\text{edit}} \tag{3}$$

其中 $\mathbf{r}$ 为射线,$\mathcal{L}_{\text{edit}}$ 为编辑区域的修复监督损失,$\lambda$ 为平衡权重。该方法避免了从零重新训练,在保留未编辑区域的同时将编辑后的变化整合进 NeRF 权重。条件于提示 $p$ 和规划物体运动 $\tau$,NEO 产生更新后的场景表征 $(\mathcal{S}', \mathcal{L}') = F_\Theta(\mathcal{S}, \mathcal{L}, p, \tau)$,可作为后续编辑的输入实现连续操作。

NeRF 重采样方法

4. 实验

4.1 物体移除结果

在五个场景上评估物体移除,对比 NeRFiller、Seal-3D 和 DFF。NEO 在 PSNR、SSIM、RMSE 和表示误差 $E_{\text{rep}}$ 上全面领先,全图和遮罩评估均最优。计算效率上 NEO 约 6 分钟完成修复,DFF 需 13 分钟,NeRFiller 约 1.5 小时——约 15 倍加速。

方法PSNR↑SSIM↑RMSE↓$E_{\text{rep}}$↓时间
NeRFiller20.400.6960.2520.104~90 min
Seal-3D27.080.8660.1620.079
DFF26.910.8780.0480.06813 min
NEO27.200.8810.0560.067~6 min
物体移除前后对比

4.2 机器人操作与装配结果

在 pick-and-place 场景中对比 Seal-3D,NEO 产生更高质量的移位物体重建,Seal-3D 常在物体原位置残留部分物体。消融实验中,遮罩条件训练最关键。连续装配实验展示了 NEO 输出预测未来场景状态的能力——在多阶段操作中保持持久 NeRF+语言场表征,迭代编辑无需重新扫描。

指标DFFNeRFillerSeal-3DNEO
浮动伪影
多视角一致部分部分
连续编辑不支持不支持不支持支持
速度13min90min6min
多视角一致渐进修复

5. 局限性

  • 铰接物体:当前框架聚焦刚体物体移位,铰接物体的运动学编辑尚未支持,是未来方向。
  • 修复依赖:多视角修复依赖 2D 修复模型质量,复杂遮挡场景的修复质量受限。
  • 计算开销:虽比基线快 15 倍,每次编辑仍需约 6 分钟,实时操作场景下仍有延迟。

6. 总结

NEO 通过结合神经场重采样、多视角一致渐进修复和知识蒸馏直接 NeRF 权重编辑,实现了语言引导的 NeRF 编辑统一框架。神经场重采样跳过物体区域采样避免浮动伪影;知识蒸馏的教师-学生模型将编辑后变化整合进 NeRF 权重而保留未编辑区域;条件于提示和运动产生可复用的更新表征,支持连续编辑。NEO-Dataset 提供首个适合机器人操作的 NeRF 编辑定量基准。物体移除 PSNR 27.20 超越所有基线,速度提升 15 倍。核心洞见是:机器人操作不需要"操作后重新扫描"——NEO 让 NeRF 成为可持久编辑的场景记忆,机器人可以在执行前"预见"操作结果,将场景表征从被动快照升级为主动预测。

flowchart TD
    A["单次扫描: 图像 I + 相机位姿 Ω"] --> B["训练 NeRF F_Theta: 场景场 S + 语言场 L"]
    B --> C["语言提示 p → 定位目标区域 O"]
    C --> D["有向包围盒 b = (c, theta)"]
    D --> E["神经场重采样: 跳过物体区域"]
    E --> F["多视角一致渐进修复"]
    F --> G["知识蒸馏: 教师 F_Theta → 学生 F_tilde"]
    G --> H["更新表征 S' L' = F(S, L, p, tau)"]
    H --> I["机器人操作执行"]
    I --> J["后续编辑: H 作为输入"]
    J --> E
机器人操作不需要"操作后重新扫描"——NEO 让 NeRF 成为可持久编辑的场景记忆,机器人可以在执行前"预见"操作结果,将场景表征从被动快照升级为主动预测。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
G0.5:单一自回归流统一机器人推理与动作

G0.5:单一自回归流统一机器人推理与动作

G0.5 用单一 Transformer 解码器在统一目标下同时生成推理与动作 token,配合跨本体动作分词器、原生思维链流与视觉记忆模块,在真机微调、BEHAVIOR、DROID、LIBERO 等 7 项基准上超越 π0.5 与 GR00T-N1.7。

VLA具身智能自回归2026年8月12日
跨具身灵巧手操作:统一手部动作空间

跨具身灵巧手操作:统一手部动作空间

提出规范球面形变的统一手部动作空间,用级联逆运动学把同一策略映射到多款灵巧手,并在仿真与真实手完成手内立方体转位。

灵巧操作Dexterous Manipulation统一动作空间2026年7月3日
CoorDex:协调身体与手部先验实现连续灵巧人形行走操作

CoorDex:协调身体与手部先验实现连续灵巧人形行走操作

人形机器人行走操作常被简化为走走停停——走到物体前停下操作。CoorDex 提出协调身体与手部先验的框架,实现行走与操作同时进行的连续灵巧 loco-manipulation,无需停顿即可在移动中抓取和操控物体。

人形机器人loco-manipulation灵巧操作2026年6月22日