Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

真实到仿真R2S场景重建

R2S-EGO:面向稀疏采集的机器人第一视角真实到仿真双代理精修

提出双代理框架:仿真机器人代理界定行为可行查询域,采集锚定几何代理提供场景结构条件,在固定预算下选择当前支持不足的视角生成伪观测精修视觉资产。48个Unitree G1第一视角下6视图达19.06dB PSNR,真实G1坐姿成功率82.5%。

Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen2026年8月7日3 分钟阅读
EN

R2S-EGO:面向稀疏采集的机器人第一视角真实到仿真双代理精修

作者:Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen

机构:XPENG Robotics · The Hong Kong Polytechnic University

论文链接:arxiv.org/abs/2608.06827

代码状态:暂未公开

一句话总结

本文提出双代理框架 R2S-EGO,通过仿真机器人代理界定行为范围内的可执行相机查询域,结合捕获锚定的几何代理提供结构条件,用仅 6 张真实图片将 48 个 Unitree G1 第一视角的 PSNR 从 14.226 提升至 19.062 dB,真实机器人坐姿成功率从 10% 提升至 82.5%。

研究背景与动机

真实到仿真(Real-to-Sim, R2S)将真实环境转化为可重复的仿真场景,用于机器人训练和评估。传统方法依赖密集多视角采集——用大量标定照片从各角度覆盖场景。然而在真实部署中,每个环境能采集到的图片数量极为有限,稀疏采集不可避免地导致机器人第一视角的视觉和结构支撑不足。

作者将这一失效模式命名为采集-消费支撑缺口(capture-consumption support gap):人类方便采集的相机位姿与机器人在执行行为时实际需要的第一视角位姿,往往不在同一空间区域。人拍照片的角度和机器人执行任务时头戴相机看到的角度之间存在系统性偏差,导致仿真场景在机器人真正需要的视角处渲染质量崩溃。

相机控制的新视角合成可以填补缺失视图,但直接将其用于 R2S 面临两个挑战。其一,查询有效性——生成的相机轨迹必须是机器人在声明行为范围内物理可达的,否则合成的图像在仿真中无法对应任何可执行位姿。其二,证据有效性——生成必须以与捕获场景绑定的结构为条件,因为相机运动本身不决定场景布局、可见性和遮挡关系。

因此,核心挑战在于用行为可行且结构锚定的合成观测来填补支撑缺口。R2S-EGO 的解法是将问题分解为两个代理的耦合:机器人代理负责可行性,几何代理负责场景支撑。

预备知识

3DGS(三维高斯泼溅)是本文的视觉资产后端。它将场景表示为一系列三维高斯椭球体,通过可微分光栅化从任意视角渲染图像。稀疏视图 3DGS 在输入图片少时容易产生浮点和模糊——这正是 R2S-EGO 要解决的渲染质量问题。

ViewCrafter 是本文使用的相机控制视频生成器。它接收一张参考图像和相对相机运动轨迹,生成一段视角过渡视频。论文仅保留生成序列的最后一帧(即目标查询位姿处的图像)。VGGT 则负责估计生成帧的相机内参和位姿,使其能注册到场景坐标系中。

方法详解

1. 问题设定

设 $\mathcal{C} = \{(I_i, \pi_i)\}_{i=1}^N$ 为带标定位姿的稀疏 RGB 捕获。固定注册将捕获和初始资产 $\mathcal{A}_0$ 映射到仿真世界坐标系 $\mathcal{W}$。仿真器 $\mathcal{S}$ 提供机器人形体 $\mathcal{E}$、动力学、相机安装 $^BT_C$ 和控制接口。行为范围 $\mathcal{B}$ 定义可达位形、允许运动和身体相关区域。

给定 $(\mathcal{C}^\mathcal{W}, \mathcal{S}, \mathcal{B}, \mathcal{A}_0)$,R2S-EGO 不获取额外真实观测,返回精修后的视觉资产 $\mathcal{A}^*$ 和从融合几何导出的碰撞面。关键在于合成观测需要双重有效性:查询可行性来自机器人代理,场景支撑来自几何代理。

2. 捕获锚定几何代理

几何代理解决的核心问题是:相机控制的生成器可以重现相机运动,但相机运动不决定场景布局。稀疏捕获提供了观测锚点,形状先验可以补充缺失结构,但先验预测在独立的规范坐标系中,需要与捕获对齐后才能使用。

标定多视角轨迹被三角化为碎片几何 $\mathcal{M}_\mathrm{obs} = (\mathcal{P}_\mathrm{obs}, A_\mathrm{obs})$。SAM 3 检测物体实例,SAM 3D 获取先验几何 $\mathcal{P}_\mathrm{prior}$。几何代理的组合公式为:

$$\mathcal{M}_\mathrm{scaf}^l = \operatorname{Compose}\Bigl(\{T_m^*(\mathcal{P}_\mathrm{prior}^m)\}_m, \operatorname{NKSR}(\mathcal{P}_\mathrm{obs}^{\neg\mathrm{prior}} \cup \mathcal{P}(\mathcal{A}^l)^{\neg\mathrm{prior}})\Bigr)$$

其中 $T_m^*(p) = s_m^* R_m^* p + t_m^*$ 是从真实三角化点与先验点之间的重叠估计的世界坐标系相似变换,仅从真实捕获求解一次后在所有精修轮次中保持固定。Compose 在物体区域保留对齐的 SAM 3D 表面,其余区域由 NKSR 从真实三角化点和当前后端几何重建。

R2S-EGO 管线总览

图1:R2S-EGO 管线。机器人代理从行为范围滚出可执行相机查询并定位当前支撑不足的视图,几何代理提供视图对齐的结构条件。注册的 ego 观测以低权重伪观测更新视觉资产,刷新的几何/碰撞代理支撑下一轮 rollout。

3. 行为范围机器人代理

机器人代理首先表示由机器人形体和声明行为范围诱导的第一视角查询域。每轮中,固定行为控制器 $\mu_\mathcal{B}$ 以重采样的初始条件重新 rollout,失败的 rollout 被丢弃并重采样直到获得 12 次成功 rollout。正向运动学和固定相机安装产生该轮的候选流 $\mathcal{V}_0^l$。

相机位姿通过正向运动学计算:

$$^\mathcal{W}T_{C,t} = {}^\mathcal{W}T_B(q_t) \, {}^BT_C$$

其中 $q_t$ 为关节位形,$^\mathcal{W}T_B$ 为基座位姿,$^BT_C$ 为固定相机安装变换。候选评分将资产缺口与几何可用性结合:

$$s_l(t) = u_l(t) \, g_l(t)$$

其中 $u_l(t)$ 是当前视觉资产在该位姿无法渲染的像素比例,$g_l(t)$ 是几何代理在该位姿能渲染的比例。两者的乘积仅在视觉支撑真正缺失且存在可用结构条件时为高。非极大值抑制沿时间轴 $t$ 折叠连续相似帧,TopK 返回 $K$ 个最高分存活位姿:

$$\mathcal{V}^l = \operatorname{TopK}\bigl(\operatorname{NMS}_t(s_l), \mathcal{V}_0^l, K\bigr), \quad |\mathcal{V}^l| = K$$

因此 $\mathcal{V}_0^l$ 是该轮行为范围内的完整可执行查询域,而 $\mathcal{V}^l$ 仅为固定预算子集。每个 $v \in \mathcal{V}^l$ 是机器人在执行声明行为时实际到达的一个相机位姿。

4. 联合 ego 视角生成与注册

对每个目标视图 $v$,固定规则缓存具有最大捕获锚定重叠的真实参考 $i(v)$。路径 $\tau_v$ 在 $N_f$ 步内从参考相机插值到目标位姿,使 ViewCrafter 获得所需的连续过渡。生成器位姿以参考坐标系表示:

$$\bar{\pi}_{v,t} = ({}^\mathcal{W}T_{C,i(v)})^{-1} \, {}^\mathcal{W}T_{C,v,t}$$

ViewCrafter 接收缓存参考、相对运动和点条件,返回序列中仅保留位于查询端点的终帧。VGGT 估计该生成帧的内参和相对位姿后才进入资产更新——查询位姿本身不作为训练位姿使用。

5. 场景精修与实现

设 $\overline{\mathcal{D}}_\mathrm{ego}^l$ 为截至第 $l$ 轮的累计注册生成观测集。从 $\mathcal{A}^l$ 出发,将视觉表示与真实捕获和累计观测集联合精修。真实捕获保持单位权重 $w_\mathrm{real} = 1$,每个生成观测权重 $w_\mathrm{syn} = 0.5$。真实捕获因此保持为持久坐标和外观锚点,而生成观测在选定目标视图处扩展可渲染支撑。

graph TD
    A["稀疏 RGB 捕获"] --> B["三角化碎片几何"]
    B --> C["SAM 3 / SAM 3D 先验对齐"]
    C --> D["几何代理 M_scaf"]
    E["行为范围控制器"] --> F["机器人 rollout"]
    F --> G["ego 相机位姿流 V_0"]
    G --> H["评分: 缺口 x 可用性"]
    D --> H
    H --> I["TopK 目标视图 V"]
    I --> J["ViewCrafter 生成 + VGGT 注册"]
    J --> K["伪观测并入 3DGS 资产"]
    K --> L["刷新碰撞面"]
    L --> F
    K --> M["精修仿真场景"]

视觉结果保留输入资产接口,当前融合几何作为场景碰撞面安装。下游仿真和策略训练因此消费精修后的场景而无需改变机器人动力学或控制接口。每轮 3DGS 优化 5k 步,3 轮累计最多 36 个生成帧,总重建预算固定 15k 步。

实验结果

冻结视角外观质量

在三个 Replica 场景的 48 个冻结 Unitree G1 ego 视角上评估。R2S-EGO 在 PSNR、SSIM 和 LPIPS-Alex 上均排名第一,达到 19.062 dB、0.757 和 0.273。最强 R2S 基线 GaussGym 的 PSNR 为 14.226 dB。R2S-EGO 仅用 6 张真实图片即超越了所有基线。

方法PSNR ↑SSIM ↑LPIPS ↓
Vanilla 3DGS12.4240.5470.481
GaussGym14.2260.6280.379
Difix3D+13.8900.6120.342
GenFusion15.7030.6480.355
R2S-EGO19.0620.7570.273
同视角定性对比

图2:同相机定性对比。每行使用相同的 G1 安装相机位姿。红框标记相同区域:桌面边缘、办公椅和沙发边界。Vanilla 3DGS 和 GaussGym 退化为浮点和模糊,Difix3D+ 扭曲物体结构,R2S-EGO 保持接近真实。

真实图片采集效率

在 office_2 场景中,Vanilla 3DGS、GaussGym 和 Difix3D+ 使用 6/10/15/30/45 张嵌套输入图片集和 16 个目标相机评估。R2S-EGO 仅用 6 张真实视图即获得 19.674 dB。即使 45 张真实视图,GaussGym、Difix3D+ 和 Vanilla 3DGS 分别仅获得 13.458、13.221 和 12.424 dB——没有一个基线达到 R2S-EGO 的 6 视图水平。这表明 R2S-EGO 在采集效率上实现了质的飞跃。

真实视图数Vanilla 3DGSGaussGymDifix3D+R2S-EGO
612.42414.22613.89019.674
1012.58013.89113.502
1512.81013.91213.615
3012.97113.62013.388
4512.42413.45813.221

消融实验

消融实验使用相同的 6 张输入和 48 个冻结视角,移除双代理框架的不同组件:

变体PSNR ↑SSIM ↑LPIPS ↓
无 ego 视频 ($\mathcal{A}^0$)13.4170.5520.588
无机器人代理分配16.1820.6610.406
无 SAM 3D 接地16.3840.6710.412
无迭代精修17.5080.7060.334
完整 R2S-EGO19.0620.7570.273

无生成伪观测时损失 5.645 dB,降至初始资产水平。用随机生成轨迹替代机器人代理分配使 PSNR 从 19.062 降至 16.182——2.880 dB 的差距验证了耦合的机器人代理分配流程。移除 SAM 3D 接地降至 16.384 dB,表明捕获锚定的结构条件对生成质量至关重要。去除迭代精修降至 17.508 dB,说明多轮更新中的碰撞面刷新和控制器重 rollout 贡献了 1.554 dB。

定量对比

图3:48 个冻结视角上的定量对比。R2S-EGO 在 PSNR、SSIM 和 LPIPS-Alex 上均居首位。

真实机器人坐姿验证

在 Unitree G1 上进行受控坐姿策略验证。GaussGym 和 R2S-EGO 条件共享教师、学生架构、训练设置、仿真器物理(包括相同的碰撞面和椅子碰撞资产),仅改变训练视觉资产。每个视觉资产条件独立训练 5 个学生策略,每个策略 8 次真实试验。R2S-EGO 在仿真中达 97.6%,真实部署达 82.5%;GaussGym 仿真 87.2%,真实仅 10.0%。每个策略种子上 R2S-EGO 均优于 GaussGym。

训练场景仿真 (%, ±std)真实 (%, ±std)
GaussGym87.2 ± 5.210.0 ± 10.5
R2S-EGO97.6 ± 2.282.5 ± 6.8

定性分析显示 GaussGym 策略在接近阶段出现足-椅碰撞和在座位前过早坐下的失败模式。R2S-EGO 策略成功完成脱绳坐姿——而 GaussGym 策略未通过安全绳门,其失败试验保持系绳状态。

局限性

作者明确界定了三条边界。其一,先验补全的几何是捕获锚定的结构假设而非场景真值。虽然融合几何也用作下游碰撞面,但作者未独立量化其度量或碰撞精度,也未分离其对视觉资产精修的贡献。其二,机器人代理覆盖的是声明行为范围而非学习策略的占用空间——它用固定控制器而非学习策略来定义查询域。其三,重复的伪观测更新可能传播生成外观或先验补全结构中的误差。

从硬件验证角度看,当前评估仅覆盖坐姿行为和椅子类型变化,未评估手臂操作和精细手-物交互等额外技能。先验几何与真实几何之间的度量差距可能影响碰撞物理的真实性,这在更剧烈接触的任务中可能更关键。

总结与展望

R2S-EGO 证明了一个精巧的洞见:当场景精修的目标不是全局覆盖而是行为范围内的机器人视角支撑时,6 张真实图片可以超越 45 张。双代理的分工——机器人代理回答"机器人会到达哪里",几何代理回答"那里应该看到什么"——将通用的新视角合成转化为有针对性的 R2S 场景精修。生成帧以低权重并入、真实帧保持锚点权重的设计,在扩展渲染支撑的同时防止了合成误差无限制传播。

从 82.5% vs 10.0% 的真实部署成功率来看,视觉资产质量的提升直接转化为 sim-to-real 策略性能的飞跃——这不是渐进式改进,而是从"不可用"到"可用"的质变。这提示在机器人仿真训练中,与其追求更密集的真实采集或更复杂的策略架构,不如在行为关键视角上精修视觉资产。

未来工作将扩展到更多行为类型和技能、学习策略定义的占用空间替代固定控制器,以及独立量化先验几何的碰撞精度。主动多视角采集和生成误差传播控制也是值得探索的方向。

当场景精修的目标从"覆盖全局"变为"支撑行为范围内的机器人视角",6 张真实图片可以超越 45 张——因为真正需要渲染的,从来不是整个房间,而是机器人会看到的那几帧。