PAPER DEEP DIVE
Agentic Real2Sim:基于视觉语言智能体的物理世界建模
Agentic Real2Sim利用视觉语言智能体进行物理世界建模,将真实世界数据转化为仿真环境,弥合real-to-sim差距。
Agentic Real2Sim:基于视觉语言智能体的物理世界建模
论文:Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents | 作者:Guanxiong Chen, Qianjun Xia, Jiawei Peng 等 | 机构:UBC / JHU / NUS / Columbia / UCLA | 链接:https://arxiv.org/abs/2607.19190 | 项目:https://agentic-real2sim.github.io/
一句话总结
Agentic Real2Sim 提出用视觉语言智能体将真实世界机器人-物体交互录制自动转换为可仿真的数字孪生剧集,通过四个链接的智能体阶段(视觉处理、物理先验推理、场景准备、仿真器闭环优化),在 DROID-100 上以仅 2.62 美元的模型成本达到 48% 的回放成功率,并支持可形变物体和人形机器人运动场景。
研究背景与动机
大型真实世界机器人数据集和日益强大的仿真器让 real-to-sim 转换看似已是"已解决的管道问题":收集观测、重建资产、放入物理引擎、训练或评估策略。但实际上,物理交互剧集远非静态场景——它包含机器人、被操作物体、相机设置、物体状态、接触、物理参数以及决定机器人在时空中行为的任务描述。将这些元素累积为可仿真的孪生剧集仍需大量人工劳动:调整视觉基础模型、清理网格、对齐坐标系、粘合脆弱的工作流。
近期工作在部分问题上取得进展。自动化 Real2Sim 框架从机器人交互中恢复仿真就绪资产和物理参数,Real2Sim2Real 框架对齐视觉和动态属性以支持操作策略开发。同时,基于 VLM 的智能体数据生成框架使用生成-批评-改进范式构建仿真就绪场景。但这些工作指向一个缺失的能力:将录制的物理交互剧集可扩展地转换为可物理仿真的数字孪生。
本文将此问题框架化为 Agentic Real2Sim:给定一个录制的物理交互剧集,目标是自动生成一个物理真实的数字孪生,保留参与者、物体、轨迹、物理参数和回放制品,以支持下游机器人学习和评估。
图1:Agentic Real2Sim 架构。录制的 DROID 剧集通过四个链接智能体转换为可仿真数字孪生。
方法详解
剧集孪生表示
Agentic Real2Sim 将真实物理交互剧集转换为可仿真剧集孪生——一个保留观测流、参与者、被操作实体、几何、时间状态、物理参数和评估证据的仿真器制品。剧集孪生表示为:
$$\mathcal{T} = (\mathcal{O}, \mathcal{A}, \mathcal{G}, \mathcal{S}_{1:T}, \Theta, \mathcal{B}, \mathcal{M})$$
其中 $\mathcal{O}$ 为真实观测,$\mathcal{A}$ 为参与者或末端执行器,$\mathcal{G}$ 为几何和外观资产,$\mathcal{S}_{1:T}$ 为随时间变化的仿真器状态,$\Theta$ 为物理和对齐参数,$\mathcal{B}$ 为仿真器后端,$\mathcal{M}$ 为决定转换是否成功的度量与追踪。设计目标是在不同领域间共享流水线阶段、制品契约、回放循环和批评接口,同时允许刚性物体操作、可形变物体交互和全身人形运动之间的技能和工具调用有所不同。
视觉处理智能体
视觉处理智能体读取录制的演示,发现相关物体,选择关键帧,分割参与者和物体,重建或导入几何,估计尺度,追踪姿态,输出规范化剧集文件夹。具体流程:首先从同步流中选择主外部相机,提取帧并构建校正视频。VLM 驱动的物体发现节点提出场景实体,关键帧选择器选择分割帧。掩码批评者可拒绝低质量分割并在有限重试预算内路由回关键帧选择。接受的掩码输入网格恢复,FoundationStereo 提供全图深度重建以实现网格缩放,FoundationPose 提供 6D 物体姿态追踪。追踪批评者记录姿态质量判断并可请求新的初始化帧。
图2:DROID 剧集大规模转换。每个剧集配对真实 DROID 观测与其 MuJoCo 剧集孪生。
物理先验推理智能体
物理先验推理智能体将视觉证据和任务上下文转换为仿真器面向的先验:物体身份、材料类别、质量提示和接触相关属性。这些参数使仿真器能够执行物理一致的模拟。两个 VLM 查询分别识别机器人操作的物体和作为地面参考的场景实体。
场景准备智能体
场景准备智能体将上述制品转换为初始化的仿真器场景:对齐机器人基座姿态、物体姿态、相机坐标系、资产、轨迹和地面参考。它调用确定性校准阶段,优化机器人基座姿态以匹配机器人掩码,估计地面参考下的地面平面方向和偏移。然后加载校准场景到 MuJoCo,做出决策:执行物体位移参数的确定性扫描,或调用 LLM 辅助循环从回放证据中提出精修。
仿真器闭环抓取优化
抓取优化通过在位移参数空间上搜索最优放置:
$$\Delta^* = \arg\max_{\Delta \in \mathcal{D}} \; \text{GraspSuccess}(\mathcal{C}(S, \Delta))$$
最终阶段优化被操作物体的位置,识别使抓取成功的最优物体放置。扫描路径评估一批候选位移的接触和抓取结果;循环路径在每次精修前向智能体暴露渲染的关键帧和结构化回放摘要。
智能体决策可形式化为在有限动作空间上的选择。对于视觉处理阶段,关键帧选择可表示为:
$$f^* = rg\max_{f \in \mathcal{F}} Q_{ ext{mask}}(f), \quad Q_{ ext{mask}}(f) = ext{VLM}_{ ext{critic}}( ext{seg}(f))$$
其中 $\mathcal{F}$ 为候选帧集合,$Q_{ ext{mask}}(f)$ 为掩码批评者对帧 $f$ 分割质量的评分。架构刻意将确定性工具与智能体决策分离。智能体节点做出依赖模糊视觉或物理证据的决策:哪些物体重要、哪个帧提供清晰掩码、分割或追踪是否可接受、哪个物体定义地面平面等。确定性工具执行提取、渲染、姿态优化和抓取优化。这种分离使系统易于消融——移除批评者或替换 VLM 后端只改变决策层,无需重写底层视觉处理和仿真工具。
flowchart TB
A["录制的 DROID 剧集
RGB + 深度 + 轨迹 + 标定"] --> B["视觉处理智能体
SAM3 分割 + FoundationStereo 深度
FoundationPose 姿态追踪"]
B --> C["规范化剧集文件夹
网格 + 尺度 + 姿态轨迹"]
C --> D["物理先验推理智能体
材料分类 + 质量提示"]
D --> E["场景准备智能体
校准 + 基座优化 + 地面估计"]
E --> F["MuJoCo 场景初始化"]
F --> G{"确定性扫描 or
LLM 辅助循环?"}
G -->|扫描| H["批量位移候选评估"]
G -->|循环| I["渲染关键帧 + 回放摘要
VLM 提出精修"]
H --> J["最优物体放置"]
I --> J
J --> K["可回放剧集孪生 T"]
实验结果
评审 $j$ 对候选 $c$ 的评分定义为各维度扣分的加权和:
$$s_j(c) = 10 - 4 \cdot \mathbb{1}[ ext{wrong object}] - 3 \cdot \mathbb{1}[ ext{wrong location}] - 2 \cdot \mathbb{1}[ ext{wrong action}] - 1 \cdot \mathbb{1}[ ext{wrong gripper}]$$
评估在 DROID-100 上进行——从 DROID 数据集中随机选取 100 个操作剧集,覆盖不同物体、相机视角、遮挡模式和操作动词(拾取/放置/推/插入)。所有采样剧集均计入回放成功率分母,包括未产生有效回放记录的运行。
回放成功率形式化定义为:给定剧集 $e$,三个评审的评分集合为 $\{s_1^*, s_2^*, s_3^*\}$,其中 $s_j^*$ 为评审 $j$ 的最佳候选评分:
$$r_e = \mathbb{1}\left[\max_{j \in \{1,2,3\}} s_j^* \geq 8 ight]$$
回放成功率是剧集级度量,衡量仿真剧集与真实剧集的一致性。评估采用结构化的 VLM 评估过程:评估器准备固定的真实和仿真关键帧(start、middle_1、middle_2、end),三个具有不同 VLM 后端的评审各自独立比较关键帧。评审对每个候选评分(满分 10),扣分规则:错误目标物体扣 4 分、错误最终物体位置扣 3 分、错误动作扣 2 分、错误末端夹爪位置扣 1 分。8 分及以上为通过,$r_e \in \{0,1\}$ 为剧集回放成功指示器,$r_e = 1$ 当且仅当至少一个评审给出 8 分以上。
| VLM 后端 | 成功 (48+) | 部分 | 失败 | 模型成本 (USD) | 相对成本 |
|---|---|---|---|---|---|
| Gemma 4 31B | 48 | 8 | 44 | $2.62 | 1× |
| Qwen 3.6 35B | 45 | — | — | $13.10 | 5.0× |
| GPT-5.4 | 43 | — | — | $82.30 | 31.4× |
| Claude Haiku 4.5 | 37 | — | — | $9.17 | 3.5× |
表1:四个 VLM 后端的回放结果和模型成本比较。开源 31B 模型成本仅为 GPT-5.4 的约 3%。
使用 Gemma 4 31B 作为 VLM 后端,Agentic Real2Sim 在 DROID-100 上产生 48 个成功、8 个部分和 44 个失败的回放结果,总模型费用仅 $2.62。四个后端的观察结果构成大致相似:Gemma 4 31B、Qwen 3.6 35B、GPT-5.4 和 Claude Haiku 4.5 分别获得 48/100、45/100、43/100 和 37/100 的回放成功。更显著的差异在成本:相对 Gemma 的 $2.62,Claude 贵 3.5 倍,Qwen 贵 5.0 倍,GPT-5.4 贵 31.4 倍。
图3:可形变和人形机器人剧集转换。(A) PhysTwin 风格可形变剧集;(B) Unitree G1 人形机器人运动。
四个后端结果相似的原因在于流水线限制了 VLM 的角色范围。VLM 不直接执行几何或物理计算——它编排确定性专用组件(分割、立体深度、姿态追踪)和确定性抓取扫描,仅被查询有限的、模式约束的决策,如物体发现、关键帧和掩码选择以及回放精修选择。由于这些查询范围狭窄,完全在现代推理 VLM 的能力范围内,流水线可跨后端迁移而无需逐模型调优:即使是 31B 开源模型也获得最高的观察成功数,同时仅使用 GPT-5.4 模型费用的约 3%。
| 阶段 | 工具 | 决策技能 |
|---|---|---|
| 物体发现 | — | object_discovery, pickup_object, support_tree |
| 分割 | SAM 3 | keyframe + mask critic |
| 几何 | SAM 3D, mesh_scale | scale_critic |
| 姿态追踪 | FoundationPose | tracking_critic |
| 物理先验 | — | material_classify |
| 场景准备 | calibration, base-pose opt. | camera_select, ground_ref |
| 抓取优化 | grasp sweep | — |
表2:各转换阶段暴露的工具和技能。确定性工具执行提取,VLM 做高层决策。
框架还扩展到可形变和人形机器人场景。可形变适配器遵循 PhysTwin/EMPM 设置,用追踪几何和粒子/弹簧状态替代刚体姿态追踪,使用仿真器回放检查恢复参数是否能再现观测到的形变。人形机器人适配器用运动上下文检索和特定于具身体的初始化替代以物体为中心的场景准备,在闭环仿真中与重定向参考运动进行回放比较。
局限性
- 刚性物体 DROID 剧集的局限性:当前主要聚焦刚性物体操作场景,可形变和人形机器人转换仅作为定性压力测试,缺乏系统性的量化评估。作者指出"当前局限在于聚焦刚性物体 DROID 剧集"。
- 对上游感知错误的敏感性:流水线对上游视觉感知和仿真器反馈中的错误敏感。分割或姿态追踪的失误会传播到下游场景准备和抓取优化,导致回放失败。所有后端的绝对回放成功率均低于 50%,表明"剩余的提升空间主要在于上游视觉和仿真组件而非 VLM 的选择"。
- 回放成功率仍有提升空间:即使在最佳后端下,100 个剧集中仍有 52 个未达到回放成功标准,部分失败源于物体几何重建不准确、姿态追踪丢失或抓取扫描未能找到可行放置。
总结与展望
Agentic Real2Sim 将 real-to-sim 转换从手工管道升级为 VLM 驱动的智能体框架。四个链接的智能体阶段——视觉处理、物理先验推理、场景准备和仿真器闭环优化——将确定性工具与智能体决策分离,使系统易于消融和跨后端迁移。开源 31B VLM 以 GPT-5.4 约 3% 的成本达到可比的回放成功率,证明 VLM 的角色范围限制在模式约束的决策查询时,后端选择主要归结为成本而非能力。
同一剧集契约为刚性操作、可形变交互和人形运动提供统一接口,标志着迈向可扩展转换的第一步。生成的对齐剧集孪生可用于下游机器人策略学习和评估,为缩小 sim-to-real 差距提供可复用的仿真资产。
金句:Real-to-sim 不是"看一眼重建一下"那么简单——它需要理解谁是演员、什么被操作、物理参数是什么。Agentic Real2Sim 让 VLM 智能体像导演一样编排这场转换,而开源模型只需前沿模型 3% 的费用就能执导。



