Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型物理仿真可变形物体

PhysCoRe:面向材料感知可变形动力学的物理修正残差世界模型

预测可变形物体在机器人操作下的演化是长期挑战。现有方法依赖逐物体优化拟合材料参数,速度慢且无法泛化;端到端学习方法外推差且违反物理约束。PhysCoRe提出物理修正残差世界模型。

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan2026年7月22日3 分钟阅读
EN

PhysCoRe:面向材质感知可变形动力学的物理校正残差世界模型

论文:PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

作者:Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构:乔治亚理工学院(Georgia Institute of Technology)

链接arXiv:2607.20653


一句话总结

PhysCoRe 将可微物质点法(MPM)模拟器与两个前馈神经网络耦合——MfM 从视觉观测推断逐粒子材质参数与置信度,RfD 在 MPM 循环内注入有界速度残差校正 sim-to-real 差距——在真实可变形物体操作序列上实现了比 PhysTwin 和 PGND 更高精度的未来预测,同时将材质识别时间从数百秒缩短至 11.4 秒,并支持置信度引导的主动探索。


研究背景与动机

要让机器人有目的地操作可变形物体,它必须在执行动作前预判物体将如何运动。这种预判依赖一个动力学模型,将计划的交互映射到由此产生的变形,其准确性直接限制了规划质量。对可变形物体而言这一要求尤为苛刻:其行为受底层材质属性(如刚度和塑性)支配,这些属性因物体而异甚至在同一物体内也可变化,且无法从 RGB-D 观测中直接读取。

现有方法沿两条基本分离的路线发展。第一条是基于物理的建模:用解析模型(弹簧-质点系统、有限元法 FEM、位置基动力学 PBD、物质点法 MPM)表示物体,通过可微仿真或无梯度优化从观测运动中恢复材质参数。这类方法可解释且物理合理,但识别通常缓慢、针对特定物体,且受限于模拟器的离散化和本构假设。第二条是数据驱动建模:从交互数据直接学习动力学,如交互网络、图神经网络等。这类方法无需校准,但需要大量数据、分布外泛化差且缺乏物理结构。

核心矛盾在于:没有任何现有方法能在保持物理一致性的同时,快速识别材质并跨物体泛化。物理方法慢且不可泛化,学习方法违反物理结构。PhysCoRe 的设计理念是结合两者优势——保留物理模拟器推进动力学,同时将材质识别和残差校正委托给学习模块。

PhysCoRe概览

图1:PhysCoRe 概览。从分割的 RGB-D 观测中,MfM 推断物体的逐粒子材质;可微 MPM 模拟器随后展开动作条件动力学,RfD 注入速度残差 $\Delta\mathbf{v}_i$ 校正网格速度。


预备知识:物质点法(MPM)

PhysCoRe 构建于可微 MPM 模拟器之上,继承其粒子-网格状态、B 样条核、本构应力模型和塑性回映。MPM 的一个循环包含四个步骤:粒子到网格(P2G)、网格更新、网格到粒子(G2P)和粒子更新。

在粒子更新中,位置和变形梯度的更新公式为:

$$ \mathbf{x}_{p}^{h+1}=\mathbf{x}_{p}^{h}+\Delta t\,\mathbf{v}_{p}^{h+1},\qquad\mathbf{F}_{p}^{h+1}=\mathcal{P}\!\Bigl(\bigl(\mathbf{I}+\Delta t\sum_{i}\mathbf{v}_{i}\otimes\nabla w_{p,i}\bigr)\,\mathbf{F}_{p}^{h}\Bigr) $$

其中 $\mathbf{x}_p^h$ 和 $\mathbf{v}_p^h$ 是粒子 $p$ 在子步 $h$ 的位置和速度,$\mathbf{F}_p^h$ 是变形梯度,$w_{p,i}$ 是 B 样条核函数,$\mathcal{P}(\cdot)$ 是塑性回映——它要么保持 $\mathbf{F}_p$ 不变(固定共旋转弹性),要么将其投影到 von Mises 塑性屈服面上。MfM 按每个 episode 选择分支。离散动作序列 $\mathbf{a}_{0:T-1}$ 通过 Catmull-Rom 样条时间上采样到子步速率。


方法详解

1. 问题定义

给定可变形物体的初始多视角 RGB-D 观测 $\mathbf{O}_0$ 和来自机器人夹爪或人手的动作序列 $\mathbf{a}_{0:T-1}$,目标是学习一个基于物理的动力学模型,预测未来粒子构型 $\mathbf{X}_{1:T}$,其中 $\mathbf{X}_t = \{\mathbf{x}_p^{(t)}\}_{p=1}^{N}$ 是 $N$ 个连续体粒子在相机帧 $t$ 的位置。由于材质属性不可直接观测,模型需从观测中推断并据此参数化模拟器,使动作条件预测保持物理一致。

2. MfM 模块(Material from Motion)

MfM 从一小段观测运动窗口估计物体材质。追踪点和控制点的规范位置及逐帧位移通过傅里叶特征编码,送入图 U-Net——在消息传递中对追踪点和靠近控制器的粒子赋予更高权重,因为这些粒子对材质最具有信息量。时间模块将深度一维卷积与 GRU 单元结合,产生单个逐粒子潜在表示。共享 MLP 将其解码为逐粒子材质 $\boldsymbol{\phi}_p = (\log E_p, \nu_p)$:

$$ \log E_{p}=\mu_{\log E}+\sigma_{\log E}\,z_{p}^{(\log E)},\qquad\nu_{p}=\mu_{\nu}+\sigma_{\nu}\,z_{p}^{(\nu)} $$

其中 $E_p$ 为杨氏模量,$\nu_p$ 为泊松比,$z_p$ 是从多倍频 Perlin 噪声生成的空间相关场。有界 sigmoid 将参数约束在采样范围内。MfM 还预测逐粒子置信度 $\mathbf{c}_p$(每参数一个值),用于训练时重加权材质损失,推理时标记最不确定区域。此外,逐粒子潜在在所有粒子上池化后送入小型 MLP,输出逐 episode 的弹性 vs 塑性行为概率 $\pi$。

3. RfD 模块(Residual from Dynamics)

RfD 弥合解析模拟器留下的残差 sim-to-real 差距。它在 MLS-MPM 循环内工作,位于网格更新和 G2P 收集之间。对每个活跃网格单元,构建紧凑特征 $\mathbf{f}_i$,汇集局部网格状态、MfM 材质估计和附近接触几何。FiLM 条件化的稀疏 3D U-Net 将该特征映射为网格速度残差:

$$ \Delta\mathbf{v}_{i}=\delta_{\max}\cdot\tanh\!\Bigl(\mathcal{R}_{\psi}(\mathbf{f}_{i};\,\mathbf{u})\Bigr) $$

其中 $\mathbf{u}$ 是总结当前仿真状态的全局上下文向量。缩放的 $\tanh$ 将 $\Delta\mathbf{v}_i$ 的每个分量限制在最大幅度 $\delta_{\max}$ 内,确保学习到的校正足够小以不破坏展开稳定性。网络输出层零初始化,因此残差从恰好零开始——RfD 初始作为恒等校正,不改变解析模拟器。校正后的速度 $\mathbf{v}'_i = \mathbf{v}_i + \Delta\mathbf{v}_i$ 替换 G2P 和粒子更新中的解析速度。因为校正在网格上施加并通过相同的 APIC 传递到粒子,它保持 MLS-MPM 的一阶动量和角动量结构。RfD 周期性应用而非每个子步都应用,在限制反向传播图的同时仍暴露窗口内累积的误差。

4. 材质增强

监督式材质数据稀缺,因为大规模测量日常物体的空间变化刚度和泊松比不切实际。PhysCoRe 从 14 个真实 PhysTwin episode 合成 1260 个增强 episode,每个保持源采集的几何和控制运动,仅改变材质。对每个 episode,从多倍频 Perlin 噪声在规范粒子上绘制空间相关材质场,通过 episode 级均值和尺度统计仿射映射到逐粒子参数。然后用相同的真实控制器动作轨迹展开 MPM 模拟器,记录逐粒子屈服事件为 episode 级塑性标签 $\pi^\star$,并从保存的相机视角重新渲染结果以产生监督训练的逐帧点云。

5. 两阶段训练

MfM 先在增强数据集上针对真实材质预训练,然后 RfM 在真实 episode 上训练(MfM 冻结)。MfM 的精炼损失为:

$$ \mathcal{L}_{\mathrm{refine}}=\mathbb{E}\!\left[\frac{1}{N}\sum_{p=1}^{N}\!\Bigl(\,\mathbf{c}_{p}\cdot\mathrm{SL1}\bigl(\bar{\boldsymbol{\phi}}_{p},\bar{\boldsymbol{\phi}}^{\star}_{p}\bigr)-\lambda\log\mathbf{c}_{p}\Bigr)\right]+\beta\,\mathrm{BCE}\bigl(\pi,\pi^{\star}\bigr) $$

其中 $\bar{\boldsymbol{\phi}}_p$ 和 $\bar{\boldsymbol{\phi}}^\star_p$ 是归一化到 $[0,1]$ 的预测和真实材质,$\mathrm{SL1}$ 是 Smooth-L1 误差,$\mathbf{c}_p$ 是置信度权重。对数置信度正则化防止 $\mathbf{c}_p$ 膨胀以平凡地缩小误差。RfD 训练时,每个 episode 从首帧展开 MPM,在 $K$ 帧窗口内处理——每个窗口开始时 MfM 刷新预测,RfD 每 $H_r$ 子步应用校正。每帧损失结合点云的单侧 Chamfer 距离和可见追踪粒子的平均 L2 误差:

$$ \mathcal{L}_{\mathrm{corr}}^{(t)}=w_{\mathrm{C}}\,\mathrm{Chamfer}\bigl(\hat{\mathbf{Y}}_{t},\,\mathbf{X}_{t}\bigr)+w_{\mathrm{L2}}\,\frac{1}{|\mathcal{T}_{t}|}\!\sum_{p\in\mathcal{T}_{t}}\!\bigl\|\mathbf{x}_{p}^{(t)}-\hat{\mathbf{x}}_{p}^{(t)}\bigr\|_{2} $$
flowchart TD
    A["RGB-D 多视角观测"] --> B["分割 + 追踪
Grounded SAM2 + CoTracker3"] B --> C["MfM 模块
图U-Net + GRU"] C --> D["逐粒子材质 phi_p
(log E, nu)"] C --> E["逐粒子置信度 c_p"] C --> F["弹性/塑性概率 pi"] D --> G["可微 MPM 模拟器
P2G -> 网格更新 -> G2P -> 粒子更新"] E --> G F --> G G --> H["RfD 模块
FiLM 稀疏3D U-Net"] H --> I["速度残差 Delta v_i
= delta_max * tanh(R(f_i))"] I --> J["校正网格速度
v'_i = v_i + Delta v_i"] J --> G G --> K["未来粒子构型 X_1:T"] K --> L["3DGS 渲染
视觉对比"] style C fill:#e1f5fe style H fill:#fff3e0 style G fill:#e8f5e9

实验结果

实验设置

真实世界数据集包含 12 个可变形物体操作 episode(人手操作),覆盖弹性物体(绳子、毛巾、毛绒玩具熊)和弹塑性物体(培乐多彩泥),动作包括提、推、拉、挤。在线置信度引导探索使用配备 Robotiq Hand-E 夹爪的 KUKA 机械臂。每个 episode 由三台 Intel RealSense D455 相机以 RGB-D 捕获,CoTracker3 提供追踪表面点,Grounded SAM2 提供物体掩码。对比基线为 PhysTwin 和 PGND。

表1:能力对比——仅 PhysCoRe 同时具备四项能力
方法物理仿真在线精炼前馈推理泛化性
PGND
PhysTwin
EMPM
PhysCoRe

未来预测

每种方法从 episode 前 50%(识别窗口)识别材质,预测后一半(保持材质固定)。用 Chamfer 距离(CD)和追踪损失衡量几何精度,用 IoU、PSNR、SSIM、LPIPS 衡量视觉质量。

定性展开对比

图2:定性展开对比。预测物体位置用 3DGS 渲染。与 PhysTwin 相比,PhysCoRe 预测的未来动力学更接近真实观测。

表2:未来预测定量结果——PhysCoRe 在两种物体类型上总体最佳
方法物体类型CD↓Track↓IoU%↑PSNR↑SSIM↑LPIPS↓
PGND弹性0.034200.1317537.810.740.1030.416
PhysTwin弹性0.016170.0301670.514.150.3090.199
PhysCoRe弹性0.009100.0255768.214.470.3020.194
PGND弹塑性0.043110.1326323.99.870.0810.440
PhysTwin弹塑性0.007780.0182163.114.160.2850.154
PhysCoRe弹塑性0.005410.0167066.115.020.2860.130

PhysCoRe 相对 PhysTwin 在弹性物体上 CD 降低 43.7%,在弹塑性物体上降低 30.5%,追踪损失分别降低 15.2% 和 8.3%。增益在弹塑性物体上最大——这正是解析模拟器面临最宽 sim-to-real 差距的地方。前馈推理也远更廉价:材质识别仅需 11.4 秒,而 PhysTwin 需 930.0 秒、PGND 需 8280.0 秒,使新物体的在线适配变得实际可行。

RfD 残差校正消融

表3:RfD 效果消融——RfD 进一步降低 CD
方法弹性 CD↓弹性 Track↓弹塑性 CD↓弹塑性 Track↓
PhysCoRe(仅 MfM)0.010470.027230.006580.01981
PhysCoRe(MfM + RfD)0.009100.025570.005410.01670

仅 MfM 已是强物理基础预测器,加入 RfD 后弹性物体 CD 进一步降低 13.1%,弹塑性降低 17.8%。更大的弹塑性增益印证了设计意图的分工:MfM 识别物体特定材质,RfD 吸收简化解析 MPM 在接触、摩擦和不可逆变形中留下的残差误差。

能力对比

图3:能力对比表与实验设置可视化。

定量结果

图4:未来预测定量结果表与置信度可视化。


局限性

  1. 材质类型有限(作者自述):PhysCoRe 目前主要关注弹性和弹塑性物体,依赖预定义的材质行为集,未直接扩展到涉及撕裂、切割、粘附、类流体运动或高度复杂接触的物体或场景。
  2. 泛化范围未验证(作者自述):虽然实验展示了快速适应新物体和操作交互,但当前评估仅限于类别内物体,未测试零样本类别级迁移。
  3. 残差模块可扩展性(作者自述):RfD 目前在有限的变形物体集合上训练,对更广泛动力学分布的可扩展性尚未探索。

总结与展望

PhysCoRe 将可微 MPM 模拟器与两个前馈模块耦合——MfM 从视觉观测推断逐粒子材质,RfD 校正模拟器内部动力学。这一设计在保持物理结构的同时准确预测可变形物体行为,且无需逐物体优化即可迁移到未见物体。在真实世界操作序列上,PhysCoRe 在预测精度上超越 SOTA 基线,其预测置信度可靠地反映材质估计可信赖的区域,展现了置信度引导探索和主动学习的潜力。

金句:「RfD 的输出层零初始化,残差从零开始——它初始作为恒等校正不改变解析模拟器,然后逐步学习吸收 sim-to-real 差距,这保证了物理结构不被破坏的同时获得数据驱动的精度提升。」

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日