Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

运动预测motion prediction3D场景流

MotionForesight:视频模型预测未来3D场景流

从普通单目视频学习物体运动预测,MotionForesight根据短视频上下文预测物体上点的未来3D轨迹,将交互预测转化为场景流预测。

Homanga Bharadhwaj, Yash Jangir2026年7月17日3 分钟阅读
EN

论文:MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction
链接:arXiv:2607.16192v1, 2026;项目主页:motionforesight.github.io
代码状态:论文提及项目主页,未直接提供 GitHub 仓库链接(⏳ 待确认)

1. 摘要

本文研究从日常单目人类视频中预测被操作物体的未来3D场景流(future 3D scene flow)。核心洞察:大规模视频模型已经编码了关于接触、affordance、物体持久性和短时动力学的时间先验,但这些先验的原生输出是未来像素或视频潜变量,而非显式的几何运动。MotionForesight 不生成未来 RGB 帧再追踪运动,而是直接预测物体表面参考点的未来3D轨迹场。模型基于 TrackCraft3R(一个前馈密集3D追踪器,构建在 video DiT Wan2.1 之上),通过对未来帧施加可学习的 mask latent,将回顾性追踪器改造为预测性预测器。仅训练轻量 LoRA 适配器,在 40K SSv2 人类交互视频上实现了令人信服的运动预测,无需语言或动作标签。

2. 研究背景与动机

"思维最根本的属性之一是预测事件的能力"——Kenneth Craik。当人观看手接近水杯、刀切水果或柜门开始移动时,往往能在动作完成前推断出物体的未来构型。这种能力超越了视觉预测,反映了对物体 affordance、接触、约束和目标的理解。

现有方法的局限:

  • 语言/动作条件方法:依赖语言描述或动作标签预测稀疏3D点轨迹或刚体6-DoF轨迹,无法自然描述铰接部件、可变形表面或局部非刚体运动。
  • 2D点轨迹方法:预测图像平面上的2D轨迹,下游控制设置中缺少度量3D信息。
  • 视频生成方法:先生成未来像素再从中恢复运动,计算开销大且视觉合理的像素不一定保持点对应关系或度量3D运动。

MotionForesight 选择密集的、参考锚定的3D场景流作为输出表示,因为它是度量级而非图像平面、物体中心而非具身特定、不限于单一刚体位姿参数化的通用接口。

3. 核心方法

3.1 问题形式化

给定 $T_1$ 个观测 RGB 帧 $I_{0:T_1-1}$,预测被操作物体上参考点在未来 $T_2$ 步的3D轨迹。为每帧估计点图 $P_t \in \mathbb{R}^{H\times W\times 3}$,从参考帧 $a=0$ 的物体掩码中采样查询点 $\mathcal{Q}$,目标是预测这些参考帧点的未来3D位置:

$$\hat{X}_{t}(q)\in\mathbb{R}^{3},\qquad q\in\mathcal{Q},\quad t=T_{1},\ldots,T_{1}+T_{2}-1.$$

默认设置:$T_1=7$(观测7帧),$T_2=15$(预测15步),$T=22$。模型不接收语言指令或动作标签等辅助输入。所有几何在最后观测相机坐标系 $t=T_1-1$ 中表示以减少相机视运动。

3.2 数据整理:从RGB视频到3D轨迹

从 Something-Something V2 (SSv2) 的约40K人-物交互视频构建伪真值监督。处理流水线:

  1. 物体分割:用数据集标注中的物体名称作为线索,在锚帧上初始化 SAM(Segment-Anything),向前向后传播掩码;
  2. 单目深度:用 DepthAnything3 估计每帧深度,恢复相机运动,构建时间对齐的点图;
  3. 3D追踪:在完整片段上运行 TrackCraft3R 获取参考锚定的3D轨迹;
  4. 坐标变换:将轨迹变换到最后观测相机坐标系,存储有效掩码。

完整片段仅用于离线伪标签生成;训练时未来帧和点图不提供给预测模型。

3.3 架构:双潜变量构造

保留 TrackCraft3R 的双潜变量构造。观测帧的 RGB 与点图分别编码后拼接为视觉-几何潜变量:

$$c_{t}=\left[E^{\mathrm{rgb}}(I_{t});E^{\mathrm{pm}}(P_{t})\right],\qquad t<T_{1}.$$

其中 $E^{\mathrm{rgb}}$ 是 RGB VAE 编码器,$E^{\mathrm{pm}}$ 是点图 VAE 编码器。RGB 流捕获外观、接触和人-物交互线索,点图流提供度量场景结构和观测3D运动。

查询流在每帧重复参考帧状态:

$$r_{t}=\left[E^{\mathrm{rgb}}(I_{a});E^{\mathrm{pm}}(P_{a})\right],\qquad a=0,\qquad t=0,\ldots,T-1.$$

重复查询流使每个时间输出槽变为相同的几何问题:参考帧每个点在时刻 $t$ 在哪里?Transformer 接收上下文和查询潜变量加上时间 RoPE,预测残差追踪潜变量 $\hat{z}^{\Delta}_{t}$,冻结的追踪解码器将其映射为3D残差并加到参考点上:

$$\hat{X}_{t}(q)=X_{0}(q)+D^{\mathrm{track}}(\hat{z}^{\Delta}_{t})(q).$$

图3:架构。观测帧产生RGB和点图几何潜变量;未来几何槽由可学习mask latent填充;帧0查询潜变量跨时间重复;冻结video DiT + 新鲜LoRA预测未来残差追踪潜变量。

3.4 将追踪转为预测:Mask Latent 机制

关键创新——将回顾性追踪器转为预测器:隐藏所有未来观测

观测时间戳:上下文流含真实视觉-几何潜变量:

$$\tilde{c}_{t}=\left[E^{\mathrm{rgb}}(I_{t});E^{\mathrm{pm}}(P_{t})\right],\qquad t<T_{1}.$$

未来时间戳:RGB图像和点图均不可用,用可学习 mask latent替换:

$$\tilde{c}_{t}=\left[m^{\mathrm{rgb}};m^{\mathrm{pm}}\right],\qquad t\geq T_{1}.$$

RGB mask latent $m^{\mathrm{rgb}}$ 和点图 mask latent $m^{\mathrm{pm}}$ 跨未来时间戳共享并空间广播,不编码特定未来外观或几何,仅指示对应时间槽未观测。时间旋转位置编码(RoPE)为每个槽分配不同时间索引,使 Transformer 能区分近期和远期预测。

flowchart LR
    A[观测RGB帧 I_0..I_6] --> B[RGB VAE编码 E_rgb]
    A2[点图 P_0..P_6
DepthAnything3] --> C[点图VAE编码 E_pm] B --> D[观测上下文潜变量 c_t] C --> D E[参考帧 a=0 编码] --> F[查询潜变量 r_t
跨时间重复] G[未来时间槽 t≥T1] --> H[可学习Mask Latent
m_rgb + m_pm] D --> I[冻结Video DiT + LoRA] F --> I H --> I I --> J[残差追踪潜变量 z_hat] J --> K[冻结追踪解码器 D_track] K --> L[未来3D轨迹
X_hat_t = X_0 + D_track z_hat]

3.5 训练策略

冻结基础视频模型、TrackCraft3R 适配器、VAE 编码器/解码器。仅训练:新鲜低秩适配器(LoRA)、I/O 投影、预测头、mask latent。损失函数为观测帧解码3D轨迹的L2损失:

$$\mathcal{L}_{\mathrm{dec}}=\lambda_{\mathrm{obs}}\frac{\sum_{t<T_{1}}\sum_{q}v_{tq}\left\|\hat{X}_{t}(q)-X_{t}(q)\right\|_{2}^{2}}{\sum_{t<T_{1}}\sum_{q}v_{tq}+\epsilon}$$

损失通过冻结的追踪解码器反向传播,但解码器参数不更新。默认 $\lambda_{\mathrm{obs}}=0.25$。

4. 关键实验

4.1 主要对比(SSv2 + OOD手机视频)

在150个SSv2 held-out视频和50个独立手机视频(OOD)上评估,报告ADE(平均位移误差)、FDE(最终位移误差)、PWT@5cm(5cm阈值内百分比),单位cm。

方法额外输入SSv2 ADE↓SSv2 FDE↓SSv2 PWT↑OOD ADE↓OOD FDE↓OOD PWT↑
MotionForesight4.476.23769.3114.8854
MolmoMotion (无语言)空动作字段5.668.90709.5016.0553
视频生成+追踪11.2012.584013.8217.6532
MolmoMotion (带语言)动作描述5.939.38689.9417.1651
视频生成+追踪 (带语言)动作描述11.9913.574413.6316.7129

MotionForesight 在所有SSv2和OOD指标上均最佳,尽管不使用语言或动作标签。MolmoMotion 使用1M视频语料库训练,MotionForesight 仅用40K SSv2视频。

图1:MotionForesight 在多样化日常操作场景中预测合理运动。

4.2 长上下文评估

观测每个视频的前50%,预测后50%。MotionForesight 显著优于 MolmoMotion:ADE 10.20cm vs 11.90cm(无语言)/12.57cm(带语言)。这表明几何感知方法能更好地将更丰富的观测上下文转化为度量一致的未来运动。

方法OOD ADE↓OOD FDE↓PWT@5cm↑
MotionForesight10.2013.5947.4
MolmoMotion (无语言)11.9016.2741.3
视频生成+追踪 (无语言)13.3315.1220.9
MolmoMotion (带语言)12.5718.7737.1

图4:未来3D轨迹预测的定性结果。从仅观测前缀预测合理物体运动,包括举起、平移、旋转、约束滑动和局部非刚体运动。

4.3 数据规模消融

训练视频数SSv2 ADE↓SSv2 FDE↓SSv2 PWT↑OOD ADE↓OOD PWT↑
1K4.816.57749.4853
10K4.726.38738.9752
40K4.476.23769.3154

40K 模型在所有SSv2指标上最强且OOD PWT最高。10K模型OOD ADE/FDE略低但定性上40K几乎总是更好。更多数据多样性改善运动先验,但该增益不总是被单模态指标单调反映。

4.4 运动条件动力学分析

标准指标(ADE/FDE/PWT)将确定性预测与单一已记录未来比较,在多模态场景中可能偏向保守预测。作者提出运动条件诊断指标:

  • TVO(轨迹向量重叠):比较每帧预测与真值位移向量,仅当点在正确方向、正确量、正确时间移动时给高分;
  • VVO(速度向量重叠):对帧间速度应用相同重叠,对加速、转向、停止更敏感;
  • MoveF1 / MoveIoU:评估是否移动了正确的物体点;MoveIoU比较每点峰值偏移;
  • DQS(动力学质量分数):结合 TVO 和 MoveF1,$\mathrm{DQS}_{c}=\sqrt{\mathrm{TVO}_{c}\,\mathrm{MoveF1}_{c}}$。

5. 局限与展望

  • 确定性预测:当前模型仅预测一个未来,但短交互前缀可能支持多个物理合理结果;多假设或概率预测可表示替代结果并暴露校准不确定性。
  • 伪真值监督:来自单目深度、相机估计、分割和追踪的误差可传播到训练和评估中;推理仍对观测点图估计误差敏感。
  • 训练数据有限:仅40K SSv2操作片段,未建立对头戴式egocentric视频、大相机运动、长时交互或非操作动力学的鲁棒性。
  • 下游连接:未来需将预测3D轨迹连接到下游规划和控制,测试从被动人类视频学习的物体中心运动先验是否改善具身决策。

6. 总结

MotionForesight 证明了大规模视频先验可以被高效地从"渲染未来外观"重定向到"预测显式、可操作的3D动力学",无需语言或动作监督。通过在 TrackCraft3R 追踪模型上施加最小修改——用可学习 mask latent 替换未来观测——并仅训练轻量 LoRA 适配器,模型将回顾性3D重构改造为前瞻性预测。参考锚定3D轨迹暴露了物理推理所需的度量变量,不将物体限制为单一刚体6-DoF位姿,允许同一表示描述平移、旋转、铰接运动和局部变形。量化、运动条件和定性结果表明该模型捕获了有意义的交互动力学,随人类视频增加而扩展,并迁移到家庭和办公室场景的手机拍摄。

视频模型已经"理解"物体如何运动——我们只需将它的输出从"画未来"重定向为"说未来",一个 mask latent 就能让回顾性追踪变为前瞻性预测。