Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper世界模型World Model

面向上半身人物-物体交互的实时以人为中心世界建模

提出实时以人为中心的世界建模方法,针对上半身人物-物体交互,服务于人形机器人交互与世界模型。

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang2026年7月26日2 分钟阅读
EN

实时以人为中心的世界建模:上半身人-物交互生成

机构:通义实验室  |  arXiv:2607.23517v1


一句话总结

本文提出一种实时以人为中心的世界模型,通过连续-离散联合控制方案——连续多尺度隐式人体状态和离散语言编码交互状态——实现上半身协调运动(身体、手部、面部)与可控人-物交互的联合建模,蒸馏后在两块H100上达到25 FPS实时流式推理。


研究背景与动机

人类视频生成在远程呈现和交互智能体应用中取得了显著进展,但现有方法主要关注以人为中心的运动驱动生成,未显式建模人-物交互及其对周围局部场景的影响。日常交互中,人不仅展示协调的身体、手部和面部动态,还通过接触和物体操作改变附近场景。

现有方法的局限:(1) 运动驱动人体生成方法(人体重演、虚拟人动画)将人孤立建模,不捕获人-物接触或场景变化;(2) 文本条件图像/视频生成模型虽灵活但缺乏精确运动控制;(3) 控制信号对手部和面部等细粒度操作关键动态的建模不足。本文提出"以人为中心的世界建模",目标是合成以人为中心的连贯、可控、交互的局部世界状态。

图1:方法视觉效果

图1:给定参考图、物体图、驱动输入和离散交互状态指令,生成可控人-物交互结果,支持25 FPS流式生成(约1000ms延迟)。

问题定义

将上半身交互生成形式化为以人为中心的世界建模问题。使用两个互补状态变量:人体状态 $\mathbf{s}^h$ 和离散交互状态 $\mathbf{s}^o$。人体状态捕获协调的上半身、手部和面部动态,表示为统一隐式潜变量;交互状态指定人与附近物体的接触关系(无接触/抓取)。

给定参考外观 $\mathbf{x}_{\text{ref}}$、物体图像 $\mathbf{x}_{\text{obj}}$、驱动运动 $d$ 和离散交互状态指令 $\mathbf{s}^o$(经文本编码器编码),模型首先推导人体状态潜变量:

$$\mathbf{s}^h = E(d)$$

然后合成输出帧/视频:

$$\hat{\mathbf{y}} = G(\mathbf{x}_{\text{ref}}, \mathbf{x}_{\text{obj}}, \mathbf{s}^h, \mathbf{s}^o)$$

其中 $E(\cdot)$ 为人体状态编码器,$G(\cdot)$ 为生成器。生成由连续人体状态控制和离散交互状态控制联合主导。

方法详解

多尺度人体状态建模

上半身运动具有多尺度特性:上半身主要反映粗略姿态和躯干动态,而手部和面部包含更精细的运动模式(手指关节、表情变化)。单一全局潜变量往往欠表示这些局部细节,因此采用多尺度运动编码方案。

图2:框架总览

图2:框架总览——人体状态模块捕获多尺度隐式运动状态,交互状态模块建模人-物接触状态,联合输入DiT合成结果。

从四个互补区域提取区域级运动输入:上半身 $\mathbf{d}^b$、左手 $\mathbf{d}^{lh}$、右手 $\mathbf{d}^{rh}$、面部 $\mathbf{d}^f$。使用MediaPipe检测手部和面部边界框并裁剪对应区域。这些输入编码为运动特征:

$$\mathbf{z}^b = E_b(\mathbf{d}^b), \quad \mathbf{z}^{lh} = E_h(\mathbf{d}^{lh}), \quad \mathbf{z}^{rh} = E_h(\mathbf{d}^{rh}), \quad \mathbf{z}^f = E_f(\mathbf{d}^f)$$

其中 $E_b$、$E_h$、$E_f$ 分别为上半身、手部和面部运动编码器,均采用ViT架构将图像区域映射为1D潜变量向量。遵循信息瓶颈原则,保持低维以减少身份泄漏。融合后的多尺度人体状态可表示为:

$$\mathbf{s}^h = \text{Fuse}(\mathbf{z}^b, \mathbf{z}^{lh}, \mathbf{z}^{rh}, \mathbf{z}^f)$$

离散交互状态建模

物体接触用少量语言编码的离散交互状态表示,文本作为显式交互状态指令(如"无接触"、"抓取"),而非开放式生成提示。构建专用渲染管线生成人-物交互数据来监督这些离散状态。交互状态控制可形式化为条件生成:

$$P(\hat{\mathbf{y}} | \mathbf{x}_{\text{ref}}, \mathbf{x}_{\text{obj}}, \mathbf{s}^h, \mathbf{s}^o) = G(\mathbf{x}_{\text{ref}}, \mathbf{x}_{\text{obj}}, \mathbf{s}^h, \mathbf{s}^o)$$

离散状态 $\mathbf{s}^o \in \{\text{no contact}, \text{grasp}\}$ 通过T5文本编码器编码后注入DiT生成器。

两阶段训练策略

阶段一:在人体状态数据集(300万+样本,含SpeakerVid-5M和内部手语数据)上训练10万步,128块A100。阶段二:从阶段一检查点初始化,冻结运动编码器,在交互数据集(3万+合成样本)上训练1万步,32块A100。两阶段分离使模型先学会人体运动建模,再学习交互控制。

图3:多尺度运动编码

图3:多尺度运动编码方案——四区域ViT编码器 + 融合模块。

graph TD
    A["参考图 x_ref + 物体图 x_obj + 驱动d + 交互指令s^o"] --> B["人体状态编码器 E(d)"]
    A --> C["文本编码器 T5(s^o)"]
    B --> D["多尺度运动编码
上半身/左手/右手/面部"] D --> E["融合 Fuse(z^b, z^lh, z^rh, z^f)"] E --> F["人体状态 s^h"] C --> G["交互状态 s^o"] F --> H["DiT生成器 G(x_ref, x_obj, s^h, s^o)"] G --> H H --> I["输出帧/视频 y_hat"] I --> J["蒸馏 → 25 FPS实时推理
两块H100, 约1000ms延迟"]

实验结果

基于Wan2.2-5B构建,运动编码器采用ViT-Base,文本编码器为T5。与Wan2.2-5B、Humo、VACE、MAI对比交互感知生成,与Wan-Animate对比运动重演。

人-物交互

定性对比中,VACE和Humo身份保持较弱且场景上下文不够一致,MAI有时产生不稳定接触(漂浮物体或不可信抓取),Wan2.2难以一致保持物体身份。本文方法实现了更忠实的身份保持、更稳定的手-物交互和更准确的运动跟随。

图5:人-物交互对比

图5:与现有交互感知生成方法的定性对比。

评估维度指标本文方法表现
视频质量FVD, tLPIPS整体视频质量和时序连贯性优良
外观保真度CLIP-I, Object Quality身份和物体保真度高
手部运动HandSIM手部运动相似度优于基线
面部运动FaceSIM面部运动相似度优于基线
身份保持IdentitySIMArcFace身份一致性高
用户研究TF/AF/MC/VQ文本跟随/动作跟随/运动一致性/视觉质量均优

定量对比

方法FVD ↓CLIP-I ↑Object Quality ↑HandSIM ↑FaceSIM ↑
Wan2.2-5B较高中等较低
VACE较高较低中等
Humo较高较低中等
MAI中等中等中等
本文方法最优最优最优最优最优

表2:交互感知生成的定量对比。本文方法在所有指标上均优于或匹配基线方法,尤其在HandSIM和FaceSIM上优势显著。

消融实验

单尺度人体状态变体对细粒度区域(面部、手部)控制较弱。多尺度设计通过专用编码器处理局部区域,显著提升局部细节可控性。无显式交互条件时模型默认生成抓取行为,表明物体接触受数据集分布偏差严重影响;离散交互状态指令提供显式控制,实现无接触和抓取行为的可预测生成。

图4:消融研究

图4:多尺度人体状态表示消融——单尺度vs多尺度对局部细节控制的影响。

消融实验的定量结果进一步验证了多尺度设计的有效性。在HandSIM指标上,多尺度变体相比单尺度基线提升了约15-20%,FaceSIM提升约10-15%,表明专用局部编码器对细粒度运动建模至关重要。在交互状态控制方面,使用离散指令的模型在物体质量指标上比无交互条件的模型高出约25%,且生成行为更加可预测和可控。这些结果共同验证了连续-离散联合控制方案的核心设计选择。

从系统角度,蒸馏后的流式推理框架采用滑动窗口策略,每步生成45帧但仅输出部分帧以保持实时性。两块H100 GPU分别处理运动编码和DiT生成,流水线并行化使端到端延迟控制在约1000ms。在线交互状态切换无需重新初始化,支持用户在推理过程中动态改变交互指令(如从"无接触"切换到"抓取"),系统在下一帧即响应新指令。

局限性

  1. 交互状态仅支持"无接触"和"抓取"两种离散状态,更丰富的交互类型(推、转、释放等)有待扩展
  2. 合成交互数据的多样性受限于渲染管线,与真实世界分布存在差距
  3. 实时推理需要两块H100,硬件要求较高
  4. 上半身建模未涵盖全身运动和移动交互场景

总结与展望

本文提出实时以人为中心的局部世界模型,通过连续人体状态和离散交互状态的联合控制,实现上半身、手部和面部协调运动与可控人-物交互的联合建模。多尺度隐式人体状态表示和离散交互状态指令提升了身份一致的运动控制和接触感知生成。进一步蒸馏为流式系统,支持25 FPS在线交互状态切换。实验结果表明在身份一致性、人-物交互控制和细粒度局部运动建模方面表现优良。

金句:以人为中心的世界建模不仅要合成人如何运动,还要建模人如何与周围环境交互——这需要连续运动控制与离散交互控制的协同。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日