Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型World Model可辨识性

受控世界模型的可辨识性研究

研究从人类交互中推断环境动力学的世界模型的可辨识性问题。

Xiangteng Zhang, Yang Guan, Bo Zhang, Ya-Qin Zhang, Shengbo Eben Li2026年7月24日2 分钟阅读
EN

受控世界模型的可辨识性

论文:On the Identifiability of Controlled World Models

作者:Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li

机构:清华大学 / 北京智源 / 香港大学

链接arXiv:2607.22430


一句话总结

本文为高斯潜在状态受控世界模型提出联合可辨识性条件——由表示可辨识性(依赖谱分离裕度)和转移可辨识性(依赖条件动作激励的非退化变化)两部分耦合组成——证明当条件满足时最小化 LeJEPA 式预测目标可在正交变换意义下恢复潜在状态和受控动态,转移预测误差上界与谱分离裕度成反比,反事实预测误差放大与最弱条件动作激励裕度成反比,并在四种非线性观测设置中实验验证。


研究背景与动机

世界模型捕获环境如何演化,使代理能预判未来状态、模拟行为后果并支持决策和规划。在控制设置中,这些能力要求模型捕获未来状态如何随候选动作变化。受控世界模型定义为以当前潜在状态和动作候选为条件的潜在转移预测器——通过显式关联状态、动作和未来状态,提供比较候选动作、评估反事实结果和基于模型规划所需的结构。

受控世界模型在具身机器人、自动驾驶和物理数据生成等物理原生智能中日益重要。它们将图像、视频或传感测量编码为紧凑状态表示,在潜在空间学习环境动态,进而支持行为预测、策略学习、值估计和轨迹优化。JEPA 是从高维观测学习此类模型的突出框架,通过最小化两个时间相关观测间的预测误差训练参数。其动作条件扩展在视觉控制和潜在空间规划中起核心作用,但留下一个根本问题:它能从非线性观测中恢复受控动态吗?现有工作缺乏对 JEPA 式学习能否真正辨识底层受控动态的理论保证。

可辨识性概览图1:受控世界模型可辨识性概览。编码器将非线性观测映射为标准高斯潜在表示,动作条件预测器建模下一表示。


方法详解

1. 问题形式化

真实潜在状态 $z_t \sim \mathcal{N}(0, I_d)$,线性高斯转移 $z_{t+1} = Az_t + Ba_t + \xi_t$,非线性观测 $x_t = g(z_t)$。学习器最小化 LeJEPA 式预测目标:

$$ \mathcal{L}_{\pi}(h,F)=\mathbb{E}_{P_{\pi}}\left[\|h(x_{t+1})-F(h(x_{t}),a_{t})\|_{2}^{2}\right] $$

其中 $h$ 为编码器,$F$ 为动作条件预测器,$P_\pi$ 为行为策略诱导的分布。平方损失使预测器目标为表示空间的条件均值而非完整条件分布。约束 $h(x_t) \sim \mathcal{N}(0, I_d)$ 防止坍塌并固定表示尺度,同时保留潜在分布不可避免的旋转对称性。

2. 表示可辨识性

定义为存在正交矩阵 $Q \in O(d)$ 使 $h(g(z)) = Qz$——潜在状态在正交变换意义下可辨识。由行为策略下可预测信号的谱分离裕度控制:

$$ R_{\pi} = \operatorname{Cov}_{P_{\pi}}(Az_t + Ba_t), \quad \gamma_{\mathrm{rep}}(\pi) = \lambda_{\min}(R_{\pi}) - \lambda_{\max}(R_{\pi})^{2} $$

平稳性给出 $\operatorname{Cov}(\xi_t) = I_d - R_\pi \succeq 0$。表示裕度 $\gamma_{\mathrm{rep}}$ 比较最弱的一阶可预测方向与最强的高阶非线性替代。

3. 转移可辨识性

定义为 $F(y, a) = QAQ^\top y + QBa$——受控条件均值在辨识坐标中可恢复。由条件动作激励控制:

$$ \Sigma_{\mathrm{tr}}(\pi) = \mathbb{E}_{z_t}\left[\operatorname{Cov}_{\pi}(a_t \mid z_t)\right], \quad \rho_{\mathrm{tr}}(\pi) = \lambda_{\min}(\Sigma_{\mathrm{tr}}(\pi)) $$

转移裕度 $\rho_{\mathrm{tr}}$ 是最弱条件动作激励。当联合条件 $\gamma_{\mathrm{rep}} > 0$ 且 $\rho_{\mathrm{tr}} > 0$ 满足时,最小化预测目标可恢复潜在状态和受控动态。

4. 近似可辨识性与误差界

转移预测误差上界与谱分离裕度成反比:

$$ E_{\mathrm{tr}} \leq \frac{C}{\gamma_{\mathrm{rep}}(\pi)} \cdot \epsilon_{\mathrm{approx}} $$

反事实预测误差的可达放大与最弱条件动作激励裕度成反比——弱条件激励使在策略预测准确与反事实误差巨大可以共存。反事实预测误差的放大界为: $$ E_{\text{cf}} \lesssim \frac{E_{\text{on}}}{\rho_{\mathrm{tr}}(\pi)} + O(\|\Delta a\|) $$ 其中 $E_{\text{on}}$ 为在策略误差,$\Delta a$ 为偏离行为分布的动作偏移。这表明即使 $E_{\text{on}} \to 0$,若 $\rho_{\mathrm{tr}}$ 小,反事实误差仍可被放大。实验在四种非线性观测映射(径向、正弦、螺旋、复合)上验证,使用 5 个随机种子报告均值和 95% 置信区间。

flowchart TD
    A["潜在状态 z_t ~ N(0,I)"] --> B["线性转移 z_{t+1}=Az_t+Ba_t+xi_t"]
    B --> C["非线性观测 x_t=g(z_t)"]
    C --> D["编码器 h(x)~N(0,I)"]
    D --> E["预测器 F(h(x_t),a_t)"]
    E --> F{"联合可辨识性条件"}
    F --> G["表示可辨识性
gamma_rep>0
谱分离裕度"] F --> H["转移可辨识性
rho_tr>0
条件动作激励"] G --> I["h(g(z))=Qz
正交变换恢复"] H --> J["F(y,a)=QAQ^T y+QBa
受控动态恢复"] I --> K["E_tr <= C/gamma_rep
误差与谱裕度反比"] J --> L["反事实误差放大
~1/rho_tr"] style G fill:#e1f5fe style H fill:#fff3e0 style K fill:#e8f5e9

实验结果

表示可辨识性

表示几何图2:不同非线性观测映射的表示几何。左为潜在状态 $z$,其余列为观测 $x=g(z)$ 和学习表示 $y=h(x)$。

固定 $\rho_{\mathrm{tr}}=1$ 变化 $\gamma_{\mathrm{rep}}$。谱分离一致改善辨识——在可辨识区域,编码器反转每个非线性观测映射并以近似正交变换辨识潜在极结构。表示和受控转移误差均随最弱可预测方向增强而降低。

辨识性能图3:表示裕度 $\gamma_{\mathrm{rep}}$ 增大时的辨识性能。左:归一化表示误差;右:归一化受控转移误差。

表1:可辨识性条件与误差界总结
条件控制量阈值误差关系
表示可辨识性$\gamma_{\mathrm{rep}}$(谱分离裕度)$> 0$$E_{\mathrm{tr}} \propto 1/\gamma_{\mathrm{rep}}$
转移可辨识性$\rho_{\mathrm{tr}}$(条件动作激励)$> 0$反事实放大 $\propto 1/\rho_{\mathrm{tr}}$
联合条件两者同时$\gamma_{\mathrm{rep}} > 0$ 且 $\rho_{\mathrm{tr}} > 0$正交变换恢复状态和动态

转移可辨识性与反事实预测

反事实转移误差图4:固定状态下跨动作的反事实转移误差。

固定表示区域变化条件动作激励 $\rho_{\mathrm{tr}} = \sigma^2$。在 $\sigma=0$ 时数据仅约束闭环映射 $A+BK$,反事实误差大且状态和动作分量不可单独辨识。增大条件激励改善反事实预测和两个转移分量——这些改善归因于转移激励而非表示质量。

转移辨识图5:条件动作覆盖增加时的转移辨识。上:条件均值转移误差和反事实放大;下:状态和动作分量相对误差。

目标条件规划

终端集图6:条件动作覆盖增加时的预测和真实终端集。虚线段表示选定序列的预测误差。

表2:规划性能随条件动作覆盖的变化
条件覆盖 $\sigma^2$反事实误差规划终端误差状态/动作分量
0(无激励)高(可达集扭曲)不可单独辨识
中等中等部分可辨识
高(充分激励)近乎消除分别可辨识

局限性

  1. 线性高斯假设:理论假设潜在状态为高斯且转移为线性($z_{t+1} = Az_t + Ba_t + \xi_t$),对非线性转移动态的可辨识性未给出保证。
  2. 充分条件非必要:$\gamma_{\mathrm{rep}} > 0$ 和 $\rho_{\mathrm{tr}} > 0$ 是充分条件,实验显示误差在 $\gamma_{\mathrm{rep}} = 0$ 附近平滑变化,表明理论可能保守。
  3. 实验规模有限:验证仅在四种受控非线性观测设置中进行,未在复杂真实视觉控制任务(如自动驾驶、机器人操作)中验证。

总结与展望

本文建立了从非线性观测学习受控世界模型的联合可辨识性理论。证明当谱分离和条件动作激励满足时,动作条件潜在预测可联合辨识潜在表示(正交变换意义下)和受控条件均值转移。仅状态预测捕获行为策略平均未来,不一般地辨识替代动作如何影响下一状态。弱条件激励使在策略预测准确与反事实误差巨大可共存,这对基于模型的规划有直接后果。

金句:「准确的行为策略预测与巨大的反事实误差可以共存——当条件动作激励不足时,模型在策略动作上预测准确但对替代控制的响应严重失真,这对需要比较候选动作序列的基于模型规划是致命的。」

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日