PAPER DEEP DIVE
受控世界模型的可辨识性研究
研究从人类交互中推断环境动力学的世界模型的可辨识性问题。
受控世界模型的可辨识性
论文:On the Identifiability of Controlled World Models
作者:Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li
机构:清华大学 / 北京智源 / 香港大学
一句话总结
本文为高斯潜在状态受控世界模型提出联合可辨识性条件——由表示可辨识性(依赖谱分离裕度)和转移可辨识性(依赖条件动作激励的非退化变化)两部分耦合组成——证明当条件满足时最小化 LeJEPA 式预测目标可在正交变换意义下恢复潜在状态和受控动态,转移预测误差上界与谱分离裕度成反比,反事实预测误差放大与最弱条件动作激励裕度成反比,并在四种非线性观测设置中实验验证。
研究背景与动机
世界模型捕获环境如何演化,使代理能预判未来状态、模拟行为后果并支持决策和规划。在控制设置中,这些能力要求模型捕获未来状态如何随候选动作变化。受控世界模型定义为以当前潜在状态和动作候选为条件的潜在转移预测器——通过显式关联状态、动作和未来状态,提供比较候选动作、评估反事实结果和基于模型规划所需的结构。
受控世界模型在具身机器人、自动驾驶和物理数据生成等物理原生智能中日益重要。它们将图像、视频或传感测量编码为紧凑状态表示,在潜在空间学习环境动态,进而支持行为预测、策略学习、值估计和轨迹优化。JEPA 是从高维观测学习此类模型的突出框架,通过最小化两个时间相关观测间的预测误差训练参数。其动作条件扩展在视觉控制和潜在空间规划中起核心作用,但留下一个根本问题:它能从非线性观测中恢复受控动态吗?现有工作缺乏对 JEPA 式学习能否真正辨识底层受控动态的理论保证。
图1:受控世界模型可辨识性概览。编码器将非线性观测映射为标准高斯潜在表示,动作条件预测器建模下一表示。
方法详解
1. 问题形式化
真实潜在状态 $z_t \sim \mathcal{N}(0, I_d)$,线性高斯转移 $z_{t+1} = Az_t + Ba_t + \xi_t$,非线性观测 $x_t = g(z_t)$。学习器最小化 LeJEPA 式预测目标:
$$ \mathcal{L}_{\pi}(h,F)=\mathbb{E}_{P_{\pi}}\left[\|h(x_{t+1})-F(h(x_{t}),a_{t})\|_{2}^{2}\right] $$其中 $h$ 为编码器,$F$ 为动作条件预测器,$P_\pi$ 为行为策略诱导的分布。平方损失使预测器目标为表示空间的条件均值而非完整条件分布。约束 $h(x_t) \sim \mathcal{N}(0, I_d)$ 防止坍塌并固定表示尺度,同时保留潜在分布不可避免的旋转对称性。
2. 表示可辨识性
定义为存在正交矩阵 $Q \in O(d)$ 使 $h(g(z)) = Qz$——潜在状态在正交变换意义下可辨识。由行为策略下可预测信号的谱分离裕度控制:
$$ R_{\pi} = \operatorname{Cov}_{P_{\pi}}(Az_t + Ba_t), \quad \gamma_{\mathrm{rep}}(\pi) = \lambda_{\min}(R_{\pi}) - \lambda_{\max}(R_{\pi})^{2} $$平稳性给出 $\operatorname{Cov}(\xi_t) = I_d - R_\pi \succeq 0$。表示裕度 $\gamma_{\mathrm{rep}}$ 比较最弱的一阶可预测方向与最强的高阶非线性替代。
3. 转移可辨识性
定义为 $F(y, a) = QAQ^\top y + QBa$——受控条件均值在辨识坐标中可恢复。由条件动作激励控制:
$$ \Sigma_{\mathrm{tr}}(\pi) = \mathbb{E}_{z_t}\left[\operatorname{Cov}_{\pi}(a_t \mid z_t)\right], \quad \rho_{\mathrm{tr}}(\pi) = \lambda_{\min}(\Sigma_{\mathrm{tr}}(\pi)) $$转移裕度 $\rho_{\mathrm{tr}}$ 是最弱条件动作激励。当联合条件 $\gamma_{\mathrm{rep}} > 0$ 且 $\rho_{\mathrm{tr}} > 0$ 满足时,最小化预测目标可恢复潜在状态和受控动态。
4. 近似可辨识性与误差界
转移预测误差上界与谱分离裕度成反比:
$$ E_{\mathrm{tr}} \leq \frac{C}{\gamma_{\mathrm{rep}}(\pi)} \cdot \epsilon_{\mathrm{approx}} $$反事实预测误差的可达放大与最弱条件动作激励裕度成反比——弱条件激励使在策略预测准确与反事实误差巨大可以共存。反事实预测误差的放大界为: $$ E_{\text{cf}} \lesssim \frac{E_{\text{on}}}{\rho_{\mathrm{tr}}(\pi)} + O(\|\Delta a\|) $$ 其中 $E_{\text{on}}$ 为在策略误差,$\Delta a$ 为偏离行为分布的动作偏移。这表明即使 $E_{\text{on}} \to 0$,若 $\rho_{\mathrm{tr}}$ 小,反事实误差仍可被放大。实验在四种非线性观测映射(径向、正弦、螺旋、复合)上验证,使用 5 个随机种子报告均值和 95% 置信区间。
flowchart TD
A["潜在状态 z_t ~ N(0,I)"] --> B["线性转移 z_{t+1}=Az_t+Ba_t+xi_t"]
B --> C["非线性观测 x_t=g(z_t)"]
C --> D["编码器 h(x)~N(0,I)"]
D --> E["预测器 F(h(x_t),a_t)"]
E --> F{"联合可辨识性条件"}
F --> G["表示可辨识性
gamma_rep>0
谱分离裕度"]
F --> H["转移可辨识性
rho_tr>0
条件动作激励"]
G --> I["h(g(z))=Qz
正交变换恢复"]
H --> J["F(y,a)=QAQ^T y+QBa
受控动态恢复"]
I --> K["E_tr <= C/gamma_rep
误差与谱裕度反比"]
J --> L["反事实误差放大
~1/rho_tr"]
style G fill:#e1f5fe
style H fill:#fff3e0
style K fill:#e8f5e9
实验结果
表示可辨识性
图2:不同非线性观测映射的表示几何。左为潜在状态 $z$,其余列为观测 $x=g(z)$ 和学习表示 $y=h(x)$。
固定 $\rho_{\mathrm{tr}}=1$ 变化 $\gamma_{\mathrm{rep}}$。谱分离一致改善辨识——在可辨识区域,编码器反转每个非线性观测映射并以近似正交变换辨识潜在极结构。表示和受控转移误差均随最弱可预测方向增强而降低。
图3:表示裕度 $\gamma_{\mathrm{rep}}$ 增大时的辨识性能。左:归一化表示误差;右:归一化受控转移误差。
| 条件 | 控制量 | 阈值 | 误差关系 |
|---|---|---|---|
| 表示可辨识性 | $\gamma_{\mathrm{rep}}$(谱分离裕度) | $> 0$ | $E_{\mathrm{tr}} \propto 1/\gamma_{\mathrm{rep}}$ |
| 转移可辨识性 | $\rho_{\mathrm{tr}}$(条件动作激励) | $> 0$ | 反事实放大 $\propto 1/\rho_{\mathrm{tr}}$ |
| 联合条件 | 两者同时 | $\gamma_{\mathrm{rep}} > 0$ 且 $\rho_{\mathrm{tr}} > 0$ | 正交变换恢复状态和动态 |
转移可辨识性与反事实预测
图4:固定状态下跨动作的反事实转移误差。
固定表示区域变化条件动作激励 $\rho_{\mathrm{tr}} = \sigma^2$。在 $\sigma=0$ 时数据仅约束闭环映射 $A+BK$,反事实误差大且状态和动作分量不可单独辨识。增大条件激励改善反事实预测和两个转移分量——这些改善归因于转移激励而非表示质量。
图5:条件动作覆盖增加时的转移辨识。上:条件均值转移误差和反事实放大;下:状态和动作分量相对误差。
目标条件规划
图6:条件动作覆盖增加时的预测和真实终端集。虚线段表示选定序列的预测误差。
| 条件覆盖 $\sigma^2$ | 反事实误差 | 规划终端误差 | 状态/动作分量 |
|---|---|---|---|
| 0(无激励) | 大 | 高(可达集扭曲) | 不可单独辨识 |
| 低 | 中等 | 中等 | 部分可辨识 |
| 高(充分激励) | 小 | 近乎消除 | 分别可辨识 |
局限性
- 线性高斯假设:理论假设潜在状态为高斯且转移为线性($z_{t+1} = Az_t + Ba_t + \xi_t$),对非线性转移动态的可辨识性未给出保证。
- 充分条件非必要:$\gamma_{\mathrm{rep}} > 0$ 和 $\rho_{\mathrm{tr}} > 0$ 是充分条件,实验显示误差在 $\gamma_{\mathrm{rep}} = 0$ 附近平滑变化,表明理论可能保守。
- 实验规模有限:验证仅在四种受控非线性观测设置中进行,未在复杂真实视觉控制任务(如自动驾驶、机器人操作)中验证。
总结与展望
本文建立了从非线性观测学习受控世界模型的联合可辨识性理论。证明当谱分离和条件动作激励满足时,动作条件潜在预测可联合辨识潜在表示(正交变换意义下)和受控条件均值转移。仅状态预测捕获行为策略平均未来,不一般地辨识替代动作如何影响下一状态。弱条件激励使在策略预测准确与反事实误差巨大可共存,这对基于模型的规划有直接后果。
金句:「准确的行为策略预测与巨大的反事实误差可以共存——当条件动作激励不足时,模型在策略动作上预测准确但对替代控制的响应严重失真,这对需要比较候选动作序列的基于模型规划是致命的。」



