Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

JEPA自监督学习表征学习

SiamJEPA:Siamese 学生编码器在 JEPA 中的作用

研究 Siamese 学生编码器在 JEPA 自监督表征学习中的作用。SiamJEPA 采用掩码 Siamese 学生编码器与 EMA 教师网络,作为有效的正则化手段提升表征可分性并加速早期训练,在有限训练预算下优于单编码器 JEPA 变体。

Makoto Yamada2026年7月4日6 分钟阅读
EN

论文元信息

标题:SiamJEPA: On the Role of Siamese Student Encoders in JEPA

作者:Makoto Yamada(冲绳科学技术大学院大学 OIST)

论文链接arXiv:2607.04044

代码github.com/oist/SiamJEPA(公开)

发表时间:2026年7月(v2: 2026年7月30日)

一句话总结

SiamJEPA 在 JEPA 框架中引入 Siamese 学生编码器,通过 KL 正则化约束两个掩码视图的表征一致性,在不依赖像素重建的情况下以更少的训练轮次学到高质量视觉表征。

研究背景与动机

自监督学习(SSL)已成为计算机视觉和机器人领域学习可迁移表征的核心范式。与有监督学习不同,SSL 从大规模无标注数据中提取语义信息,为下游任务提供通用的特征基础。在机器人领域,高质量的视觉表征对于感知、操作和导航都至关重要——从机械臂抓取中的物体识别到移动机器人的场景理解,都依赖于从视觉输入中提取的表征质量。

联合嵌入架构是 SSL 的重要分支,其核心思想是将同一输入的不同视图映射到共享的潜在空间中。SimCLR 利用对比学习拉近正样本对、推远负样本对;BYOL 和 SimSiam 则证明负样本并非必需,通过 stop-gradient 和 EMA 教师网络即可避免表征坍缩。DINO 系列进一步将这一思路推广到视觉 Transformer,在大规模工程化训练中取得了卓越效果。

Joint Embedding Predictive Architecture(JEPA)是联合嵌入方法的最新演进。不同于直接对齐潜在表征,JEPA 学习从可见上下文预测被掩码区域的潜在表征,从而在潜在空间而非像素空间完成预测。I-JEPA 和 V-JEPA 是这一方向的代表工作。JEPA 的优势在于跳过像素级重建,直接捕获语义信息,理论上能更高效地学到有用的表征。V-JEPA 2 甚至将其扩展到世界模型学习,展现了 JEPA 在视频理解和预测规划中的潜力。

然而,现有 JEPA 模型(I-JEPA、V-JEPA)均采用单一学生编码器。与此同时,脑启发学习模型 PhiNet 提出了 Siamese 学生编码器的架构,灵感来自海马体和新皮层的生物回路——Siamese 编码器对应时间预测假说,EMA 机制对应互补学习系统(CLS)理论中的快慢学习。但 Siamese 编码器在 JEPA 框架中究竟扮演什么角色,此前缺乏系统研究。这正是本文要回答的核心问题:Siamese 学生编码器在 JEPA 中起什么作用?

此外,掩码 Siamese 方法(如 SiamMAE、CropMAE、RSP)虽然也使用 Siamese 编码器,但它们仍基于像素或特征级重建目标,而非潜在空间预测。它们在密集预测任务(分割、姿态估计)上表现出色,但对通用视觉表征学习的效果尚不清楚。SiamJEPA 填补了这一空白,将 Siamese 编码器与潜在预测目标相结合,形成统一的框架。

预备知识

JEPA 基本框架:给定输入图像的 patch 序列 $\bm{X} \in \mathbb{R}^{m \times d_{\text{in}}}$($m$ 为 patch 数),JEPA 通过掩码操作将可见区域送入学生编码器,将完整图像送入 EMA 教师编码器,然后训练预测器从学生表征预测教师编码器输出的被掩码区域的潜在表征。预测发生在潜在空间,不涉及像素重建。

EMA 教师网络:教师编码器 $f_{\text{ema}}$ 的参数不通过梯度更新,而是以指数移动平均方式追踪学生编码器参数:$\theta_{\text{ema}} \leftarrow \alpha \cdot \theta_{\text{ema}} + (1-\alpha) \cdot \theta$。这一机制源自 BYOL 和 DINO,用于提供稳定的目标表征,避免训练崩溃。

Siamese 编码器:指两个共享权重的编码器网络处理同一输入的不同视图。在 SiamJEPA 中,两个 Siamese 学生编码器分别接收不同的掩码 $M_1$ 和 $M_2$,产生两个互补的表征,通过一致性约束促进更鲁棒的表征学习。

概率预测器:SiamJEPA 的预测器采用了源自随机视频生成和 DreamerV2 的概率框架——通过后验分布 $q(\bm{Z}|\text{both views})$ 和先验分布 $p(\hat{\bm{Z}}|\text{single view})$ 的 KL 散度来建模潜在表征的不确定性,鼓励编码器捕获跨视图共享的信息。

方法详解

整体架构

SiamJEPA 的核心改动是在标准 JEPA 的学生侧增加了一个编码器。标准 JEPA 使用一个学生编码器处理可见区域、一个预测器预测掩码区域的教师表征;SiamJEPA 则使用两个共享权重的 Siamese 学生编码器,分别对同一图像施加不同的掩码 $M_1$ 和 $M_2$,再通过各自的预测器预测教师网络中被掩码区域的表征。

JEPA 架构

图1a:标准 JEPA 架构。学生编码器处理可见上下文,预测器预测教师网络中被掩码区域的潜在表征。

SiamJEPA 架构

图1b:SiamJEPA 架构(即 PhiNet 架构)。两个 Siamese 学生编码器处理不同掩码视图,Sim-1 损失对齐二者输出。

JEPA 与 SiamJEPA 架构对比

图1:JEPA 与 SiamJEPA 架构对比。Sim-1 是对齐 Siamese 编码器的损失函数,虚线表示 stop-gradient。

Siamese 学生编码器

设 $\bm{X} \in \mathbb{R}^{m \times d_{\text{in}}}$ 为 patch 化的输入图像,$m$ 为 patch 数。两个 Siamese 学生编码器和教师编码器的输出为:

$$\bm{H}^{(1)} = f(\text{Mask}(\bm{X}, M_1)), \quad \bm{H}^{(2)} = f(\text{Mask}(\bm{X}, M_2)), \quad \bm{Y} = f_{\text{ema}}(\bm{X})$$

其中 $\bm{H}^{(1)} \in \mathbb{R}^{N \times (m_1+1) \times d}$、$\bm{H}^{(2)} \in \mathbb{R}^{N \times (m_2+1) \times d}$、$\bm{Y} \in \mathbb{R}^{N \times (m+1) \times d}$ 分别是两个学生分支和教师分支的输出。$N$ 是 batch size,$m_1 = |M_1|$、$m_2 = |M_2|$ 是各自未被掩码的 token 数,$d$ 是嵌入维度。$f(\cdot)$ 是共享权重的 Siamese 学生编码器,$f_{\text{ema}}(\cdot)$ 是 EMA 教师编码器。$\text{Mask}(\bm{X}, M)$ 是掩码操作符。

关键设计是两个掩码集合不相交:$M_1 \cap M_2 = \emptyset$。这一非重叠掩码策略对于防止 SiamJEPA 中的捷径学习至关重要——如果两个编码器看到相同的 token,它们可能通过简单复制而非学习语义来产生一致的输出。

编码器输出进一步分解为 CLS token 和 patch token:

$$\bm{H}^{(1)} = [\bm{H}_{\text{cls}}^{(1)}; \bm{H}_{\text{patch}}^{(1)}], \quad \bm{H}^{(2)} = [\bm{H}_{\text{cls}}^{(2)}; \bm{H}_{\text{patch}}^{(2)}], \quad \bm{Y} = [\bm{Y}_{\text{cls}}; \bm{Y}_{\text{patch}}]$$

其中 $\bm{H}_{\text{cls}} \in \mathbb{R}^{N \times 1 \times d}$ 是 CLS token 表征,$\bm{H}_{\text{patch}} \in \mathbb{R}^{N \times m \times d}$ 是 patch token 表征。

预测器网络

SiamJEPA 使用两个预测器:线性预测器 $h(\cdot)$ 和 Transformer 预测器 $g(\cdot)$。

线性预测器 $h$ 用于对齐两个 Siamese 学生编码器的全局表征:

$$h(\bm{H}) = \bm{H}\bm{W}$$

其中 $\bm{W} \in \mathbb{R}^{d \times d}$ 是线性变换矩阵,帮助对齐两个 Siamese 学生编码器的表征空间。

Transformer 预测器 $g$ 则负责预测被掩码区域的潜在表征。SiamJEPA 采用了概率预测框架,定义后验和先验分布:

$$\text{后验:} \quad \bm{Z}^{(1)} \sim q(\bm{Z}^{(1)} | h(\bm{H}_{\text{cls}}^{(1)}), \bm{H}_{\text{cls}}^{(2)})$$

$$\text{先验:} \quad \hat{\bm{Z}}^{(1)} \sim p(\hat{\bm{Z}}^{(1)} | h(\bm{H}_{\text{cls}}^{(1)}))$$

后验融合了两个 Siamese 分支的信息,先验仅基于第一个分支的表征。对称地,交换两个分支得到 $\bm{Z}^{(2)}$ 和 $\hat{\bm{Z}}^{(2)}$。潜在变量 $\bm{Z}$ 建模了给定上下文后潜在表征的不确定性。$q(\cdot)$ 和 $p(\cdot)$ 均由两层神经网络参数化,并在构建分布前先经过带 batch normalization 的 projector head。

Transformer 预测器的输出为:

$$\hat{\bm{Y}}^{(1)} = g(h(\bm{H}^{(1)}), \bm{Z}^{(1)}) \in \mathbb{R}^{N \times (m+1) \times d}$$

$$\hat{\bm{Y}}^{(2)} = g(h(\bm{H}^{(2)}), \bm{Z}^{(2)}) \in \mathbb{R}^{N \times (m+1) \times d}$$

损失函数

SiamJEPA 的总损失由两部分组成:Siamese 编码器间的 KL 散度(Sim-1)和对教师表征的 MSE 预测损失(Sim-2)。

Sim-1:KL 散度正则化。通过约束后验和先验之间的 KL 散度,鼓励两个 Siamese 编码器产生一致的潜在表征:

$$\text{KL}_{\text{sg}}^{(1)} = \text{KL}(q(\bm{Z} | [h(\bm{H}_{\text{cls}}^{(1)}), \bm{H}_{\text{cls}}^{(2)}]) \| \text{sg}(p(\bm{Z} | h(\bm{H}_{\text{cls}}^{(1)}))))$$

$$\text{KL}_{\text{sg}}^{(2)} = \text{KL}(q(\bm{Z} | [h(\bm{H}_{\text{cls}}^{(2)}), \bm{H}_{\text{cls}}^{(1)}]) \| \text{sg}(p(\bm{Z} | h(\bm{H}_{\text{cls}}^{(2)}))))$$

其中 $\text{sg}(\cdot)$ 是 stop-gradient 操作符。这一设计要求先验(仅从单一视图推断)匹配后验(从两个视图推断),从而鼓励编码器捕获跨视图共享的信息,丢弃视图特定的变化。

Sim-2:MSE 预测损失。衡量预测的掩码区域表征与教师网络真实表征之间的差异:

$$\text{MSE}^{(1)} = \frac{1}{|\bar{M}|} \|\text{Mask}(\bm{Y}_{\text{patch}}^{(1)} - \hat{\bm{Y}}_{\text{patch}}^{(1)}, \bar{M})\|_{\text{Frob}}^2$$

$$\text{MSE}^{(2)} = \frac{1}{|\bar{M}|} \|\text{Mask}(\bm{Y}_{\text{patch}}^{(2)} - \hat{\bm{Y}}_{\text{patch}}^{(2)}, \bar{M})\|_{\text{Frob}}^2$$

其中 $\|\cdot\|_{\text{Frob}}$ 是 Frobenius 范数,$\bar{M} = M \setminus (M_1 \cup M_2)$ 是两个掩码集合并集的补集,$M = \{1, 2, \ldots, m\}$ 是所有 patch 的索引集合。预测目标是教师网络中既不被 $M_1$ 也不被 $M_2$ 覆盖的区域。

总损失

$$\mathcal{L} = \frac{1}{2}(\text{MSE}^{(1)} + \text{MSE}^{(2)}) + \frac{\lambda_{\text{KL}}}{2}(\text{KL}_{\text{sg}}^{(1)} + \text{KL}_{\text{sg}}^{(2)})$$

参数 $\lambda_{\text{KL}}$ 控制 Siamese 编码器一致性的强度。当 $\lambda_{\text{KL}} = 0$ 时,SiamJEPA 退化为类似单编码器 JEPA 的模型。这一统一公式使得研究者可以系统地研究 Siamese 编码器的贡献。

graph LR
    A["输入图像 X"] --> B["掩码 M1"]
    A --> C["掩码 M2"]
    A --> D["EMA 教师 f_ema"]
    B --> E["学生编码器 f
分支1"] C --> F["学生编码器 f
分支2"] D --> G["教师表征 Y"] E --> H["线性预测器 h"] F --> H H --> I["概率预测器
后验 q / 先验 p"] I --> J["KL 散度
Sim-1 正则化"] I --> K["Transformer 预测器 g"] K --> L["MSE 损失
Sim-2 预测"] G --> L J --> M["总损失 L"] L --> M

图2:SiamJEPA 数据流。输入图像经过三个路径——两个 Siamese 学生编码器(不同掩码)和一个 EMA 教师——通过 KL 正则化和 MSE 预测损失联合训练。

与标准 JEPA 的关键区别

SiamJEPA 与标准 I-JEPA 的核心区别在于学生侧的双编码器设计。I-JEPA 使用一个学生编码器处理可见上下文,一个预测器预测目标区域;SiamJEPA 则使用两个 Siamese 学生编码器分别处理不同的掩码视图,并通过 KL 正则化约束二者的一致性。这使得 SiamJEPA 不仅学习预测掩码表征,还学习从不同掩码视角产生一致的潜在表征——这构成了额外的归纳偏置。

另一个重要区别是预测器架构。I-JEPA 使用较深的 Transformer 预测器;而 SiamJEPA 发现仅需 1-2 层的浅层预测器即可取得良好效果,这在参数效率上具有显著优势。论文还发现,浅层预测器配合 Siamese 编码器,可能是 Siamese 架构本身提供了一部分预测器的能力。

训练配置

SiamJEPA 使用 ViT-Base 作为骨干网络,在 ImageNet-1K 上预训练。有效 batch size 为 8192,预测器深度为 1,基础学习率 $1.5 \times 10^{-4}$。EMA 动量采用分段调度:第 1-200 轮为 0.99,第 201-300 轮为 0.999,第 301-400 轮为 0.9999。掩码率在 $\{0.7, 0.75, 0.8\}$ 中选择。实现基于 MAE 官方代码库而非 I-JEPA 代码库,以提供重建方法和 JEPA 方法的统一比较框架。

预训练和线性探测配置

图3:预训练与线性探测配置对比。SiamJEPA 使用更浅的预测器(深度1 vs MAE的8)和更大的有效 batch size。

实验结果

与其它 SSL 方法的比较

在 ImageNet 线性探测基准上,SiamJEPA 在 400 轮训练后达到 70.7% 的 Top-1 准确率,超越了 MAE 在 400 轮时的 61.9%(甚至接近 MAE 在 1600 轮的 68.0%),并与 CAE 在 1600 轮的 70.4% 相当。这意味着 SiamJEPA 用不到 MAE 四分之一的训练轮次达到了更高的准确率,展现了显著的训练效率优势。

方法训练轮次Top-1 准确率 (%)
MAE40061.9
MAE160068.0
CAE160070.4
I-JEPA60072.9
JEPA-like ($\lambda_{\text{KL}}=10^{-5}$)40068.9
SiamJEPA ($\lambda_{\text{KL}}=0.01$)40070.7

表1:ImageNet 线性探测性能对比。SiamJEPA 在 400 轮即超越 MAE 1600 轮的表现。

与 I-JEPA 相比,SiamJEPA 的最终准确率较低(70.7% vs 72.9%),但论文指出这一比较不直接:I-JEPA 训练了 600 轮且使用不同的训练设置。SiamJEPA 的目标不是刷新 SOTA,而是验证 Siamese 编码器在 JEPA 中的作用。

Siamese 编码器的正则化效果

消融实验清楚地展示了 KL 正则化权重 $\lambda_{\text{KL}}$ 的影响。从 $\lambda_{\text{KL}} = 0.00001$ 增加到 $0.01$ 或 $0.03$ 时,线性探测准确率在各个训练阶段都有提升。在 101 轮时,$\lambda_{\text{KL}}=0.01$ 达到 63.72%,而 $\lambda_{\text{KL}}=0.00001$ 仅 60.88%——这意味着 Siamese 编码器的一致性约束在训练早期就产生了显著收益。$\lambda_{\text{KL}}=0.01$ 的模型在 200 轮即达到了 $\lambda_{\text{KL}}=0.00001$ 在 400 轮才达到的水平,验证了 Siamese 编码器加速收敛的作用。

$\lambda_{\text{KL}}$Weight Decay51轮101轮201轮301轮400轮
0.000010.0549.7560.8866.1268.2168.91
0.0100.0551.6463.7268.0069.3069.33
0.0300.0551.3763.5868.4269.0569.24
0.000010.148.8558.9957.6862.5562.54
0.0100.148.8363.4467.8469.5770.15
0.0300.147.4762.6367.9769.8270.17

表2:KL 正则化权重与 weight decay 的消融。$\lambda_{\text{KL}}=0.01$ 配合 weight decay=0.1 取得最佳最终性能(70.15%)。

掩码策略的影响

论文比较了随机掩码和块掩码两种策略。块掩码在所有配置下均优于随机掩码,尤其在训练早期差距明显——在 51 轮时,块掩码(掩码率0.75)达到 51.64%,而随机掩码仅 32.27%。但随着训练进行,随机掩码在合适的掩码率下也能达到不错的性能(65.10%)。这一发现表明,JEPA 式表征学习也许并不需要精心设计的掩码策略,这对实际部署具有积极意义。

有趣的是,掩码率为 0.8 时随机掩码的表现(67.10%)反而超过了块掩码(66.79%),暗示在高掩码率下两种策略的差异缩小。有效掩码率(两个方向合并后不贡献梯度的区域)在掩码率 0.75 时约为 0.5,这意味着模型需要从一半的 patch 信息中预测另一半的表征。

表征类型的影响

论文对比了 CLS token、第 10 层 mean pooling 和第 12 层(最终层)mean pooling 三种表征用于线性探测。第 10 层 mean pooling 在训练早期表现最好,而第 12 层 mean pooling 在充分训练后逐渐追平甚至超越。这表明中间层更早学到线性可分的语义表征,而最终层在训练初期更专注于预训练目标,之后才逐渐学习到更通用的表征。Mean pooling 整体优于 CLS token,说明有用的语义信息分布在 patch 表征中,而非集中在 CLS token。

EMA 调度的影响

较大的 EMA 动量(0.9999)导致模式坍缩,而较小的动量(0.999)则持续提升性能。在 $\lambda_{\text{KL}}=0.01$ 和 weight decay=0.1 的设置下,EMA 动量 0.999 达到 70.15%,而 0.9999 发生坍缩。论文指出 EMA 调度策略是通过实验确定的,仍有改进空间。这一发现与 BYOL 和 DINO 中的经验一致——过大的 EMA 动量可能导致教师网络更新过慢,与学生网络产生偏差,不利于 Siamese 架构的一致性约束。

局限性

未达到 SOTA 性能(作者自述)。SiamJEPA 的目标不是追求最高基准分数,而是验证 Siamese 编码器的作用。与 I-JEPA(72.9%)相比,SiamJEPA(70.7%)的绝对准确率更低,且训练设置不同,不构成直接比较。作者承认通过更广泛的超参数搜索和更长训练,性能有望进一步提升,但这超出了本文范围。

预测器深度的研究不充分(作者自述 + 本文判断)。受限于计算资源,论文未能系统探索预测器深度的影响。虽然经验上发现 1-2 层浅预测器效果最好,但作者不确定这是 SiamJEPA 的内在属性还是特定于当前实验设置。这一问题对理解 SiamJEPA 的架构设计原理至关重要,但需要更多计算资源才能回答。

仅在 ImageNet 上验证(本文判断)。所有实验均在 ImageNet-1K 线性探测上完成,未测试下游任务(如检测、分割)或更大规模数据集。Siamese 编码器在密集预测任务上的效果——尤其考虑到 SiamMAE 等方法在姿态估计和分割上的优势——仍需验证。此外,ViT-Base 以外的模型规模(如 ViT-Large 或 ViT-Huge)未涉及,SiamJEPA 的可扩展性尚不明确。

与 I-JEPA 的比较不够公平(本文判断)。论文基于 MAE 代码库而非 I-JEPA 官方实现,训练动态与原版 I-JEPA 不同。虽然这提供了重建方法和 JEPA 方法的统一比较框架,但也意味着与 I-JEPA 的性能差距可能部分来自实现差异而非方法本身的优劣。

总结与展望

SiamJEPA 首次系统研究了 Siamese 学生编码器在 JEPA 框架中的作用。核心发现是:Siamese 编码器并非简单的架构选择,而是构成预测表征学习的重要归纳偏置。通过 KL 正则化约束两个掩码视图的一致性,Siamese 编码器充当了有效的正则化器,限制了表征空间,提高了表征的可分性,并加速了训练早期的收敛。在有限训练预算下,SiamJEPA 始终优于可比的单编码器 JEPA 变体。

更广泛地看,SiamJEPA 的意义在于连接了两个此前平行发展的研究方向:以 I-JEPA 为代表的 JEPA 系列和以 PhiNet 为代表的脑启发学习。论文证明 PhiNet 的 Siamese 架构可以自然地纳入 JEPA 框架,且带来实质性的性能提升。这一统一视角为未来的 JEPA 模型设计提供了新的思路。

论文还揭示了一些有趣的实践发现:随机掩码在调优后与块掩码差距不大,浅层预测器即可取得良好效果——这些发现降低了 JEPA 方法的实现门槛,有利于其更广泛的采用。对于机器人领域而言,更高效的视觉表征学习意味着可以用更少的标注数据和计算资源获得更好的感知能力,这对于在资源受限的机器人平台上部署 SSL 模型具有实际价值。

未来方向包括:更系统地研究预测器深度与表征动态的关系、在更大规模模型和数据集上验证 SiamJEPA 的可扩展性、探索 Siamese 编码器在 V-JEPA 等视频 JEPA 模型中的作用,以及将 SiamJEPA 应用于机器人感知和世界模型学习的下游任务。

金句

"Siamese student encoders are not merely an architectural choice but constitute an important inductive bias for predictive representation learning."
"Siamese 编码器并非简单的架构选择,而是预测表征学习的重要归纳偏置。"

相关论文

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Human-JEPA:能够感知与预测的人类中心视觉模型

Human-JEPA:能够感知与预测的人类中心视觉模型

理解人类的机器应当能够感知当下并预测未来。现有的人类中心视觉模型在静态图像上预训练,在静态密集感知上达到 SOTA,但无法处理运动与预测。本文提出 Human-JEPA,一个在视频上通过锚定预测训练的人类中心视觉模型:密集目标被钉在初始化的冻结副本上,防止密集感知的静默坍缩;块掩码被纯过去到未来的分割取代,避免了 5 个点的动作税和 17 个点的重识别坍缩。在冻结探针下,Human-JEPA 以 2.7 倍更少的参数在姿态估计和行人重识别上领先像素锚定专家模型,同时其预测头是首个不降低预测性能的预测头。单一安全适配的模型因此同时服务于理解人类的两个方面。

human-centric visionvideo forecastingpose estimation2026年8月21日
StageWAM:面向机器人操作世界-动作模型的阶段联合嵌入预测

StageWAM:面向机器人操作世界-动作模型的阶段联合嵌入预测

通用机器人策略旨在将多模态观测和语言任务指令映射为跨任务的动作。现有方法通常将未来表示为固定的短视频-动作块。本文区分了两种互补的未来:捕获局部场景演化的短期物理未来,以及表示任务进度的阶段级语义未来。提出StageWAM,在基于Motus的世界动作模型(WAM)上增加Stage-JEPA——一种目标条件联合嵌入预测架构。Stage-JEPA使用冻结的V-JEPA2编码器提取当前状态表示,预测下一推断阶段的潜在目标。在50个RoboTwin 2.0任务中,StageWAM实现90.25%总体成功率,成功回合平均执行步数较最强基线减少5.97%。

机器人操作世界模型JEPA2026年8月11日
PhyLatent:JEPA世界模型的动力学相关表征

PhyLatent:JEPA世界模型的动力学相关表征

本文提出PhyLatent,用SVIC、PSG、FRA、CASC和LD约束JEPA潜空间,解决物理不变性、可辨识性与反事实动力学塌缩;Cube MPC成功率从70.0%升至78.1%。

JEPAWorld ModelsMPC2026年8月6日