
LeVJEPA:无需启发式技巧的高效可扩展视频预训练
LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。
Lukas Kuhn, Lucas Maes, Giuseppe Serra2026年8月27日
联合嵌入预测架构SIGRegvideo-SSL2026年8月27日
