Human-JEPA:能够感知与预测的人类中心视觉模型
理解人类的机器应当能够感知当下并预测未来。现有的人类中心视觉模型在静态图像上预训练,在静态密集感知上达到 SOTA,但无法处理运动与预测。本文提出 Human-JEPA,一个在视频上通过锚定预测训练的人类中心视觉模型:密集目标被钉在初始化的冻结副本上,防止密集感知的静默坍缩;块掩码被纯过去到未来的分割取代,避免了 5 个点的动作税和 17 个点的重识别坍缩。在冻结探针下,Human-JEPA 以 2.7 倍更少的参数在姿态估计和行人重识别上领先像素锚定专家模型,同时其预测头是首个不降低预测性能的预测头。单一安全适配的模型因此同时服务于理解人类的两个方面。
Hui Wei, Licai Sun, Guoying Zhao·2026年8月21日
human-centric visionvideo forecasting姿态估计2026年8月21日