TEMPO:让 VLA 记住世界怎么动

视频加载中
视频加载中VLA 只看当前一帧,看到移动瓶子也分不清它往哪走。TEMPO 用冻结视频模型提取运动摘要、接上机器人动作历史,动态瓶子交接成功率从 44% 提到 74%。
视觉语言动作模型Dynamic ManipulationTemporal ContextMotion PerceptionVideo Foundation ModelI2RT YAM Ultra动态操作
Category: arm
Author: @heetezition
Date: 2026-09-17T00:00:00
Duration: 72.8s
Reference: https://arxiv.org/abs/2609.16864





