在仿真中预训练视觉灵巧操作SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。Sarthak Kamat, Adam Rashid, Satvik Sharma·2026年8月16日仿真到现实灵巧操作灵巧手2026年8月16日
AtlasVLA:面向VLA模型的持久化世界-自我状态建模提出双记忆架构:4D持久世界状态记忆将瞬态2D观测提升为体素哈希全局空间状态解决感知遗忘,自我工作记忆跟踪任务进度。扩散Transformer基于此联合状态实现主动推理,仅用腕部相机即在LIBERO、RLBench和真实世界达到SOTA,长程任务成功率提升9.4%-17.5%。Guiyu Zhao, Longteng Guo, Yanghong Mei·2026年8月7日视觉语言动作模型物理AI世界-自我状态2026年8月7日