HomeBody:GPT Astra 跳过 VLA,直接指挥 G1 收拾陌生厨房

发推人转述斯坦福的 HomeBody:一台 Unitree G1 先探索陌生厨房,建立持久空间记忆与 Real2Sim 数字孪生,再用 GPT Astra(推文写作 GPT-6 Astra)规划并组合技能。项目页由斯坦福 The Movement Lab 与加州理工团队发布(2026 年 9 月,作者 Gio Huh、Cayden Gu、Takara E. Truong、C. Karen Liu、Guy Tevet),核心追问是:当 System 2 的前沿 VLM 足够强,中间那层学习型 System 1 VLA 是否还必要。HomeBody 用即插即用的 VLM 加可组合技能库,替代 VLM→VLA→System 0 全身控制这条链路,不需要环境专属训练数据,也不做额外策略学习。部署分三步:机器人先在未见过的厨房里采集 0.5 倍 iPhone 视频、D435i 观测、LiDAR 与 SLAM、关节姿态以及 Astra 选定的路点;再由 Astra 充当 Real2Sim 智能体,用机器人自己采集的数据在 Isaac Sim 中重建数字孪生;然后直接下达日常任务,VLM 靠空间上下文选择动作与目标,而不是执行动作级脚本。技能库含抓取、放置、开抽屉、从抽屉取物、导航五个技能,共享同一套目标与执行结果接口,通过结构化 tool call 调用,也允许接入自己的学习策略或经典算法。两个演示任务:整理厨房(把咖啡袋集中到岛台,丢掉变质的牛奶与橙汁盒),以及取药(药瓶起初不在视野内,用存储的关键帧定位抽屉,右手开抽屉取药递给人,左手丢掉纸盒)。执行侧用 Super Odometry 定位,并以 ICP 把 SLAM 地图与重建对齐;抓取调用给出归一化到 0-1000 的图像点与用哪只手,触发分割并配 SAM 2.1 跟踪与 Fast-FoundationStereo 深度估计,随后用最小 jerk 样条、逆运动学与扫掠碰撞检查规划手臂;失败时先做有界本地重试,穷尽后把原因返回给 VLM,由它重新定位或改换计划。下身控制用预训练 AMO,手臂与手指令 250 Hz、AMO 策略 50 Hz,技能与感知整套跑在一台 RTX 4090 笔记本上,Astra 在远端。作者也列出局限:Real2Sim 增加搭建时间与 API 成本,任务长度受可达范围、操作能力与硬件耐久(手指舵机过热)限制,Astra 的推理延迟会在技能之间造成停顿。代码已在 GitHub 开源,项目页尚未给出论文链接。





