Delta-0:69 自由度人形全身移动操作基础模型

视频加载中
视频加载中Delta Intelligence 发布人形基础模型 Delta-0,核心是把「大脑」与全身控制器协同设计。大脑是一个潜在世界-动作模型:mixture-of-transformers 三分支(视觉语言分支读多视角观测与指令、视觉分支在 DINO 语义空间里预测未来画面、动作分支以本体感受为条件生成全身动作),用前向动力学、逆动力学、视觉规划、纯策略四种模式联合训练。控制器把动作指令翻译成 69 个自由度的关节目标,走 delta-action 接口,让策略输出、遥操作与人类纠正共用同一套执行入口;在约 3 小时 31 分日常动作数据上零样本评测,全局根轨迹误差与 MPJPE 都优于 HEFT、MimicLite v1.1、SONIC v1.1、ScaleBFM XL。数据侧用 1 万多小时「第一视角画面 + 全身动作」配对人类数据预训练,并设计 154 维(补齐到 180 维)共享动作表示,让单臂、双臂、Ego、UMI、人形多种数据源共用一个动作空间;动作数据从 10% 加到 100%,高精度跟踪覆盖率由 29.2% 升到 72.6%。评估走 real-to-sim-to-real:用 3D 重建加 LLM 智能体把真实场景转成可仿真资产,先在仿真里跑可重复的自主 rollout,再把候选策略送回真机验证。真实世界 RL 后训练用价值模型估计「距成功还有多少代价」,给自主尝试与人工纠正打正负条件信号——洗碗机任务在镜像布局(洗碗机与水槽左右互换)这一分布外场景下,成功率从 SFT 的 20%(4/20)提升到 65%(13/20)。视频展示六项家务长程任务:放唱片、铺床、捡地上的玩具、开洗碗机、踩脚踏垃圾桶、坐沙发。
Category: humanoid
Author: @HumanoidRTech
Date: 2026-09-28T00:00:00
Duration: 274.4s
Reference: https://deltai.com/en/blog/delta-0





