Skip to content
← 标签

#统一多模态 (1)

MachEmbodied-U0:理想汽车的统一理解-生成具身基础模型

MachEmbodied-U0:理想汽车的统一理解-生成具身基础模型

理想汽车 Foundation Model 团队提出 MachEmbodied-U0(ME-U0),一个把理解与生成专家统一进 Mixture-of-Transformers 架构的具身基础模型。理解专家以自回归文本生成输出子任务描述与可供性定位(含边界框、交互方式与交互点);生成专家用 flow matching 联合去噪未来视觉动力学(RGB、深度、表面法线、光流)与连续机器人动作,四种视觉模态共享同一个视频 VAE 隐空间与生成骨干,无需分模态预测头。Multi-rate Rotary Position Encoding(MRPE)解决动作比视频密三倍带来的时间对齐问题:保留视频隐帧的共享时间位置,给块内每个动作按次序分配不同的高度轴索引,配合 H_a = 3(H_v - 1) 的采样规则,形成每视频隐步对应 12 个动作步的一致跨模态时间结构。数据侧从约 5,700 小时机器人示范加 3,920 小时第一人称示范中精选出约 4,200 小时,覆盖四个开源数据集与六种本体(AgiBot G1 占 52.8%);三阶段清洗依次做突变检测、状态-动作一致性检查与物理边界检查;Ego2Robot 合成流水线用 Depth Anything 3、SAM3、ProPainter、SAM3D、两阶段 PPO 与 MuJoCo/Mink 逆运动学把人类示范转为机器人对齐的观测与轨迹标注。实验在下游不补任何子任务、可供性、几何与运动标注的前提下取得 RoboDojo 17.66 分(WAM 组最强,精度 23.95、长程 36.98 领先最明显)、LIBERO 99.0%、LIBERO-Plus 82.5%,并保留零样本的子任务预测、可供性接地与视觉动力学能力。作者诚实指出记忆类任务最弱(Score 8.42),因模型不显式保留观测历史。

Wen, Haoran, Wang, Wenfu, Shi, Kunsong2026年9月22日
MachEmbodiedME-U0理想汽车2026年9月22日