智元 GE-Act 2.0:首个验证预训练与规模化路径的「原生」世界动作模型

视频加载中
视频加载中智元机器人(AgiBot Research,arXiv:2609.05588)发布 GE-Act 2.0:与多数继承预训练视频生成器的世界动作模型(WAM)不同,其可训练的生成与动作组件全部在操作数据上**从零初始化**——无继承视频生成器、无任务专属微调。三个组件:控制导向自编码器 CoAE(激进压缩下保留动作与指令相关信息)、单步视觉规划器 SVP(一次可微前向生成完整未来状态,39,000 小时数据预训练)、逆动力学模型 IDM(32,000 小时预训练);再以知识对齐选择性优化 KASO 联合训练(只选与记录动作行为兼容的预测未来,减少错配监督)。残酷的真机零样本 OOD 测试:未见场景/物体、100 个原子任务、20 个技能类、双本体(G1-OP 占联合训练数据 50%+,G2-90D 不足 2%)。联合训练数据从 300 小时扩到 30,000 小时:G1-OP 成功率 17.1%→44.1%,G2-90D 13.4%→31.1%(+17.7 个百分点,印证跨本体迁移);收益覆盖 19/20 与 18/20 技能组,技能覆盖度与零样本 OOD 成功率强相关(Pearson r=0.80)。全管线(三相机观测→52 个可执行动作)在单张 RTX 5090 上仅 104 ms,动作块 30 Hz 执行约 1.7 秒运动时域——消费级 GPU 上的实时控制。Code coming soon。
Category: world-model
Author: @AGIBOTofficial
Date: 2026-09-11T00:00:00
Duration: 228.633s
Reference: https://ge-act-v2.github.io/





