提出LabRobFail,化学自助实验室中机器人失效分析基准,评估具身agent在安全关键化学实验中的可靠性与失效应对。
提出N0-TWAM,首个大规模触觉原生世界-动作模型,同时预测未来视觉与未来接触,在contact-rich操作上展现强能力。
探索性研究,检验GPT-5.1大模型在无具身训练、无仿真经验、无传感运动经验下,能否作为物理移动机器人的高层控制器,评估其世界模型能力。
提出LeapBot-WA世界锚定动作模型,通过预测潜在对齐摆脱像素级视频生成瓶颈,提升世界-动作模型的表示效率。
提出WARL力矩增强强化学习,将动作空间从关节扩展到力矩,提升腿式机器人的探索能力与运动性能。
提出运动感知向量量化框架与质心复用,降低VLA模型在GPU上的推理延迟,服务于实时具身AI部署。
提出具身操作的数据金字塔框架,分析多数据源(耦合观测、物理状态与动作)对具身agent的差异化贡献,指导具身智能数据构建。
通用机器人需要推理自身行为,融合感知、世界知识、规划、成功检测、恢复和底层控制。现有方法试图通过大规模预训练将所有能力融入学习策略。我们提出将这些能力分解为语言条件控制代理和高层编排器。Pigey编排器在推理时闭环运行:前沿VLM规划子目标、选择冻结后端执行、验证结果、失败时恢复。在LIBERO-PRO上提升4倍(12.8%→53.3%),在真实机器人上将冻结策略从近零提升到90%以上,无需额外数据采集或训练。
PAVXploreRL提出物理-动作-视觉世界模型强化学习方法,通过动作探索实现具身智能体的环境理解和策略优化。
Athena-Brain是一个高效的机器人大脑系统,面向通用智能和具身交互,集成感知、推理和行动能力。
EA-Nav提出具有身体感知的安全视觉导航策略学习方法,让机器人理解自身身体约束进行安全导航。
ReferTrack提出先指代再跟踪的范式用于身体化VLA模型,结合自然语言指代和视觉跟踪实现机器人对目标的精准操作。