
UCAG-P:一个策略驾驭九种本体——小米的相机中心统一动作几何预训练
小米具身智能团队联合澳门大学提出 UCAG-P:把机械臂、双臂、人形与人手视频统一表示为相机可观测的锚点几何运动(腕部 p0 + 抓取中心 p1 的相机系 3D 轨迹),几何条件化翻译器再输出可执行命令,人类视频无需重定向或视频合成即可直接监督策略。基于 Qwen3-VL-4B 三阶段训练,语料 102 万条轨迹 / 6373.6 小时 / 9 种本体(36.7% 人手数据);单 checkpoint 零微调拿下 LIBERO 98.3%、RoboTwin Easy 88.7% / Hard 89.2%、LIBERO-Plus 零样本 82.0%、RoboCasa GR-1 62.0%;Piper 真机取面包 60% vs π0.5 的 20%,ALOHA→ARX 跨本体零样本 35%。
Xiaomi Embodied Intelligence Team, University of Macau, :2026年8月26日
视觉语言动作模型跨本体操作学习2026年8月26日