
跨具身迁移:冻结的类人机器人全身控制器通过解析编解码器与 LoRA 适配器实现迁移
冻结的 GEAR-SONIC 全身控制器(Unitree G1)通过闭式编解码器 + LoRA 适配器(0.25% 参数,2% 算力)迁移到 AgiBot X2 Ultra,分布外场景超越原生训练(69.0% vs 59.0%)。
跨具身迁移:冻结的类人机器人全身控制器通过解析编解码器与 LoRA 适配器实现迁移
原文来源:sonic-agibot-x2.github.io/sonic-transfer/
作者:Sitarama Chekuri · Claude Fable 5(Anthropic AI 协作)· 2026 年预印本草稿
链接:论文 PDF · 模型权重 · 代码仓库 · 配套:冻结规划器迁移
核心发现
一个冻结的、已公开发布的全身控制器(GEAR-SONIC,在 Unitree G1 上训练)直接驱动 AgiBot X2 Ultra——编码器、token 瓶颈和运动先验全部原封不动。仅通过一个闭式关节空间编解码器加上一个解码器上的 LoRA 适配器(仅占平台 0.25% 的参数),在一个 8-GPU 节点上训练一夜——约等于平台引用训练算力的 2%。
结果不是持平,而是反转:在分布外内容上,迁移版本击败了为 X2 原生训练的追踪器(69.0% vs 59.0% 成功率)——而分布内基准测试几乎无法区分两者。同样的配方,去掉编解码器后,在平台自身身体上专门化时实现了零遗忘。
工作原理
蓝色部分全部是已发布平台,逐比特一致且冻结不动。橙色部分是本文的工作:输入输出端各加一个闭式逐关节编解码器,加上挂在动力学解码器上的 LoRA 适配器——仅占平台参数的 0.25%,是唯一被训练的部分。论文涵盖了冻结所带来的可测量性:具身成本下限、信息瓶颈和过训练弧线。
编解码器的设计是闭式(closed-form)的,意味着每个关节的映射不需要学习——它是一个解析公式,将一个机器人关节空间"翻译"为另一个的关节空间。这保证了迁移的第一步是纯几何的、无信息损失的。LoRA 适配器则负责弥合动力学差异——两个机器人质量分布、惯量、摩擦特性不同导致的运动动态差异。
放松行走——原生 vs 零样本 vs 适配后
江南 Style 舞蹈——原生 vs 零样本 vs 适配后
迁移失败时:毫秒级异常
一个公开的困难,坦率陈述。冻结的 G1 方法在面对近期发布的精细操作检查点时比面对早期核心版本困难得多。该检查点针对慢精度场景和手腕精度,而由此衍生的全身控制器正是表现出这一行为的那些。
这个异常从未在仿真中复现——无论是在工作站上,还是在机器人自身的 aarch64 二进制上用操作者自己录制的命令磁带驱动,模型、调参和执行器工坊逐字节一致。在仿真中,同一个手势是轨迹中最平静的部分:0.9–1.8° 髋追踪误差,而硬件上为 42°。这排除了配置、构建和操作者输入——将原因悬而未决。
核心未知是力矩需求本身:模型反复要求超过硬件能产生的力矩,原因尚未隔离——这可能是跨具身迁移根本无法实现的事情。冻结先验要求的动态是这个具身的执行器无法实现的,而训练中没有任何机制惩罚这种要求,因为在仿真中执行器限制被免费吸收。回退到原生训练的现任追踪器则完全消除了这一行为。
结果一览
| 模型 | novel500(分布内) | hard300v3(尾部) | PHUMA(OOD) | PHUMA 存活率 |
|---|---|---|---|---|
| 原生(X2 原生训练) | 96.4 / 33.6 / 43.8 | 70.0 / 40.6 / 56.0 | 59.0 / 42.6 / 67.4 | 87.4 |
| 迁移(仅广度) | 95.6 / 33.7 / 42.9 | 71.0 / 40.0 / 56.4 | 61.6 / 42.9 / 60.9 | 89.4 |
| 迁移(选定) | 96.2 / 33.1 / 42.9 | 72.3 / 39.9 / 55.8 | 69.0 / 41.7 / 60.6 | 90.7 |
成功率 % / 平均毫米 / p95 毫米(存活者),IsaacLab 严格门控,同一台机器;存活率 = MuJoCo 在 OOD 切片上的第二裁判。分布内:不可区分。分布外:冻结先验的优势——从广度阶段就存在,经打磨后扩大。
方法解读
这项工作的核心洞察是:当两个机器人的运动学结构足够相似时(G1 和 X2 Ultra 都是双足类人形),一个冻结的全身控制器可以通过最小化的适配实现跨平台迁移。编解码器处理静态映射——将一个机器人的关节配置空间解析地转换到另一个——而 LoRA 适配器处理动态差异——学习两个体之间运动行为的残差。
LoRA(Low-Rank Adaptation)在这里的作用是精妙的:不是微调整个解码器(可能破坏冻结平台的表征),而是在注意力层和前馈层的权重矩阵旁挂低秩分解矩阵 $W + BA$,其中 $W$ 冻结,$B$ 和 $A$ 是可训练的低秩矩阵。这意味着原平台的全部知识被保留,适配器只学习"修正"——在本例中是修正不同身体动态导致的运动差异。
0.25% 的参数占比意味着:在约 300M 参数的平台上,LoRA 适配器仅约 750K 参数。训练一夜(8 GPU × ~8 小时 ≈ 64 GPU 小时)对比平台原始训练引用的约 3,200 GPU 小时,确实约为 2%。这种极端高效性来自一个关键事实:大部分"如何运动"的知识已经在冻结先验中,适配器只需学习"如何在这个特定身体上运动"。
局限性
第一,迁移在面对精细操作检查点时表现恶化。作者坦率指出,冻结的 G1 方法在精细操作场景下比在核心运动场景下困难得多——执行器力矩需求超限的异常正是由此引发。这表明跨具身迁移存在能力边界:当目标平台的能力分布与源平台显著不同时(如精度场景下的腕部控制),纯参数化适配可能不够。
第二,异常无法在仿真中复现。这一事实既是好消息也是坏消息:好消息是排除了配置/构建/操作者输入的问题;坏消息是意味着仿真到现实的差距(sim-to-real gap)在跨具身设置中被放大——仿真中执行器限制被"免费"吸收,但硬件上物理约束无法绕过。
第三,工作尚未完成。G1-stock 参考列尚在等待验证过的 G1 MuJoCo 录制工具链。完整的异常分析仍在进行中,包括 2026-08-25 的髋滚转爆发和 2026-08-26 的软髋下的力矩反转。
意义与展望
这项工作对具身智能领域有重要启示。如果跨具身迁移可以用 0.25% 的参数和 2% 的算力实现——甚至在分布外场景中超越原生训练——那么"一个模型适配所有机器人"的愿景比之前想象的更可行。编解码器 + LoRA 的范式提供了一条可扩展的路径:冻结大型通用运动先验,为每个新机器人训练轻量适配器。
同时,力矩超限的异常也提出了一个深刻的警告:仿真中的"免费"执行器限制吸收在硬件上变成了硬约束。未来的跨具身迁移可能需要显式建模执行器能力——不是所有运动都是可实现的,训练中应该惩罚超出物理极限的力矩请求。
这项工作建立在已发布的 GEAR-SONIC 平台之上。配套工作:冻结规划器迁移。最近的先前工作:Any2Any(LimX Dynamics)——在异构类人机器人上实现低成本持平;本页面:在相近配对上实现冻结平台反转。
原文来源:sonic-agibot-x2.github.iohttps://sonic-agibot-x2.github.io/sonic-transfer/