
SteadyTray:冻结步态、只训残差,让人形边走边端稳托盘
人形边走边端托盘的难点不在走,而在托盘与物体之间没有任何刚性连接:脚底落地冲击沿运动链传到末端执行器,物体只靠摩擦与重力被动约束,转弯、加减速或被推时随时滑移、倾斜、翻倒。SteadyTray 提出 ReST-RL,把两件事在参数层面拆开:预训练步态基策略训练完即完全冻结,任何后续梯度都不许回流;残差模块由特权编码器(机器人线速度、托盘位姿与投影重力、物体位姿/线速度/角速度,输出 64 维特征)加零初始化适配器组成,既可在动作空间叠加残差修正,也可用 FiLM 逐层调制冻结基策略的激活。零初始化保证训练第 0 步与原策略逐位一致,不会先毁掉步态再重建。部署侧用 DAgger 只蒸馏编码器、适配器整体冻结,学生仅需本体感知加头部 RealSense D435 与 AprilTag 的物体位姿估计,把模仿难度从动作空间压到 64 维潜空间。Isaac Lab 仿真(8192 并行环境,2×RTX A6000)中:变速指令跟踪成功率 96.9%(冻结基策略 47.4%、端到端 89.1%),推机器人 84.6%(基策略仅 9.1%),推物体 74.6%;三种残差接法成绩接近,说明收益来自结构化残差解耦本身而非某种适配器形态。奖励曲线显示端到端总奖励不低,但物体直立奖励长期停在约 0.9,残差变体爬到约 1.8。观测延迟消融中,延迟训练在 0.00 到 0.06 秒全部档位领先,含零延迟档(90.2 对 78.4)。Unitree G1(29 自由度)零样本端起咖啡杯、装水红酒杯、手术器械与密封食品盒,抗踢抗推恢复由上下肢协调完成。局限:编码器只处理单个物体、不建模细粒度几何与物理属性;头部相机视场窄且固定,难以换持握姿态避障;纯 sim-to-real RL 依赖大量奖励塑形与仿真调校;评测未覆盖高重心、易滑动或软体载荷。
