
ResSafe:用残差强化学习为人形机器人学习安全滤波
ResSafe 把人形机器人控制的性能与安全解耦:名义策略只优化任务表现,冻结后用残差 RL 训练一个专学安全修正的策略,最终动作两者相加,等效于隐式最小范数安全滤波器。Unitree G1 极限平衡任务上,随机负载下摔倒率从 7.29% 降至 1.11% 而跟踪误差几乎不涨,且可跨参考策略检查点泛化、迁移至真机。
Qu, Gechen, Zhang, Tong, Zhang, Bike2026年9月14日
人形机器人Safety FilterResidual RL2026年9月14日
