Proxy Policy Steering: Adapting a Frozen Generalist Policy at Inference

Loading video
Loading videoProxy Policy Steering trains a reference proxy and a task proxy whose calibrated velocity-space residual steers a frozen base sampler at every denoising step. Across 8 real-world and 4 simulation tasks it lifts the pi-0.5 base by 53% absolute success on average while keeping broad capabilities such as failure recovery.
Robot foundation modelsPolicy AdaptationInference-Time SteeringRobot ManipulationDiffusion policiespi-0.5Manipulation
Category: research
Author: @TritiumAc
Date: 2026-09-11T00:00:00
Duration: 13.568s
Reference: https://arxiv.org/abs/2609.09148





