Patch Policy:利用稠密视觉表征的高效具身控制
Patch Policy 提出一种轻量 Transformer 策略架构,直接消费冻结预训练 ViT 的稠密 patch 特征,避免全局池化带来的空间信息损失,也不需要亿级参数 VLM 的推理开销。其核心是 block-causal 注意力掩码:帧内 patch 全注意力,帧间严格因果,从而兼容 VQ-BeT、Diffusion Policy 等标准策略头。实验表明,在四个仿真和三个真实操作任务中,Patch Policy 相对全局特征策略平均提升 40%,并超越微调 OpenVLA-OFT 约 18%,同时参数量仅为后者的约 0.7%。
Patch Policydense visual representationDINOv2Gaoyue Zhou, Zichen Jeff Cui, Ada Langford·2026年7月20日