Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

Paper

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen2026年7月30日2 分钟阅读
EN

论文元信息

项目内容
标题FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation
作者Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen (上海交通大学, 上海创新研究院, Noematrix Ltd.)
论文链接arXiv:2607.28596
项目主页fa-rdp.github.io
硬件Flexiv Rizon 4R (遥操作主臂) + Rizon 4s (从臂)

一句话总结:FA-RDP 提出频率自适应的扩散策略,通过多频率视觉-力 Transformer 和多模态指示器,在接触前保持多模态轨迹多样性(低频扩散采样),在接触后切换到高频蒸馏策略实现快速力反馈响应,在三个接触富集操作任务上平均成功率达 81.7%。

研究背景与动机

接触富集操作中,动作多模态性和反应性在不同阶段主导同一回合。接触前,多条轨迹可能同样有效,保持多样的动作模式很重要。接触后,几何约束和力限制收窄了解空间,成功执行需要快速响应力反馈。

标准扩散策略使用固定推理频率和采样步数贯穿整个回合,迫使一个根本性妥协:低频多步采样更好地保持接触前多模态性,但对力反馈响应缓慢;高频采样提高反应性,但倾向于坍缩不同的接触前模式。

此前的工作各有局限:扩散策略(DP)预测时间连贯的动作序列,但每个块内控制仍是开环的,接触后无法使用新观测的力信号更新动作。RDP 使用分层慢-快设计实现闭环执行,但快策略仅依赖压缩的潜动作,信息可能丢失。ImplicitRDP 通过端到端扩散网络学习视觉和力模态消除了显式分层,但多步扩散采样限制了闭环推理频率。

FA-RDP概览

图1:多模态引导的频率自适应。接触前低指示值选择低频扩散采样器;接触后指示值随力响应升高,选择高频蒸馏采样器。

方法详解

多频率视觉-力 Transformer

FA-RDP 的核心是共享的多频率视觉-力 Transformer。同一骨干网络用于两种频率模式 $\nu \in \{\ell, h\}$,单次前向传播以一个频率模式为条件预测该模式的动作块。关键设计是频率自适应位置编码——频率模式不作为额外 token 嵌入,而是在共享时间网格上选择时间索引:高频模式使用连续位置,低频模式使用稀疏位置,两种模式在同一底层时钟上表达。

前向扩散过程采样时间步 $k$ 和噪声 $\boldsymbol{\epsilon} \sim \mathcal{N}(0, \mathbf{I})$,构造加噪动作:

$$\mathbf{A}^{\nu}_{k} = \sqrt{\bar{\alpha}_k} \mathbf{A}^{\nu} + \sqrt{1 - \bar{\alpha}_k} \boldsymbol{\epsilon}$$

网络预测动作块 $\hat{\mathbf{A}}^{\nu} = \pi_\theta(\mathbf{A}^{\nu}_k, k, \mathbf{o}_n^s, \mathbf{o}_n^{\text{force}}, \nu)$,隐含噪声预测为:

$$\hat{\boldsymbol{\epsilon}} = \frac{\mathbf{A}^{\nu}_k - \sqrt{\bar{\alpha}_k} \hat{\mathbf{A}}^{\nu}}{\sqrt{1 - \bar{\alpha}_k}}$$

每个模式的扩散目标为:

$$\mathcal{L}_{\epsilon}^{\nu} = \mathbb{E}_{\mathbf{A}^{\nu}, k, \boldsymbol{\epsilon}} \left[ \| \hat{\boldsymbol{\epsilon}} - \boldsymbol{\epsilon} \|_2^2 \right]$$

共享骨干使用联合多频率扩散目标训练:

$$\mathcal{L}_{\text{MF}} = \mathcal{L}_{\epsilon}^{\ell} + \mathcal{L}_{\epsilon}^{h}$$

多频率Transformer

图2:多频率视觉-力 Transformer。频率模式在共享时间网格上选择位置索引——高频用密集位置,低频用稀疏位置。

基于多模态的频率选择

多频率 Transformer 提供了两种采样器,但策略需要决定在不同阶段使用哪个。FA-RDP 使用学习到的多模态指示器估计局部多模态性,而非依赖阶段标签。第二阶段在独立校准集上训练指示器头,冻结第一阶段策略。对每个校准样本,固定相同视觉-力条件,独立采样低频策略 $N=8$ 次并计算经验动作残差:

$$e(\mathbf{o}_n) = \frac{1}{N} \sum_{m=1}^{N} \| \hat{\mathbf{A}}^{\ell}_m - \mathbf{A}^{\ell} \|_2^2$$

残差高表示多模态性强(不同采样产生不同结果),选择低频采样器;残差低(接触后约束收窄)选择高频蒸馏采样器。

流形一致性蒸馏(MCD)

为实现高频模式的单步推理,FA-RDP 引入流形一致性蒸馏。该方法将扩散网络重参数化为在机器人动作流形上预测动作,同时保留基于 DDPM 的残差监督。通过六步网格 $\mathcal{G} = \{99, 79, 59, 39, 19, 0\}$ 上的蒸馏,将多步扩散压缩为单步预测。

流形一致性蒸馏

图3:流形一致性蒸馏(MCD)。将扩散网络重参数化为在机器人动作流形上预测动作,实现单步高频推理。

graph TD
    A["接触前阶段"] --> B["多模态指示器: 低值
(多条有效轨迹)"] B --> C["选择低频扩散采样器
10Hz, 多步DDIM"] D["接触后阶段"] --> E["多模态指示器: 高值
(约束收窄)"] E --> F["选择高频蒸馏采样器
30Hz, 单步MCD"] C --> G["保持轨迹多样性"] F --> H["快速力反馈响应"]

图4:FA-RDP 频率自适应推理流程。指示器值动态切换低频/高频采样器。

实验结果

主实验对比

在三个接触富集操作任务上评估:双盒翻转、双开关切换、双按钮按压。每任务 60 条演示,20 次试验评估。

方法按钮开关平均
DP (仅视觉)0/202/204/2010.0%
RDP (分层)5/207/209/2035.0%
ImplicitRDP (固定频率)8/2011/2012/2051.7%
回归策略(力)2/204/206/2020.0%
FA-RDP14/2018/2017/2081.7%

表1:主实验成功率。FA-RDP 在所有三个任务上均取得最高成功率。

实验设置

图5:机器人工作区和任务物体。Rizon 4s 从臂执行任务,腕部 iPhone 相机和固定第三视角 USB 相机提供观测。

多模态保持

统计接触前轨迹在右、中右、中左、左四种模式上的分布。FA-RDP 和 ImplicitRDP 覆盖全部四种模式,而仅高频蒸馏策略坍缩到一种主导模式。这表明 FA-RDP 在实现高频力响应的同时保持了接触前的多模态能力。

指示器引导切换

方法按钮开关平均
仅高频蒸馏12/2014/2011/2061.7%
FA-RDP14/2018/2017/2081.7%

表2:指示器引导切换对比。频率自适应切换将平均成功率从 61.7% 提升到 81.7%。

指示器和力曲线

图6:多模态指示器值和力曲线。接触前指示值低,接触后随力响应升高,支持采样器切换。

蒸馏方法对比

方法按钮开关平均
仅高频(未蒸馏)4/203/205/2020.0%
MeanFlow Policy0/200/201/201.7%
Consistency Policy0/200/201/201.7%
高频蒸馏(MCD)12/2014/2011/2061.7%

表3:高频蒸馏方法对比。MCD 大幅优于 MeanFlow 和 Consistency Policy。

局限性

1. 感知模态有限:作者自述当前评估仅限于视觉-力输入,未测试其他传感模态(如触觉传感)。

2. 单任务策略:当前使用单任务策略而非多任务学习,泛化到新任务的能力未验证。

3. 三阶段训练流程:需要三个阶段的训练流程(多频率骨干 → 指示器 → 蒸馏),增加了训练复杂度。

总结与展望

FA-RDP 优雅地解决了接触富集操作中接触前多样性与接触后反应性之间的阶段依赖性权衡。其核心洞察是:不应在整个回合中固定推理频率,而应根据操作阶段动态调整——接触前用低频多步扩散保持多模态性,接触后用高频单步蒸馏实现快速力反馈。

多模态指示器是这一自适应的关键:它通过测量局部动作多模态性来决定使用哪个采样器,无需人工标注阶段标签。流形一致性蒸馏(MCD)则解决了高频模式下单步推理的精度问题,大幅优于 MeanFlow 和 Consistency Policy。

实验结果令人信服:FA-RDP 在三个任务上平均成功率 81.7%,显著优于 ImplicitRDP(51.7%)和 RDP(35.0%)。指示器引导的频率切换将成功率从 61.7% 提升到 81.7%,证明了频率自适应的核心价值。

"不应在整个回合中固定推理频率"——这一洞察揭示了机器人操作中一个被忽视的维度:时间分辨率本身应该是一个自适应变量,而非超参数。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日
X-Morph:人体运动先验跨形态可扩展机器人学习

X-Morph:人体运动先验跨形态可扩展机器人学习

将人体运动转换为四足、六足等非人形腿式机器人的可执行行为,通过重定向、RL跟踪和蒸馏实现跨形态运动先验迁移——不追求关节级模仿,而是保留意图、时序、协调和接触结构。

步态优化跨形态运动先验2026年6月29日