PAPER DEEP DIVE
PRISM:面向交互结构化运动控制的多项式表示
PRISM 提出一种紧凑的策略表示方法,将可观测物理变量间的多项式交互显式化、可学习化。标准 MLP 策略接收一阶变量(位置、速度),但许多动作相关线索来自乘积交互(如关节功率=扭矩×速度)。PRISM 用因子化多项式模块直接暴露这些交互,无需枚举所有单项式,在人形机器人行走和接触丰富操作上显著超越 MLP 基线。
PRISM:交互结构化运动控制的多项式表示
机构:密歇根大学安娜堡分校 | arXiv:2607.23473v1
一句话总结
PRISM是一种策略表示方法,通过因子化多项式模块显式暴露可观测物理变量间的多项式交互(如功率、惯性、接触、滑移),在RL中应用于MLP骨干后、在IL中替换Diffusion Policy的线性本体感知条件化,在人形运动和接触密集操作上显著优于标准MLP和更大MLP,并产生无传感器柔顺行为。
研究背景与动机
机器人策略几乎总是用MLP实现从观测到动作的映射。但机器人观测是物理变量——关节位置、速度、命令、IMU等。许多动作相关的物理量不直接出现在观测向量中,而是变量间交互的产物:关节功率是力矩与速度的乘积、科里奥利效应取决于速度乘积、滑移和接触冲量从本体感知与命令的耦合关系中涌现。
标准MLP仅接收一阶变量,这些动作相关的物理量是隐式的而非直接可用的。虽然MLP理论上可通过深度和非线性激活隐式逼近乘法关系,但这种交互必须被发现而非显式提供。PRISM通过学习因子化多项式表示直接暴露这些交互。
图1:关节功率、科里奥利效应、接触力等物理量可通过可观测变量的多项式交互形成,但不是直接输入。
方法
可部署策略设置
策略 $\pi_\theta(a_t | o_t)$ 将观测 $o_t = (x_t, c_t)$ 映射到动作 $a_t$,其中 $x_t \in \mathbb{R}^d$ 为可部署本体感知状态,$c_t$ 为其余输入(命令、图像、语言等)。策略在部署时不接收潜在物理量(接触力、地形摩擦、物体质量等)。PRISM不直接识别这些量,而是提供可编码其可观测效应的交互敏感特征。
交互结构化本体感知表示
给定可部署输入 $x_t$,首先计算两个学习仿射因子:
$$u_t = W_1 x_t + b_1, \quad v_t = W_2 x_t + b_2$$默认二阶表示为:
$$\psi_2(x_t) = u_t \odot (\mathbf{1} + \alpha_2 \odot v_t) = u_t + \alpha_2 \odot (u_t \odot v_t)$$其中 $\odot$ 为逐元素乘法,$\alpha_2$ 与策略联合学习。第一项保留直接一阶路径,第二项引入因子化二次交互。$\alpha_2$ 初始化接近零,使表示从标准线性投影开始并端到端学习交互贡献。因子化构造避免显式枚举所有成对单项式,同时允许每个交互方向从数据中学习。
PRISM递归扩展到多项式阶 $K$:
$$\psi_k(x_t) = \psi_{k-1}(x_t) \odot [\mathbf{1} + \alpha_k \odot (W_k x_t + b_k)], \quad k = 2, \ldots, K$$每个额外因子将最大多项式阶增加一,同时保留所有低阶路径。最终表示映射到条件化维度:
$$z_t = g_\eta(\psi_K(x_t))$$
图2:PRISM架构——因子化多项式模块替换线性条件化路径。
RL中的应用
PRISM将本体感知状态编码为 $z_t$ 后输入Actor。Actor结合该表示与剩余输入预测动作分布 $\pi_\theta(a_t | z_t, c_t)$。PPO实例化中Actor预测高斯动作分布均值。PRISM不改变动作空间、奖励函数或低层控制器。特权仿真信息仅限于Critic,部署Actor不可用。
IL中的应用
在Diffusion Policy中,PRISM替换标准本体感知条件化路径(线性投影)为多项式层,端到端训练。关节功率等物理量的交互效应可形式化为:
$$P_{\text{joint}} = \sum_{i} |\tau_i \dot{q}_i|$$其中 $\tau_i$ 和 $\dot{q}_i$ 分别为关节 $i$ 的力矩和角速度。标准MLP需隐式发现这种乘法关系,而PRISM通过多项式因子直接暴露。
graph TD
A["观测 o_t = (x_t, c_t)
本体感知 + 命令/图像"] --> B["PRISM多项式模块"]
B --> C["仿射因子 u_t, v_t"]
C --> D["因子化交互
ψ_K = u_t ⊙ (1 + α ⊙ v_t)"]
D --> E["条件化特征 z_t"]
E --> F["RL: Actor预测动作分布"]
E --> G["IL: Diffusion Policy条件化"]
F --> H["人形运动
零样本sim2real"]
G --> I["接触密集操作
无传感器柔顺"]
实验结果
人形运动
在Humanoid-Gym上评估,PRISM在回合长度、线速度跟踪误差和存活率上均最优。关键发现:更大MLP(Larger MLP Control)无法弥合与基线的性能差距,表明PRISM的优势不来自参数扩展,而来自显式暴露乘法交互。
| 方法 | 回合长度 ↑ | 跟踪误差 ↓ | 存活率 ↑ | 说明 |
|---|---|---|---|---|
| 标准MLP | 较低 | 较高 | 较低 | 速度漂移和早期跌倒 |
| 更大MLP | 中等 | 中等 | 中等 | 容量增加无效 |
| PRISM (度2) | 最优 | 最低 | 最高 | 显式交互表示 |
| PRISM (度3) | 最优 | 最低 | 最高 | 略优但更复杂 |
图3:PRISM在Humanoid-Gym上展现更紧的收敛边界和更稳定的速度跟踪。
操作中的无力传感器多项式条件化
在LIBERO基准上,PRISM在空间、长时序、物体、目标四类任务上均达到最高成功率。更重要的是,PRISM产生了涌现柔顺行为——在接触前快速接近,接触后立即减速,保持低而稳定的接触力轮廓,而无需力、力矩、触觉输入或导纳控制。标准Diffusion Policy在碰撞时产生硬冲击,MCC-Sensorless响应延迟导致接触力超过600N。
| 方法 | 成功率 ↑ | 平滑性 ↓ | 位置误差 ↓ | 姿态误差 ↓ |
|---|---|---|---|---|
| Diffusion Policy | 基线 | 较差 | 基线 | 基线 |
| MCC-Sensorless | 中等 | 中等 | 中等 | 中等 |
| MCC-Oracle (非可部署) | 高 | 好 | 低 | 低 |
| PRISM | 最高 | 最优 | 最低 | 最低 |
图4:PRISM在接触时主动减速——快速接近后立即速度抑制,吸收冲击能量调节接触力。
更强骨干验证
PRISM在BFM-Zero(人形运动)和SmolVLA(LIBERO操作)上均有效。在两个领域中,PRISM优于对应的更大容量对照组且使用更少参数,表明多项式交互的归纳偏差不限于特定架构或任务域。柔顺行为的物理建模可理解为接触力与末端速度的关系:
$$F_c \propto \frac{d(m \cdot v_{\text{EEF}})}{dt} \approx m \cdot \frac{dv_{\text{EEF}}}{dt}$$PRISM通过多项式交互隐式编码 $v_{\text{EEF}}$ 与本体感知的关系,在接触时自然产生减速行为。
从表示学习理论角度,PRISM的因子化多项式构造与传统多项式展开有本质区别。传统方法枚举所有 $d$ 维变量的 $K$ 阶单项式,产生 $inom{d+K}{K}$ 项,在 $d$ 较大时维度爆炸。PRISM通过因子化避免了这种枚举——每个因子 $lpha_k$ 是一个 $d$ 维向量,整个 $K$ 阶表示仅需 $K imes d$ 个额外参数,复杂度为 $O(Kd)$ 而非 $O(d^K)$。参数效率可量化为:
$$rac{ ext{PRISM params}}{ ext{Full expansion}} = rac{K imes d}{inom{d+K}{K}} \ll 1 \quad ext{when } d \gg K$$这种因子化类似于低秩近似——不捕获所有可能的交互,而是学习最具控制相关性的交互方向。实验验证了这一设计选择:度2已捕获大部分增益,度3略优但复杂度增加,表明大多数动作相关交互是低阶的。
PRISM在更强骨干上的成功特别值得关注。BFM-Zero和SmolVLA都是参数量显著更大的模型,拥有更强的表示能力。然而,即使在这些强骨干上,PRISM仍然带来提升且优于更大容量对照组。这说明多项式交互的归纳偏差提供的信息是模型容量无法替代的——正如卷积的平移不变性先验对图像识别的价值,多项式交互先验对物理运动控制具有类似的基础性意义。
柔顺行为的涌现是PRISM最引人注目的特性。在传统机器人学中,柔顺控制需要力/力矩传感器和导纳控制环路。PRISM仅通过本体感知的多项式交互就产生了等效的柔顺行为——在接触前保持高速接近,接触瞬间速度骤降。这种行为模式类似于阻抗控制中的阻尼项,但完全从数据中学习而非显式编程。接触力调节可理解为多项式交互编码了关节位置-速度-命令的耦合关系,当这些变量在接触时产生特定模式时,策略自然产生减速响应。
局限性
- 假设关键动作线索可被低阶多项式交互捕获,对长时序历史或未观测接触几何可能不足
- 无法补偿缺失的感知覆盖——若关键信息不在视觉或本体感知中,仍会失败
- 实验聚焦于人形运动和固定控制器的接触密集操作
- 未来方向:自适应多项式阶、时序交互、更广机器人形态和真实世界接触
总结与展望
PRISM是一种紧凑策略表示,显式暴露可观测物理变量间的多项式交互。通过因子化多项式模块,在RL中作为MLP骨干后的逐步激活函数,在IL中替换Diffusion Policy的线性条件化。实验表明PRISM在人形运动和接触密集操作上优于标准和更大MLP基线,支持无传感器柔顺行为,且无需额外部署时传感或特权物理输入。多项式表示应成为具身运动控制的标准架构选择。
金句:交互结构不能被容量替代——更大MLP无法弥合性能差距,只有显式暴露乘法交互才能实现质的飞跃。



