PAPER DEEP DIVE
通过可行动作映射桥接强化学习与最优控制
提出通过可行动作映射桥接强化学习与最优控制的方法,在RL探索与最优控制约束间建立映射,提升机器人控制的稳定性与可解释性。
1. 论文概览:在 RL 与最优控制之间架起可行动作映射之桥
FAOC(Feasible Action for Optimal Control)由 Richter Optimization GmbH 与 Sony AI 团队于 2026 年 7 月提出,是一个集成强化学习(RL)与最优控制(OC)的新框架。其核心贡献是一个计算高效的基于优化的映射算法,将 RL 智能体的动作从一个静态抽象集合变换为最优控制问题(OCP)的状态相关可行参数集,保证动态系统约束的严格满足。FAOC 有效结合了 OC 的可预测安全性与 RL 的灵活性。与先前工作不同,RL 智能体的抽象动作空间无需专家或启发式设计,OCP 表述也不因 RL 无法保证可行性而妥协。论文将该方法应用于机器人乒乓球运动规划——一个汇聚这些挑战的场景,并在仿真实验中证明 FAOC 在样本效率与闭环性能上均超越 SOTA 基线。该系统已部署于真实机器人,首次在官方 ITTF 比赛中与职业级选手竞技并获胜。
2. 核心问题:分层控制架构的接口挑战
论文考虑一个分层控制架构:高层 RL 策略评估环境状态以选择战略行为,低层参数化 OCP 计算满足物理与安全约束的最优控制输入来跟踪这些高层目标。根本挑战出现在两层之间的接口。假设 RL 策略在一个静态、几何简单的抽象空间 $\bar{\mathcal{A}} \subseteq \mathbb{R}^n$ 中运行,而底层 OCP 受严格物理限制约束,这些限制为动作编码参数向量 $p \in \mathbb{R}^n$ 诱导出复杂的、状态相关的可行区域 $\mathcal{P}(x)$。若 RL 智能体选择映射到不兼容参数配置的抽象动作,OCP 将变得不可行,导致控制系统失效。FAOC 的目标是设计一个中介映射算法,安全且双射地将 RL 智能体的抽象动作翻译为保证可行的 OCP 参数。
3. 问题设定与拓扑性质
3.1 RL 接口
高层序贯决策过程建模为有限视界折扣 MDP $(\mathcal{S}, \mathcal{A}, \kappa, r, \rho_0, \gamma)$,其中 $\mathcal{S}$ 为连续状态空间,$\mathcal{A} \subseteq \mathbb{R}^n$ 为动作空间,$\kappa: \mathcal{S} \times \mathcal{A} \to \mathcal{P}(\mathcal{S})$ 为随机转移核,$r: \mathcal{S} \times \mathcal{A} \to \mathbb{R}$ 为奖励函数,$\rho_0 \in \mathcal{P}(\mathcal{S})$ 为初始分布,$\gamma \in [0,1)$ 为折扣因子。RL 策略 $\pi_\theta$ 输出动作 $\bar{a} \in \bar{\mathcal{A}}$。
3.2 参数化 OCP 表述
OCP 表述为以下数学规划:
$$\min_{z \in \mathcal{Z}} f(z, p, x) \quad \text{s.t.} \quad g(z, p, x) \leq 0, \quad H_z z + H_p p + H_x x + h = 0 \tag{2}$$其中 $x \in \mathbb{R}^{n_x}$ 为初始状态,$z \in \mathbb{R}^{n_z}$ 为 OCP 决策变量(如预测状态与输入轨迹),$p \in \mathbb{R}^n$ 为 RL 智能体给定的动作编码参数。取决于 $x$ 与 $p$ 的值,OCP 可能存在也可能不存在可行解 $z$。状态相关可行参数集定义为:
$$\mathcal{P}(x) \triangleq \{p \in \mathbb{R}^n \mid \exists z \in \mathcal{Z}:\ g(z,p,x) \leq 0,\ H_z z + H_p p + H_x x + h = 0\}$$引理 1(参数集拓扑性质):在温和几何条件下,$\mathcal{P}(x)$ 为紧、实心、凸且维数为 $n$。线性 MPC 作为推论 1 被显式证明。
4. 凸集间的可逆映射
4.1 通用映射算法
映射算法基于径向缩放方法:确定从基集内部点出发射线的边界缩放因子,施加双射方向变换 $\phi(\cdot)$,并相对于目标集内部点比例缩放变换后的射线。形式化地,给定基集 $\mathcal{X}$、目标集 $\mathcal{Y}$(均紧、实心、凸),内部点 $x_c \in \operatorname{int}\mathcal{X}$、$y_c \in \operatorname{int}\mathcal{Y}$,待映射点 $x \in \mathcal{X}$:
$$d \leftarrow x - x_c, \quad \text{计算 } \alpha \geq 1 \text{ 使 } x_c + \alpha d \in \operatorname{bd}\mathcal{X}$$ $$d' \leftarrow \phi(d), \quad \text{计算 } \beta > 0 \text{ 使 } y_c + \beta d' \in \operatorname{bd}\mathcal{Y}$$ $$y \leftarrow y_c + \frac{\beta}{\alpha} d' \tag{映射 M}$$关键要求是变换必须完全可逆,以确保任何由最优控制器选择的可行参数或专家示范提供的参数可唯一投影回 RL 智能体的抽象动作空间,避免动作混叠。命题 1建立了映射的可逆性。先前工作的径向映射被严格限制于基集为超立方、方向变换为恒等($\phi(d)=d$)、目标集内部点固定在原点的情况;FAOC 大幅推广了这一框架。
4.2 几何畸变缓解
为防止点积累(几何畸变),论文开发了面积匹配方向变换(2D,命题 2 与 3),以及利用仿射相关椭球代理的任意维可扩展线性变换(命题 4)。
4.3 隐式定义集合的映射
为实现无需 $\mathcal{P}(x)$ 显式几何表示的实时可扩展性,论文推导了直接从 OCP 约束计算内部点(命题 6 与 7)与目标形状矩阵(命题 8)的鲁棒表述。
5. 实验评估:机器人乒乓球
5.1 运动规划设置
FAOC 部署于 8-DoF 移动操作器的真实机器人上。控制栈跨两个时间尺度运行:高层 RL 策略处理视觉与运动学反馈以决定拦截策略并避障;低层关节控制器在 1 kHz 跟踪位置参考。每个控制步,RL 智能体观测 157 维系统状态(球观测、关节状态与期望技能),输出 16 维目标位置与速度航点向量(八关节各两个)。航点须在 32 ms 视界后到达,故 RL 智能体以 31.25 Hz 行动。32 ms 视界分为 $N=4$ 个 $T=8$ ms 区间,假设各区间加加速度恒定。对每关节规划 32 个开环设定点轨迹,须严格遵守位置、速度、加速度与加加速度物理限制。FAOC 为每个 RL 步每关节求解一个参数化 OCP。
5.2 对比控制器
对比 FAOC、2Dsoft、1Dpos、1Dvel、1Dacc 五种控制器。使用 SAC 算法与 BRO 网络架构。FAOC 取得最高样本效率与最终性能,两个 2D 控制器(FAOC 与 2Dsoft)一致优于 1D 变体,后者在随机种子间变异性显著更大。
| 控制器 | 动作维度 | 特征 | 相对表现 |
|---|---|---|---|
| FAOC(本文) | 2D(位置+速度) | 状态相关可行集映射 | 最佳 |
| 2Dsoft | 2D | 软约束惩罚 | 次优 |
| 1Dpos | 1D(位置) | 仅位置航点 | 较差 |
| 1Dvel | 1D(速度) | 仅速度航点 | 较差 |
| 1Dacc | 1D(加速度) | 仅加速度航点 | 最差(3/5种子<50%) |
5.3 算法与架构的影响(SimBaV2)
实验 (b) 用 SimBaV2 测试 FAOC 是否独立于算法与架构内在地优于其他方法。实验 (c) 用 SimBaV2 与低 RL 频率测试 FAOC 通过结合 2D 航点与可达性感知的状态相关动作空间获得更好轨迹段可控性的假设。FAOC 在回球率、生成的上旋与速度上显著优于所有其他方法,解释了其卓越奖励。下旋与目标距离无统计显著差异。1D 控制器性能劣归因于可控性降低:RL 智能体仅指定一个航点变量,其余自由度留给优化器,限制了可达行为集并增加对探索的敏感性。
6. 五大贡献汇总
| 贡献 | 内容 | 关键结果 |
|---|---|---|
| 拓扑刻画 | OCP 可行性的几何条件 | 引理 1 + 推论 1(线性 MPC) |
| 可逆映射 | 径向算法双射变换 | 算法 1 + 命题 1(可逆性) |
| 几何畸变缓解 | 面积匹配 + 线性变换 | 命题 2,3,4 |
| 隐式集合可处理性 | 从约束直接计算内部点/形状 | 命题 6,7,8 |
| 乒乓球验证 | 8-DoF 真实机器人 | ITTF 官方比赛获胜 |
7. 局限性
- 凸集假设:映射算法假设可行集为凸。非凸域需 RL 智能体解决战略非凸性(如障碍规避、非线性运动学),OCP 处理局部运动学约束产生凸集——这种分工虽有效,但限制了对一般非凸问题的直接适用性。
- 下旋与目标距离无显著改进:所有方法生成下旋少(高速切球同时避桌具挑战性),目标放置精度约 30 cm,仅够粗略击球放置。
- 实时性依赖高效 QP 求解:实时可扩展性依赖 DAQP 等嵌入式 QP 求解器,对更大规模或更复杂 OCP 的计算成本有待验证。
- 专用领域验证:主要在乒乓球场景验证,其他机器人任务的泛化能力需进一步实验。
8. 总结
FAOC 是一个将 RL 动作从静态凸集映射到状态相关可行参数集的控制框架。其五大贡献环环相扣:OCP 可行性的拓扑刻画(引理 1);可逆可行动作映射(算法 1、命题 1);几何畸变缓解(面积匹配与线性变换);隐式定义集合的可处理性(直接从约束计算内部点与形状矩阵);以及在机器人乒乓球中的验证——使物理机器人能在官方 ITTF 比赛中与职业级选手竞技并获胜。实验证实 FAOC 通过无缝结合严格可达性感知与卓越的轨迹段可控性,一致超越现有 RL-OC 架构。核心洞见是:与其让 RL 在不可行动作中碰壁,不如用可逆映射将 RL 的自由限定在 OC 的可行域内——安全与灵活不再对立。
flowchart TD
A["RL 策略 π_θ
观测 157 维状态"] --> B["抽象动作 ā ∈ Ā ⊂ R^n
(静态凸集)"]
B --> C["FAOC 可逆映射 M"]
D["OCP 约束
位置/速度/加速度/加加速度"] --> E["可行参数集 P(x)
(状态相关,紧,实心,凸)"]
E --> C
C --> F["可行参数 p ∈ P(x)"]
F --> G["参数化 OCP 求解"]
G --> H["最优轨迹 z*
32 个开环设定点"]
H --> I["低层 1kHz 关节控制器"]
I --> J["8-DoF 机器人执行"]
J --> A



