Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

PaperSimulation仿真

基于超网络的自适应多任务制导、导航与控制学习

提出基于超网络的自适应多任务制导、导航与控制学习方法,在多任务间共享与特化策略,提升无人机/机器人多任务GNC的效率。

Ricard Marsal I Castan, Aman Arora, Antoine Richard, Andrej Orsula, Cédric Pradalier, Miguel A. Olivares-Méndez2026年7月27日3 分钟阅读
EN

1. 论文概览:超网络驱动的多任务制导导航控制

Hyper-GNC 由 Ricard M. Castan、Aman Arora、Antoine Richard、Andrej Orsula、Cédric Pradalier 和 Miguel A. Olivares-Méndez 于 2026 年 7 月提出,是一个面向轨道自由飞行机器人的多任务强化学习框架。其核心思想是用超网络将物理启发的任务语义嵌入映射为共享 Actor-Critic 策略的动态权重,使单一紧凑控制器同时掌握速度跟踪、对接、巡检和带障碍物导航四项 GNC 任务。传统方案为每项任务维护独立策略,架构脆弱且随需求演进灵活性受限;Hyper-GNC 的连续语义嵌入空间允许控制器在部署时零样本泛化到训练集之外的新任务组合(如安全带障对接、稳定、点导航),无需任何重训练。大量实验表明,Hyper-GNC 的样本效率可与单任务专家媲美,且在显著惯性扰动和外部力矩下保持稳定性。框架在 Int-Ball2 仿真与实验室浮动平台真机均得到验证。

Hyper-GNC 概览

2. 核心问题:GNC 任务间的梯度冲突与行为组合

航天器任务剖面要求根本对立的控制律:对接需软动力学、精确位姿对齐和目标附近激进阻尼制动;巡检和速度跟踪则需刚性跟踪参考向量并保持动量。朴素共享策略(如标准 PPO、多 Critic PPO)将这些梯度平均化,导致控制器对接时过于激进、跟踪时又过于迟缓。更关键的是,任务空间中存在大量未见组合(如带障对接、故障下稳定),为每种组合训练独立策略计算不可行,而使用离散任务 ID 的标准多任务方法因将任务视为孤立类别而非连续行为流形上的点,无法合成这些新行为组合。该局限直接削弱操作灵活性:任何未预见场景都需地面干预更新控制器。此外,3D 轨道策略在地面测试台验证存在严重域鸿沟。

3. 方法:Hyper-GNC 框架

3.1 上下文感知权重调制

Hyper-GNC 采用分离架构:(a) 主网络处理机器人观测;(b) 超网络基于任务上下文生成主网络参数。主网络作为 Actor-Critic,Actor 有两个输出头参数化 Beta 分布(形状参数 $\alpha$ 和 $\beta$)。超网络挂接到每个自适应层,输入语义任务嵌入 $e_k \in [0,1]^5$,经共享 MLP(语义编码器)处理后馈入四个调制头:权重缩放 $\Psi_{\text{scale}}^W$、权重加性 $\Psi_{\text{add}}^W$、偏置缩放 $\Psi_{\text{scale}}^b$、偏置加性 $\Psi_{\text{add}}^b$。

设 $z \in \mathbb{R}^{d_{in}}$ 为自适应层输入,$\mathbf{W}_{\text{base}}, \mathbf{b}_{\text{base}}$ 为静态权重偏置,层输出 $y \in \mathbb{R}^{d_{out}}$ 用动态权重计算:

$$y = \mathbf{W}_{\text{dyn}}(e_k)\,z + \mathbf{b}_{\text{dyn}}(e_k) \tag{2}$$

动态参数通过残差缩放-平移调制从基参数导出:

$$\mathbf{W}_{\text{dyn}}(e_k) = \mathbf{W}_{\text{base}} \times (1 + \Psi_{\text{scale}}^W(e_k)) + \Psi_{\text{add}}^W(e_k) \tag{3}$$ $$\mathbf{b}_{\text{dyn}}(e_k) = \mathbf{b}_{\text{base}} \times (1 + \Psi_{\text{scale}}^b(e_k)) + \Psi_{\text{add}}^b(e_k) \tag{4}$$ Hyper-GNC 框架

3.2 Rank-1 向量分解

为高效生成调制矩阵 $\Psi \in \mathbb{R}^{d_{out}\times d_{in}}$,每个超网络头预测两个向量——查询向量 $\mathbf{q}(e_k) \in \mathbb{R}^{d_{out}}$ 和键向量 $\mathbf{k}(e_k) \in \mathbb{R}^{d_{in}}$,调制矩阵为其外积:

$$\Psi(e_k) = \frac{\mathbf{q}(e_k) \times \mathbf{k}(e_k)}{\sqrt{d_{\text{out}}}} \tag{5}$$

对 $[32 \times 32]$ 层,满秩调制头需预测 1024 值/头,4 头共 4096 额外参数;Rank-1 分解将键 $\mathbf{k} \in \mathbb{R}^{32}$ 和查询 $\mathbf{q} \in \mathbb{R}^{32}$ 降至 64 值——16 倍压缩,同时保持完整的缩放-平移表达能力。这与 LoRA 中秩 1 更新已被证明足够进行参数高效适配类似。稳定初始化方面,Key/Query 头权重以近零方差($\sigma=10^{-4}$)初始化,缩放头输出偏移 $+1.0$,使初始 $\Psi_{\text{scale}} \to 1, \Psi_{\text{add}} \to 0$,即 $\mathbf{W}_{\text{dyn}} \approx \mathbf{W}_{\text{base}}$,类似 ResNet 残差 $\gamma$ 初始化与 FiLM 条件化。

3.3 物理启发的语义任务嵌入

框架将所有任务目标投影到连续语义流形上,定义上下文向量 $e_k \in [0,1]^5$ 为归一化物理控制优先级:

$$e_k = [\alpha_{pos}, \alpha_{att}, \alpha_{vel}, \alpha_{brake}, \alpha_{safe}] \tag{6}$$

其中 $\alpha_{pos}$ 和 $\alpha_{att}$ 管理位置与姿态误差,$\alpha_{vel}$ 决定速度保持,$\alpha_{brake}$ 启用负加速度,$\alpha_{safe}$ 激活避障行为。该嵌入类似经典任务设计中的 GNC 优先级向量,五维直接映射到标准 GNC 任务的独立控制目标。训练时每维从均匀分布采样(连续采样正则化),防止策略过拟合离散任务 ID。推理时可组合未见行为,如设 $\alpha_{brake}=1$ 且 $\alpha_{safe}=1$ 合成"安全带障对接"。部署时 $e_k$ 可由操作员、上层任务规划器设定或按任务阶段硬编码,无需在线学习或重训练。

3.4 Sim-to-Real 迁移与域随机化

在 Isaac Lab 仿真器中修改以在 4096 并行环境(每任务 1024)同时训练四项策略,PPO 在每次迭代跨所有任务计算更新。Int-Ball2 使用连续动作空间,浮动平台使用二值动作空间;为适应 sim-to-real 迁移,将策略输出从 Beta 分布切换为高斯分布——Beta 分布动作集中在边界需 $\alpha_\theta(s) \to \infty$ 或 $\beta_\theta(s) \to \infty$,产生梯度不稳定。部署时使用 $\mathcal{U}(0.0,0.15)$ 质量与质心偏移及 $\mathcal{U}(0.0,0.2)$ 扭矩力进行域随机化。

Int-Ball2 GNC 任务收敛对比

4. 实验

4.1 四任务性能对比

在 Int-Ball2 仿真平台上对比单任务 RL、多任务 RL、PCGrad、多 Critic 和 Hyper-GNC。评估指标包括位置误差 $e_p$、姿态误差 $e_o$、线速度误差 $e_v$、角速度误差 $e_\omega$ 和成功率 SR。Hyper-GNC 在样本效率上与单任务专家相当,且部署评估中常超越过拟合的专家。

方法对接 $e_p$[m]↓巡检 $e_o$[rad]↓导航 SR[%]↑参数量
Single-Task RL0.0170.10685.5305K
Multi-Task RL0.0360.23379K
Hyper-GNC0.0170.10685.579K

单任务专家在训练回报上略高,但超网络在部署评估中始终优于它们——这归因于多任务架构的固有正则化效应:专家易过拟合特定训练种子或利用奖励函数漏洞,而超网络被迫学习跨任务共享的广义控制流形。

四任务性能对比表

4.2 行为组合与零样本泛化

测试模型在训练集之外的新行为组合上的表现,包括带障对接、稳定和点导航。基于语义流形的组合能力使 Hyper-GNC 在所有新任务配置上具竞争力,相比高斯方法在所有任务上实现 50.97% 提升。Hyper-GNC 无需任务标识符——必要任务信息已由超网络捕获,而多 Critic 和 PCGrad 方法受益于 one-hot 编码或语义嵌入。

方法带障对接 $e_p$↓稳定 $e_\omega$↓点导航 $e_p$↓
Single-Task RL0.0570.0370.056
Hyper-GNC0.0570.0370.056
组合任务性能表

4.3 真机实验与 Sim-to-Real

在实验室浮动平台卫星模拟器上进行真机验证,每任务三次独立运行。定量结果证明 Hyper-GNC 框架成功迁移到物理硬件。域随机化显著缩小了 sim-to-real 差距,尤其在带障导航和对接任务上。训练使用单块 RTX 4090,多任务训练仅 291 分钟,而四项单任务训练合计需 783 分钟。

浮动平台鲁棒性分析

5. 局限性

  • 感知假设:当前框架聚焦低层控制器,大多观测仅需本体感知,但带障导航等复杂任务假设环境信息完美,缺少感知能力集成。
  • 任务多样性有限:当前任务集聚焦 6-DOF 刚体控制,未来轨道任务如主动碎片清除或在轨服务需协调机械臂,超网络在多体耦合动力学下的扩展能力待验证。
  • 真机部署范围:虽然仿真使用高保真 Int-Ball2 平台,但物理部署目前限于实验室卫星模拟器,真实轨道环境验证尚未进行。

6. 总结

Hyper-GNC 通过将连续语义任务流形经超网络架构映射到共享 Actor-Critic 策略权重,成功克服了异构任务目标训练单智能体时的梯度干扰。框架可同时掌握对接、速度跟踪、巡检和避障四项任务剖面,样本效率与单任务专家相当,且支持零样本行为组合。Rank-1 向量分解使超网络参数量大幅降低(16 倍压缩),适合飞行硬件部署。Int-Ball2 仿真和浮动平台真机验证了鲁棒性和效率。核心洞见是:GNC 任务不应被当作离散类别,而应是连续物理优先级流形上的点——超网络将任务语义直接编织进控制器权重,使一个紧凑模型如同拥有了可随时重塑的通用控制律。

flowchart TD
    A["语义任务嵌入 e_k = α_pos, α_att, α_vel, α_brake, α_safe"] --> B["共享语义编码器 MLP"]
    B --> C["调制头: 权重缩放/加性, 偏置缩放/加性"]
    C --> D["Rank-1 分解: 查询 q × 键 k → 调制矩阵 Ψ"]
    D --> E["残差缩放-平移: W_dyn = W_base × 1 + Ψ_scale + Ψ_add"]
    E --> F["自适应层: y = W_dyn z + b_dyn"]
    F --> G["Actor-Critic 主网络"]
    H["机器人观测 z"] --> F
    G --> I["Beta 分布 α, β → 连续动作 Int-Ball2"]
    G --> J["高斯分布 → 二值动作 浮动平台"]
    I --> K["PPO 跨 4096 并行环境训练"]
    J --> K
    K --> L["域随机化: 质量/质心/扭矩扰动"]
    L --> M["真机部署"]
GNC 任务不应是离散类别,而是连续物理优先级流形上的点——超网络将任务语义直接编织进控制器权重,使一个紧凑模型如同拥有可随时重塑的通用控制律。

相关论文

在仿真中预训练视觉灵巧操作

在仿真中预训练视觉灵巧操作

SPD 让操作员在 VR 头显中直接操控虚拟物体,一周内在 MuJoCo 仿真里采集 75 小时同 embodiment 灵巧操作数据,用流匹配预训练扩散 Transformer;在 56 自由度双臂灵巧平台上仅用 1-2 小时真实示教微调,五项双手任务全面超越从零训练的行为克隆,且历史条件化加短动作块配置从预训练中获益最大。

灵巧操作灵巧手预训练2026年8月16日
FA-RDP:频率自适应反应扩散策略

FA-RDP:频率自适应反应扩散策略

In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to preserve diverse action modes. After contact, geometric constraints and force limits narrow the solution space, while successful execution demands rapid responses to force feedback. However, standard diffusion policies use a fixed inference frequency and sampling steps throughout the episode, forcing a fundamental compromise: low-frequency, multi-step sampling better preserves pre-contact multimodality but responds slowly to force feedback, whereas high-frequency sampling improves reactivity but tends to collapse distinct pre-contact modes. To resolve this tradeoff, we present FA-RDP, a frequency-adaptive reactive diffusion policy. A shared multi-frequency visual-force Transformer predicts action chunks at both low and high frequencies, while a learned multimodality indicator dynamically selects multi-step low-frequency sampling before contact and one-step high-frequency sampling as action ambiguity decreases. We further introduce Manifold Consistency Distillation (MCD), which reparameterizes the diffusion network to predict actions on the robot action manifold while retaining DDPM-based residual supervision. Experiments on three contact-rich manipulation tasks show that FA-RDP achieves the highest success rate while preserving diverse pre-contact trajectory modes. Code and videos are available at https://fa-rdp.github.io.

Paper2026年7月30日
PhiZero:基于物理语言的世界模型

PhiZero:基于物理语言的世界模型

We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.

Paper2026年7月30日
Booster Lab:可部署人形运动学习的数据中心化管线

Booster Lab:可部署人形运动学习的数据中心化管线

将异构运动源(人体演示+仿真采集)转化为可部署的 Booster T1 运动策略,四阶段管线将运动数据视为学习回路可控部分:数据策展→real-to-sim适配→AMP强化学习→跨仿真器验证+部署。

步态优化人形机器人AMP2026年6月26日