Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

人形机器人多智能体强化学习MARL

基于多智能体强化学习的协作跳长绳

提出 Marope 多智能体强化学习框架,让多台 Unitree G1 人形机器人协作跳长绳:下层去中心化 MARL 学习摇绳操作,上层集中调度策略协调执行节奏,并融入多样跳跃策略提升对不同玩家风格的泛化,仿真与真机实验均优于基线。

Zihao Wang, Shijie Peng, Kerui Wu, Yu Huang, Ruiqi Xue, Dong Liu, Tian Xu, Lei Yuan, Yang Yu2026年6月6日3 分钟阅读
EN

论文信息

  • 原标题:Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning
  • 作者:Zihao Wang, Shijie Peng, Kerui Wu, Yu Huang, Ruiqi Xue, Dong Liu, Tian Xu, Lei Yuan, Yang Yu(南京大学 计算机软件新技术全国重点实验室 / 人工智能学院)
  • 发表时间:2026-06-06 · arXiv:2606.08064 [cs.RO]
  • 链接arXiv 论文 · 项目主页
  • 代码状态:暂未开源(项目主页提供视频演示,未附代码仓库链接)
  • 实验平台:Unitree G1(29 自由度)· Isaac Lab 大规模并行仿真 + 光学动捕真机部署

一句话总结

Marope 是首个多人形机器人协作跳长绳系统:用分层多智能体强化学习让两台 Unitree G1 协作摇动一根可变形长绳,上层集中调度策略实时跟随跳跃者节奏,再借助基于 IPM 的多样性内在目标自动发现多样玩家行为,使整套系统能适应风格迥异的跳跃者。

研究背景与动机

让机器人复现人类的敏捷运动,一直是具身智能的核心目标之一。近年来"人形机器人体育"成为一个活跃的测试床:跑步、立定跳远、跑酷、乒乓球、羽毛球、网球相继被攻克。这些任务之所以有价值,一方面因为体育在人类生活中的普及度和观赏性,另一方面因为它们对动态全身控制提出了极端要求——高速、平衡、精确时序缺一不可。

但跳长绳与已有的人形体育任务存在三点本质差异。第一,它天然是多智能体任务:两名摇绳者必须通过各自的全身控制共同产生一致的绳体运动,同时各自保持平衡与稳定足部接触,任何一方的失误都会立刻破坏整根绳的运动。第二,绳子是可变形且欠驱动的对象,其中间构型无法被直接控制,这使得一次性轨迹回放或盲动作模仿(blind motion tracking)都不足以完成可靠摇绳——论文实验中的开环基线恰好证实了这一点。第三,成功跳绳依赖绳子旋转相位与跳跃者跳跃相位的精确时间同步,微小的相位错配就会导致绳打人或者跳跃失败;而在开放世界里,不同玩家的跳跃节奏与风格千差万别且事先未知。

现有的人形体育方法几乎都采用单智能体范式:一个集中式学习框架控制单台机器人完成孤立的运动技能。多智能体强化学习(MARL)虽然在其他领域已有积累,但面临联合状态-动作空间随智能体数量指数膨胀的"维度灾难",通常借助值分解或去中心化策略梯度把高维联合空间化为可解的低维表示。把这些技术搬到"两台人形机器人共同操纵一根柔性绳并配合第三名参与者"的场景,此前尚无人做过。

因此,协作跳长绳呼唤一种新的学习框架:既要协调多台人形机器人、闭环操纵柔性绳,又要适应多样化的跳跃行为。这正是 Marope 要回答的问题。作者声称这是第一个多人形机器人协作跳长绳系统,把人形体育从单智能体运动技能扩展到了需要紧密协同的多机器人场景。

预备知识:部分可观马尔可夫博弈

论文把协作跳长绳形式化为部分可观马尔可夫博弈 $\mathcal{M}=\langle\mathcal{N},\mathcal{S},\{\mathcal{A}^{i}\}_{i\in\mathcal{N}},P,\{R^{i}\}_{i\in\mathcal{N}},\gamma,\{\Omega^{i}\}_{i\in\mathcal{N}},\mathcal{O}\rangle$:$\mathcal{N}$ 是参与智能体集合,$\mathcal{S}$ 是全局状态空间,每个智能体 $i$ 拥有自己的动作空间 $\mathcal{A}^{i}$ 与观测空间 $\Omega^{i}$。每个时刻,智能体只能拿到部分观测 $o_{t}^{i}$,执行联合动作后获得各自奖励 $r_{t}^{i}=R^{i}(s_{t},\bm{a}_{t})$,目标是学出策略 $\pi^{i}(a_{t}^{i}\mid o_{t}^{i})$ 最大化折扣回报 $\mathbb{E}[\sum_{t}\gamma^{t}r_{t}^{i}]$。这个形式化强调了"去中心化执行"的约束:每台机器人决策时看不到全局状态。

绳子的仿真方式也值得说明:在 Isaac Lab 中用 $N$ 个小型刚性胶囊体(capsule)串接、以被动驱动的球关节连接来近似真实绳的物理属性,绳的两端分别固定在两名摇绳者的腕部连杆(拆除了手部)。真机侧则用光学动捕系统获取绳上反光标记点、机器人基座位姿与玩家关键身体部位位置。摇绳者拆掉手部、以腕部直接持绳的设定,让"绳-机"接口在仿真与真机间保持一致。

方法详解

图1:Marope 总览。(a) 多人形机器人跳长绳任务管线;(b) 分层协调框架;(c) 低层去中心化摇绳策略经 MARL 训练;(d) 基于 IPM 多样性内在目标发现多样玩家行为,提升高层调度策略的泛化性。

Marope 由三个部分组成:低层去中心化摇绳策略 $\pi^{\text{manip}}$、高层集中调度策略 $\pi^{\text{sched}}$,以及为训练提供多样化"对手"的多样性玩家发现机制。三者按"先技能、后协调、再泛化"的顺序训练,推理时则由高层向低层下发指令构成级联。

1. 摇绳建模:不指定绳的轨迹,只指定运动的不变量

设两台摇绳机器人的基座位置为 $\mathbf{p}_{\text{base}}^{1}$、$\mathbf{p}_{\text{base}}^{2}$,论文定义绳的参考中心与旋转轴为:

$$\mathbf{p}^{\text{c}}=\Pi_{xy}\left(\frac{\mathbf{p}_{\text{base}}^{1}+\mathbf{p}_{\text{base}}^{2}}{2}\right)+[0,0,\hat{h}]^{\top},\quad\mathbf{e}^{\text{r}}=\frac{\Pi_{xy}(\mathbf{p}_{\text{base}}^{2}-\mathbf{p}_{\text{base}}^{1})}{\lVert\Pi_{xy}(\mathbf{p}_{\text{base}}^{2}-\mathbf{p}_{\text{base}}^{1})\rVert_{2}}$$

其中 $\Pi_{xy}$ 是水平投影算子(丢弃 $z$ 分量),$\hat{h}$ 是目标旋转高度。目标旋转角速度写作 $\hat{\bm{\omega}}=\hat{\omega}\cdot\mathbf{e}^{\text{r}}$,$\hat{\omega}$ 是带符号标量。这套定义保证了摇绳行为具有 SE(2) 机动性:两台机器人可以一边摇绳一边整体平移、转向、重新站位,而不是被钉死在原地。

在此之上,命令空间被设计为 $\mathcal{G}^{\text{manip}}=[\mathcal{G}^{\text{move}},\mathcal{G}^{\text{rope}}]$,其中协同运动分量 $\mathcal{G}^{\text{move}}=[\hat{v}_{x}^{\text{lin}},\hat{v}_{y}^{\text{lin}},\hat{v}_{z}^{\text{ang}}]$ 描述参考中心与旋转轴在世界系下的目标线速度与角速度,摇绳分量 $\mathcal{G}^{\text{rope}}=[\hat{h},\hat{w},\hat{\omega}]$ 描述旋转高度、绳两端目标宽度与摇绳角速度。与"给可变形对象显式指定参考轨迹"相比,这个六维抽象抓住了跳长绳中绳体运动的关键模式:速度分量控制整体站位,$\hat{h}$ 与 $\hat{w}$ 约束绳扫过的区域,$\hat{\omega}$ 指定摇绳节奏。这是全文最重要的设计取舍——控制绳的"运动不变量"而非"瞬时形状"。

2. 对称观测与多智能体策略优化

每台摇绳机器人 $i\in\{1,2\}$ 的观测由三部分组成:命令观测 $o^{\text{cmd},i}=[\hat{v}_{x}^{\text{lin},i},\hat{v}_{y}^{\text{lin},i},\hat{v}_{z}^{\text{ang}},\hat{h},\hat{w},\operatorname{sign}(i)\cdot\hat{\omega}]$,其中线速度表示在各自的 yaw-only 基座系中,角速度乘以 $\operatorname{sign}(i)$(1 号机取正、2 号机取负)以保证两名摇绳者的观测语义对称;绳形态历史 $o^{\text{rope},i}$ 拼接离散绳上 $m$ 个采样点在基座系中的位置,采样下标 $k_{1:m}^{i}$ 在每个回合开始时随机抽取、并按到"本侧绳端"的索引距离排序;本体感知历史 $o^{\text{proprio},i}=[\bm{\omega}^{\text{b}},\mathbf{g}^{\text{b}},\mathbf{q},\dot{\mathbf{q}},\tilde{a}]$ 包含基座角速度、基座系重力投影、关节位置/速度与上一时刻动作。

策略输出动作 $a_{t}\in\mathbb{R}^{N_{\text{joints}}}$,经 $\hat{\mathbf{q}}_{t}=\mathbf{q}_{\text{default}}+\bm{\alpha}\odot a_{t}$ 换算为所有关节的目标位置交给 PD 控制器。为保证真机上的实时去中心化推理,训练采用 MAPPO 算法与"集中训练、去中心化执行"(CTDE)范式,奖励由任务项(跟踪线速度、角速度、宽度、旋转)与正则项(动作变化率、身体姿态、关节限位、足部滑动、非预期接触等)组成。

3. 跳跃节奏表示与跳跃策略

要让玩家跳起来,先要有一个可靠的跳跃策略。论文把跳跃建模为"地面-空中"交替的周期过程,每个周期用元组 $\mathcal{G}^{\text{rhythm}}=\langle\nu,\kappa,\varphi,c=\mathbf{1}(\varphi\geq\kappa)\rangle$ 描述:$\nu=1/T$ 是由周期长度导出的频率,$\kappa=T^{\text{ground}}/T$ 是地面阶段占比,$\varphi\in[0,1)$ 是连续相位变量,按 $\varphi\leftarrow\varphi+\nu\Delta t$ 前进并在新周期归零,$c$ 是二值时钟。跳跃策略 $\pi^{\text{jump}}(a_{t}\mid[\mathcal{G}^{\text{rhythm}},o_{t-H+1:t}^{\text{proprio}}])$ 的核心目标就是让足部接触掩码与二值时钟 $c$ 对齐,从而涌现出周期性跳跃。

4. 高层集中调度:让绳的相位追着玩家的相位走

低层策略只会按命令摇绳,真正"配合玩家"靠高层调度策略 $\pi^{\text{sched}}(\mathcal{G}^{\text{manip}}\mid o_{t}^{\text{sched}})$。其观测 $o_{t}^{\text{sched}}=[\mathcal{G}^{\text{rhythm}},o_{t-H+1:t}^{\text{rope}},o_{t-H+1:t}^{\text{player}}]$ 汇聚三路信息:跳跃节奏信号、绳形态历史,以及玩家状态——玩家用有向包围盒(OBB)表示,包含位置 $\mathbf{p}_{t}^{\text{obb}}$、朝向 $\mathbf{R}_{t}^{\text{obb}}$ 与尺寸 $\Delta_{t}^{\text{obb}}$,绳与玩家观测都统一表示在旋转中心坐标系中。

调度策略的核心目标是节奏同步加防碰撞。为度量节奏,论文先估计绳绕轴 $\mathbf{e}^{\text{r}}$ 的旋转相位:用最小二乘把绳上各点速度拟合为一个刚体角速度

$$\bar{\bm{\omega}}=\arg\min_{\bm{\omega}}\sum_{i=1}^{N}\lVert\mathbf{v}^{\text{rope}}[i]-\bm{\omega}\times(\mathbf{p}^{\text{rope}}[i]-\mathbf{p}^{\text{c}})\rVert_{2}^{2}$$

再把每个绳点变换到以 $\mathbf{e}^{\text{r}}$ 为基准的局部坐标系 $\xi_{i}=[\mathbf{e}^{\text{r}},\mathbf{e}^{z}\times\mathbf{e}^{\text{r}},\mathbf{e}^{z}](\mathbf{p}^{\text{rope}}[i]-\mathbf{p}^{\text{c}})$,取相位平均:

$$\bar{\theta}^{\text{rope}}=\frac{1}{2\pi N}\sum_{i=1}^{N}\operatorname{atan2}(\operatorname{sgn}(\langle\bar{\bm{\omega}},\mathbf{e}^{\text{r}}\rangle)\xi_{i}^{y},-\xi_{i}^{z})$$

理想情况下,旋转相位 $\bar{\theta}^{\text{rope}}$ 应当在玩家跳到最高点(即 $\varphi=1-\frac{1-\kappa}{2}$)时周期性过零,绳才能恰好从脚下掠过。因此目标旋转相位 $\hat{\theta}^{\text{rope}}$ 被设为比跳跃相位 $\varphi$ 超前 $\frac{1-\kappa}{2}$,相位跟踪误差与防碰撞等奖励项一起优化调度策略。这个"相位超前量由地面阶段占比决定"的设计,把物理直觉直接编码进了奖励。

5. 多样性玩家发现:用 IPM 制造"难缠的对手"

调度策略如果只和单一风格的跳跃策略对练,上线后遇到真人就会水土不服。论文给跳跃策略增加连续潜变量 $z\in\mathbb{R}^{d_{\text{latent}}}$(先验为标准高斯 $\mathcal{N}(\mathbf{0},\mathbf{I})$),并用一个多样性内在目标逼不同 $z$ 产生真正不同的行为:

$$\max_{\pi^{\text{jump}}}\gamma_{\mathcal{F}}\Big(p(x,z),p(x)p(z)\Big)=\sup_{f\in\mathcal{F}}\mathbb{E}_{z\sim p(z),x\sim\pi^{\text{jump}}(z)}\Big[f(x,z)-\mathbb{E}_{\tilde{z}\sim p(z)}f(x,\tilde{z})\Big]$$

这里 $\gamma_{\mathcal{F}}$ 是函数类 $\mathcal{F}$ 上的积分概率度量(IPM),$x$ 是描述策略访问状态的特征(如局部系末端位姿)。直观含义是:最大化"状态特征与潜编码联合分布"相对"两者边缘分布乘积"的依赖程度,即让 $z$ 真正改变行为。取 $\mathcal{F}$ 为 1-Lipschitz 函数类时,该目标恰等价于 Wasserstein-1 距离。由于在整个函数类上求上确界不可行,论文引入可学习的度量模型 $\phi$ 并用谱归一化保证 Lipschitz 连续性:

$$\max_{\phi}\mathbb{E}_{z\sim p(z),x\sim\pi^{\text{jump}}(z)}\Big[\phi(x,z)-\mathbb{E}_{\tilde{z}\sim p(z)}\phi(x,\tilde{z})\Big]$$

多样性内在奖励与任务奖励加权合成 $r_{t}^{\text{div}}=r_{t}^{\text{task}}+\beta\phi(x_{t},z)$,并配合课程机制:只有当跳跃策略的任务表现达到预设阈值后才启用多样性项,防止多样性探索干扰主任务。训练完成后,从多样跳跃策略中随机采潜编码得到的各种"玩家",作为调度策略训练时的对手,相当于自动数据增广。

6. 训练与推理的级联结构

graph TB
    subgraph P1[Stage 1 多样玩家发现]
        A["潜条件跳跃策略 pi_jump"] --> B["IPM 多样性目标
Wasserstein-1 + 谱归一化"] B --> C["多样跳跃行为
作为训练对手"] end subgraph P2[Stage 2 低层摇绳技能] D["紧凑命令 G_manip
中心 轴 角速度 宽度"] --> E["对称观测
命令 + 绳形态 + 本体感知"] E --> F["MAPPO 集中训练
去中心化执行"] end subgraph P3[Stage 3 高层调度] G["节奏相位 + 绳相位
+ 玩家 OBB"] --> H["集中调度策略 pi_sched"] end C --> H H --> I["自适应 G_manip 指令"] I --> D F --> J["Unitree G1 真机部署
MoCap 观测 + DDS 通信"]

训练分三阶段:先交替优化跳跃策略与度量模型(发现多样性),再用 MAPPO 预训练低层摇绳策略,最后以多样玩家为对手训练高层调度策略(算法 1)。推理时则是自顶向下的级联:节奏信号与感知进入调度策略,调度策略输出 $\mathcal{G}^{\text{manip}}$,低层策略据此产生关节指令,两台机器人去中心化执行。

实验结果

实验设置与 Sim2Real

仿真实验在 Isaac Lab 的大规模并行环境中进行;真机平台为 Unitree G1(29 自由度)。真机观测依赖光学动捕:绳的每一侧贴 4 个反光标记点(共 8 个可观测点,与仿真中 $m=8$ 的绳形态观测设计保持一致),玩家身上贴标记点以重建关键部位位置并计算 yaw-only OBB,节奏信号与动捕数据经 DDS 服务分发到各机器人计算节点。

Sim2Real 迁移依赖系统的域随机化(论文表 4):绳侧随机化胶囊数量 $N\sim\mathcal{U}(80,100)$、密度(默认值的 0.8–1.2 倍)、弯曲刚度系数 $\mathcal{U}(10,40)$、弯曲阻尼 $\mathcal{U}(2,10)$、扭转刚度 $\mathcal{U}(4,16)$、扭转阻尼 $\mathcal{U}(1,5)$;机器人侧随机化静/动摩擦系数、恢复系数、连杆质量(0.9–1.1 倍)、躯干质心偏移(±2.5/±5/±5 cm),并以 $\mathcal{U}(1,3)$ 秒的间隔施加随机推扰($v_x,v_y\in\mathcal{U}(-0.5,0.5)$ m/s);观测噪声覆盖本体感知(重力投影、角速度、关节位置/速度)、绳形态(±0.1 m)与玩家 OBB(位置、6D 朝向、尺寸)。

摇绳操作分析(表 1)

指标OursSingle AgentOpen Loopw/o Segment Sampling
旋转跟踪误差 $E_{\text{rot}}$ ↓1.719±0.3322.733±0.5396.754±2.0182.223±0.484
宽度跟踪误差 $E_{\text{wid}}$ ↓0.063±0.0110.136±0.0300.284±0.1350.087±0.038
线速度跟踪误差 $E_{\text{lin}}$ ↓0.103±0.0110.222±0.0520.199±0.0490.121±0.024
角速度跟踪误差 $E_{\text{ang}}$ ↓0.109±0.0410.114±0.0390.112±0.0400.110±0.041
动作变化率 ↓1.349±0.1301.526±0.2070.945±0.0971.300±0.142
足部滑动 ↓0.040±0.0030.122±0.0100.082±0.0120.053±0.004

表1:摇绳操作仿真实验(1000 回合统计)。Single Agent 用单策略同时控制两台机器人;Open Loop 录制本文策略轨迹后用动作模仿开环复现。

三个对比各有指向。Single Agent 把两台机器人的观测与动作拼接后交给单一策略,结果所有任务指标全面落后——冗余且高度耦合的观测-动作空间拉低了优化效率,这为"去中心化分治"提供了直接证据。Open Loop 的动作最平滑(动作变化率 0.945 优于本文的 1.349),但旋转跟踪误差暴涨到 6.754(本文 1.719),宽度误差也接近 4.5 倍:开环复现完全无法应对绳这种可变形对象的复杂动力学,闭环强化学习是必需品。w/o Segment Sampling 用均匀间隔的绳观测点替代随机分段采样,各项指标温和退化,说明随机分段采样提升了策略对"非均匀绳观测"的鲁棒性——而这恰恰更接近真机动捕的传感条件。足部滑动 0.040 全场最低,则说明摇绳过程中两名摇绳者的站位稳定性最好。

玩家协调分析(表 2)

指标Oursw/o Schedulingw/o Player Diversity
绳-玩家重叠率 ↓0.090±0.0490.392±0.1400.120±0.094
相位跟踪误差 ↓0.397±0.1151.092±0.2730.414±0.155
玩家跟踪误差 ↓0.116±0.0220.182±0.3600.172±0.021
完成成功率 ↑0.787±0.2040.358±0.2070.751±0.216

表2:玩家协调仿真实验。w/o Scheduling 关闭高层调度、改用时钟频率计算原地摇绳角速度;w/o Player Diversity 用无多样性目标的跳跃策略作训练对手。

最具说服力的是 w/o Scheduling 一组:关掉高层调度后,绳-玩家重叠率从 0.090 恶化到 0.392(绳打人的时间步占比翻了四倍多),完成成功率从 78.7% 跌到 35.8%。这说明"用时钟频率换算角速度"的简单规则组合根本造不出跳长绳所需的精细协同——调度策略对节奏的自适应调整是不可替代的。w/o Player Diversity 的退化相对温和但方向一致(成功率 75.1%、相位误差 0.414),验证了多样化训练对手对泛化的贡献。评估时特意使用"随机采潜编码的多样跳跃策略"作为玩家,正是为了模拟开放世界中风格未知的参与者。

可视化与真机部署

论文用 PCA 可视化了跳跃策略访问的局部系末端位姿:加入多样性目标后,行为分布显著扩张,证明 IPM 目标确实在"发现"而非"假装"多样。相位跟踪曲线则显示,偏移 $(1-\kappa)/2$ 后的绳旋转相位与跳跃节奏相位能长时间保持小误差同步——高层调度的"追相位"行为肉眼可见。

图2:真机部署的四个场景(论文图 3):两台人形机器人纯摇绳、单台人形与人类协作摇绳、与人类跳跃者协调、与人形跳跃者协调。

真机实验覆盖四个场景:纯摇绳(两台 G1 协作,以及一台 G1 与一名人类协作),以及带跳跃者的完整跳绳(玩家分别为人类与人形机器人)。人类玩家与人形玩家的跳跃风格、身体形态差异巨大,Marope 均能成功协调,验证了多样性训练带来的跨玩家适应力;而"单机+人类摇绳"场景还顺带展示了低层摇绳技能本身对人类伙伴的鲁棒性。

图3:贴有反光标记点的真机长绳(论文图 5):每侧 4 个、共 8 个可观测点,与仿真中 m=8 的绳形态观测设计对齐。

局限性

作者自述:其一,整个框架为跳长绳这一特定任务定制,无法直接迁移到其他协作型人形任务;其二,目前只考虑单玩家设定,扩展到多玩家乃至花式跳绳(如 double dutch 双绳)仍是开放问题;其三,真机依赖外部光学动捕,未来需要用机载传感器在开放环境中与多样人类伙伴协作。

进一步判断:其一,玩家状态以动捕重建的 OBB 直接喂给调度策略,感知环节并未纳入学习闭环,动捕误差或遮挡会直接传导为观测噪声(虽然训练时对 OBB 加了噪声随机化);其二,仿真中最优配置的完成成功率为 78.7%,仍意味着约五分之一的跳跃失败,真机上的稳定性只会更低;其三,奖励函数包含十余个人工设定权重的项(论文表 8),迁移到新平台或新绳参数时大概率需要重新调参;其四,胶囊链是对绳动力学的近似,高速摇绳下的空气阻力与绳体形变差异可能成为 sim-real gap 的来源。

总结与展望

Marope 把人形体育从"单机炫技"推进到了"多机协同":两台机器人、一根不可直接控制的柔性绳、一名风格未知的跳跃者,三个难点被一套分层框架逐一拆解。其方法论价值在于三点可复用的设计:用紧凑命令空间抽象可变形对象的操作目标(控制运动不变量而非瞬时形状)、用 CTDE 多智能体训练支撑真机去中心化执行、用 IPM 多样性内在目标自动生成训练对手以提升协调策略的泛化。这套"低层技能复用 + 高层调度 + 多样性增广"的范式,对未来涉及共享柔性对象的多机器人协作任务——抬运、拉绳、乃至双绳花式跳绳——都有借鉴意义。

金句

绳子不听指令,只服从物理——Marope 不规定绳的形状,而是控制它运动的不变量:中心、轴、角速度与宽度。

相关论文

人形机器人被动移动座椅上的坐姿移动研究

人形机器人被动移动座椅上的坐姿移动研究

研究人形机器人在被动椅上的全向坐姿移动。策略仅用本体感知,速度跟踪优于站立。分析了正则化对收敛与误差的影响。

人形机器人Humanoid坐姿移动2026年8月28日
LAC:人形机器人全身线性与角度柔顺控制

LAC:人形机器人全身线性与角度柔顺控制

LAC 提出通用人形全身柔顺控制器:在人体交互数据接触帧上施加采样的力/力偶扰动合成大规模柔顺响应数据,经教师-学生强化学习训练单一策略,实现对上半身外力的线性与角度柔顺、刚度全程单调调制,并在仿真、真机与遥操作移动操作中验证。

人形机器人全身控制柔顺控制2026年8月26日
GigaBrain-WBC:人形机器人全身控制的行为世界模型

GigaBrain-WBC:人形机器人全身控制的行为世界模型

首个用于人形机器人全身控制的行为世界模型(BWM),训练因果Transformer联合预测下一步动作、状态和潜在行为指令分布,使策略网络同时建模环境对行为的影响。自动地形标注管线从重定向运动中恢复3D接触几何,部署时检测不合理指令并回退到已学行为,在四项测试中成功率最高(地形交互81.3%、不合理指令83.1%、跌倒恢复99.3%),Unitree G1检查点可迁移至Maker L01机器人。

人形机器人Humanoid世界模型2026年8月18日
LATENT:从不完美人类动作学习人形网球技能

LATENT:从不完美人类动作学习人形网球技能

LATENT 以碎片化、不完整的人类网球动作数据为先验,经修正与组合学出可稳定击球的人形策略,部署到 Unitree G1,能与人类进行多拍对拉。

LATENT人形机器人网球2026年3月13日