Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

机器人学习Robot Learning视觉抽象

机器人通过投影视觉抽象学习交流

机器人通过投影视觉抽象学习交流的研究。

Danyang Yan, Boyuan Wang, Jiaxun Liu, Boyuan Chen2026年7月24日2 分钟阅读
EN

机器人学习通过投影视觉抽象进行交流

论文:Robot Learning to Communicate through Projected Visual Abstractions

作者:Danyang Yan, Boyuan Wang, Jiaxun Liu, Boyuan Chen

机构:杜克大学电气与计算机工程系 / 机械工程与材料科学系 / 计算机科学系

链接arXiv:2607.22434 · 项目主页


一句话总结

本文提出一个能动态表达阴影的机器人系统——使用 21 自由度软皮肤灵巧手和可微阴影自模型,通过任务无关的自我探索学习手部构型到投影阴影外观的映射,给定目标阴影图像或视频后通过梯度搜索优化手部构型并经碰撞感知仿真精炼获得物理可行运动,在手语手势、手影戏和动物运动模仿中验证了机器人通过投影视觉抽象进行交流和视觉叙事的框架。


研究背景与动机

人类经常通过身体抽象进行交流——影子、剪影、反射。这些表示允许观察者在未直接观察物理实体的情况下推断物体、人物、动作甚至情感的信息。然而机器人仍主要局限于通过物理形态表达自身。使机器人能通过投影视觉抽象交流,需要同时推理身体运动和该运动如何转化为观察者感知的外部表示。

影子表演特别引人关注,因为影子直接从身体的几何和运动产生,同时将其转化为根本不同的视觉表示。表演者可以有意操纵三维形态(如手)来生成观察者可识别和解读的二维剪影。许多动物也利用影子作为导航和交流的线索。

投影视觉抽象是指从物理形态产生但与之不同的视觉形式——影子、剪影、反射。使机器人掌握这种能力,意味着它需要理解自身运动如何在外部媒介上产生可被观察者解读的表示。核心挑战在于:机器人需要生成既视觉可识别又物理可控的影子。传统刚性机械手不适合阴影表达——刚性连杆间的间隙允许光线穿透手指,碎片化投影剪影。全软体手虽更顺应但运动精度低、难以建模。人类手影艺术家通过刚性骨骼支撑覆盖软组织实现这一组合——精确运动与顺应接触密封光路。

系统概览图1:机器人手主动生成富有表现力的阴影表演。


方法详解

1. 混合刚软手设计

手部设计图2:机器人手设计。刚性骨骼覆盖顺应性软皮肤,每指四连杆运动链,MCP 关节提供 2 自由度。

每个手指为细长刚性骨架覆盖顺应性泡沫层的混合设计,泡沫通过低填充率 TPU 3D 打印制造。每指为四连杆运动链,近似人手的 DIP、PIP 和 MCP 关节。每个 MCP 关节提供 2 自由度(屈伸和外展内收),加腕关节共 21 自由度。投影设置:聚光灯距手掌中心 3 米,白色背景板距手 1 米后方。

2. 阴影自模型学习

自模型框架图4:阴影自建模框架。(A) 机器人通过电机扰动收集关节-阴影对训练神经网络;(B) 部署时冻结模型,梯度优化关节角匹配目标阴影。

从关节构型到阴影外观的映射难以直接求逆——许多物理不同的手势产生相同或高度相似的二维剪影,直接训练逆模型是不适定的。因此训练前向阴影自模型,从 21 维关节构型 $\bm{\uptheta}_i$ 预测二元阴影图像 $\hat{\mathbf{I}}_i$:

$$ \hat{\mathbf{I}}_i = f_{\text{NN}}(\text{FK}(\bm{\uptheta}_i)), \quad \mathcal{L}_{\text{MAE}} = \|\hat{\mathbf{I}}_i - \mathbf{I}_i\|_1 $$

前向运动学将关节角映射到指尖位置,第 $j$ 指的末端位置为: $$ \mathbf{p}_j = \text{FK}(\bm{\uptheta}_j) = \mathbf{T}_{\text{wrist}} \prod_{k=1}^{4} \text{Exp}(\bm{\uptheta}_{j,k}) \, \mathbf{p}_{\text{tip}} $$ 其中 $\bm{\uptheta}_{j,k}$ 为第 $j$ 指第 $k$ 关节角,$\text{Exp}(\cdot)$ 为指数坐标变换。其中 $\text{FK}$ 为解析正向运动学,$f_{\text{NN}}$ 为神经网络。模型通过电机扰动(motor bubbling)自监督收集数据训练。

3. 两阶段优化

第一阶段在冻结的自模型上梯度优化关节角匹配目标阴影。总损失结合像素级重建、剪影重叠和感知相似度:

$$ \mathcal{L}_{\text{total}} = w_1 \cdot \mathcal{L}_{\text{MAE}} + w_2 \cdot \mathcal{L}_{\text{IoU}} + w_3 \cdot \mathcal{L}_{\text{CLIP}} $$

第二阶段在物理仿真器中用爬山搜索精炼——爬山搜索在自模型解 $\bm{\uptheta}^*$ 的邻域内寻找无碰撞构型: $$ \bm{\uptheta}^{\text{final}} = \arg\min_{\bm{\uptheta}} \mathcal{L}_{\text{total}}(\bm{\uptheta}) \quad \text{s.t.} \quad \text{collision-free}(\bm{\uptheta}), \quad \|\bm{\uptheta} - \bm{\uptheta}^*\| \leq \epsilon $$ 碰撞检测确保物理可行。39.34% 的自模型优化位姿存在碰撞问题,爬山精炼解决这些约束同时保持阴影外观。混合策略比纯爬山高效:先用可微优化高效定位高质量构型空间区域,再用物理局部搜索精炼可行性。

4. 动态阴影与运动规划

对动态阴影表演,引入表达区域目标、时间平滑正则化和关键帧优化。关键帧从目标视频提取,独立优化后引入时间平滑正则化确保帧间连贯: $$ \mathcal{L}_{\text{temporal}} = \sum_{t} \|\bm{\uptheta}_{t+1} - \bm{\uptheta}_t\|_2^2 + \lambda_e \cdot \mathcal{L}_{\text{expressive}}(\bm{\uptheta}_t) $$ 其中 $\mathcal{L}_{\text{expressive}}$ 为表达区域目标,保留视觉重要的运动线索。关键帧独立优化后用基于采样的轨迹规划器生成无碰撞运动计划,直接在物理机器人上执行。

flowchart TD
    A["目标阴影图像/视频"] --> B["二值化处理"]
    B --> C["阶段1: 梯度优化
冻结自模型上优化关节角"] C --> D["最优关节构型
(可能碰撞)"] D --> E["阶段2: 爬山精炼
碰撞感知仿真"] E --> F["物理可行位姿"] F --> G["运动规划
无碰撞轨迹"] G --> H["物理手执行
真实阴影投影"] I["电机扰动自探索"] --> J["前向阴影自模型
FK + NN"] J --> C style C fill:#e1f5fe style E fill:#fff3e0 style J fill:#e8f5e9

实验结果

评估设置

数据集含 61 个目标:26 个 ASL 手语手势图像、19 个手影动物关键帧(鸭、鹿、孔雀、骆驼)、16 个原始动物视频关键帧(狼嚎、乌鸦翻翅)。难度递增:ASL 与手形态最对齐,手影动物更细长风格化,原始动物不对应任何手形态。

模仿结果图5:静态图像和视频帧目标的阴影模仿结果。

表1:61 个单图像目标的定量结果(↓表示越低越好)
方法Total↓Base↓CLIP↓MAE↓IoU Loss↓
Random0.45900.21350.11160.34020.4772
Inverse0.42620.19590.12460.31020.4370
Nearest Neighbor0.20140.08490.07820.11600.1910
Ours (w/o H.C.)0.18090.08280.06810.10900.1873
Ours (Base)0.12100.06400.07070.08290.1440
表2:关键发现总结
发现详情
前向模型优于逆模型逆模型接近随机猜测,前向自模型提供可微映射
爬山精炼提升 33.1%总损失从 0.1809 降至 0.1210,解决 39.34% 碰撞位姿
混合优于纯爬山500 步混合 > 500 步纯爬山,接近 2000 步纯爬山但运行时更短
跨形态差距泛化ASL 最易,手影动物中等,原始动物最难但仍有意义
定量表图6:所有 61 个单图像目标的定量结果表。

自模型续图3:阴影自模型框架细节(续)。


局限性

  1. 手部形态限制:21 自由度手虽比多数机械手灵巧,但与人手仍有形态差距,某些复杂手影(如需要极精细指尖控制)可能无法准确再现。
  2. 单光源假设:系统假设单一聚光灯 3 米外的固定投影设置,对多光源、环境光干扰或不同投影距离的鲁棒性未验证。
  3. 实时性不足:两阶段优化(梯度搜索+爬山精炼)计算成本较高,不适合实时交互式阴影对话场景。

总结与展望

本文建立了机器人通过投影视觉抽象进行交流的框架。混合刚软手设计兼顾运动精度和光路密封,可微阴影自模型通过自监督学习手部构型到阴影外观的映射,两阶段优化在可微效率与物理可行性间取得平衡。在手语、手影戏和动物运动模仿中验证了框架的有效性,扩展了机器人表达进入投影视觉抽象领域。

金句:「直接训练从目标阴影到关节角的逆模型是不适定的——因为许多物理不同的手势产生相同的二维剪影;训练前向自模型使其可微,再通过梯度反传优化关节角,是将投影外观转化为具身执行的关键。」