
A4A:从人类演示跨具身迁移面向动作的4D可供性
人类视频里什么信息能真正迁移到机器人控制?A4A 的答案不是静态可供性掩码,而是「面向动作的 4D 可供性」:语言条件下、与交互相关的 3D 点在未来一段时间的运动轨迹。几何依据是短程对应——短时域内交互点运动与末端执行器位移都可由 SE(3) 刚体/准刚体变换近似,是同一次操作转移的两种描述。作者用 HOI4D、EPIC-KITCHENS 与自采 RGB-D 构建超 8 万段语料,经 GroundingDINO + SAM 2 + CoTracker3 + LingBot-Depth 重建保身份 3D 点轨迹。训练分两阶段:先用基座 VLA 的原生目标族预测点运动残差,再把点接口换回机器人本体感受与动作接口,共享隐模块完整保留、不加额外时序网络,因此能同时套到自回归、回归、扩散与两种流匹配五种范式。LIBERO-Object 上五个策略全部提升(Octo 28.2→57.2、OpenVLA 66.4→76.4、π0 77.8→87.8);RLBench 平均 39.0→61.0,纯 RGB 执行即超过用 3D/4D 观测的 ManiGaussian(51.0);同架构只换预训练数据的对照实验 41.0→60.0,证明增益来自以交互为中心的监督;真实 Piper 六技能四策略 56.7%→72.5%。局限:大幅非刚性形变、严重滑移与反复接触切换、多圈拧盖类双臂协调。
Yifan Han, Litao Liu, Yuqi Gu2026年9月5日
视觉语言动作模型Affordance4D Affordance2026年9月5日
