PAPER DEEP DIVE
弥合实验室到店铺的鸿沟:面向零售人形机器人的数据高效后训练与经验驱动学习VLA框架
VLA人形机器人从基准性能到可靠真实部署存在巨大鸿沟。本文提出DEED(数据高效后训练与经验驱动学习)系统级方法,在超市薯片补货任务上用Unitree G1-Edu人形与GR00T N1.6基础模型评测。DEED含三部分:(1)数据高效后训练流水线——控制频率对齐、数据策展、任务相关视觉高亮、降低VLA依赖;(2)经验驱动精炼,改编自RECAP,用文本优势前缀与视觉语言价值函数适配GR00T解耦架构;(3)潜空间分布内外分析工具。结果表明弥合实验室到店铺鸿沟主要是系统集成而非架构挑战:精细数据设计与定向后训练用单GPU即可将朴素微调下失败的策略转为胜任的真实系统。
一句话总结
DEED 是面向 VLA 人形机器人真实部署的系统级框架,在超市薯片补货任务上用 Unitree G1-Edu + GR00T N1.6 评测:数据高效后训练(频率对齐 $f_r=f_{ctrl}\le f_{cam}$、六条数据策展规则、IA-VLA 视觉高亮、二元手控+Butterworth 平滑、连续子任务片段)将朴素 SFT 的 0% 成功率提到 32%;经验驱动精炼(改编 RECAP,文本优势前缀 Advantage=True/False + 仅视觉语言价值函数适配 GR00T 解耦架构)首轮再提到 42%,但第二轮因分布漂移降回 22%——说明弥合实验室到店铺鸿沟主要是系统集成而非架构挑战。
Figure 1 — 数据采集与实验硬件:Unitree G1-Edu 配两个腕部外置相机,在超市补货任务上评测。
1. 研究背景与动机
视觉-语言-动作(VLA)模型已成为通用机器人操作的主流范式,但基准性能与可靠真实部署之间存在巨大鸿沟。部署预训练 VLA 更多依赖工程选择而非架构创新:动作表示、相机布置、控制频率对齐、数据策展——行为克隆从根本上受限于示教,数据不一致或轻微分布偏移会迅速累积为策略失败。且离线策略无法从自身经验改进。
本文受一个将人形补货部署到运营中超市的工业项目驱动,其现实约束塑造了设计。在 Unitree G1-Edu + GR00T N1.6 上做超市薯片补货:从手推车产品箱抓一袋薯片、转身到相邻货架、放下、转回重复。核心主张:弥合实验室到店铺鸿沟主要是系统集成而非架构挑战——不改底层模型,精细数据设计与定向后训练用单 GPU 即可把朴素微调下失败的策略变成胜任的真实系统。
2. 核心方法:DEED 三组件
2.1 数据高效后训练(DE)
频率层级:相机 $f_{cam}$、遥操 $f_t$、录制 $f_r$、推理控制 $f_{ctrl}$ 须满足:
$$f_r=f_{ctrl}\le f_{cam},\qquad f_t\ge f_r$$
视觉是策略感知世界的唯一通道,录制或推理快于相机意味着从帧间未变的重复观测学习,产生不光滑不可靠行为。录制频率决定连续动作目标间的空间分辨率,进而决定所学运动的光滑度。录制与推理控制频率必须匹配——策略在录制速率下学习动作空间的时间语义,推理时以其他速率派发动作是模型从未训练应对的失配。本文取 $f_t=50$ Hz、$f_{cam}=30$ Hz、$f_r=f_{ctrl}=25$ Hz。
数据策展六规则(每条对应一个失败模式):
| 规则 | 防止的失败 |
|---|---|
| 平衡状态覆盖 | 偏向主导状态动作,低表示状态退化 |
| 只录高效成功行为 | 犹豫/回退/失败前奏被当有效行为学 |
| 保留偶然恢复 | 纯净成功无恢复行为,漂移后无法回正 |
| 最大化动作一致性 | 相似状态动作不一→学平均无效动作 |
| 最小化不可控环境变化 | 外部因素致动作-结果关系不一致 |
| 避免空操作状态 | 空闲段把不变状态与不一致动作配对 |
Figure 2 — 改编 IA-VLA:大 VLM 用分割掩码高亮任务相关区域并跨帧传播,避免逐帧推理,放置区为掩码补集的空区域用包围框高亮。
降低 VLA 依赖两技巧:
- 二元手控:手开闭本质离散,用二元信号控制而非学连续细粒度关节控制;二元决策与视觉特征(尤其腕部相机)强相关,避免连续驱动。
- Butterworth 滤波平滑:动作块间过渡是抖动常见来源;训练数据为光滑轨迹,抖动把执行动作推到训练分布外。推理时对预测动作序列加 Butterworth 滤波,保泛化同时让执行光滑且分布内。
连续子任务片段:多子任务任务中,子任务过渡是常见失败点——分段示教隐式训练模型把片段边界当静态重复动作(GR00T 用最后片段内动作填充目标块)。推荐录跨越完整子任务过渡的连续片段,并避免子任务语言提示共用措辞。
2.2 经验驱动精炼(ED)——改编 RECAP
离线 SFT 策略只能与所示数据一样好,无自身部署经验改进机制。改编 RECAP(RL with Experience and Corrections via Advantage-conditioned Policies),但 GR00T 解耦架构(视觉-语言骨干与 Flow-Matching 动作头分离)不同于 RECAP 原本的紧耦合 VLA。不改模型架构:用文本指令前缀"Advantage=True/False"做条件,价值函数仅条件于相机观测与文本指令。
迭代精炼:从 DE 策略起收集自主 rollout,人仅在必要时纠正。数据含原始遥操、成功自主执行、人恢复示教。价值函数 $V_\phi(o_t,\ell)$ 估计每观测 $o_t$ 在指令 $\ell$ 下期望回报,用预训练 Eagle-3 视觉-语言编码器 $f_\psi$ + 轻量 MLP 价值头(两 1024 隐藏层、GELU、均值池化 token 嵌入),预测 $B=101$ 均匀离散回报箱的类别分布而非直接回归标量。计算每步优势标签 $\hat A_t$,训练时作条件 token。人纠正干预强制标正($c_t=1$)无视估计优势。阈值 $\tau$ 使目标比例 $\epsilon=0.4$ 数据标正。
标签编码为文本前缀 Advantage=True/False 拼到指令 $\ell$ 前;数据生成时条件 dropout $p_{drop}=0.3$(非训练时)以不改 GR00T 训练流水线。每轮从原 checkpoint(GR00T-N1.6-G1-PnPAppleToPlate)重初始化以防优化漂移与误差累积。推理时优势固定 True,即 $\pi_\theta(a_t|o_t,\ell,A=\text{True})$,偏向正优势行为。
Figure 3 — 经验驱动策略精炼流水线。从 DE 阶段 SFT 策略起,RECAP 用自主 rollout 数据精炼;每轮价值函数与 VLA 均从各自预训练 checkpoint 初始化。
2.3 潜空间分布内外分析工具
用微调 GR00T 状态编码器 $f_\phi$ 的潜空间测当前构型距训练数据多远。每训练时间步过编码器得 $z=f_\phi(s)$,拟合 $K$ 分量高斯混合模型:
$$p(z)=\sum_{k=1}^{K}\pi_k\,\mathcal{N}(z\mid\mu_k,\Sigma_k)$$
混合形式重要:单任务有多种有效构型,示教流形本质多模态;单模拟合会把合法替代策略标为异常。新状态 $z$ 用到最近分量的 Mahalanobis 距离评分:
$$d(z)=\min_k\,(z-\mu_k)^\top\Sigma_k^{-1}(z-\mu_k)$$
高方差方向偏差贡献小,低方差方向强惩罚——区分关节构型的良性变化与偏离示教流形的真正偏离。阈值从训练距离经验分布推导而非手调,分 ID/软 OOD/硬 OOD。附每关节 z 分数与 PCA 三主成分可视化。策略无关,跨两阶段复用。
flowchart TB
GR00T["GR00T N1.6 checkpoint (0% SR)"] --> DE["Data-Efficient post-training
freq align + 6 curation rules
+ visual highlight + binary hand
+ Butterworth + continuous eps"]
DEMO["81 teleop demos
(51.5 min)"] --> DE
DE --> DEPOL["DE policy: 32% SR"]
DEPOL --> ROLLOUT["autonomous rollouts
+ human corrections"]
ROLLOUT --> RECAP["RECAP adaptation
text Advantage prefix
+ VL value function (101 bins)"]
RECAP --> R1["RECAP iter 1: 42% SR"]
R1 --> R2["RECAP iter 2: 22% SR
(distributional drift)"]
OOD["latent GMM + Mahalanobis
OOD tool"] -.->|"diagnose drift"| R2
style DE fill:#dbeafe,stroke:#2563eb
style RECAP fill:#fef9c3,stroke:#ca8a04
style R2 fill:#fee2e2,stroke:#dc2626
style OOD fill:#dcfce7,stroke:#16a34a
3. 实验结果
Unitree G1-Edu + Dex-3 手,动作空间从原生 32 维降到 20 维(每臂 7 关节、每手二元开闭、1 腰关节、3 基速度)。本体感受状态 17 维。视觉:一头 RealSense D435i + 两腕 RealSense D405,$640\times480$ 30 FPS。81 条遥操示教约 51.5 分钟;116 条自主 rollout(41 成功 75 失败)约 56.9 分钟,共约 108.4 分钟。单 RTX 5090 工作站。每条件 50 episode,报 95% Wilson 置信区间。
| 模型 | 成功率 | 均执行时长(s) | 最大连续补货数 |
|---|---|---|---|
| Naive SFT | 0% (0/50) | N/A | 0 |
| DE policy | 32% (16/50) | 24.30 | 4 |
| RECAP iter 1 | 42% (21/50) | 22.37 | 1 |
| RECAP iter 2 | 22% (11/50) | 21.09 | 1 |
关键发现:DE 阶段做主要工作(0%→32%);首轮 RECAP 提到 42%(有增益但非统计显著);第二轮降回 22%——经验驱动增益不跨轮累积。最佳解释是分布漂移:自生成 rollout 主导训练集后,覆盖最广成功行为的遥操示教相对影响下降,优势重标越来越绑在策略自身采样分布,形成逐步收窄有效状态-动作分布的反馈环。OOD 工具佐证:精炼策略偏离示教流形。
结构发现:精炼策略倾向单次放置后停下而非回起始构型——终止完成态价值高于复位中间姿态,复位过渡得低/负优势被抑制。实践靠外部指令回起始。更深任务泛化需求越大,自生成 rollout 越难覆盖,精炼越易收窄到行为子集——维持遥操与 rollout 固定混合或周期重引入示教可能必要。
Figure 6 — 补货评测代表帧:初始位、抓取、放置、转回。
4. 主要贡献
- 数据高效后训练流水线:频率层级 $f_r=f_{ctrl}\le f_{cam}$、六条数据策展规则、IA-VLA 视觉高亮、二元手控+Butterworth 平滑、连续子任务片段——不改模型把 0% 策略变 32%。
- RECAP 适配解耦 VLA:文本优势前缀 Advantage=True/False + 仅视觉语言价值函数(101 离散箱),不改 GR00T 架构,首轮提 42%。
- 潜空间 OOD 工具:GMM + Mahalanobis 在策略自身状态编码器潜空间测分布漂移,把性能下降转为可测可测的解释。
- 系统视角洞察:弥合实验室到店铺鸿沟是系统集成而非架构挑战;经验驱动增益不跨轮累积,需维持示教-rollout 混合;复位行为需显式处理。
5.
条件策略定义
$$ \pi_{\theta}(a_{t}\mid o_{t},\ell,A{=}\texttt{True}) $$
值函数期望
$$ V_{\phi}(o_{t},\ell)=\sum_{i=1}^{B}p_{\phi}(b_{i}\mid o_{t},\ell)\,b_{i} $$
局限与展望作者自述:单任务(薯片补货)、单物体类型、单机器人平台;RECAP 第二轮退化说明经验驱动精炼在高变异任务中增益有限。复位行为问题未在学习框架内解决。评测无跨泛化体制的专门评估。
分析判断:样本规模小(50 episode/条件),42% vs 32% 的增益非统计显著,结论是"有增益但不确证"。仅单 GPU 单任务,能否扩展到多任务、多物体、更大规模未验证。价值函数用分类分布预测回报是 RECAP 做法,但在人形高维任务中回报信号噪声大。OOD 工具阈值从训练分布推导,但新场景的真正异常可能不在任何训练分量附近——召回与精度的权衡未充分刻画。二元手控仅适用于开闭本质的任务,更细操作需连续控制。
6. 总结
DEED 的核心主张是弥合 VLA 实验室到店铺鸿沟主要是系统集成而非架构挑战。不改 GR00T N1.6 底层模型,仅靠数据高效后训练(频率对齐、六条策展规则、视觉高亮、二元手控+Butterworth 平滑、连续片段)即把朴素 SFT 的 0% 成功率提到 32%;一轮 RECAP 适配(文本优势前缀+仅视觉语言价值函数,不改架构)再提到 42%,但第二轮因自生成 rollout 主导训练集致分布漂移降回 22%——说明经验驱动增益不跨轮累积,需维持示教-rollout 混合。潜空间 GMM+Mahalanobis OOD 工具把性能下降转为可测的分布漂移解释。全程单 RTX 5090,数据质量重于数据量。



