PAPER DEEP DIVE
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化
零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。
论文:Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
作者:Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu
机构:Robbyant · 港科大(广州) · 港科大
链接:arXiv:2608.26103 · 项目主页 · GitHub(代码/模型/数据计划于 2026-09-15 前发布)
一句话总结
Zero-WAM 把大语言模型里的"上下文学习"搬进机器人操控:用一段人类演示视频作为任务指令,一个因果式视频-动作模型就能零样本执行从未训练过的任务——配套的可扩展管线自动生成 7.42 万条"人类视频-机器人轨迹"语义配对数据,并用"上下文未来块预测"目标强制模型真正读懂人类视频,在 RoboTwin 2.0 七个未见任务上平均成功率 46.95%,比最强基线高 29.5 个百分点。
一、研究背景与动机
机器人学习的终极目标之一,是让策略执行它从未见过的任务,而且不需要为每个新任务重新采集机器人数据或更新参数。在自然语言处理领域,大语言模型早就解决了类似问题:给模型几个示例或一段描述,它就能在上下文中直接学会新任务,这就是上下文学习(ICL)。ICL 的本质是把"泛化"问题转化为"任务描述"问题——模型能力是固定的,关键是你用什么方式告诉它要做什么。
机器人操控领域的"任务描述"长期依赖语言指令。但语言有天然局限:很多操控任务的细节很难用文字说清(比如"把杯子放到秤上"里杯子的朝向、抓取点、放置精度),而且策略还必须把语言映射到从未见过的任务动态上。视觉语言动作(VLA)模型虽然通过大规模异构数据提升了泛化,但 AGNOSTOS 等评测显示,代表性 VLA 策略在零样本跨任务操控上依然普遍失败——视觉-语言表征空间与动作空间之间存在巨大鸿沟。
本文的洞察是:对人类来说,最自然的操控任务描述方式不是语言,而是一段人类示范视频。视频直接展示了预期的状态变化过程,比语言承载了多得多的任务动态线索。因此作者提出:把"人类视频"作为上下文任务指令,训练一个能同时听懂语言和人类视频两种指令的因果式视频-动作模型。
难点在于数据:要让模型学会跟随人类视频指令,需要大量"人类视频 + 同任务机器人轨迹(带可执行动作)"的配对数据,覆盖足够多的任务种类。人工采集这种配对数据成本极高,任务多样性也难以保证。于是作者设计了一条自动生成管线,把任务级采样的机器人轨迹转化为语义匹配的人类视频,得到 HumanGen 数据集——74.2K 条人机 ICL 对、覆盖 8.6K 种任务。这是本文最核心的工程贡献。
另一个隐蔽的难点是"捷径学习":训练时,模型往往可以只靠机器人历史视频的外推就预测出下一个视频块,完全不用看人类视频。一旦养成这种捷径,到了未见任务上模型仍然只会依赖历史,人类视频指令形同虚设。为此作者引入"上下文未来块预测"(IFP)辅助目标,强制主干网络把人类视频传达的任务演化信息编码进当前表征。实验证明这一设计把七个未见任务的平均成功率从 28.55% 拉到 46.95%。
二、预备知识:流匹配与因果视频-动作建模
Zero-WAM 的视频生成基于流匹配(flow matching)。给定干净视频 $\mathbf{x}_0$、高斯噪声 $\bm{\epsilon}\sim\mathcal{N}(\mathbf{0},\mathbf{I})$ 和流时间 $t\in[0,1]$,加噪视频与目标速度场分别为:
$$\mathbf{x}_t=(1-t)\mathbf{x}_0+t\bm{\epsilon},\qquad \mathbf{v}^\star_t=\bm{\epsilon}-\mathbf{x}_0 \tag{1}$$
在条件 $c$ 下,流匹配损失即让网络预测的速度逼近目标速度:
$$\mathcal{L}_{\mathrm{fm}}=\mathbb{E}_{\mathbf{x}_0,\bm{\epsilon},t}\left[\left\|\mathbf{v}_\theta(\mathbf{x}_t,t,c)-\mathbf{v}^\star_t\right\|_2^2\right] \tag{2}$$
推理时从纯噪声出发,沿学到的速度场积分回 $t=0$ 即得生成视频。
在策略结构上,本文沿用 LingBot-VA 系列的因果视频-动作框架:每个控制步都是一次因果预测——给定任务条件与历史观测,模型预测下一个机器人视频块及与之时间对齐的可执行动作块。每条机器人轨迹被切分为 $\tau=\{(\mathbf{x}^i,\mathbf{a}^i)\}_{i=1}^N$,在块索引 $i$ 处预测:
$$p_\theta\!\left(\mathbf{x}^{i+1},\mathbf{a}^{i+1}\mid\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},c\right) \tag{3}$$
这一联合预测被分解为"先预测视频、再解码动作":
$$p_\theta\!\left(\mathbf{x}^{i+1},\mathbf{a}^{i+1}\mid\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},c\right)=p_\theta^{\mathrm{vid}}\!\left(\mathbf{x}^{i+1}\mid\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},c\right)\cdot p_\theta^{\mathrm{act}}\!\left(\mathbf{a}^{i+1}\mid\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},\mathbf{x}^{i+1},c\right) \tag{4}$$
其中 $p_\theta^{\mathrm{act}}$ 本质上是一个逆动力学模型:从预测出的未来机器人视频块反解出可执行动作。视频分支与动作分支采用 Mixture-of-Transformers(MoT)设计——各自拥有独立的 QKV 投影、FFN 与输出头,但共享同一序列中的注意力层;动作块表征被放在未来视频表征之后,使动作解码能注意到预测出的未来视频,与式(4)的分解一致。
模型底座是 Wan-2.2-TI2V-5B(双向文图生视频模型),被改造为上述因果式视频-动作策略。视频分支为 30 层、隐藏维度 $d_v=3072$ 的 Transformer;动作分支隐藏维度 $d_a=3072$,参数从视频分支初始化;两分支均用 RoPE 位置编码;机器人视频与人类视频共用 Wan-2.2 VAE 编码,语言指令由 T5 编码。
三、数据工程:HumanGen 与 Task-diverse VA
Zero-WAM 的能力上限由两类数据共同决定,这也是本文区别于以往"改模型"工作的地方——它本质上是一项数据可扩展性的工作。
3.1 Task-diverse VA:按任务重切分公开机器人数据
作者从 AgiBot、InternData-A1、Open-X-Embodiment、RoboCOIN、RoboMIND 五个公开机器人视频-动作预训练数据集出发(与 LingBot-VA 同源)。这些数据集轨迹量大,但存在严重的"同任务重复遥操作"冗余——直接按原始分布训练,预训练会被少数高频任务的重复轨迹主导。解决办法是按任务重新切分:每个任务由"操控动作 × 操作对象"的组合定义,任务标签优先取自数据集元数据,不足时从轨迹中解析;然后对每个任务设采样上限,上限随各数据集的任务内多样性调整。最终得到超过 6000 个任务、每个训练纪元约 40 万条机器人轨迹的均衡语料,称为 Task-diverse VA。
3.2 上下文人类视频生成管线
图 1(论文 Fig 2):数据构成与上下文人类视频生成管线。上方为 Task-diverse VA 与 HumanGen 四个子集;下方为把任务级采样机器人视频转化为人类视频指令的四步管线。
管线从任务级采样的机器人轨迹出发,四步生成语义匹配的人类视频:
第一步,任务分析:VLM(Gemini 3.1 Pro 或 Qwen3.6-Plus)从机器人视频中提取任务名、初始物体状态、状态变化、最终状态,并生成一条图像编辑提示词,用于把机器人视频首帧改造成人类操控场景的初始观察。背景、视角、环境风格、物体实例与摆放位置等视觉对齐多样性,就通过这条提示词注入,同时保持任务语义不变。
第二步,生成人类首帧:图像编辑模型(Nano Banana 2 或 Qwen-Image-2.0)根据首帧与编辑提示词,生成人类观察视角的初始图像。
第三步,生成人类视频:VLM 结合编辑后的人类观察图与物体状态信息,生成描述"人类双手应如何操作物体完成任务"的视频生成提示词,交给视频生成模型(Wan 2.7 或 Kling AI 3.0)合成人类操作视频。
第四步,质检:VLM 逐条评估生成视频的任务语义保持度与物理合理性,合格者与其原始机器人轨迹配对,形成一条 ICL 样本——人类视频是"视觉任务说明书",机器人轨迹提供可执行动作监督。
3.3 HumanGen 数据集构成
最终 HumanGen 包含 74.2K 条人机 ICL 对、覆盖 8.6K 种任务,分四个子集:
| 子集 | 用途 | 任务数 | ICL 对数 |
|---|---|---|---|
| Pre-train ICL(External) | 预训练,外部数据源 | 5062 | 41188 |
| Pre-train ICL(In-house) | 预训练,内部数据源 | 3522 | 30247 |
| Simulation ICL(RoboTwin 2.0) | 仿真训练/评测 | 50(43 训练 + 7 留测) | 2500 |
| Real-world ICL | 真机适配 | — | 252 |
| 合计 | — | 8.6K | 74.2K |
与已有任务级配对人机数据集相比,HumanGen 在任务数与配对规模上都高出一到两个数量级,且人类视频是自动生成而非人工采集,可扩展性是其根本优势。
四、方法详解
图 2(论文 Fig 1):Zero-WAM 总览。模型以语言指令或人类视频作为任务条件,因果地预测未来机器人视频块与对齐的动作块;训练时附加 IFP 辅助目标。
4.1 人类视频作为任务指令
训练时,人类视频 $\mathbf{h}$ 被拼接在机器人轨迹之前,作为视频预测的前缀记忆。在块索引 $i$ 处,视频分支的上下文为:
$$\mathcal{C}^{\mathrm{vid},i}=[\,[\mathbf{h},\mathbf{x}^{\leq i}],\mathbf{a}^{\leq i},\ell\,],\qquad p_\theta^{\mathrm{vid}}(\mathbf{x}^{i+1}\mid\mathcal{C}^{\mathrm{vid},i}) \tag{5}$$
而动作分支不直接注意人类视频——$\mathbf{h}$ 传达的任务语义已被吸收进预测出的下一个机器人视频块,动作解码退化为标准逆动力学:
$$\mathcal{C}^{\mathrm{act},i}=[\,\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},\mathbf{x}^{i+1},\ell\,],\qquad p_\theta^{\mathrm{act}}(\mathbf{a}^{i+1}\mid\mathcal{C}^{\mathrm{act},i}) \tag{6}$$
训练时式(6)中的 $\mathbf{x}^{i+1}$ 是 teacher forcing 下的真值视频块,推理时替换为视频分支生成的块。这个设计的妙处在于:人类视频与机器人轨迹在形态、视角、背景、物体摆放上都不同,模型不可能"抄动作",只能学任务级对应关系——这正是跨形态迁移的关键。
由于人类视频与多视角机器人视频共用同一 VAE、共享视觉隐空间,论文用 RoPE 高度轴偏移来区分两者:机器人隐变量保持原坐标 $(q,y,x)$,人类视频隐变量沿高度轴平移:
$$\mathrm{pos}_{\mathrm{human}}(q,y,x)=(q,y+\Delta_H,x),\qquad \Delta_H>H_{\mathrm{mv}} \tag{7}$$
偏移量 $\Delta_H=32$ 大于多视角机器人隐布局的高度 $H_{\mathrm{mv}}$,把人类视频放到机器人坐标范围之外,避免同序列交互时的表征混淆。
4.2 上下文未来块预测(IFP):对抗捷径学习
这是模型设计中最精巧的部分。在已见任务的 teacher-forcing 训练中,下一个机器人视频块常常可以仅靠近期机器人历史 $(\mathbf{x}^{\leq i})$ 外推得到——模型不读人类视频也能降低损失,捷径就此养成;评测未见任务时,模型继续依赖历史,恰恰在最需要人类视频信号的时候忽略了它。
IFP 的对策:训练时额外要求模型从当前机器人视频表征出发,预测多个带时间跨度的未来机器人视频块。设时间跨度为 $s$、预测块数为 $K$,第 $k$ 个目标块的索引为:
$$j_k=(i+1)+1+(k-1)s,\qquad k=1,\ldots,K \tag{8}$$
实现上加 $K$ 个 IFP 模块 $\{G_k\}_{k=1}^K$,每个模块结构与视频分支单个 Transformer 层相同,从最后一层视频 Transformer 初始化。预测素材来自主干视频 Transformer 的 $M$ 个中间层:收集 $\mathbf{x}^{i+1}_t$(流时间 $t$ 下的加噪块)的多层隐表征 $\{\mathbf{r}^{i+1}_m\}_{m=1}^M$,拼接后经轻量 MLP 投影 $P_{\mathrm{fuse}}$ 融合:
$$\bm{\phi}^{i+1}=P_{\mathrm{fuse}}\left(\mathrm{Concat}\left(\{\mathbf{r}^{i+1}_m\}_{m=1}^M\right)\right) \tag{9}$$
每个 IFP 模块以融合表征、干净历史与语言指令为条件,对自己的跨度未来块做流匹配去噪:
$$p_{\theta,k}^{\mathrm{ifp}}\left(\mathbf{x}^{j_k}\mid\bm{\phi}^{i+1},\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},\ell\right),\qquad \mathcal{L}_{\mathrm{ifp}}=\sum_{k=1}^K w_k\,\mathcal{L}_{\mathrm{fm}}\left(\mathbf{x}^{j_k};\bm{\phi}^{i+1},\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},\ell\right) \tag{10}$$
一个极易被忽略却决定成败的细节:IFP 模块不直接条件于人类视频 $\mathbf{h}$,它获取任务信息的唯一通道是 $\bm{\phi}^{i+1}$——即主干视频 Transformer 与人类视频交互之后提取的表征。如果 IFP 直接看 $\mathbf{h}$,辅助分支会学成一个独立的人类视频条件预测器,而主干依然不编码任务信息;由于 IFP 模块在推理时被移除,部署策略将一无所获。正因只监督 $\bm{\phi}^{i+1}$,未来预测损失才真正倒逼主干把人类视频的任务演化编码进当前表征。多个未来块并行预测、用跨度 $s$ 拉开难度,又避免了未来块之间的时序依赖。超参取 $K=4$、$s=2$,权重 $(w_1,\dots,w_4)=(0.5,0.25,0.15,0.15)$。
4.3 训练目标与推理
对每个目标视频块 $\mathbf{x}^{i+1}$ 采样噪声与流时间,构造 $\mathbf{x}^{i+1}_t=(1-t)\mathbf{x}^{i+1}+t\bm{\epsilon}^{i+1}$,视频分支的下一块损失为:
$$\mathcal{L}_{\mathrm{fm}}^{i+1}(c)=\left\|\mathbf{v}_\theta^{\mathrm{vid}}\!\left(\mathbf{x}^{i+1}_t,t\mid\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},c\right)-\mathbf{v}^{\star,i+1}_t\right\|_2^2 \tag{11}$$
动作分支在动作空间用同样的流匹配形式,噪声 $\bm{\epsilon}^{i+1}_a$、流时间 $r\in[0,1]$:
$$\mathcal{L}_a^{i+1}(c)=\left\|\mathbf{u}_\theta^{\mathrm{act}}\!\left(\mathbf{a}^{i+1}_r,r\mid\mathbf{x}^{\leq i},\mathbf{a}^{\leq i},\mathbf{x}^{i+1},c\right)-\mathbf{u}^{\star,i+1}_r\right\|_2^2 \tag{12}$$
Task-diverse VA 样本只有语言条件 $c=\ell$,总损失为 $\mathcal{L}_{\mathrm{VA}}=\mathbb{E}[\mathcal{L}_{\mathrm{fm}}^{i+1}(\ell)+\lambda_a\mathcal{L}_a^{i+1}(\ell)]$;HumanGen 样本的视频预测条件为 $c=\{\mathbf{h},\ell\}$ 并附加 IFP 损失,动作损失仍只条件于 $\ell$(与式(6)一致):
$$\mathcal{L}_{\mathrm{ICL}}=\mathbb{E}_{i,t,r,\bm{\epsilon},\bm{\epsilon}_a}\left[\mathcal{L}_{\mathrm{fm}}^{i+1}(c)+\lambda_a\mathcal{L}_a^{i+1}(\ell)+\lambda_{\mathrm{ifp}}\mathcal{L}_{\mathrm{ifp}}\right] \tag{13}$$
预训练时 Task-diverse VA 与 HumanGen 按 1:5 采样;非 ICL 样本以 0.1 概率丢弃语言指令,ICL 样本以 0.1 概率丢弃人类视频隐变量、语言指令 dropout 从 Wan-2.2 默认 0.1 提高到 0.4,削弱模型对语言的依赖。优化器 AdamW,峰值学习率 $1\times10^{-4}$,权重衰减 0.01;机器人视频块大小在 1–4 间随机采样;每 GPU 将不同长度的样本打包进一条序列(注意力掩码隔离),单 GPU 最大 token 数控制在 160K 以内。预训练共消耗 15360 GPU 时。
推理时 IFP 模块被整体移除,支持两种模式:纯语言模式(视频 CFG=5)与 ICL 模式(人类视频编码一次后缓存为前缀记忆,关闭语言指令,ICL 分类器自由引导尺度 5)。两种模式推理块大小均为 2,动作 CFG 为 1.0。
4.4 方法流程一图总览
flowchart TB
subgraph DATA["Data Construction"]
R1["Task-sample robot trajectories
5 public datasets > 6K tasks"]
R1 --> VA["Task-diverse VA
~400K trajectories / epoch"]
R1 --> VLM1["VLM task analysis
Gemini 3.1 Pro / Qwen3.6-Plus"]
VLM1 --> IMG["Image editing
Nano Banana 2 / Qwen-Image-2.0
human first frame"]
IMG --> VID["Video generation
Wan 2.7 / Kling AI 3.0"]
VID --> QC["VLM quality check
semantic + physical plausibility"]
QC --> HG["HumanGen
74.2K pairs / 8.6K tasks"]
end
subgraph MODEL["Zero-WAM Training"]
VA --> MIX["Mixture sampling
VA : HumanGen = 1 : 5"]
HG --> MIX
MIX --> MAIN["Causal MoT video-action branch
Wan-2.2-TI2V-5B backbone"]
MAIN --> IFP["IFP modules x4, stride 2
only via fused repr phi"]
IFP --> MAIN
end
subgraph DEPLOY["Zero-shot Deployment"]
HV["Unseen task human video"] --> CACHE["Encode once as prefix memory"]
CACHE --> GEN["Generate next robot video chunk"]
GEN --> ACT["Decode aligned action chunk
inverse dynamics"]
ACT --> GEN
end
MODEL --> DEPLOY
五、实验结果
5.1 RoboTwin 2.0 仿真:七个未见任务的零样本泛化
图 3(论文 Fig 3 相关):RoboTwin 2.0 未见任务示例,涵盖未见物体、铰接物体、双臂与长时域操控。
评测协议:RoboTwin 2.0 共 50 个双臂操控任务,每任务 50 条轨迹;按任务级切分,43 个任务用于后训练,7 个任务完全留作未见评测(放物体上秤、盖章、开微波炉、订书机移到垫上、面包放篮子、放空杯、叠三块积木)。这 7 个任务覆盖未见物体抓取放置、未见铰接物体操控与未见长时域操控。后训练用 64 GPU 跑 4000 步,按 2:10:3 联合采样 Task-diverse VA、HumanGen 与 RoboTwin 数据。基线有两个:WAN-Action(同样从 Wan-2.2 初始化、同架构、只在 43 个已见任务上训练)与 LingBot-VA(用其发布的预训练权重做同样后训练)。每个实验 3 个随机种子、每任务每种子 100 次闭环回放。
| 未见任务 | WAN-Action | LingBot-VA | Zero-WAM |
|---|---|---|---|
| 放物体上秤 | 3.00±2.16 | 6.17±4.87 | 24.67±2.05 |
| 盖章 | 7.33±1.25 | 3.67±2.49 | 47.00±4.55 |
| 开微波炉 | 2.26±1.60 | 29.33±10.66 | 59.00±2.83 |
| 订书机移到垫上 | 10.67±1.70 | 23.33±8.22 | 69.14±2.93 |
| 面包放篮子 | 15.26±2.55 | 17.33±6.18 | 35.00±3.74 |
| 放空杯 | 38.33±2.05 | 42.33±7.85 | 84.87±0.18 |
| 叠三块积木 | 0.00±0.00 | 0.00±0.00 | 9.00±2.16 |
| 平均 | 10.98±1.07 | 17.45±1.40 | 46.95±0.72 |
这组数字值得细读。三个方法构成一个干净的"预训练来源"阶梯:WAN-Action 只有通用视频先验 + 已见任务;LingBot-VA 多了机器人视频-动作预训练;Zero-WAM 再叠加任务均衡预训练与人机 ICL 数据。最终平均成功率 46.95%,比 LingBot-VA 的 17.45% 高 29.5 个百分点,比 WAN-Action 高 35.97 个百分点,且七个任务全胜,不是靠单个简单任务拉高的。开微波炉(铰接物体)与盖章(稀有物体重定位)增益最大;放空杯达 84.87%,超过两个基线一倍以上;最难的长时域任务叠三块积木上,两个基线都是 0,只有 Zero-WAM 拿到非零的 9%——长时域零的突破尤其能说明问题。
5.2 真机实验:双臂 Franka 上的未见配置
图 4(论文 Fig 4):真机定性评测,人类视频指令引导三类未见任务配置的执行。
真机在三类任务族上评测,每类只用少量已见任务演示适配真机运动学,测试配置全部留出;Zero-WAM 测试时只给人类视频、不给语言,而 LingBot-VA 基线配有详细文字任务描述。每任务 30 次真机试验:
| 任务族 | 训练组合数 | 训练演示数 | LingBot-VA(语言) | Zero-WAM(人类视频) |
|---|---|---|---|---|
| 物体放入容器 | 30 | 120 | 43.3 | 53.3 |
| 三物体顺序操控 | 16 | 96 | 10.0 | 33.3 |
| 双桌腿插入 | — | 36 | 0.0 | 16.7 |
三物体顺序操控要求模型跟随人类视频指定的任意物体顺序(含未见物体与容器),Zero-WAM 33.3% 对 LingBot-VA 10.0%,三倍有余;双桌腿插入中,人类视频还要指定"哪条颜色的腿插哪个孔",这种细粒度规格语言很难说清、人类视频一目了然——LingBot-VA 全军覆没,Zero-WAM 在未见插入配置上成功,作者还观察到向未见颜色/类型桌腿与桌面的定性迁移。精细物理插入的绝对成功率仍受限于任务难度,这一点作者坦承。
5.3 消融:三个组件各贡献了什么
图 5(论文 Fig 5 相关):上下文人类视频提示在未见任务上的消融。
人类视频 ICL 的作用:所有变体都只在 43 个已见任务上训练以隔离大规模预训练的影响。相比只用语言的 WAN-Action(10.98%),加入人类视频指令把平均成功率提到 36.36%——ICL 提供了超越文本的任务信息;Zero-WAM w/o pretrain 也大幅超过带机器人预训练的 LingBot-VA(17.45%)。但三个变体在叠三块积木上全部为零,而完整 Zero-WAM 非零——说明小规模 ICL 数据不足以解决未见长时域任务,大规模任务多样的 ICL 预训练必不可少。
IFP 的作用:加 IFP 把七任务平均从 28.55% 提到 46.95%,开微波炉与盖章增益最大;叠三块积木从 0 突破到 9%。这证明 IFP 有效激发了从 ICL 数据中学到的人类视频跟随能力。
任务均衡预训练的作用:构造一个"纯文本变体"(保留 ICL 样本但屏蔽人类视频条件),与 LingBot-VA 对比——两者的机器人预训练语料大体同源,因此这个对比直接回答"任务级重切分是否比单纯扩大原始分布更好"。结果纯文本变体拿到 39.44%,比 LingBot-VA 高 21.99 个百分点,在订书机移到垫上、面包放篮子、放空杯上增益明显:即使完全没有人类视频条件,任务均衡采样本身就改善了跨任务迁移。
六、局限与讨论
作者自述的局限主要有两处。其一,实验集中在静态桌面操控,尚未扩展到移动操控、更长时域以及更复杂、动态、非结构化环境——这既是当前边界也是明确的未来方向。其二,双桌腿插入等精细任务的绝对成功率仍然有限,精细物理插入对视觉规格与动作精度的要求远超当前模型上限。
从第三方视角还可以补充几点。其一,人类视频完全由生成模型合成,其质量上限受制于视频生成模型的物理合理性;虽然管线有 VLM 质检,但"语义保持"的判定标准并未量化披露,生成数据与真实人类行为分布的差距会如何影响向真实人类示范指令的迁移,论文没有直接验证。其二,仿真主结果建立在 7 个未见任务上,样本任务数偏少,个别任务(如放空杯)的高成功率对平均值的贡献不小;真机每任务仅 30 次试验,置信区间较宽。其三,15360 GPU 时的预训练成本与对商业闭源生成模型(Gemini、Nano Banana、Kling)的依赖,使这条数据管线的可复现性打了折扣——代码、模型与数据均计划于 2026 年 9 月 15 日前发布,届时社区才能检验。
不过,作者在讨论中指出了这条路线更深远的价值:第一人称人类视频的采集规模远超机器人演示,而人机之间在形态、观察与动作上的鸿沟一直阻碍其利用。HumanGen 在任务语义层面而非动作层面建立人机对应——机器人策略可以从海量人类经验中获取广泛任务知识,只依赖少得多的机器人数据做可执行动作监督。这可能是"人类视频作为机器人学习燃料"的一种可扩展解法。
七、总结与展望
Zero-WAM 给出的答案可以浓缩成三句话:把零样本跨任务泛化形式化为上下文世界-动作建模,一个因果策略同时支持语言与人类视频两种任务指令;用自动管线把任务级采样的机器人轨迹转化为语义匹配的人类视频,以 HumanGen(74.2K 对、8.6K 任务)与 Task-diverse VA(6K+ 任务、每纪元 40 万轨迹)两条数据腿支撑预训练;用 IFP 目标堵住历史外推捷径,逼模型真正使用人类视频。仿真上七个未见任务平均 46.95%、领先最强基线 29.5 个百分点,真机上三类未见配置全面胜出,验证了"可扩展的人类视频指令 + 任务均衡机器人预训练"是通往通用操控的一条务实路径。
展望层面,若代码与数据如期发布,值得关注的后续问题是:合成人类视频训练出的策略,面对真实人类随手拍的示范视频表现如何?这套"视频即指令"的接口能否扩展到移动操控与真正的长时域任务?这些将决定 Zero-WAM 开创的数据范式能走多远。
金句
"语言告诉你任务的名字,人类视频给你看任务的灵魂——Zero-WAM 让机器人学会盯着灵魂做事,而不是靠着记忆猜下一个动作。"



