
1X 世界模型:从视频到动作——机器人学习的新范式
1X 介绍其视频预训练世界模型 1XWM,集成到 NEO 中作为机器人策略。与 VLA 不同,1XWM 从文本条件的视频生成中提取机器人动作,利用互联网视频中的世界动力学实现零样本泛化,无需大规模遥操作数据。
从视频到动作:机器人学习的新范式
家庭机器人需要具备常识行为和对物理世界的深层理解。当今的许多机器人基础模型是视觉-语言-动作模型(VLA),它们在预训练的 VLM 之上添加一个输出头来预测机器人动作(如 PI0.6、Helix、Groot N1.5)。VLM 受益于互联网规模的知识,但其训练目标侧重于视觉和语义理解,而非物理动力学预测。教会一个模型完成对人类来说很简单的任务,需要数万小时的昂贵机器人数据。
在这篇博文中,1X 介绍了他们的视频预训练世界模型 1XWM,并将其集成到 NEO 中作为机器人策略。VLA 直接从静态图像-语言输入预测动作轨迹,而这种基于世界模型的策略则从文本条件的视频生成中提取机器人动作。通过利用互联网规模视频中固有的世界动力学,1XWM 能够泛化到新的物体、运动和任务,而无需在大规模机器人数据或遥操作演示上进行预训练。这代表了一种向新范式的转变:让机器人智能受益于视频预训练的规模化,而这一切由专为人类身体高保真迁移设计的硬件栈所支撑。
为什么是视频?现实的结构性先验
互联网视频隐式编码了现实的结构性先验:人和物体如何运动、力施加在哪里、交互的隐含约束是什么。将视频准确转化为动作,不仅需要模型——还需要一个与人体形态在运动学和动力学上一致的具身形态。
硬件作为 AI 技术栈的一等公民,弥合了人机翻译差距。通过将具身形态与类人柔顺性相结合,交互动力学——摩擦力、惯性、接触行为——通常与人体运动足够接近,使模型学习到的先验保持在分布范围内。模型能想象到的,NEO 通常就能做到。
两阶段落地:从视频到动作
原始视频提供了视觉上的"是什么",但缺乏控制上的"怎么做"。为了将视频知识带入世界模型形态,1X 采用了由其集成技术栈支撑的两阶段落地过程,遵循 DreamGen 和 UniPi 等已有工作:
- 世界模型(WM):给定文本提示和起始帧,WM 将预期的未来展开为视频序列。
- 逆动力学模型(IDM):IDM 从生成的视频帧中提取所需的机器人动作轨迹。
在推理时,系统接收文本提示和起始帧。WM 展开预期的未来,IDM 提取所需的轨迹,机器人执行该序列到真实世界。
1XWM 架构
1XWM 骨干网络建立在 140 亿参数的生成式视频模型之上。为了将该模型适配到 NEO 的具身形态,1X 采用了多阶段训练策略:
字幕增强
DALL-E 3 等先前工作表明,在描述性视觉字幕上训练可以显著提高视觉基础模型的提示遵从性。然而,许多第一人称数据集只包含简短的任务描述。为此,1X 使用 VLM 生成更详细的字幕,通过字幕增强过程用于训练。
评估指标
为了选择最佳的 1XWM 骨干检查点,1X 使用一种评估指标,比较真实未来动作序列与训练好的 IDM 在生成视频上运行得到的动作之间的动态时间规整距离。这有助于筛选出不仅视觉效果好而且动作准确的生成结果。
逆动力学模型(IDM)
类似于 DreamGen,1X 使用一个双图像 IDM 预测器,滑动窗口为 W=8 帧,以实现高效的训练和推理。但不同之处在于,他们使用 Depth Anything 骨干网络和独立的流匹配头,而非单一扩散 Transformer。t 和 t+W 时刻的帧通过深度骨干网络,提取的嵌入用于流匹配头的条件输入。IDM 在 400 小时未过滤机器人数据上训练,包括随机玩耍数据和与任何有意义任务不对应的运动。这使得模型能够在任何位置忠实地追踪 NEO 的运动。
真实世界执行
在测试时,给定起始帧和指示 NEO 该做什么的文本提示,1XWM 展开未来视频帧。IDM 随后提取相应的机器人动作轨迹,并直接在机器人上执行。为确保轨迹平滑,IDM 的输出在一批初始噪声值和滑动窗口之间进行时间维度平均。
NEO 后训练数据集主要包含高质量的拾取-放置数据(98.5%),筛选条件为台面操作且手部可见。通过利用基础视频模型的网络规模预训练,1XWM 能够泛化到大量未见过的物体、环境和任务。
泛化能力与局限性
1X 探索了超越 NEO 已见过和做过的任务泛化能力。生成的视频和事后事实的视频并排观看时非常相似,表明 1XWM 具有强大的空间、运动学和物理理解能力。
团队还测试了需要双手协调和人机交互的任务——这些能力不包含在训练数据集中。这表明此类知识来自视频预训练和第一人称人类中间训练。由于 NEO 的具身形态与人类非常相似,从人类视频数据中学到的可供性可以直接迁移。
然而,生成结果有时对任务完成和深度理解过于乐观。生成的展开在视觉上看起来合理,但可能微妙地违反真实世界约束(如物体一致性、深度、几何形状、接触)。后训练方案显著减少了这些错误,但单目预训练仍可能导致三维定位能力不足,即使生成的视频"成功"了,真实机器人也可能不到位或过冲。
测试时计算:Best-of-N 采样
有时从视觉上就能明显看出生成的展开是否可能成功。例如,用"pull tissue"(抽纸巾)提示 1XWM 时,偶尔会生成 NEO 拿起纸巾盒的视频。1X 发现执行错误生成时的成功率接近 0%。
这促使团队探索测试时计算来提高任务成功率。通过并行生成多个展开并执行最好的一个,团队在"抽纸巾"任务上研究了一到八个并行生成的情况,发现从八个选择中选出最高质量生成可以带来更高的任务成功率。
消融实验
字幕增强
1X 发现字幕增强在所有评估拆分上都提高了视频生成质量。增强后的字幕更好地匹配视频模型预训练期间使用的详细文本条件,同时也为任务特定的运动提供更清晰的条件。
第一人称人类数据
添加第一人称人类数据在新任务和文本到图像拆分上都提高了生成质量。这与第一人称人类数据为操作提供了可迁移先验、且能很好地映射到 NEO 人形具身的假设一致。对于有良好 NEO 数据覆盖的分布内任务,第一人称数据可能稀释后训练混合,导致视觉评分中性或负面的变化。
真实世界消融
对于每个任务,所有模型在相同设置下、同一机器人上运行 30 次,不使用测试时过滤。在分布内任务(抓取薯片)上,所有模型表现相似,表明分布内任务对数据或字幕变化最不敏感。
擦洗盘子任务在所有模型中最具挑战性。缺少第一人称人类中间训练阶段或字幕增强的模型会错误理解指令。同时具备两者的模型是唯一实现非零成功率的模型。
总体来看,存在一个清晰的联系:提高视觉模型质量的改进也提高了真实世界实验中的任务成功率。
结论
1XWM 将网络规模视频数据的知识迁移到 NEO 上,先想象再执行各种任务。从这里出发,1X 期待改进 1XWM,以解决实现有用的家庭自主性所需的更复杂、更长程的任务。在生成式视频模型快速发展的基础上,配备 NEO 量产爬坡数据,视频到动作的机器人学习前景广阔。

