Skip to content
RobotWorld
返回博客
LightNav-0:把 2000+ 真实场景变成 4000+ 小时对齐经验,零样本通用导航大脑
具身智能Real2Sim2Real导航

LightNav-0:把 2000+ 真实场景变成 4000+ 小时对齐经验,零样本通用导航大脑

Light Origins 发布 LightNav-0:Real2Sim2Real 数据引擎把 2000+ 互联网真实场景变成可复用仿真世界,产出 4000+ 小时视觉-语言-动作经验,经三阶段后训练在 10 项仿真设置中刷新纪录,并零样本迁移到人形、四足、空中与轮式机器人。

Light Origins2026年9月1日4 分钟阅读
EN

把真实场景变成可扩展的经验

要构建能在不同机器人本体、任务和场景之间零样本泛化的具身基础模型,必须在大规模真实世界经验上做后训练(也就是对齐)。现实世界遥操作是收集这类经验的主要方式,但要达到支撑零样本泛化所需的规模和多样性,仍然非常困难。

Light Origins 用一个 Real2Sim2Real 数据引擎来大规模合成真实世界经验的仿真替代品。它把 2,000 多个来自互联网的真实世界场景变成可复用的仿真世界,为导航后训练产出 4,000 多小时多样化的视觉-语言-动作(VLA)经验。

这批数据通过三个阶段训练通用导航模型:具身推理(ER)中期训练具身监督微调(SFT)在线强化学习(RL)。最终产物是 LightNav-0——单个模型在指令跟随、目标物体导航和具身视觉跟踪三大类共 10 个仿真设置上取得最先进性能,并零样本迁移到人形、四足、空中和轮式机器人。

Light Origins 把通往物理 AGI 的路径概括为三个扩展范式:可扩展预训练、可扩展对齐、可扩展部署。LightNav-0 是其通过 Real2Sim2Real 走向可扩展对齐的第一步,它展示的命题是:规模化对齐才是物理世界零样本泛化的关键。

LightNav-0 是 Light Origins 的首个通用导航大脑,展示了跨多种机器人本体、任务和场景的零样本泛化。

01 · 打破具身后训练的冷启动

具身后训练有一个生产问题:物理经验是一台机器人、一个环境、一次尝试这样到来的,而泛化却依赖本体、世界与任务的各种组合。在真实世界里收集这些组合不仅昂贵,而且跟不上现代模型训练所需的迭代速度。

可扩展对齐(Scalable Alignment)从 2,000 多个来自互联网的真实世界场景出发。数据引擎不把它们当作静态资产,而是把不同格式的场景统一到同一个仿真接口里,让每个世界都能支撑多种目标、路线、视角和任务形式。相机几何随经验一起变化,训练分布因此不会绑定在某个视场角、安装高度或机器人本体上。

每一次 rollout 都变成一条对齐记录:模型看到了什么、指令指向什么、应该关注哪里、应该如何移动。正是这种对齐——而非单纯的渲染量——把场景规模转化为后训练价值。当前引擎产出 4,000 多小时的视觉-语言-动作经验;而物理部署又会揭示下一轮应该补充哪些场景、任务和交互。

图 01 —— 真实场景被渲染成经验。仿真导航回合 · 第一人称 RGB · 8 fps。

02 · 后训练配方:三个阶段

具身基础模型正越来越遵循一套熟悉的后训练配方:领域中期训练、监督微调、强化学习。这个顺序是刻意的——中期训练塑造表征,SFT 教会行为,RL 在策略自身分布下改进结果。LightNav-0 通过 ER 中期训练、具身 SFT 和在线 RL 把这套配方适配到导航上。

02A · 阶段 I —— 在行动对齐之前先推理空间

机器人轨迹之所以昂贵,是因为每一条都必须同时对齐场景、指令和动作序列。然而导航策略在行动之前需要的很多能力——把语言落地到像素、定位自由空间、推理空间关系、跟踪变化——完全可以从图像和视频中以更大的规模学到。阶段 I 在中期训练中建立这些空间先验;阶段 II 再用轨迹把它们连接到动作上。

Gemini Robotics 建立在 Gemini Robotics-ER 之上,MolmoAct2 用 MolmoER 作为 VLM 骨干——这是具身推理成为动作学习基础的两个例子。LightNav-ER 为 LightNav-0 扮演的正是这个角色:用空间先验初始化阶段 II。在行动对齐之前,它在报告的 8 个具身推理基准上 4 个第一、4 个第二,宏平均分 67.4。

阶段 I 的训练配方

能力族主动采样占比
图像指点(Image pointing)35.14%
单图 VQA25.05%
通用视觉与抽象推理20.00%
视频推理19.81%

指点是最大的专项组成部分;视觉、抽象与时序推理占其余的 64.86%。阶段 I 的混合数据来自 36 个数据源。

八个具身推理基准:LightNav-ER 平均 67.4

基准LightNav-ER
Point-Bench64.5
RefSpatial57.4
RoboSpatial-POI56.5
RoboSpatial-VQA71.9
Where2Place76.6
CV-Bench88.4
ERQA43.8
EmbSpatial79.8

汇总:平均 67.4,8 个基准中 4 个第一、4 个第二,比初始化(Qwen3-VL)高 4.3。与 MolmoER 的对比也印证了同一趋势。

实体落地(Entity Grounding)

被接地的短语始终与其图像空间中的点保持链接。下面的例子展示了模型如何根据"列出图中所有家用电器并指出每个的位置"这样的提示,把冰箱、饮水机、微波炉和咖啡机逐一点出来。

办公茶水间场景中的家电被逐一指点定位
提示:"列出这张图片中的家用电器,并指出每个的位置。" 接地输出:冰箱、饮水机、微波炉和咖啡机,每个实体都对应图像空间中的点。
未来城市中的飞行汽车被全部点出
开放集实体接地:模型在未来城市场景中找出全部飞行汽车。
霓虹广告牌被全部点出
密集实例计数:图中全部霓虹广告牌被逐一点出(共 18 处)。

02B · 阶段 II —— 构建具身 SFT 数据

阶段 I 给了模型空间先验;阶段 II 必须把它变成行为。物理采集无法在后训练规模上覆盖足够多的场景、目标、路线和视角组合。Real2Sim2Real 改变了规模的基本单位:场景只采集一次,然后用它生产许多可执行的交互。

目标标注:Molmo2 标注开放集物体

来自互联网的原始场景资产并不自带可用的导航目标。对于没有标注的高斯泼溅场景,Molmo2 在渲染视图中指向候选物体;引擎把这些点提升到 3D,只保留跨视角一致的目标。带标注 3D 包围盒的场景则直接进入目标清单。所有场景来源的图像空间点都通过度量深度提升到同一个目标清单中。

场景中的目标实例被标注并汇总成目标清单
开放集指点 → 实例清单:每个实例至少 2 个视角、空间散布小于 0.6 米,多视角 3D 融合后进入统一目标清单(RGB + 度量深度 · 4 个朝向)。

回合合成:仿真器生成可执行的 rollout

目标通过验证后,引擎从目标清单采样目标、抽取可见起点、在导航网格上规划并锚定路线,然后渲染第一人称视频——大规模地执行。动作轨迹最先生成;语言在之后添加,且不允许改变目标或几何。

从可见起点开始的导航回合
一个回合的起点:目标从停止点可见,保证指令在几何上可执行。
导航网格上规划的路线
在导航网格上规划并锚定路线,一个场景可以产出许多回合。
停止锚点特写
停止锚点:路线终点的几何约束。

语言验证:VLM 把 rollout 变成经过验证的语言

几何提供了路线,视频提供了观测历史,语言是唯一不确定的组件——因此引擎沿两条独立路径生成语言并做双重验证。模板或视频 VLM 起草的指令在语义检查下重写,再对着最终视图验证。八方向扇区产生感知目标的模板(几何路径),Seed2.0 起草基于视频的指令(视频路径),两种来源共享同一个语言面。这一步把一个渲染出的 rollout 变成对齐的训练样本。

仿真广场场景的到达视角
指令描述的是真实存在的行为,而不是让规划器从孤立的文字里恢复行为。

对齐与均衡检查之后,每个回合离开引擎时都是一条同步记录:语言、视觉历史、图像空间点和运动。阶段 II 扩展的是这些记录——不是场景或视频本身,而是对齐的具身经验。

INSIGHT-Bench:引擎的一个可复现切片

INSIGHT-Bench 记录了这个引擎的一个可复现切片:来自 1,683 个场景的 53,090 个训练回合,外加来自 210 个场景、共 1,097 个回合的冻结评估集。场景混合了常规网格与高斯泼溅重建;回合混合了五种空间类型与指令指定目标的五种不同方式。

训练回合按场景来源回合数占比
HM3D / MP3D34,53165.0%
InteriorGS8,53416.1%
HabitatGS5,77610.9%
VLNVerse4,2498.0%

渲染器还把传感器几何当作一个数据维度:在同一场景内采样 90–130° 视场角、0.5–1.5 米相机高度、−15° 到 15° 俯仰角。这让策略在训练期间就接触到本体尺度的视角变化,而不是把每条路线绑定到单一相机配置。

带接地目标的第一人称渲染视图
引擎渲染出的第一人称视图——几何提供路线,视频提供观测历史,语言最后生成并验证。

02C · 阶段 II —— 让空间推理变得可执行

这些对齐记录,正是阶段 I 的空间先验转化为行为的地方。从同一条语言目标和同一段视觉历史出发,模型要学会三个相互关联的决策:目标指的是什么、哪里可以运动、哪条轨迹能到达目标。由于三者由同一次交互监督,阶段 II 把感知与动作当作一个问题来学,而不是两个分离的任务。

训练配比保留了这个基础:大部分样本教导航与动作,较小的推理流则维持阶段 I 的空间能力处于活跃状态。在阶段 II 数据固定的前提下,LightNav-ER 初始化改善了全部八个被评测的设置。一个紧凑的接口把先验带入行为——图像空间的 Point CoT 表达空间意图,RVQ 动作 token 表达随后的轨迹。

完整的阶段 II 混合数据超出上述记录切片:16 个导航数据源与 33 个推理数据源共同训练。R2R、RxR、ScaleVLN、SRDF 与跟踪数据、户外场景、高斯泼溅世界一同进入训练流。指令保持长文本形态:总计 74.2 万条、去重后 47.4 万条,中位长度 20 词。

可用数据池样本量
VQA520 万
ObjectNav470 万
SRDF470 万
ScaleVLN280 万
Tracking280 万
VLN-CE · RxR180 万
VLN-CE · R2R64.2 万
INSIGHT-Bench45.4 万

实际训练中,77.6% 的采样样本用于导航与动作,22.4% 为视觉问答(VQA)。

ER 初始化改善全部八个设置

设置LightNav-ER 相对 Qwen3-VL 初始化的增益
R2R+2.7
RxR+1.0
HM3D v1+3.1
HM3D v2+1.5
MP3D+4.2
OVON Seen+1.6
OVON Synonyms+0.8
OVON Unseen+4.0
平均成功率60.8 → 63.1(8/8 改善)
平均 SPL39.0 → 40.0

路线教会模型看哪里、往哪走

由于 Real2Sim2Real 引擎为每一帧保留了被指称物体、相机位姿与路线,每个回合天然自带点标签:一个可达的未来路径点投影为"可供性点"(affordance point);每当被指称物体进入视野,其 3D 目标就投影为"物体点"(object point)。因此点监督随生成的路线一起增长——无需单独的标注流程。

用于标注可供性点的仿真室内 RGB 观测
可供性点:从自由空间中选出的一个可导航点(RGB 视图)。
带选中自由空间可供性点的深度渲染
同一帧的深度渲染与投影出的可供性点。
包含被指称扶手椅的仿真室内 RGB 观测
物体点:被指称物体在图像空间中落地(RGB 视图)。
带被指称物体点的深度渲染
同一帧的深度渲染与被指称物体点。

Point CoT:为什么图像空间的点胜过文本与 3D 坐标

Point CoT 始于一个约束:自回归控制的推理必须便宜到每一步都能跑、结构化到能在数据引擎规模上被监督。团队首先考虑过文本 CoT——表达力强,但长度不定、解码昂贵、难以一致地合成,且动作失败时难以证伪。也考虑过度量 3D 目标——精确,但把监督绑死在深度、位姿、相机标定、重建以及跨本体统一坐标系上。

图像空间的点提供了更简单的替代方案:每个决策只增加两个点 token——物体点在被指称物体可见时将其落地,可供性点标出用于前进的自由空间。仿真几何大规模地提供这两个标签;部署时模型仅凭 RGB 与语言预测它们——无需深度、定位、标定或地图。由于格式固定,推理序列保持很短。

设置Point CoT 成功率增益
R2R+9.0
RxR+2.8
HM3D v1+13.5
HM3D v2+11.6
MP3D+12.0
OVON Seen+7.1
OVON Synonyms+7.5
OVON Unseen+3.9
平均成功率 / 平均 SPL+8.4 / +5.7(8/8 改善)

动作即 token

每个训练目标都是带十个路径点的度量 SE(2) 轨迹。为了把动作放进与语言、图像空间点相同的自回归接口,团队在阶段 II 轨迹分布上学习了一个残差向量量化器(RVQ)。

该 tokenizer 由三个 256 条目的码本组成:L0 选择粗轨迹,L1 与 L2 编码逐级残差。最终的三 token 表示达到平均路径点位移误差 0.72 cm。消融支持三层即最小充分层级:两层会显著增大重建误差,更多层或更大码本只有边际收益。每个前缀都可解码——L0 本身就定义一条完整粗轨迹,后续每个 token 逐步细化。

对齐回合中的 rollout 帧
一个对齐回合变成一个有序的预测目标:LightNav-0 先输出物体点与可供性点作为图像空间 CoT,随后输出三个 RVQ 动作 token。解码动作 token 即可恢复固定 1.5 米前向范围内的十点轨迹。

环境扩展尚未饱和

由于预测接口与阶段 II 配方保持不变,可以在不改变学习目标的前提下沿三个轴变化规模:训练环境数量、对齐 SFT 样本数量、模型容量。在测试范围内,扩大环境集合是改善策略最可靠的方式——环境扩展的每一步四项指标都在上升;增大模型规模结果好坏参半,而从同一场景池追加 SFT 回合则收益递减。在当前规模下,新增环境很可能比更密集地采样现有环境更有价值。

Real2Sim2Real 让这种扩张可落地:每个采集的环境重建一次,之后被反复用于生成多条对齐的目标、路线、指令与相机视角。更多算力提高回合吞吐量;更多场景资产扩大回合覆盖的视觉与空间变化。

02D · 阶段 III —— 超越示范训练

再宽泛的 SFT 数据也有边界:它向策略展示了成功导航如何展开,却没教它如何从自己的错误中恢复。一次转弯太晚、一次过冲、一次丢失目标,都会把策略带入示范极少覆盖的状态。阶段 III 保持同样的"点 + 动作"接口,但从新的经验来源学习——策略自己的轨迹及其结果。

阶段 III 完全在仿真中进行。模型不再跟随数据引擎提供的路线,而是提出完整计划,由仿真器对结果打分。策略自身的状态——以及自身的错误——开始塑造训练信号。GRPO 从这些计划的相对结果中学习。动作词表保持固定——RL 在 SFT 引入的同一套 RVQ 动作 token 上运行——而监督从"模仿成功路线"转向"改善策略自身决策的后果"。

EVT-Bench 的分心跟踪(distracted-tracking)切分提供了稳定的读数:成功率从 SFT 检查点的 74.4 上升到第 120 步观测到的最佳值 82.6(在 101 个场景的 1,392 个回合上评测),之后进入平台期。

03 · 跨任务、跨场景、跨本体的泛化

公开基准是第一道迁移测试。Light Origins 在十个设置上评估同一个检查点,覆盖指令跟随、物体导航、开放词汇搜索与目标跟踪,使用 VLN-CE、Matterport3D 与 HM3D、HM3D-OVON 和 EVT-Bench。

LightNav-0 只用单路第一人称 RGB,且局限于相机当前视场;全景与多相机方法一次能观察多个方向。因此每项设置给出两组对比:相同传感约束下的单目方法,以及更宽视角系统的结果。LightNav-0 在全部十个单目对比中排名第一;把更宽传感纳入后,仍有四项保持第一(原文 Fig. 12)。

设置(基准)LightNav-0(单目 SR)最强单目对手最强宽视角结果
R2R(VLN-CE val-unseen)68.5Qwen-RobotNav-4B 66.9Qwen-RobotNav-8B 72.1
RxR(VLN-CE val-unseen)73.6Qwen-RobotNav-8B 73.4Qwen-RobotNav-8B 76.5
MP3D 物体导航53.3CogNav 46.6Qwen-RobotNav-4B 52.2
HM3D v174.5Uni-NaVid 73.7WMNav 58.1
HM3D v279.5FiLM-Nav 77.0Qwen-RobotNav-4B 75.6
OVON Seen55.3MTU3D 55.0Qwen-RobotNav-4B 57.7
OVON Synonyms53.3MTU3D 45.0Qwen-RobotNav-4B 60.1
OVON Unseen47.0MTU3D 40.8ABot-N0 54.0
EVT 单目标跟踪91.7ReferTrack 89.4CoMaTrack 92.1
EVT 干扰跟踪82.6ReferTrack 73.3CoMaTrack 74.2

重新思考导航评测

大多数导航基准把多种能力压缩成一个成功率,场景集中在 Habitat 风格的室内扫描,指令又常是长路线描述。模型失败时,分数无法说明它是误解了目标、漏掉了空间关系,还是根本不会在这个场景里走。

Light Origins 为此构建了 INSIGHT-Bench,把因素拆开:它评估五种"原子化"的目标指定方式——基础(Base)、方向(Direction)、关系(Relation)、极值(Extremum)、序数(Ordinal),横跨公寓、住宅、商业空间、机构场所与户外环境五类场景。基准包含 210 个保留场景中的 1,097 个 episode。在相同"前视 RGB"协议下评测的七个开源策略中,LightNav-0 在每一个指令类别和场景类别上都取得最高成功率

场景类型:公寓、住宅、商业、机构与户外 指令类型:基础、方向、关系、极值与序数
Fig. 13 — INSIGHT-Bench 的两个轴:五种场景类型 × 五种指定导航目标的原子方式。

INSIGHT-Bench 上的具体数字(成功率,共享 0–70 刻度):按指令类型,LightNav-0 取得 Base 45.1、Direction 57.7、Relation 37.8、Extremum 37.2、Ordinal 38.2,全面领先 JanusVLN、NaVid、Uni-NaVid、TAMP-Nav、InternVLA-N1 与 StreamVLN;按场景类型,LightNav-0 取得公寓 61.1、住宅 50.5、商业 42.1、机构 29.2、户外 34.2,同样全类别第一。

零样本迁移是具身后训练的试金石

一个策略在单一机器人上有价值并不稀奇,泛化才是更强的考验:当身体、环境或任务改变时,还剩下什么。LightNav-0 沿三个轴接受检验——四种物理机器人本体、未见过的室内外环境,以及三大任务族:长指令跟随、开放词汇物体导航、目标跟踪。

Fig. 15 — 拥挤街道上的跨本体跟踪:三种机器人本体 · 行人与移动干扰物。
Fig. 16 — 户外跟随移动目标。LightBot-0 · 公共公园。
Fig. 17 — 室内目标跟踪。Unitree Go2 · 办公环境。
Fig. 18 — 办公室指令跟随。LightBot-0 · 多个语言目标。
Fig. 19 — 开放词汇物体导航。LimX TRON 1 · 公共公园。
Fig. 20 — 跨本体目标跟踪。三种机器人本体 · 公共街道。

04 · 超越具身导航

数据扩展只有在策略能走出"孕育它的世界"时才有意义。因此测试原封不动的检查点,让它远离机器人训练数据的视觉分布:先在闭环交互世界里,再在开环的真实世界视频上。

两种设置回答不同的问题。在交互世界里,每个预测动作都会改变下一个观测,误差会累积,策略被端到端地考验;在视频里,模型无法影响自己看到的内容,这隔离出目标接地、自由空间推理与轨迹预测能否在陌生相机、运动与视觉风格下幸存。

陌生世界里的闭环控制

每个环境加入不同的挑战:体素世界改变场景几何与纹理;驾驶世界要求高速连续转向,留给纠错的时间更少;第一人称世界引入老式图形画面,最后一个还同时改变分辨率与宽高比(低分辨率 4:3 画面)。

Fig. 21 — 导航至目标并跟踪。体素世界 · 物体导航 + 跟踪。
Fig. 22 — 跟随一条漫长蜿蜒的路线。驾驶世界 · 连续转向。
Fig. 23 — 跟随长路线指令。第一人称世界 · 老式纹理。
Fig. 24 — 导航至命名目标。第一人称世界 · 风格化光照。

开环视觉迁移

山地骑行、速度滑冰、自由式滑雪与越野跑带来快速自我运动、遮挡、尺度变化,以及具身后训练数据中不存在的非机器人相机动力学。在这些视频中,LightNav-0 依然逐帧接地目标并预测可行运动。

Fig. 25 — 预测穿越变化地形的路径。山地骑行。
Fig. 26 — 在近距干扰物中跟踪目标。速度滑冰。
Fig. 27 — 预测穿越腾空与尺度变化的运动。自由式滑雪。
Fig. 28 — 随小径转弯更新路径。越野跑。

05 · LightNav-0 已开源

此次发布汇聚了 LightNav-0 背后的模型、代码与技术报告,更完整的评测套件将随后跟进。Light Origins 同时感谢 LimX Dynamics(逐际动力)与 Manycore Tech(群核科技)在物理部署与仿真上的协作支持。

RobotWorld 视角:LightNav-0 给"具身后训练数据从哪里来"提供了一个可复用的答案——不是更努力地遥操作,而是把互联网场景变成可执行的对齐经验工厂。三个可复用的工程判断值得注意:其一,"先几何后语言"的生成顺序让指令天然可执行,绕开了从文本反推行为的经典难题;其二,图像空间点(Point CoT)证明推理接口可以只有两个点那么便宜,却仍带来全部八个设置的提升;其三,环境覆盖率而非数据量或参数量,是当前最可靠的扩展轴。对国内团队而言,这套 Real2Sim2Real 管线与跨本体零样本结果,为"用仿真对齐替代真机遥操作"提供了迄今最完整的公开证据链。

来源:Introducing LightNav-0 — Scaling Real2Sim2Real for Zero-Shot Generalist Navigation,Light Origins,2026 年 9 月 1 日。本文为完整翻译/改编,图表数据均取自原文。

相关文章