Skip to content
RobotWorld
返回开源项目

OPEN SOURCE DEEP DIVE

LightNav-0LightOrigins导航

LightNav-0:激发 VLM 空间智能的通用具身导航模型

Light Origins 开源的紧凑型通用导航模型:Qwen3-VL-4B 骨干 + 双通道指向 + RVQ 动作 token,单一检查点覆盖指令跟随/物体导航/视觉追踪,零样本迁移人形、四足、轮式、无人机四类本体,全仿真训练,Apache-2.0。

lightorigins/LightNav-061PythonApache-2.02 min read

一个模型、四种机器人:通用具身导航大脑

LightNav-0 是 Light Origins 团队开源的紧凑型通用具身导航模型。它的核心思路是"激发预训练视觉语言模型的空间智能":以 Qwen3-VL-4B-Instruct 为骨干,不添加任何导航专用模块——没有路点预测头、没有任务专用动作头、没有按本体拆分的专家网络。仅扩充词表(索引化指向 token + RVQ 动作 token),空间推理轨迹与动作编码都通过骨干原有的自回归 LM 头解码。

指令跟随、开放词汇物体导航、具身视觉追踪三类任务共享同一套 token 接口,同一个检查点零样本迁移到人形、四足、轮式、无人机四种机器人本体,以及训练中未见过的场景——全程无遥操作。

方法:双通道指向 + RVQ 动作 tokenizer

LightNav-0 架构:VLM 骨干消费压缩的第一人称 RGB 历史与语言指令,输出双通道指向 token 与三个 RVQ 动作 token,解码为 10 个 SE(2) 路点
LightNav-0 架构:预训练 VLM 骨干消费压缩的第一人称 RGB 历史与语言指令,先输出双通道指向,再由三个 RVQ 动作 token 解码出 10 个 SE(2) 路点。

每个决策步,模型把带时间戳的第一人称 RGB 历史与自然语言指令交织进单一因果序列,输出两样东西:

  • 双通道指向——一个"可供性点"(可行的局部方向/自由空间路点)+ 一个"目标点"(任务目标),各占一个图像网格 token。这是显式的空间推理轨迹:先在像素上锚定计划,再生成动作。
  • 三个 RVQ 动作 token,解码为未来 10 个 SE(2) 路点——交给各本体自己的低层控制器的统一几何接口。

任务语义完全来自指令,没有任务识别 token;同一骨干、同一接口、同一目标函数服务所有导航任务。

时间感知的历史压缩:导航既需要近处的几何细节,也需要长时程上下文。LightNav-0 按"近因"压缩历史,遵循艾宾浩斯遗忘曲线的形状:采样率随帧龄指数衰减、空间池化步长指数增长——越久远的观测贡献越少越粗的 token,当前观测保留最细细节。时间戳 token 在池化后保持顺序。压缩器跑在 ViT 之后,支持 256K/576K/1M 像素预算,限定上下文长度而不把整段历史塌缩成单帧摘要。

RVQ 动作 tokenizer:10 步 SE(2) 轨迹由 1 个 256 项粗码本 + 2 个 256 项残差码本量化,分辨率分别约 0.9m、7cm、4cm。任意非空前缀都能解码为可执行的粗轨迹,每加一层残差就细化几何精度——三个 token 同时表达大尺度运动与厘米级路径形状。

分层残差向量量化动作 tokenizer:粗码本加两个残差码本量化 10 步 SE(2) 轨迹
分层残差向量量化动作 tokenizer:粗码本 + 两个残差码本量化 10 步 SE(2) 轨迹,组合码字解码回轨迹。

基准:单一检查点全面领先

一个共享检查点、不按基准微调,全部数字来自单一前向 RGB 流(无深度、无里程计、无全景相机)。要点:

  • 指令跟随(VLN-CE):R2R val-unseen SR 68.5% / SPL 62.8%,RxR SR 73.6% / SPL 64.5%,超过 NaVILA、StreamVLN、DualVLN、CorrectNav、Qwen-RobotNav-8B。
  • 物体导航(6 个 ObjectNav 设置):MP3D 53.3%、HM3D v2 79.5%、OVON 未见类别 47.0%,六项全部第一。
  • 具身视觉追踪(EVT-Bench):带干扰物的 DT 设置 SR 82.6%,并超过论文中所有全景/多相机系统。
  • INSIGHT-Bench(部署导向基准,1097 个 episode、210 个室内外场景、统一 120° 前视 RGB 接口):SR 43.7%,大幅领先 NaVid 26.9%、Uni-NaVid 24.3%。

缩放分析给出三条不同曲线:模型规模 2B→4B 提升明显(R2R SR/SPL +8.6/+7.4)但 8B 基本不涨;数据量单调但边际递减;环境多样性是唯一持续有回报的轴——训练环境从 1/8 加到全部,R2R +16.7 SR、RxR +21.1 SR。场景多样性,而非参数量或纯时长,才是可靠的杠杆。

VLN 缩放分析:成功率随骨干规模、数据量、环境覆盖率的变化
缩放分析:模型规模饱和、数据边际递减,环境覆盖率是唯一持续回报的轴。

工程与部署:全仿真训练,真机即插即用

模型完全在仿真中训练("所以可扩展"),经 scalable 的 real2sim2real 迁移到真实机器人,跨机器人、跨任务、跨场景。仓库提供完整链路:

  • 推理/服务:`lightnav-predict` 一条命令对视频片段做指令导航;`lightnav-serve` 起 WebSocket 服务流式接帧,多机器人可共享一台服务器(会话微批)。
  • 仿真试玩:`mujoco_demo/` 自带 MuJoCo TurtleBot + ProcTHOR 场景,无需 ROS/Habitat/GPU,浏览器即开即玩。
  • 真机部署:`robot_deploy/` 是完整的 ROS 2 机上栈——相机驱动、WebSocket 客户端、MPC 路点跟踪器、Web 控制面板,自带 Unitree Go2 与 LimX TRON 1 适配器,并提供"自带机器人"接口。
  • 评测:VLN-CE / ObjectNav 与 EVT-Bench 评测 harness 随仓库发布;INSIGHT-Bench 的 episode 与评测代码单独放出。
LightNav-0 总览:仿真数据引擎、三阶段训练、四类机器人零样本部署与十个公开基准对比
LightNav-0 总览:基于仿真的数据引擎、三阶段模型训练、四类机器人本体的零样本部署,以及十个公开基准上的成功率对比。

模型权重在 Hugging Face(LightOriginsHQ/LightNav-0,基于 Qwen3-VL-4B-Instruct 微调),代码与权重均为 Apache-2.0。论文:arXiv 2608.30935《LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation》。