OPEN SOURCE DEEP DIVE
LightNav-0:激发 VLM 空间智能的通用具身导航模型
Light Origins 开源的紧凑型通用导航模型:Qwen3-VL-4B 骨干 + 双通道指向 + RVQ 动作 token,单一检查点覆盖指令跟随/物体导航/视觉追踪,零样本迁移人形、四足、轮式、无人机四类本体,全仿真训练,Apache-2.0。
一个模型、四种机器人:通用具身导航大脑
LightNav-0 是 Light Origins 团队开源的紧凑型通用具身导航模型。它的核心思路是"激发预训练视觉语言模型的空间智能":以 Qwen3-VL-4B-Instruct 为骨干,不添加任何导航专用模块——没有路点预测头、没有任务专用动作头、没有按本体拆分的专家网络。仅扩充词表(索引化指向 token + RVQ 动作 token),空间推理轨迹与动作编码都通过骨干原有的自回归 LM 头解码。
指令跟随、开放词汇物体导航、具身视觉追踪三类任务共享同一套 token 接口,同一个检查点零样本迁移到人形、四足、轮式、无人机四种机器人本体,以及训练中未见过的场景——全程无遥操作。
方法:双通道指向 + RVQ 动作 tokenizer
每个决策步,模型把带时间戳的第一人称 RGB 历史与自然语言指令交织进单一因果序列,输出两样东西:
- 双通道指向——一个"可供性点"(可行的局部方向/自由空间路点)+ 一个"目标点"(任务目标),各占一个图像网格 token。这是显式的空间推理轨迹:先在像素上锚定计划,再生成动作。
- 三个 RVQ 动作 token,解码为未来 10 个 SE(2) 路点——交给各本体自己的低层控制器的统一几何接口。
任务语义完全来自指令,没有任务识别 token;同一骨干、同一接口、同一目标函数服务所有导航任务。
时间感知的历史压缩:导航既需要近处的几何细节,也需要长时程上下文。LightNav-0 按"近因"压缩历史,遵循艾宾浩斯遗忘曲线的形状:采样率随帧龄指数衰减、空间池化步长指数增长——越久远的观测贡献越少越粗的 token,当前观测保留最细细节。时间戳 token 在池化后保持顺序。压缩器跑在 ViT 之后,支持 256K/576K/1M 像素预算,限定上下文长度而不把整段历史塌缩成单帧摘要。
RVQ 动作 tokenizer:10 步 SE(2) 轨迹由 1 个 256 项粗码本 + 2 个 256 项残差码本量化,分辨率分别约 0.9m、7cm、4cm。任意非空前缀都能解码为可执行的粗轨迹,每加一层残差就细化几何精度——三个 token 同时表达大尺度运动与厘米级路径形状。
基准:单一检查点全面领先
一个共享检查点、不按基准微调,全部数字来自单一前向 RGB 流(无深度、无里程计、无全景相机)。要点:
- 指令跟随(VLN-CE):R2R val-unseen SR 68.5% / SPL 62.8%,RxR SR 73.6% / SPL 64.5%,超过 NaVILA、StreamVLN、DualVLN、CorrectNav、Qwen-RobotNav-8B。
- 物体导航(6 个 ObjectNav 设置):MP3D 53.3%、HM3D v2 79.5%、OVON 未见类别 47.0%,六项全部第一。
- 具身视觉追踪(EVT-Bench):带干扰物的 DT 设置 SR 82.6%,并超过论文中所有全景/多相机系统。
- INSIGHT-Bench(部署导向基准,1097 个 episode、210 个室内外场景、统一 120° 前视 RGB 接口):SR 43.7%,大幅领先 NaVid 26.9%、Uni-NaVid 24.3%。
缩放分析给出三条不同曲线:模型规模 2B→4B 提升明显(R2R SR/SPL +8.6/+7.4)但 8B 基本不涨;数据量单调但边际递减;环境多样性是唯一持续有回报的轴——训练环境从 1/8 加到全部,R2R +16.7 SR、RxR +21.1 SR。场景多样性,而非参数量或纯时长,才是可靠的杠杆。
工程与部署:全仿真训练,真机即插即用
模型完全在仿真中训练("所以可扩展"),经 scalable 的 real2sim2real 迁移到真实机器人,跨机器人、跨任务、跨场景。仓库提供完整链路:
- 推理/服务:`lightnav-predict` 一条命令对视频片段做指令导航;`lightnav-serve` 起 WebSocket 服务流式接帧,多机器人可共享一台服务器(会话微批)。
- 仿真试玩:`mujoco_demo/` 自带 MuJoCo TurtleBot + ProcTHOR 场景,无需 ROS/Habitat/GPU,浏览器即开即玩。
- 真机部署:`robot_deploy/` 是完整的 ROS 2 机上栈——相机驱动、WebSocket 客户端、MPC 路点跟踪器、Web 控制面板,自带 Unitree Go2 与 LimX TRON 1 适配器,并提供"自带机器人"接口。
- 评测:VLN-CE / ObjectNav 与 EVT-Bench 评测 harness 随仓库发布;INSIGHT-Bench 的 episode 与评测代码单独放出。
模型权重在 Hugging Face(LightOriginsHQ/LightNav-0,基于 Qwen3-VL-4B-Instruct 微调),代码与权重均为 Apache-2.0。论文:arXiv 2608.30935《LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation》。