PAPER DEEP DIVE
VOP-Nav:四足机器人在拥挤环境中的敏捷导航
VOP-Nav 将速度障碍(VO)的几何安全性与端到端强化学习结合,仅用机载多帧 LiDAR 预测安全速度区域,让 Unitree Go2 在拥挤动态环境中敏捷避障导航。
论文:Learning Agile Navigation in Crowded Environments for Quadruped Robots
作者:Shuyu Wu, Zeyu Liu, Tianbao Zhang, Fanxing Li, Fangyu Sun, Mingkang Xiong, Wei Xi, Wenxian Yu, Danping Zou
机构:上海交通大学 · 美的集团高端重载机器人全国重点实验室
链接:arXiv:2607.15036(2026-07-16)·
代码状态:未开源(论文未提供代码仓库,检索 GitHub 亦未发现官方实现)
一句话总结
VOP-Nav 用一个直接从多帧 LiDAR 回归“安全速度区间”的感知网络 VOP-Net,把速度障碍(Velocity Obstacle)的几何安全性注入端到端强化学习策略的输入与奖励,使 Unitree Go2 在密集动态人群中以接近 2 m/s 的平均速度实现零碰撞零样本导航。
研究背景与动机
四足机器人要走进城市街道、商场、工厂和公共交通枢纽,绕不开一个核心场景:在密集且不断移动的人群中穿行。这类场景有两个天然的难点。其一,动态障碍频繁遮挡传感器视野,感知质量急剧下降;其二,行人轨迹本质上不可预测,密度越高越难估计。在医疗急救、灾难救援这类时间敏感任务里,机器人可能需要顶着疏散人流逆行运送物资,高密度对向人流会直接堵死路径。导航系统必须同时满足“安全”和“敏捷”两个看似矛盾的目标。
传统方案遵循“感知—规划—控制”流水线。DWA 与速度障碍(VO)这类经典方法在速度域而非空间域推理,能施加显式的碰撞避免约束,但它们依赖强假设:每个障碍物的位置与速度都必须准确已知。后续工作试图用机载检测与跟踪(YOLO、多假设跟踪等)在线估计障碍状态,但在密集人群中,严重遮挡与传感器噪声使状态估计极不可靠,VO 规划器随之失效。这正是本文要解决的“感知瓶颈”。
另一个方向是端到端学习:用强化学习或可微物理直接把传感观测映射为关节级指令,省掉显式感知与规划模块,避免多级流水线的误差累积与延迟。对四足机器人而言,关节级输出还能带来轮式底盘不具备的敏捷性——这对抢占人群中转瞬即逝的空隙至关重要。但作者在实验中发现,端到端方法在密集动态环境中表现明显下滑。原因有二:一是针对密集移动障碍的奖励很难设计,传统的碰撞惩罚或距离奖励只能训练出“临撞才躲”的反应式行为,无法引导策略提前避开未来可能变危险的区域;二是端到端策略从原始观测学到的隐式表征,难以可靠编码移动障碍物施加的时变碰撞约束。
于是出现了一个清晰的矛盾:基于模型的方法有安全保证但感知脆弱,端到端学习鲁棒敏捷但缺乏对障碍运动的显式预测。本文的切入点就是缝合这两条路线——保留 VO 的几何安全性,但不再显式计算 VO,而是让一个神经网络直接从原始 LiDAR 序列中“感知”出安全速度区域。作者把这个范式命名为速度障碍感知(Velocity Obstacle Perception)。
预备知识:速度障碍与碰撞锥
速度障碍方法把机器人 A 与障碍物 B 都搬到速度域里分析。把 A 建模为半径 $r_A$ 的圆,B 建模为半径 $r_B$ 的圆,定义相对速度 $v_{AB}=v_A-v_B$。以 A 为质点、以 B 的位置为圆心、以 $r_A+r_B$ 为半径构造膨胀碰撞区域 $\hat{B}$,则所有可能碰撞的相对速度构成原始锥:
$$C_{AB}=\{v_{AB}\mid \lambda_{AB}\cap\hat{B}\neq\emptyset\}$$
其中 $\lambda_{AB}$ 是从 A 出发、沿 $v_{AB}$ 方向的射线。实际导航只关心有限时间窗 $\tau$ 内的碰撞,因此要去掉锥内对应“$\tau$ 之后才撞”的内部区域,得到截断碰撞锥 $CC_{AB}$。再把相对速度空间平移回 A 的绝对速度空间,即对 $CC_{AB}$ 做关于障碍速度 $v_B$ 的 Minkowski 和:
$$\text{VO}^{\tau}_{A|B}=\{v_A\mid v_A\in CC_{AB}\oplus v_B\}$$
只要机器人速度 $v_A$ 落入该灰色区域,$\tau$ 时间内必然发生碰撞;对多个障碍物取并集,就得到整个场景的禁行速度区。传统 VO 方法的流程是“检测—跟踪—估计速度—计算碰撞锥—规划”,而本文的思路是把这整条链路压缩成一个网络的回归目标。
系统总览:三阶段训练流水线
整个系统按三阶段训练,全部在 Isaac Gym 中完成,最后零样本迁移到真机。
图1:系统架构。(a) 三阶段训练流水线:先训练 Basic 策略,再用它采数据训练 VOP-Net,最后把 VOP-Net 预测同时作为输入与奖励训练 VOP-Nav 策略。(b) Unitree Go2 真机部署,VOP-Net 与策略并行推理,底层 PD 控制器 200 Hz。
flowchart TD
A["Stage 1: Isaac Gym 1024 parallel envs
train Basic policy, 970-dim obs"] --> B["Roll out Basic policy
collect 10,000 files x 1024 envs x 48 steps"]
B --> C["Compute ground-truth safe velocity region
Algorithm 1 with privileged obstacle states"]
C --> D["Stage 2: train VOP-Net
5-frame LiDAR, 3-channel tensor
MobileNet + orthogonal attention"]
D --> E["VOP-Net output
360 x 2 safe velocity intervals"]
E --> F["Stage 3: train VOP-Nav policy
obs 1693-dim, from scratch"]
E -->|"policy input at inference"| F
E -->|"reward r_VO at training"| F
F --> G["Zero-shot deploy on Unitree Go2
VOP-Net 50 Hz + policy 50 Hz + PD 200 Hz"]
形式化上,任务被建模为部分可观测马尔可夫决策过程(POMDP):$\langle\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{R},\Omega,\mathcal{O}\rangle$,因为机器人只能通过机载 LiDAR、深度相机与本体感知获得局部且易被遮挡的观测。策略 $\pi_\theta(a_t\mid o_t)$ 的优化目标是最大化折扣回报,用 PPO 求解:
$$J(\pi_\theta)=\mathbb{E}_{\pi_\theta}\left[\sum_{t=0}^{\infty}\gamma^{t}r_t\right]$$
方法详解
1. 安全速度区域:把 VO 离散成可回归的目标
VOP-Net 的监督信号是“安全速度区域”:机器人最大可行速度圆与所有障碍物 VO 并集之补集的交集。稠密场景中 VO 并集的几何形状极不规则,直接回归很困难,作者把速度空间沿角度域均匀离散为 $d=360$ 个方向,每个方向 $j$ 上保留一个安全速度区间 $\mathbf{v}_{\text{safe}_j}$。这一离散化保留了物理可解释性,又给网络提供了结构化的定长回归目标。
计算时先把障碍状态从世界系 $F_W$ 变换到机器人本体系 $F_R$。设机器人位置 $p_R=[x_R,y_R,z_R]^T$、航向 $\theta_R\in[-\pi,\pi)$,则本体系到世界系的仿射变换为:
$$T_{R\rightarrow W}=\begin{bmatrix}R(\theta_R)&t\\ 0^{T}&1\end{bmatrix},\quad R(\theta_R)=\begin{bmatrix}\cos\theta_R&-\sin\theta_R\\ \sin\theta_R&\cos\theta_R\end{bmatrix}$$
用其逆变换 $T_{W\rightarrow R}$ 把每个障碍的位置和速度映射进本体系后,逐障碍计算各方向上从原点到膨胀边界 $\hat{B}$ 的距离 $L_j$,取临界速度幅值 $D_j=\min(L_j,v_{\max})$。若机器人当前在 VO 区域之外,该方向可行区间为 $[0,D_j]$;若已身处 VO 区域之内(碰撞风险迫在眉睫),则优先给出脱离碰撞所需的最小区间 $[D_j,v_{\max}]$。最后对所有障碍逐方向取交集:$\mathbf{V}_{\text{safe}}=\bigcap_{i=1}^{n}\mathbf{V}_{\text{safe}}^{O_i}$。当同一方向出现多段可行区间时,保守地保留低速段——因为学习到的运动策略未必能稳定达到理论上的高速段,依赖它们可能诱发过度激进的 davranство。整套流程即论文中的 Algorithm 1。
2. VOP-Net:从原始 LiDAR 序列直接感知动态约束
VOP-Net 是本文的核心贡献。它不检测、不跟踪、不显式计算任何 VO 几何,而是让网络隐式编码动态约束。输入是当前帧加前四帧共五帧 LiDAR 扫描,预处理成三通道张量:第一通道是原始距离;第二通道是切向差分(空间梯度),用于凸显障碍边界;第三通道是帧间径向差分(时间梯度),编码机器人与环境相对位移的观测级线索。这个设计很巧妙——障碍物的运动信息不需要显式估计,它就藏在连续帧的差分里。
特征提取用 MobileNet 块,兼顾轻量与表达力;随后接一个正交注意力模块,分别沿时间轴与空间角度轴做池化,生成两套独立的注意力权重:一套强调关键的历史时刻,一套强调危险的空间方向。最后经时间池化与 MLP 解码器回归 $d\times 2=360\times 2$ 维的安全速度区间(每个方向的最小、最大安全速度)。
3. 阶段一:Basic 策略
Basic 策略在动态仿真环境中训练,目标是获得基础导航能力并为阶段二产生数据。观测共 970 维:50 维本体感知(足端接触力、基座角速度、重力投影向量、到目标相对距离、剩余回合时间、关节位置与速度、上一时刻动作),加上 $22\times 40$ 深度图(880 维)和 40 维 LiDAR(9° 角分辨率)。动作是 12 维目标关节位置,由 PD 控制器跟踪,力矩计算为:
$$\tau=K_p(t_a-q)-K_d\dot{q}$$
奖励函数主要沿用 ABS 框架,包含碰撞惩罚、目标追踪、力矩与动作平滑正则。让机器人敢跑起来的关键是敏捷奖励:
$$r_{\text{agile}}=\max\left\{\text{ReLU}\left(\frac{v_x}{v_{\max}}\right)\cdot\mathbf{1}(\text{dir}_{\text{good}}),\ \mathbf{1}(d_{\text{goal}}<\sigma_{\text{tight}})\right\}$$
其中 $v_{\max}=4.5$ m/s,$\mathbf{1}(\text{dir}_{\text{good}})$ 要求航向误差在 105° 以内,$\sigma_{\text{tight}}=0.5$ m 的项保证机器人进入目标附近时奖励不塌缩。这一项直接决定了 Basic 策略的高速运动能力上限。
4. 阶段二:数据集与混合损失
用 Basic 策略在动态环境中采集了大规模数据集:10,000 个数据文件,每个文件聚合 1,024 个并行环境、48 个时间步的转移数据,包含机器人运动学与全部障碍物的几何/运动学状态(位置、速度),用于按 Algorithm 1 离线计算监督信号。采集时故意把最大速度设为 $v_{\max}=4.5$ m/s,鼓励探索高速机动。训练损失把 IoU 的几何对齐性与 MSE 的梯度稳定性结合起来:
$$\mathcal{L}=\alpha\mathcal{L}_{\text{IoU}}+(1-\alpha)\mathcal{L}_{\text{MSE}},\quad \alpha=0.2$$
设预测与真值区间分别为 $\mathbf{v}_{\text{pred}_j}=[v^{\min}_{\text{pred}_j},v^{\max}_{\text{pred}_j}]$ 与 $\mathbf{v}_{\text{safe}_j}$,IoU 项衡量区间重叠,MSE 项约束边界数值精度:
$$\mathcal{L}_{\text{IoU}}=\frac{1}{d}\sum_{j=1}^{d}\left(1-\frac{|\mathbf{v}_{\text{pred}_j}\cap\mathbf{v}_{\text{safe}_j}|}{|\mathbf{v}_{\text{pred}_j}\cup\mathbf{v}_{\text{safe}_j}|+\epsilon}\right)$$
$$\mathcal{L}_{\text{MSE}}=\frac{1}{2d}\sum_{j=1}^{d}\left((v^{\min}_{\text{pred}_j}-v^{\min}_{\text{safe}_j})^{2}+(v^{\max}_{\text{pred}_j}-v^{\max}_{\text{safe}_j})^{2}\right)$$
5. 阶段三:VOP-Nav 策略的双重集成
理论上可以把 VOP-Net 的预测当作硬几何约束直接裁剪速度,但作者明确指出这样做次优:网络预测是从原始传感数据学来的近似,带有偏差与不确定性,硬执行会导致过度保守或不可行的动作。因此预测以两种互补方式融入策略:推理时作为状态输入的一部分,训练时作为奖励整形项。观测空间在 Basic 的 970 维基础上,追加 3 维线速度(因为 VOP 约束只在速度域有意义)和 720 维 VOP-Net 输出,共 1693 维。策略从零开始训练。
速度约束奖励 $r_{\text{VO}}$ 惩罚违反预测安全区间的速度指令,是一个软约束:
$$r_{\text{VO}}=\begin{cases}v-v_{s\text{-min}},&\text{if }v<v_{s\text{-min}}\\ v_{s\text{-max}}-v,&\text{if }v>v_{s\text{-max}}\\ 0,&\text{otherwise}\end{cases}$$
其中 $v=\|\mathbf{v}_{xy}\|$ 是当前平面速度幅值。由于 VOP-Net 输出的是离散角度 bin,而机器人速度方向 $\theta=\operatorname{atan2}(v_y,v_x)$ 是连续的,作者用 $k=5$ 个最近角度扇区做逆距离加权插值,角距离按周期环绕计算:$\delta_i=\min(|\theta-\lambda_i|,\,2\pi-|\theta-\lambda_i|)$,权重 $w_i=(\delta_i+\epsilon)^{-1}/\sum_j(\delta_j+\epsilon)^{-1}$,插值得到当前方向的 $v_{s\text{-min}}$ 与 $v_{s\text{-max}}$。
6. 训练环境与课程
训练场地由起点区、目标区与中间 $8\times 5$ m² 的障碍区构成,纵向两侧装墙防止绕行取巧,强迫策略必须穿过动态障碍区。动态障碍用圆柱体(高 1.7 m、半径 0.5 m,近似行人)建模,每回合最多 8 个,沿直线运动并在边界镜面反射;静态障碍包括最多 2 个细圆柱与最多 4 个长方体。课程等级 $l_c\in\{0,\dots,9\}$ 按机器人到目标的距离自适应升降(0.5 m 晋升、2.0 m 降级),障碍数量线性增加,动态障碍速度上界按 $v^{d}_{\max}=\max(v_{\min}^{\text{obj}},0.1(l_c+1)v_{\max}^{\text{obj}})$ 扩张,并以概率 $p_{\text{change}}=0.05\,l_c$ 注入随机加减速或急停扰动,地形粗糙度从 0 cm 线性升到 7 cm。
图2:训练环境示意图——绿色起点区、粉色目标区,中央为线性移动的黄色动态圆柱与棕色/灰色静态障碍。
六、实验结果
作者在 Isaac Gym 中设计了四个与训练分布不同的测试环境(森林、办公室、广场、低速),动态障碍由 RVO 算法驱动以更接近真实人群,并引入反应系数 $r_{\text{react}}\in[0,1]$ 控制多少比例的行人会主动避让机器人。训练时刻意不用 RVO——它计算开销大、容易形成局部拥堵冻结、还会削弱高速交互样本——而用快速直线障碍训练、用协作式 RVO 人群测试,是对泛化能力的严格检验。基线覆盖五类:经典 VO 方法 ORCA、学习式 VO 方法 NavRL、人群导航规划器 HEIGHT、四足人群导航 REASAN、敏捷四足导航 ABS。
1. 主实验:五个环境全面领先
下表为主实验结果(成功率%,节选关键列):
| 环境 | 策略 | 成功率↑ | 碰撞率↓ | 超时率↓ | 平均速度↑ | 峰值速度↑ |
|---|---|---|---|---|---|---|
| Training | ABS | 53.16 | 43.57 | 3.26 | 2.29 | 3.42 |
| ORCA(2T) | 59.89 | 22.73 | 17.38 | 1.21 | 2.65 | |
| NavRL(2T) | 71.84 | 22.55 | 5.61 | 1.13 | 2.49 | |
| VOP-Nav | 78.35 | 18.91 | 2.74 | 1.99 | 3.34 | |
| Forest | ABS | 76.07 | 23.42 | 0.50 | 2.47 | 3.44 |
| NavRL(2T) | 90.49 | 8.68 | 0.84 | 1.56 | 2.57 | |
| REASAN | 68.06 | 30.90 | 1.04 | 1.67 | 2.35 | |
| VOP-Nav | 94.48 | 5.42 | 0.10 | 2.55 | 3.56 | |
| Office | NavRL(2T) | 81.07 | 13.60 | 5.34 | 1.13 | 2.52 |
| ABS | 61.29 | 29.33 | 9.38 | 2.15 | 3.35 | |
| VOP-Nav | 81.12 | 14.93 | 3.95 | 2.03 | 3.49 | |
| Square | ORCA(2T) | 78.79 | 20.31 | 0.89 | 1.50 | 2.70 |
| ABS | 53.11 | 44.19 | 2.70 | 2.24 | 3.30 | |
| VOP-Nav | 83.67 | 15.67 | 0.65 | 1.96 | 3.35 | |
| Slow | NavRL(2T) | 88.89 | 5.98 | 5.13 | 1.09 | 2.50 |
| ABS | 83.92 | 13.78 | 2.30 | 2.30 | 3.34 | |
| VOP-Nav | 92.24 | 6.08 | 1.69 | 2.19 | 3.42 |
几个值得细读的现象:训练环境是最难的场景(空间受限、密度高、动态障碍速度 1.5 m/s),ORCA 与 NavRL 碰撞率低但超时率极高,把回合时长翻倍(2T)后成功率才上来,说明它们靠"熬时间"而非"走得快"通过;HEIGHT 因为前向速度指令被限制在 0.5 m/s,即使回合拉长四倍也在训练环境只有 0.17% 的成功率;REASAN 在训练环境碰撞率高达 48.10%。VOP-Nav 是唯一在五个环境都拿到最高成功率、且平均速度保持在 1.96–2.55 m/s 区间的方法——它不是靠牺牲速度换安全,而是靠感知动态约束找到可行间隙。
图3:广场测试环境——高密度动态人群场景,黄色圆柱为模拟行人。
轨迹定性分析(论文 Fig. 8)很能说明问题:HEIGHT 在第 421 步因移动太慢被撞;ORCA 进入拥挤区后反复减速、在角落长时间冻结,第 622 步被撞;NavRL 在第 270 步急刹调整后从间隙穿过,但通过时余量很小;ABS 的恢复策略救回几次紧急减速,却仍反复闯入拥挤区,第 437 步被撞。VOP-Nav 在第 146 与 270 步主动减速转向开阔空间,路径可行时立刻加速,比 NavRL 更早到达目标。配合 Fig. 10 的安全速度场可视化:第 146 步 VOP 模块检测到速度空间分裂——右侧安全速度低、左侧支持更高速度,机器人选左侧绕开危险区;第 330 步预测安全区与某个动态障碍当前位置重叠,说明网络正确识别出该障碍正在远离,可以安全利用其身后空间。
2. VOP-Net 预测质量与消融
VOP-Net 在验证集上达到 IoU 0.808、MSE 0.172。作者进一步在最终策略回滚中在线评估(取成功轨迹中起止进度 5%–95% 的交互密集段),并定义误安全率 FS 与误不安全率 FU 区分过度乐观与过度保守的错误:
| 环境 | 模型 | IoU↑ | MSE↓ | FS(%)↓ | FU(%)↓ |
|---|---|---|---|---|---|
| Training | VOP-Net | 0.7005 | 0.2972 | 16.49 | 10.21 |
| Forest | VOP-Net | 0.6883 | 0.5581 | 13.28 | 16.22 |
| Office | VOP-Net | 0.7792 | 0.1667 | 8.52 | 8.61 |
| Square | VOP-Net | 0.5520 | 0.5368 | 23.92 | 14.44 |
| Slow | VOP-Net | 0.7891 | 0.2309 | 8.07 | 10.12 |
广场这种极端拥挤场景 IoU 最低(0.552)、FS 最高(23.92%),符合直觉。用特权信息算出的真值安全区替换 VOP-Net 预测训练的 GT-VOP-Nav 在多数环境进一步提高成功率、显著降低碰撞率,说明预测误差主要影响避碰质量而非任务可达性;但 VOP-Net 仅用机载观测就保住了大部分性能。消融实验(Table V)则把 VOP-Net 的两种用法拆开:只用奖励(Only reward)倾向保守,四个环境成功率低于 Basic、超时率明显升高;只用输入(Only input)在五个环境都拿到最高平均与峰值速度,但碰撞率处处高于完整 VOP-Nav。结论清晰:输入提供安全速度信息,奖励约束对它的使用,两者合起来才得到进度与安全的最佳平衡。Forest 是唯一例外——保守行为在低约束环境已足够,Only reward 反而与 VOP-Nav 打平。
图4:安全速度预测可视化——左为真值、右为 VOP-Net 预测,绿色为安全速度区,蓝色外环为最大速度限制。
3. 真机实验:零样本部署
真机平台为 Unitree Go2 + Livox Mid-360 + RealSense D435i,室内用动捕定位、室外用 Fast-LIO2;Jetson Orin Nano 跑 VOP-Net 与传感器驱动,Intel N100 跑导航策略,两者同步 50 Hz,底层 PD 控制 200 Hz。室内 20 m × 8 m 场地布置 12 个静态障碍,7 名参与者被要求故意拦截机器人;室外选小树林(起伏地形、可主动干扰)与 3 m 宽窄路。结果:室内 15/15 全部成功(平均速度 1.422 m/s、峰值 2.462 m/s),室外 15 次成功 12 次,两次失败源于定位不确定性、一次超时发生在极窄通道(机器人选择等待可行路径而非冒险硬闯)。
图5:真机实验平台与传感器配置。
作者对仿真—真机速度差(约 1.4 m/s 对 2 m/s 量级)做了诚实归因:真实行人会停、转、加速、故意阻挡,比仿真中的几何代理更复杂;Mid-360 是非重复扫描雷达,60 Hz 下每帧点数少,平面化滤波后部分角度扇区无点,只能填最大量程;Fast-LIO2 在机器人剧烈运动时里程计漂移,会污染相对目标与速度估计。值得注意的是,开阔场地高速测试中真机仍能达到 3.014 m/s 峰值,紧急制动测试能在障碍出现在 1 m 处时成功刹停,两名操作员持续阻挡下系统无碰撞无摔倒——这些压力测试说明拥挤场景中的低速是交互与部署约束所致,而非基础运动能力退化。
七、局限性
1. 2D 平面表征丢弃三维可通行性(作者自述)。VOP-Net 工作在平面投影上,计算高效但简化了足式机器人特有的三维可通行性:悬垂结构、沟壑等负障碍需要体素级感知才能正确处理,当前表征在这些场景会失效。
2. 室外定位漂移(作者自述)。户外运行依赖 Fast-LIO2,剧烈运动带来的里程计漂移会使相对目标与速度估计失真,这是两次室外失败的直接原因。
3. 感知链路的工程性妥协(读者判断)。Mid-360 平面化后空扇区填最大量程,相当于把"没看到"当成"无限远",在玻璃、高反射或稀疏点云场景存在系统性风险;仿真中用 ray casting 近似深度与 LiDAR 也引入观测失真。此外,真机平均速度明显低于仿真,说明 sim-to-real 的速度差距尚未完全弥合。方形的 0.552 IoU 也提示极端拥挤下感知质量仍有明显下降空间。
八、总结与展望
VOP-Nav 给出了"几何安全"与"学习敏捷"融合的一条干净路径:不去显式检测与跟踪障碍,而是让网络把多帧 LiDAR 直接映射为速度障碍理论定义的安全速度区域;这个中间表征既是策略的输入,又是训练时的奖励信号,形成感知—决策的闭环。仿真中五个环境成功率全面领先且保持 2 m/s 级速度,真机零样本部署室内 15/15,验证了该设计的工程可行性。对具身导航领域,它的启示在于:与其让策略从原始观测中隐式猜出碰撞约束,不如提供一个物理可解释、可微分、可作为软约束注入的中间层。未来工作可能沿三个方向展开——把安全速度区域扩展到三维可通行性、改进室外鲁棒定位、以及把 VOP-Net 迁移到人形平台或更复杂的城市级人群场景。
九、金句
"把速度障碍从需要精确障碍状态的计算几何,变成从多帧 LiDAR 直接回归的感知任务——VO 预测在推理时是策略的眼睛,在训练时是策略的教练。"
本解读基于 arXiv:2607.15036v1 全文精读撰写。



