PAPER DEEP DIVE
VLA-Corrector:面向自适应动作视界的轻量级检测与纠正推理
视觉-语言-动作(VLA)基础模型在具身智能上进展显著。为降低策略调用频率并保持时间连贯性,多数生成式策略采用动作块机制,在固定动作视界下以开环方式执行多步未来动作。然而这种先预测后盲目执行的范式牺牲了闭环反应性:在接触丰富的物理交互中,即使微小的局部扰动也会在开环盲区内迅速放大,导致误差复合并最终任务失败。为此本文提出 VLA-Corrector,一个面向动作块 VLA 策略的轻量纠正推理框架。在不修改主干策略权重的前提下,VLA-Corrector 引入轻量潜空间视觉监控器(LVM),持续比较预测与实际的视觉特征演化,实现在线检测视觉动力学偏差;一旦检测到持续偏差,系统触发截断事件、丢弃剩余陈旧动作,并通过在线梯度引导(OGG)发起纠正重规划。该检测-纠正机制自然诱导出事件触发的自适应动作视界:当前动作块可靠时保留长视界执行,执行开始漂移时调用短视界纠正重规划,从而缓解静态视界在执行鲁棒性与策略调用频率之间的权衡。VLA-Corrector 可在不重训 VLA 主干的情况下集成到不同 VLA 模型中,在保留动作块效率收益的同时中断复合误差,显著提升长视界、接触丰富机器人操作任务的鲁棒性。
论文:VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon | 作者:Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang(浙江大学 / 阿里巴巴达摩院) | 链接:arXiv:2607.01804 | 代码:已开源(LeRobot 分支)
一句话总结
本文提出 VLA-Corrector,一个不改动 VLA 主干权重的轻量推理期修正框架:用潜空间视觉监控器(LVM)在线比对"预测的"与"实际发生的"视觉特征演化,一旦发现持续性漂移即触发中断、丢弃陈旧动作块,并通过在线梯度引导(OGG)让下一次重规划朝可恢复的方向生成动作,从而把固定动作horizon变成事件触发的自适应horizon。
研究背景与动机
视觉-语言-动作(VLA)基础模型把感知、语言与动作生成统一在单一框架内,已成为通用机器人控制的重要路线。现代 VLA 策略普遍依赖扩散模型或流匹配(flow matching)等生成式动作模型来刻画连续机器人动作的高维多模态分布。然而生成式模型的单步推理延迟较高,无法在每个控制步都做闭环重规划,于是"动作表达能力"与"高频反馈控制"之间存在根本张力。
工程上的常见折中是动作块(action chunk):一次前向推理预测一段未来动作序列,控制器只顺序执行前 $H$ 步,称 $H$ 为动作horizon(action horizon)。该设计摊薄了策略调用频率、提升了时间平滑性,但同时也制造了一个开环盲区(open-loop blind spot),带来两类复合风险。其一,策略缺乏实时反应性:新的观测每个控制步都在到达,但系统要等到horizon结束才使用它们,无法对意外滑移、碰撞或位姿漂移即时响应。其二,误差可能在盲区内累积到重规划也无法挽回的程度:若偏差长期不被纠正,机器人会漂移到训练时极少见到的分布外状态,此时即便下一次重规划调用也难以把执行拉回预期轨迹,任务最终失败。
关键在于,这两类风险都随horizon变长而恶化。论文用系统实验量化了这一权衡:在三个 VLA 主干上扫描不同horizon,发现更大的horizon显著减少策略调用次数,但成功率同步下降。以 $\pi_{0.5}$ 为例,把horizon调大可让策略调用减少约四倍,却把成功率从约 64% 压到 49% 以下;SmolVLA 与 X-VLA 呈同样趋势。更重要的是,最优horizon依赖任务难度、环境动力学与 sim-to-real 差距,很难预先设定一个在所有场景都最优的静态horizon。
由此论文给出一个清晰的判断:问题的关键不在于"选一个更好的固定horizon",而在于"判断当前的动作块何时不再值得信任"。这引出两个核心问题:(1)如何及时检测执行偏差并在误差累积到不可恢复之前终止陈旧动作;(2)截断之后如何修正轨迹——因为朴素的重规划往往不够:VLA 可能重新生成仍然无法逃离偏差状态的动作,让机器人再次被困。
针对这两个问题,VLA-Corrector 给出"检测—修正"(detect-and-correct)的推理期方案:LVM 负责在开环执行期间持续比对预测与观测的视觉演化,一旦检测到持续偏差就触发中断事件、立即截断剩余陈旧动作并发起新的动作生成;OGG 则不依赖朴素重规划,而是利用预测与观测视觉动力学的差异,在新动作生成过程中注入修正梯度,主动把机器人引导回预期轨迹,而不是寄望于重新推理自然恢复。两者结合,把固定horizon转变为带自纠正重推理的自适应horizon,兼顾长horizon的效率与短horizon的反应性。
预备知识:动作块与开环执行
在具身连续控制中,当前视觉观测 $o_t$ 先由视觉编码器 $\mathcal{E}$ 编码为潜表示 $Z_t^{\mathrm{real}}=\mathcal{E}(o_t)$。为平衡策略调用频率与动作平滑性,参数为 $\theta$ 的生成式 VLA 策略在一次推理中预测一个动作块:
$$A_t=[a_t,a_{t+1},\dots,a_{t+C-1}]\sim\pi_{\theta}(\cdot\mid Z_t^{\mathrm{real}},\,l)$$
其中 $a_t$ 为单个控制动作,$l$ 为语言指令。部署时只顺序执行前 $H$ 个动作($H\leq C$),该执行窗口即动作horizon,对应执行队列 $Q_t=[a_t,\dots,a_{t+H-1}]$;在此期间控制器不再查询 VLA 策略。VLA-Corrector 的全部设计都建立在"执行队列期间仍有新鲜观测可用、但策略不重查询"这一事实之上。
方法详解
VLA-Corrector 的核心思想是把"动作生成"与"执行监控"解耦:VLA 主干负责生成动作块,VLA-Corrector 负责监控执行是否仍在正轨上,并只在漂移出现时介入。方法由四个环节组成:外部潜动力学修正器的训练、LVM 在线异常检测、事件触发截断、以及 OGG 纠正重规划。整个框架在 VLA 策略训练完成之后才训练,且不改动主干权重。
1. 训练外部潜动力学修正器
先在基准训练集上微调 VLA 主干,然后冻结 VLA,用其视觉编码器 $\mathcal{E}$ 从演示轨迹中抽取视觉潜变量。给定转移 $(o_t,a_t,o_{t+k})$,计算当前与未来的真实潜状态及其差值,作为短horizon视觉潜演化的监督目标:
$$Z_t^{\mathrm{real}}=\mathcal{E}(o_t),\quad Z_{t+k}^{\mathrm{real}}=\mathcal{E}(o_{t+k}),\quad \Delta Z_{t+k}^{*}=Z_{t+k}^{\mathrm{real}}-Z_t^{\mathrm{real}}$$
随后训练一个轻量外部动力学修正器 $M_{\phi}$,从当前潜状态与已执行动作预测这一残差演化:
$$\Delta\hat{Z}_{t+k}=M_{\phi}(Z_t^{\mathrm{real}},\,a_t)$$
注意 $M_{\phi}$ 预测的是残差视觉潜演化而非绝对未来潜状态,这主动抑制了静态场景内容、促使模型聚焦于与任务相关的动态变化。训练目标同时约束幅值匹配与方向一致:
$$\mathcal{L}_{\mathrm{corr}}=\left\|\Delta\hat{Z}_{t+k}-\Delta Z_{t+k}^{*}\right\|_2^2+\beta\left[1-\mathrm{CosSim}\!\left(\Delta\hat{Z}_{t+k},\,\Delta Z_{t+k}^{*}\right)\right]$$
其中 $\beta$ 平衡残差精度与方向对齐。可训练组件不是 VLA 策略本身,而是一个在冻结 VLA 特征之上单独训练的轻量潜动力学模块;这种模块化设计允许针对每个基准重训或替换修正器,而无需重新优化昂贵的 VLA 主干。修正器在基准演示轨迹上训练,因为其目标不是像完整世界模型那样建模所有可能未来,而是学习"局部潜动力学是否与正轨执行一致";演示虽含少量遥操作抖动,但足以刻画让任务正确推进的行为。由于这是局部、低维的预测任务,一个轻量 MLP 即可胜任:实验中约 40M 参数的修正器已能提供有效的监控与纠正信号,训练成本极低。
2. 潜视觉动力学在线异常检测(LVM)
训练好 $M_{\phi}$ 后,将其用于在线监控当前动作块是否仍可靠。在控制步 $t$,LVM 用已执行动作 $a_t$ 与当前潜状态预测期望的短horizon潜残差 $\Delta Z_{t+k}^{\mathrm{exp}}=M_{\phi}(Z_t^{\mathrm{real}},a_t)$。与此同时,尽管策略不重查询,最新观测仍然可得:编码未来观测得到真实残差 $\Delta Z_{t+k}^{\mathrm{real}}=Z_{t+k}^{\mathrm{real}}-Z_t^{\mathrm{real}}$。LVM 度量两者之间的不一致:
$$E_t=1-\mathrm{CosSim}\!\left(\Delta Z_{t+k}^{\mathrm{exp}},\,\Delta Z_{t+k}^{\mathrm{real}}\right),\qquad \mathrm{CosSim}(\mathbf{u},\mathbf{v})=\mathbf{u}^{\top}\mathbf{v}\,/\,(\|\mathbf{u}\|\,\|\mathbf{v}\|)$$
$E_t$ 越大表示视觉动力学失配越强,为后续事件触发截断提供连续信号。该信号只依赖视觉编码器与轻量 MLP 的前向传播,成本远低于一次完整 VLA 推理。
3. 鲁棒在线监控下的事件触发截断
给定连续的不一致分数 $E_t$,需要判断偏差是否"持续"到值得介入。直接对 $E_t$ 设阈值并不稳定,因为瞬时视觉离群点会造成误触发。论文采用基于动态阈值与持续性检查的鲁棒事件触发规则:维护最近分数的滑动窗口 $\mathbf{E}_W=\{E_{t-w+1},\dots,E_t\}$,计算其中位数 $M_e$ 与中位数绝对偏差:
$$\mathrm{MAD}=\mathrm{median}\!\left(|E_i-M_e|\right),\quad E_i\in\mathbf{E}_W$$
再定义两个自适应阈值,构成带滞回的状态机:
$$T_{\mathrm{on}}=M_e+\lambda_{\mathrm{on}}\,\mathrm{MAD},\qquad T_{\mathrm{off}}=M_e+\lambda_{\mathrm{off}}\,\mathrm{MAD},\qquad \lambda_{\mathrm{on}}>\lambda_{\mathrm{off}}$$
$T_{\mathrm{on}}$ 用于确认持续偏差,$T_{\mathrm{off}}$ 提供滞回以避免在正常与异常状态间快速振荡。为避免对孤立尖峰触发,维护一个持续性计数器 $c_t$:当 $E_t>T_{\mathrm{on}}$ 时累加,当 $E_t<T_{\mathrm{off}}$ 时清零;仅当 $c_t\geq p$($p$ 为耐心参数)连续满足时才触发中断事件。一旦触发,VLA-Corrector 丢弃当前队列中剩余动作,并以纠正模式重新查询策略;若已从原队列执行了 $h$ 个动作,则实际实现的horizon为 $H_{\mathrm{adaptive}}=h$,从而在稳定阶段保留长horizon、在持续视觉漂移表明动作块不再可靠时缩短horizon。
4. 在线梯度引导的纠正推理(OGG)
截断只是停止陈旧动作,恢复仍依赖下一次重规划。中断事件之后,VLA-Corrector 仅对紧随其后的那一次策略调用施加 OGG,把这次恢复重规划引导向纠正性的潜方向。在流匹配的去噪步 $\tau$,设 $A^{\tau}$ 为带噪动作块,VLA 预测速度场 $v_{\tau}=\pi_{\theta}(A^{\tau},Z_t^{\mathrm{real}},\tau)$,由此估计干净块 $\hat{A}_0=A^{\tau}-\tau v_{\tau}$ 并取其首个动作 $\hat{a}_t=\hat{A}_0[0]$;修正器再预测该候选动作的潜效果:
$$\Delta\hat{Z}_{\mathrm{act}}=M_{\phi}(Z_t^{\mathrm{real}},\,\hat{a}_t)$$
设 $t-k$ 为中断事件前最后一个稳定步,定义期望残差 $\Delta Z_{\mathrm{exp}}=M_{\phi}(Z_{t-k}^{\mathrm{real}},a_{t-k})$,累积偏差 $\Delta Z_{\mathrm{dev}}=Z_t^{\mathrm{real}}-Z_{t-k}^{\mathrm{real}}$,则纠正性潜方向为:
$$\Delta Z_{\mathrm{corr}}=\Delta Z_{\mathrm{exp}}-\Delta Z_{\mathrm{dev}}$$
该方向在保留预期局部动力学的同时,补偿开环执行期间累积的漂移。OGG 通过下式把预测动作效果对齐到 $\Delta Z_{\mathrm{corr}}$:
$$\mathcal{L}_{\mathrm{OGG}}=1-\mathrm{CosSim}\!\left(\Delta\hat{Z}_{\mathrm{act}},\,\Delta Z_{\mathrm{corr}}\right)$$
并把所得梯度注入流匹配速度场:
$$v_{\tau}^{\mathrm{guide}}=v_{\tau}-\eta\,\nabla_{v_{\tau}}\mathcal{L}_{\mathrm{OGG}},\qquad A^{\tau-\Delta\tau}=A^{\tau}-\Delta\tau\,v_{\tau}^{\mathrm{guide}}$$
其中 $\eta$ 控制引导强度。由于 OGG 修改的是速度场而非直接扰动动作坐标,它与原始流匹配过程保持兼容,能产生更平滑的纠正重规划。OGG 只在中断后的单次恢复查询上引入额外梯度计算,后续策略调用回到标准推理,除非再次检测到中断事件。
下图给出 VLA-Corrector 的整体流程:从标准动作块管线(A)出发,加入 LVM 检测持续漂移并触发中断(B),事件截断陈旧动作并把下一次重规划从普通流匹配切换为 OGG 引导的流匹配(C),OGG 用期望与观测的潜演化把重规划引导回可恢复轨迹(D)。

图1:VLA-Corrector 总览(论文 Figure 3)。A 为标准动作块管线,B 为基于潜空间视觉的误差监控与中断,C 为在线梯度引导,D 为 CGS 中的纠正性潜几何。
flowchart TD
A["Block A 标准动作块推理 VLA主干生成动作块"] --> B["执行前H步 开环盲区不查询策略"]
B --> C["Block B 潜空间视觉监控LVM 比较期望残差与实测残差 得不一致分数Et"]
C --> D{"Et 连续p步超过Ton 判定持续漂移"}
D -- 否 --> B
D -- 是 --> E["中断事件 丢弃队列剩余陈旧动作"]
E --> F["Block C/D 在线梯度引导OGG 以纠正方向为目标 在速度场注入修正梯度"]
F --> G["生成纠正后的新动作块 恢复闭环反应性"]
G --> B
实验结果
实验覆盖 MetaWorld、LIBERO 两个仿真基准与真实 AgileX PiPER 机械臂,主干以 $\pi_{0.5}$ 为主,并用 SmolVLA 与 X-VLA 做跨架构验证。下面从跨架构泛化、样本效率、性能-效率权衡、机制分析与真实世界五个角度解读。
跨架构泛化(MetaWorld)
VLA-Corrector 在三个 VLA 主干上一致提升,且越难的任务增益越大。$\pi_{0.5}$ 平均成功率提升 15.65 个百分点,SmolVLA 提升 4.75,X-VLA 提升 4.05;最强增益出现在 $\pi_{0.5}$ 的 Very Hard 分片,从 41.0% 提升到 65.0%。这说明修正机制对"接触丰富、误差敏感"的任务最为有效。
| 主干 | 方法 | Easy | Medium | Hard | Very Hard | 平均 |
|---|---|---|---|---|---|---|
| π0.5 | Baseline | 70.5 | 45.0 | 38.3 | 41.0 | 48.70 |
| π0.5 | + VLA-Corrector | 83.2 | 61.7 | 47.5 | 65.0 | 64.35 |
| SmolVLA | Baseline | 81.3 | 53.6 | 51.7 | 61.0 | 61.90 |
| SmolVLA | + VLA-Corrector | 83.4 | 56.0 | 64.2 | 63.0 | 66.65 |
| X-VLA | Baseline | 72.5 | 46.4 | 48.3 | 55.0 | 55.55 |
| X-VLA | + VLA-Corrector | 74.4 | 50.0 | 50.0 | 64.0 | 59.60 |
表1:MetaWorld 跨架构成功率(%)。对应论文 Table 1。
样本效率(LIBERO)
论文进一步检验 VLA-Corrector 能否弥补任务数据不足。以公开 LeRobot few-shot 检查点为起点,few-shot 微调的 $\pi_{0.5}$ 平均成功率 94.00%,加上 VLA-Corrector 后达到 97.80%,甚至超过全量微调基线的 96.95%。这表明 few-shot 微调已能学到大部分正常任务轨迹,但缺乏对漂移状态及其恢复行为的覆盖;VLA-Corrector 不靠暴露更多罕见失败案例来改进恢复,而是在推理期提前中断误差累积并引导纠正重规划,从而降低对额外后训练数据的依赖。
| 模型 | Object | Spatial | Goal | Long | 平均 |
|---|---|---|---|---|---|
| π0.5 全量微调 | 99.4 | 98.2 | 97.8 | 92.4 | 96.95 |
| π0.5 few-shot 微调 | 97.8 | 95.4 | 96.2 | 86.6 | 94.00 |
| π0.5 few-shot + VLA-Corrector | 99.8 | 100.0 | 98.0 | 93.4 | 97.80 |
表2:LIBERO 样本效率(%)。对应论文 Table 2。
性能-效率权衡与数据效率
完整的horizon扫描表明,VLA-Corrector 并非靠增加策略查询次数换取成功率,而是提升"每次调用的成功率"。在 $\pi_{0.5}$、SmolVLA、X-VLA 上,最大 success-per-call 增益分别达 29.9%、45.3%、39.1%。例如 SmolVLA 在horizon 10 时成功率从 61.90% 升到 73.00%,同时策略调用从 19.27 降到 15.64。以 $\pi_{0.5}$ 在horizon 50 为例,成功率从 48.72% 升到 58.70%,平均调用从 5.15 降到 4.98,效率增益 +24.6%。这支持了自适应horizon的核心假设:长块在稳定执行期间仍有价值,但一旦潜视觉动力学指示漂移就应中断。

图2:固定horizon下的性能-效率权衡(论文 Figure 2)。horizon越大调用越少但成功率越低,三个主干趋势一致。

图3:各horizon下的 success-per-call 效率增益(论文 Figure 4)。horizon越长增益越大,最高 +24.6%。
修正器的数据效率同样良好:在 MetaWorld 上按比率 $r\in\{0.2,0.4,0.6,0.8,1.0\}$ 子采样演示训练修正器,$r=1.0$ 时平均成功率 54.32%(较基线 48.72% 提升 5.60),且性能在 $r\approx0.6$–$0.8$ 附近饱和,说明轻量潜动力学修正器只需捕捉局部正轨一致性信号,而非完整动力学模型。
机制分析:LVM 检测与 OGG 纠正
LVM 提供了信息量充足且时机恰当的漂移信号。成功回合的 $E_t$ 集中在低值区,而失败回合呈现更重的高分尾并触发更多中断事件,说明 $E_t$ 捕捉到了易失败的视觉动力学失配。进一步把 MetaWorld 轨迹人工划分为关键阶段(如精确抓取、对齐)与非关键阶段(如稳定抓取后的容忍搬运),发现 83.7% 的截断发生在关键阶段、仅 16.3% 在非关键阶段,验证了自适应horizon的直觉:并非处处缩短horizon,而是在容忍阶段保留长horizon效率、在误差敏感阶段恢复短horizon精度。

图4:成功与失败回合的 $E_t$ 分布(论文 Figure 5)。失败回合高分尾更重。

图5:按任务阶段的截断分布(论文 Figure 6)。83.7% 的截断发生在关键阶段。
OGG 的独立贡献通过"同一中断截断后比较标准重推理与 OGG 引导重推理"来隔离:OGG 在所有难度级别上都提升了中断后恢复率,平均增益 0.23,说明截断停止陈旧动作之后,OGG 引导的重推理进一步提高了恢复重规划的质量。组件消融同样清晰:仅截断把平均成功率从 48.70% 提到 60.35%,加入 OGG 后进一步到 64.35%。

图6:中断后恢复率对比(论文 Figure 7)。OGG 引导推理一致优于标准推理,平均 +0.23。
检测器设计的对照实验进一步支持解耦:把监控头耦合进 $\pi_{0.5}$ 内部(辅助头预测同样的短horizon潜残差)仅得 49.55%,而解耦的外部 LVM 达 64.35%。可能原因是内部辅助目标会更新同时被 VLM-to-action 规划使用的骨干表示,反而损害原始动作生成;外部 LVM 在冻结特征上学习监控信号,避免直接修改策略表示。
真实世界评估(AgileX PiPER)
真实实验在 AgileX PiPER 六自由度机械臂上以 $\pi_{0.5}$ 为主干,包含抓取放置、对齐、扰动恢复三组各三个任务、每任务 20 次试验。VLA-Corrector 在三组上均提升,平均成功率从 55.6% 升到 73.3%;抓取放置增益温和(+8.3),对齐更大(+16.6),扰动恢复最大(+28.3)。该趋势与框架的定位一致:保留标准执行性能、提升精度敏感操作、并在在线扰动使剩余动作块过时时收益最大。
| 方法 | 抓取放置 | 对齐 | 扰动恢复 | 平均 |
|---|---|---|---|---|
| π0.5 Baseline | 70.0 ± 11.6 | 56.7 ± 12.5 | 40.0 ± 12.4 | 55.6 ± 7.3 |
| + VLA-Corrector | 78.3 ± 10.4 | 73.3 ± 11.1 | 68.3 ± 11.8 | 73.3 ± 6.5 |
表3:AgileX PiPER 真实世界成功率(%,95% 二项置信区间)。对应论文 Table 5。

图7:真实世界扰动恢复演示(论文 Figure 12)。执行中人工移动抽屉/插入目标,机器人需从过时动作块中恢复。
局限性
作者自述的局限之一是 OGG 的墙钟开销:OGG 在恢复推理期间做在线梯度计算,使整体墙钟推理时间相对"关闭 OGG 的同管线"增加 1.62–1.68 倍;单次 OGG 引导恢复查询约 588.52 ms,约为标准动作块推理 278.01 ms 的 2.12 倍。作者强调该开销是事件触发的、只作用于中断后的恢复查询,摊销到每个执行步仅约 +7.93 ms,但对延迟敏感的高频控制场景仍是实际约束。
作者自述的局限之二是修正器的跨域迁移有限:用 LIBERO 演示训练的修正器在 MetaWorld 上仅把基线从 48.7% 提到 51.8%(+3.1),而域匹配的 MetaWorld 修正器可提到 58.7%(+10.0)。这说明修正器捕捉到部分可迁移的"正轨视觉动力学"概念,但域匹配演示对精确偏差检测与有效纠正引导仍然重要。
从方法设计看还有两点值得注意。其一,监控信号完全来自视觉潜演化,对不产生明显视觉变化的扰动(如纯力/接触层面的滑移、夹爪打滑但画面几乎不变)可能不敏感;论文真实世界失败模式中也承认无_force feedback 的六自由度臂在紧密对齐任务中会因接触几何、摩擦或微小高度误差失败。其二,事件触发的多个超参(窗口大小 15、$\lambda_{\mathrm{on}}=3.0$、$\lambda_{\mathrm{off}}=2.0$、耐心 $p=5$、冷却 10 步)需要按场景调定,论文虽给出敏感性分析($\eta=1$ 最优、40M LVM 足够),但跨任务族的最优配置仍可能需要重新标定。
总结与展望
VLA-Corrector 研究了动作块 VLA 策略中的开环盲区:固定horizon提升调用效率,却允许陈旧动作累积误差。它以轻量"检测—修正"层回应:监控潜视觉动力学、在漂移持续时截断陈旧动作、并把下一次推理引导向恢复方向。结果表明,小型推理期模块无需重训 VLA 主干即可提供定向的鲁棒性增益。它不是取代动作块,而是让动作块变得自适应:可靠时保留长horizon执行,不可信时调用纠正重规划。对机器人开发者而言,这提供了一条低成本、可插拔的鲁棒性增强路径——在冻结的强主干之上叠加一个约 40M 的监控/纠正模块,即可在长horizon、接触丰富的操作任务中显著降低复合错误。
金句
"关键不在于选择一个更好的固定horizon,而在于判断当前的动作块何时不再值得信任。"
—— 论文引言:This suggests that the key is not to choose a better fixed horizon, but to decide when the current chunk should stop being trusted.



