Skip to content
RobotWorld
返回博客
Zetta ζ:冻结 VLA 权重也能持续进化——清华 AIR 的闭环具身执行框架
具身智能embodied AIVLA

Zetta ζ:冻结 VLA 权重也能持续进化——清华 AIR 的闭环具身执行框架

清华 AIR 与 Z-Trans AI 提出 Zetta ζ:一个闭环具身执行框架。它不微调策略、不更新 VLA 权重,而是进化围绕策略的执行框架——代码化的运行时评审器监控每个动作、恢复技能在偏离时接管、验证门只放行通过泛化检验的技能。冻结基线在 LIBERO-Pro 上成功率 31.0%,同一策略在 Zetta ζ 下达到 92.5%(绝对提升 +56.3 个百分点);RoboCasa 18 任务平均从冻结基线提升 20 个百分点至 93.6%;Z-Infra 把有效 rollout 吞吐放大 20.6 倍,推理提速 11.1 倍。技能可零样本迁移,且出现清晰的机器人「顿悟时刻」。

Tsinghua AIR & Z-Trans AI2026年8月30日2 分钟阅读
EN

清华大学智能产业研究院(AIR)与 Z-Trans AI 联合发布 Zetta ζ——一个闭环具身执行框架(harness):基础 VLA 策略权重完全冻结、不做任何梯度更新,却能在物理任务上持续变强。Zetta ζ 不微调策略本身,而是进化策略周围的执行框架:以代码形式编写的运行时评审器(runtime critics)紧盯每一个动作,恢复技能(recovery skills)在出错瞬间接管控制,验证门控只允许通过泛化检验的技能入库。在 LIBERO-Pro 上,冻结基线的成功率只有 31.0%;同一个策略在 Zetta ζ 加持下达到 92.5%。

项目页给出的核心数字:

  • 90.8% LIBERO-Pro Goal 平均任务成功率(冻结基线 31.0%,绝对提升 +56.3 个百分点)
  • 93.6% RoboCasa 18 任务平均成功率(比冻结 VLA 提升 +20 个百分点)
  • 20.6× 有效 rollout 吞吐量提升(Z-Infra 推理基础设施)
  • 11.1× 框架自身推理加速
Zetta ζ 总览:具身智能的闭环自我进化
Zetta ζ 为具身自我进化闭合回路:运行时评审器在执行过程中触发恢复动作,已验证的失败被蒸馏成可复用的评审器与恢复技能,跨 rollout 持续积累。

问题:开环框架无法驾驭物理执行

具身智能体正越来越多地用于弥补端到端策略模型的短板——但智能体路线尚未实现物理执行过程中的闭环学习。现有框架基本是开环的:rollout 期间按固定技能执行,只在整段回合结束后才进行反思。作者认为,这种事后反思从根本上无法驾驭正在展开的执行过程,因为物理交互要求决策以远超当今大型智能体模型的频率,跟踪快速变化的机器人-环境状态。等回合级反思分析完,杯子早就摔在地上了。

Zetta ζ 的回答是:按时间尺度把"治理"与"反思"分离,并且进化代码而非权重——不微调 VLA、不对策略权重做任何梯度更新,只进化以代码形式存在的执行框架。

三个时间尺度分离的进化回路

框架通过三个不同速度的回路自我进化:

  • 回路 1 · 动作级——评审器治理的动作回路。学得的运行时评审器以动作频率执行,监控物理状态,一旦执行偏离正常分布就立刻触发恢复技能。这正是治理能够在线而非事后进行的原因。
  • 回路 2 · Rollout 批次级——候选优化回路。失败的 rollout 按最早可观测分歧点聚类、做因果诊断,并转化为代码空间中的候选评审器与恢复技能更新。
  • 回路 3 · 迭代级——验证门控的技能更新回路。只有通过历史回归测试与严格留出集泛化检验的候选者,才能进入版本化技能库。修好一个任务却弄坏其他任务的技能永远无法入库。
Z-Harness 进化框架总览
Z-Harness 进化框架总览:并行 rollout 由可进化的评审器、恢复技能与工具组成的框架在编排智能体指挥下治理;失败轨迹触发离线聚类、因果诊断、最小修复与泛化检验,通过后合并回框架。
Zetta ζ 在部署中实现高效的闭环自我进化。

机器人"顿悟时刻":成功不是一条平滑曲线

项目中最引人注目的观察之一:进步并非渐进式的。Zetta ζ 往往能定位关键物理瓶颈,然后解锁一次陡峭的、非连续的成功率跃升——团队称之为机器人的"顿悟时刻"(Aha Moments)。

RoboCasa 上的顿悟时刻
RoboCasa 上的顿悟时刻:早期迭代只有边际收益;一旦识别出决定性的物理变量,成功率陡然上升。
LIBERO-Pro 上的顿悟时刻
LIBERO-Pro 上的顿悟时刻:wine-bottle-in-bowl 从 15% 提升到 95%,cream-cheese 摆放从 5% 提升到 90%——全程 VLA 权重冻结。

案例研究:RoboCasa 上的 CoffeeSetupMug

在开启电水壶、滑动洗碗机搁架、关上烤面包机门、放置咖啡壶等 RoboCasa 任务上都能观察到逐轮改进。CoffeeSetupMug 任务是一个代表性例子:

第 0 轮——成功率 70%。策略正确识别了杯子与咖啡机,开始运送杯子。但当机器人靠近咖啡机时,由于缺乏对抓取稳定性与碰撞余量的持续检查,手臂与环境发生碰撞并丢失杯子。策略没能及时发现这一局部物理异常,导致任务失败。
第 1 轮——成功率 86%。Zetta ζ 从失败中进化出接触感知的操作技能:评审器持续监控抓取稳定性、物体漂移与碰撞风险;被触发后,恢复技能在保持安全间距的前提下运送杯子,直到确认放置稳定后才交还控制权。

案例研究:把盘子推到灶台前(LIBERO-Pro)

LIBERO-Pro 上更难的一个例子——冻结策略起始成功率为 0%,需要两轮进化技能才能通关:

第 0 轮——成功率 0%。rollout 在失败点 0 处失败:抓取盘子后,策略没有保持稳定的抓取,在完成运送之前就丢失了物体。
第 1 轮——成功率 45%。评审器 1(retained-grasp)判断盘子是否被稳妥抬起,恢复技能 1(retained-object transport)接管运送并解决失败点 0。随后 rollout 遭遇失败点 1:运送途中抓取丢失。
第 2 轮——成功率 95%。在评审器 1 与恢复技能 1 的基础上,评审器 2(carry-retention)检测运送途中的抓取不稳,恢复技能 2(robust-carry retry)重新稳定抓取并降低运送风险。两者合力解决失败点 1,任务得以成功完成。

成功率随进化轮次持续扩展

随着评审器-恢复机制的累积叠加,任务成功率稳步逼近冻结策略的能力上限:

LIBERO-Pro Goal (T) 扩展曲线
LIBERO-Pro Goal (T):不做 VLA 微调,平均成功率从 31.0% 提升至 92.5%。
LIBERO-Pro Goal (S) 扩展曲线
LIBERO-Pro Goal (S):十个任务平均成功率从 38.0% 提升至 89.0%。
RoboCasa Atomic-Seen 扩展曲线
RoboCasa Atomic-Seen:18 个任务平均成功率从 73.56% 提升至 93.56%。

学到的技能零样本跨任务迁移

Zetta ζ 进化出的技能并非任务特定的轨迹,而是由物体相对几何、接触、抓取保持与进度谓词定义的——这些物理不变量可以在相关任务之间迁移,无需额外的进化回路:

  • 抓取放置类技能。在 PnP-Stove 上学到的预抓取、重新抓取与稳定放置技能,把 PnP-Sink、PnP-Cabinet、PnP-Toaster 的宏平均成功率从 64% 提升到 84%。
  • 铰接体类技能。在 TurnOffStove 上学到的目标定位、避碰接近与稳定接触技能,把水龙头、橱柜、微波炉类任务的宏平均成功率从 64% 提升到 80%。
RoboCasa 上反思驱动的扩展与迁移
RoboCasa 上反思驱动的扩展与迁移:在一个源任务上发现的技能,无需额外进化回路即可迁移到相关任务。

Z-Infra:自我进化具身智能体的推理基础设施

环境中的自我探索是学习数据的来源,因此更快的 rollout 带来更快的进化。Z-Infra 是把智能体逻辑与异构执行资源解耦的推理基础设施层:控制平面把智能体请求路由到专门的环境工作节点与 rollout 工作节点,同一套智能体逻辑无需修改即可在异构硬件上运行。

Z-Infra 三层架构
Z-Infra 三层架构:控制平面把智能体请求路由到专门的环境工作节点与 rollout 工作节点,将智能体逻辑与异构硬件解耦。
Z-Infra rollout 吞吐量
吞吐量:在 8×A100 GPU 上,Z-Infra 把有效 rollout 吞吐量从 1.7 提升到 35.1 episodes/分钟(20.6×)。
Z-Infra 负载下的时延
负载下的时延:基线方法时延急剧恶化或智能体开销很高,而 Z-Infra 保持受控的单回合时延。
系统性能对比。

基准测试结果

所有提升都来自框架的进化,而非改变冻结的 VLA 权重。LIBERO-Pro Goal (T/S) 与 LIBERO-10 (T/S) 各取十个任务平均;RoboCasa 为 18 个 Atomic-Seen 任务的宏平均。

LIBERO-Pro 与 RoboCasa 成功率(%),加粗为 Zetta ζ。
基准设置冻结 VLAZetta ζ
LIBERO-ProGoal (T)31.092.5
Goal (S)38.089.0
LIBERO-ProLIBERO-10 (T)50.063.0
LIBERO-10 (S)9.040.0
RoboCasa18 Atomic-Seen73.5693.56

为什么重要

作者希望读者记住的结论:闭环框架的自我进化为可靠的物理智能开辟了一条扩展之路。成功率随自我探索经验持续增长,学到的技能零样本迁移,清晰的机器人"顿悟时刻"不断涌现——而基础策略全程保持冻结。如果这一范式能在更大规模上复现,它是对"以微调为中心"范式的有力替代方案:改进框架,而不是改进权重。

论文:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence(arXiv:2608.16590)· 代码:air-embodied-brain/Zetta-Embodiment

来源:Zetta ζ 项目主页——清华大学智能产业研究院(AIR)& Z-Trans AI。Xin Ding、Liang Mi、Mingzhe Huang、Zixuan Wang、Chao Zhang、Zixu Hao、Fu Chen、Xiangyu Li、Yikai Zheng、Yaoyu Guo、Weijun Wang、Kun Li、Hao Wu、Yunxin Liu、Ting Cao。

原文来源:Zetta ζ Project Pagehttps://air-embodied-brain.github.io/zetta/

相关文章