
Zetta ζ:冻结 VLA 权重也能持续进化——清华 AIR 的闭环具身执行框架
清华 AIR 与 Z-Trans AI 提出 Zetta ζ:一个闭环具身执行框架。它不微调策略、不更新 VLA 权重,而是进化围绕策略的执行框架——代码化的运行时评审器监控每个动作、恢复技能在偏离时接管、验证门只放行通过泛化检验的技能。冻结基线在 LIBERO-Pro 上成功率 31.0%,同一策略在 Zetta ζ 下达到 92.5%(绝对提升 +56.3 个百分点);RoboCasa 18 任务平均从冻结基线提升 20 个百分点至 93.6%;Z-Infra 把有效 rollout 吞吐放大 20.6 倍,推理提速 11.1 倍。技能可零样本迁移,且出现清晰的机器人「顿悟时刻」。
清华大学智能产业研究院(AIR)与 Z-Trans AI 联合发布 Zetta ζ——一个闭环具身执行框架(harness):基础 VLA 策略权重完全冻结、不做任何梯度更新,却能在物理任务上持续变强。Zetta ζ 不微调策略本身,而是进化策略周围的执行框架:以代码形式编写的运行时评审器(runtime critics)紧盯每一个动作,恢复技能(recovery skills)在出错瞬间接管控制,验证门控只允许通过泛化检验的技能入库。在 LIBERO-Pro 上,冻结基线的成功率只有 31.0%;同一个策略在 Zetta ζ 加持下达到 92.5%。
项目页给出的核心数字:
- 90.8% LIBERO-Pro Goal 平均任务成功率(冻结基线 31.0%,绝对提升 +56.3 个百分点)
- 93.6% RoboCasa 18 任务平均成功率(比冻结 VLA 提升 +20 个百分点)
- 20.6× 有效 rollout 吞吐量提升(Z-Infra 推理基础设施)
- 11.1× 框架自身推理加速
问题:开环框架无法驾驭物理执行
具身智能体正越来越多地用于弥补端到端策略模型的短板——但智能体路线尚未实现物理执行过程中的闭环学习。现有框架基本是开环的:rollout 期间按固定技能执行,只在整段回合结束后才进行反思。作者认为,这种事后反思从根本上无法驾驭正在展开的执行过程,因为物理交互要求决策以远超当今大型智能体模型的频率,跟踪快速变化的机器人-环境状态。等回合级反思分析完,杯子早就摔在地上了。
Zetta ζ 的回答是:按时间尺度把"治理"与"反思"分离,并且进化代码而非权重——不微调 VLA、不对策略权重做任何梯度更新,只进化以代码形式存在的执行框架。
三个时间尺度分离的进化回路
框架通过三个不同速度的回路自我进化:
- 回路 1 · 动作级——评审器治理的动作回路。学得的运行时评审器以动作频率执行,监控物理状态,一旦执行偏离正常分布就立刻触发恢复技能。这正是治理能够在线而非事后进行的原因。
- 回路 2 · Rollout 批次级——候选优化回路。失败的 rollout 按最早可观测分歧点聚类、做因果诊断,并转化为代码空间中的候选评审器与恢复技能更新。
- 回路 3 · 迭代级——验证门控的技能更新回路。只有通过历史回归测试与严格留出集泛化检验的候选者,才能进入版本化技能库。修好一个任务却弄坏其他任务的技能永远无法入库。
机器人"顿悟时刻":成功不是一条平滑曲线
项目中最引人注目的观察之一:进步并非渐进式的。Zetta ζ 往往能定位关键物理瓶颈,然后解锁一次陡峭的、非连续的成功率跃升——团队称之为机器人的"顿悟时刻"(Aha Moments)。
案例研究:RoboCasa 上的 CoffeeSetupMug
在开启电水壶、滑动洗碗机搁架、关上烤面包机门、放置咖啡壶等 RoboCasa 任务上都能观察到逐轮改进。CoffeeSetupMug 任务是一个代表性例子:
案例研究:把盘子推到灶台前(LIBERO-Pro)
LIBERO-Pro 上更难的一个例子——冻结策略起始成功率为 0%,需要两轮进化技能才能通关:
成功率随进化轮次持续扩展
随着评审器-恢复机制的累积叠加,任务成功率稳步逼近冻结策略的能力上限:
学到的技能零样本跨任务迁移
Zetta ζ 进化出的技能并非任务特定的轨迹,而是由物体相对几何、接触、抓取保持与进度谓词定义的——这些物理不变量可以在相关任务之间迁移,无需额外的进化回路:
- 抓取放置类技能。在 PnP-Stove 上学到的预抓取、重新抓取与稳定放置技能,把 PnP-Sink、PnP-Cabinet、PnP-Toaster 的宏平均成功率从 64% 提升到 84%。
- 铰接体类技能。在 TurnOffStove 上学到的目标定位、避碰接近与稳定接触技能,把水龙头、橱柜、微波炉类任务的宏平均成功率从 64% 提升到 80%。
Z-Infra:自我进化具身智能体的推理基础设施
环境中的自我探索是学习数据的来源,因此更快的 rollout 带来更快的进化。Z-Infra 是把智能体逻辑与异构执行资源解耦的推理基础设施层:控制平面把智能体请求路由到专门的环境工作节点与 rollout 工作节点,同一套智能体逻辑无需修改即可在异构硬件上运行。
基准测试结果
所有提升都来自框架的进化,而非改变冻结的 VLA 权重。LIBERO-Pro Goal (T/S) 与 LIBERO-10 (T/S) 各取十个任务平均;RoboCasa 为 18 个 Atomic-Seen 任务的宏平均。
| 基准 | 设置 | 冻结 VLA | Zetta ζ |
|---|---|---|---|
| LIBERO-Pro | Goal (T) | 31.0 | 92.5 |
| Goal (S) | 38.0 | 89.0 | |
| LIBERO-Pro | LIBERO-10 (T) | 50.0 | 63.0 |
| LIBERO-10 (S) | 9.0 | 40.0 | |
| RoboCasa | 18 Atomic-Seen | 73.56 | 93.56 |
为什么重要
作者希望读者记住的结论:闭环框架的自我进化为可靠的物理智能开辟了一条扩展之路。成功率随自我探索经验持续增长,学到的技能零样本迁移,清晰的机器人"顿悟时刻"不断涌现——而基础策略全程保持冻结。如果这一范式能在更大规模上复现,它是对"以微调为中心"范式的有力替代方案:改进框架,而不是改进权重。
论文:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence(arXiv:2608.16590)· 代码:air-embodied-brain/Zetta-Embodiment
来源:Zetta ζ 项目主页——清华大学智能产业研究院(AIR)& Z-Trans AI。Xin Ding、Liang Mi、Mingzhe Huang、Zixuan Wang、Chao Zhang、Zixu Hao、Fu Chen、Xiangyu Li、Yikai Zheng、Yaoyu Guo、Weijun Wang、Kun Li、Hao Wu、Yunxin Liu、Ting Cao。
原文来源:Zetta ζ Project Pagehttps://air-embodied-brain.github.io/zetta/


