PAPER DEEP DIVE
Zetta:冻结策略模型,让执行框架自进化出物理智能
清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。
论文:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
作者:Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao 等(共同一作 6 人);项目负责人 Ting Cao
机构:清华大学智能产业研究院 (AIR) · Z-Trans AI
链接:arXiv:2608.16590 · 项目主页 · 代码状态:论文未附代码仓库链接,项目页为成果展示页
一句话总结
Zetta 是一个闭环具身执行框架:基础 VLA 策略全程冻结,靠一组可在线进化的代码化运行时"批评家"(critic)与恢复技能,在动作频率上实时治理执行、在回合批级别诊断失败并提出修复、在验证门控下沉淀技能——配合专门设计的 Z-Infra 回滚基础设施,把 LIBERO-Pro 成功率从 34.5% 进化到 90.8%、RoboCasa 从 73.6% 提到 93.6%,并观察到清晰的机器人"顿悟时刻"。
一、研究背景与动机
物理智能目前沿着两条互补的路径扩展。第一条是端到端策略模型:VLA(视觉-语言-动作)与 WAM(世界-动作)模型,用 DROID、Open X-Embodiment 等大规模演示语料训练。但具身数据依然稀缺,在有限分布上训练的模型面对真实部署的动态变化时十分脆弱——从演示到可靠真实执行之间的鸿沟仍未弥合。
第二条路径是用大语言模型作为具身智能体,去编排策略模型、代码、工具与控制原语,目标是从环境中的自我探索里学习。这条路线缓解了端到端策略的局限,但作者指出一个关键事实:现有的具身智能体框架并没有真正实现这种学习。它们基本上是开环的——执行一旦开始,智能体就不再持续地根据演化中的机器人-环境状态做决策,而是跟随固定技能或预规划轨迹,只在回合结束后才反思。
这种"事后反思"有结构性缺陷:它无法在失败发生时在线验证反思是否正确,整条轨迹上的信用分配困难,而且回顾性分析往往拿不到失败瞬间的精确状态。于是总结出来的经验难以复用,对有效学习的支持有限。
实现闭环执行的根本瓶颈在于频率:物理任务要求决策与当前机器人和环境状态耦合,而状态常在毫秒级延迟预算内变化,大型智能体模型无法在真实系统中以这种频率做决策。这正是 Zetta 要解决的核心矛盾——既要闭环治理的高频率,又要从执行经验中持续进化。
本文的关键想法是:引入可在线进化的代码化批评家(critic),由它们在动作频率上治理物理执行、按动作与环境的动态变化触发智能体干预。围绕这个想法构建的 Zetta 冻结基础策略模型,只进化运行时批评家与恢复技能构成的执行框架,并用三个时间尺度分离的循环实现自进化;同时,由于环境是学习数据的来源、回滚吞吐成为智能扩展的限速器,作者还构建了 Z-Infra——据其所知第一个专为自进化具身智能体设计的回滚基础设施。
二、问题形式化:双智能体治理与进化架构
Zetta 把长时程机器人操作任务形式化为一个"权威约束的治理与进化过程"。系统中有两个固定组件:动作策略 $\pi$(给定观测 $s_t$ 与目标 $g$ 生成低层动作 $a_t=\pi(s_t,g;\theta)$,参数满足约束 $\nabla\theta=0$,即全程冻结)与编排智能体 $\mathcal{A}_{orch}$(固定的多模态推理算子,负责审计实时证据、批准模式切换,其决策逻辑在进化中保持不变)。
进化的对象是执行框架 $\mathcal{H}$:
$$\mathcal{H}=\{C,R,\mathcal{T}\} \tag{1}$$
其中运行时批评家 $C$ 是一组高频监控函数,持续扫描轨迹 $\tau_{0:t}$ 并生成结构化提案:
$$P_t=C(\tau_{0:t})=\langle e_t,\hat{\sigma}_t\rangle \tag{2}$$
$e_t$ 是可审计的失败证据(碰撞、进度停滞等),$\hat{\sigma}_t$ 是建议的执行模式。$R$ 是按因果失败机制组织的恢复策略库,$\mathcal{T}$ 是工具集。执行中的最终模式由裁决函数决定:
$$\sigma_t=\mathcal{A}_{orch}(P_t,R,\mathcal{T},\mathcal{K}) \tag{3}$$
$\mathcal{K}$ 是任务知识上下文(预定义里程碑、成功判据、环境约束)。这个协议强制证据驱动:虽然 $C$ 高频运行,但只有证据 $e_t$ 被 $\mathcal{A}_{orch}$ 验证并接受后,干预才被允许。离线的进化智能体 $\mathcal{A}_{evo}$ 分析失败回滚数据 $\mathcal{D}_{fail}$ 迭代改进框架:
$$\mathcal{H}^{(k+1)}\leftarrow\mathcal{A}_{evo}(\mathcal{D}_{fail}^{(k)},\mathcal{H}^{(k)}) \tag{4}$$
终极目标是在 $\pi$ 与 $\mathcal{A}_{orch}$ 不变的前提下,找到最大化期望任务成功率的最优框架配置:
$$\max_{\mathcal{H}}J(\mathcal{H})=\mathbb{E}_{g,s_0\sim\mathcal{D}}\left[\text{Success}(\tau)\mid\pi,\mathcal{A}_{orch},\mathcal{H}\right] \tag{5}$$
三、三个挑战与三条设计原则
作者识别出冻结 VLA 策略的三个核心挑战,并各给出一条设计原则。挑战一:开环的语义-物理鸿沟。SOTA VLA/WAM 语义理解强,但推理时是开环前馈策略,缺乏闭环感知-运动纠错能力,物体滑脱、轻微碰撞这类小扰动会级联成整体失败。对应原则是高频状态治理:用与动作策略解耦、频率高于策略推理率的运行时批评家持续监控物理执行状态,在偏离标称分布的最早迹象就触发干预。挑战二:过度参数化修复的泛化陷阱。临时调试容易做出"过拟合"修复——为了让某个失败实例成功而调低层控制参数,结果破坏了 VLA 语义泛化所依赖的动作分布。对应原则是层级化因果诊断下的最小干预:诊断按"评估→批评家→状态→规划→恢复→参数"的优先级自顶向下遍历,"若高层逻辑能解决失败,就绝不修改低层参数"。挑战三:专家在环调试不可扩展。人工逐个分析修补长尾失败实例昂贵且无法跟上初始条件的无限变化。对应原则是自动化进化泛化:用全自动进化循环替代手工调试,并以严格的留出泛化协议验证。
四、方法详解:三阶段进化循环
4.1 阶段一:经验性失败画像与基线建立(循环 1)
进化周期开始时,系统在开发种子集 $\mathcal{D}_{dev}$ 上大规模采样动作策略 $\pi$,建立无治理干预的纯 VLA 基线。为保证经验严谨性,循环 1 强制两个确定性维度:确定性路由(所有回滚任务经集中调度器按节点实时负载分发,同批回滚在相同容器、仿真器版本与硬件配置下运行)与有效性判定——回滚只有在传感器数据与视频证据完整时才计入有效集:
$$\mathcal{V}=\{seed_j\in\mathcal{D}_{dev}\mid\text{Valid}(seed_j)=True\} \tag{6}$$
基础设施失败的尝试(网络抖动、仿真器崩溃)强制用原逻辑种子重跑,直到产生有效轨迹,保证 $\mathcal{V}$ 的统计分布不被非策略因素污染。每条有效轨迹被表示为多模态时间序列:
$$\tau^{(j)}=\{(s_t,a_t,\mu_t,\phi_t)\}_{t=0}^{T} \tag{7}$$
$\mu_t$ 是任务特定语义里程碑的完成状态,$\phi_t$ 是碰撞强度、接触力向量等物理辅助信号。语料随后被整理成两个仓库:按里程碑聚合的成功参考索引 $I_{succ}(\mu)=\{s_t\mid\tau\in\mathcal{V}_{succ},\mu_t=\mu\}$(式 8,揭示任务成功的"标称分布"),以及失败种子清单与"首个缺失里程碑" $m^*$:
$$m^*=\min\{m_k\in M\mid m_k\notin\{\mu_t\}_{t=0}^{T}\} \tag{9}$$
$m^*$ 既是失败的粗粒度聚类准则,也把因果诊断的搜索空间收窄到 $m^*-1$ 到 $m^*$ 的转移证据上。
4.2 阶段二第一阶段:失败聚类与因果诊断
诊断智能体 $\mathcal{A}_{diag}$ 不按最终结果做表面分类,而是按"最早可观测分歧"(EOD)聚类种子:
$$t_{EOD}=\min\{t\mid\text{dist}(s_t,s_t^{ref})>\epsilon,\;s_t^{ref}\in I_{succ}(\mu_t)\} \tag{10}$$
利用 $t_{EOD}$ 及其上下文($m^*$、机器人-物体相对位姿、激活的工具 ID),把失败清单划分为互斥的失败簇 $\mathcal{K}=\{K_1,\dots,K_n\}$,每簇选一个中心样本(medoid)种子做深入诊断。为消除多模态模型的空间推理不一致与多视角幻觉,诊断遵守严格的单视角锚定协议:先指定最能展示末端执行器、目标物体与关键接触面的主视角,之后所有视觉推理都锚定该视角;证据不足时回退到仿真器内部状态、传感器轨迹与物理信号 $\phi_t$ 做跨模态验证,而不是切换视角。
对选出的 medoid 种子,$\mathcal{A}_{diag}$ 在诊断层空间 $\mathcal{L}=\{L_{eval},L_{crit},L_{state},L_{plan},L_{recv},L_{param}\}$ 上自顶向下定位根因层:
$$L^*=\arg\max_{L\in\mathcal{L}}\{\text{IsRootCause}(L)\mid\text{Evidence from }\tau,\text{Primary View}\} \tag{11}$$
检查顺序依次为:评估层(成功判据或里程碑逻辑错误)→批评家层(漏报/误报)→状态表示层(位姿或接触信息偏离物理真值)→规划/控制层(状态正确但策略与工具无法处理物理约束)→恢复层(恢复手册自身缺陷)→参数层。这个顺序保证补丁落在最小有效层,保护基础模型的完整性。
4.3 阶段二第二阶段:批评家引导的框架修复与验证
修复智能体 $\mathcal{A}_{repr}$ 按诊断规格实例化治理组件:批评家增强 $C^*$(检测特定失败前兆条件的高频监控函数)、恢复手册起草 $R^*$ 与工具适配 $\mathcal{T}^*$。关键设计是嵌入恢复逻辑的"VLA 再入契约":定义何时把控制权交还给基础策略的逻辑谓词
$$\Psi(s_t)=\mathbb{1}(\text{FailureCleared})\land\mathbb{1}(\text{Stability}(s_t)>\gamma) \tag{12}$$
只有当原始失败证据 $e_t$ 被明确清除、且物理状态达到由稳定接触力定义的平衡时,才允许交还控制。$\text{Stability}(s_t)$ 度量接触力矩振荡与抓取力,$\gamma$ 是稳定阈值——这个契约防止瞬态动力学效应在策略恢复时引发二次失败。修复补丁 $\mathcal{H}_{patch}$ 在原 medoid 种子上经过两步闭环验证:诊断回放确认增强批评家能正确识别分歧点 $t_{EOD}$,再从初始状态做全新闭环回滚,只有任务达到目标里程碑且所有干预都经 $\mathcal{A}_{orch}$ 合规裁决才算通过:
$$\text{Success}(\mathcal{H}_{patch})=\mathbb{1}(\mu_{T,new}=m_{goal}\land\forall t\in\text{Intv},\text{Adjudicated by }\mathcal{A}_{orch}) \tag{13}$$
4.4 阶段三:整合、打包与泛化
泛化智能体 $\mathcal{A}_{gen}$ 把已验证的种子专属补丁整合成统一、版本化的合并框架 $\mathcal{H}_{merged}=\{C_{merged},R_{merged},\mathcal{T}_{merged}\}$:批评家统一(对触发条件做逻辑或、动态调整噪声阈值,保证在簇内多样初始条件下可靠检测)、恢复整合(把种子专属手册抽象为机制级不变量)。合并后的框架还要通过历史回归测试与严格隔离的留出集评估,并经由动态转移协议决定何时把新版本提升为线上框架。由于技能与代码不提供梯度,作者借鉴 SkillOpt 与 EmbodiSkill,在代码空间构造类 SGD 的有界稳定更新。
五、Z-Infra:为自进化而生的回滚基础设施
闭环学习把回滚吞吐变成了智能扩展的限速器:环境是学习数据的来源,回滚越快,进化越快。Z-Infra 的核心想法是引入完全解耦智能体逻辑与硬件资源管理的抽象层——智能体只与虚拟回滚接口交互,指定"执行什么"(哪个模型、哪个环境、哪个操作),而"在哪执行、如何执行"由基础设施独立处理。
架构分三层。控制平面是所有智能体交互的唯一入口,暴露统一 API、处理请求路由、资源管理与容错。环境工作器层管理仿真会话生命周期,采用基于会话的生命周期管理与资源共享组:环境步进例程用高性能 C++ 控制器重写(合并控制执行、动作插值、物理子步与渲染),关键路径上释放 GIL,让多个槽位在同一工作器进程内并行推进物理与渲染。回滚工作器层是 GPU 常驻的批推理执行器,按模型身份、输入模态与张量形状把请求分入兼容性组,先来先服务地派发;三个工程点值得注意:模型分区——把 $\pi_{0.5}$ 这类 VLM+动作专家两段式架构拆成独立进程、用 CUDA IPC 传激活,平均推理延迟降 53%、200ms SLO 下有效吞吐提升 2.4 倍;量化运行时——对 $\pi_{0.5}$ 在 RTX 4090 上只给计算密集的前缀 MLP 做 W8A8 量化、其余保持 BF16,获得 1.18–1.32 倍加速且 LIBERO 成功率不降;整体基于 Ray 构建,三层之间用五条有界 Ray Channel 划分控制流与数据流。
六、实验结果
实验在 8 张 RTX 4090 的集群上进行,两个基准的基础策略分别是 $\pi_{0.5}$(LIBERO-Pro)与 GR00T N1.5(RoboCasa),全程冻结、不做任何微调;两个基准都遵守严格的泛化评估协议——最终框架在进化与开发过程从未见过的隔离测试种子上评估。
6.1 基准成绩
| 设置 | 方法 | Average |
|---|---|---|
| Goal (T) | π0.5 冻结基线 | 31.0 |
| Zetta | 92.5 | |
| Goal (S) | π0.5 冻结基线 | 38.0 |
| Zetta | 89.0 | |
| LIBERO-10 (T) | π0.5 冻结基线 | 50.0 |
| Zetta | 63.0 | |
| LIBERO-10 (S) | π0.5 冻结基线 | 9.0 |
| Zetta | 40.0 | |
| 总体宏平均 | π0.5 冻结基线 | 32.00 |
| Zetta | 71.13(+39.13) |
Zetta 在 40 个任务-设置对中的 32 个上提升、其余 8 个持平,无一退步。RoboCasa 18 个 Atomic-Seen 任务上,冻结 GR00T 基线的宏平均成功率从 73.56% 提升到 93.56%(绝对增益 20.00 个百分点),全部 18 个任务一致提升,接触密集与长时程任务(如 T4、T5、T15)增益最大——T5 从 48% 到 86%,T15 从 50% 到 100%。
6.2 扩展性与"顿悟时刻"
成功率随进化轮次持续爬升:LIBERO-Pro 从 34.5% 到 90.8%,RoboCasa 从 73.6% 到 93.6%。RoboCasa 18 任务的宏平均在四轮累积全局修复中走过 73.56% → 78.71% → 84.85% → 90.54% → 93.56%,每个检查点都保留此前验证过的批评家、恢复与工具能力。
更有意思的是"顿悟时刻"(Aha Moments):在单个失败簇的进化内部,成功率往往先停滞、后突变。早期修订版(如预抓取暂存、局部门控)只带来边际收益,因为它们处理的是局部症状;当进化智能体隔离出决定性的物理状态变量——抓取保持、末端执行器重对准、语义接近几何——并把 VLA 执行拉回其在域区域时,成功率出现不连续的跃升,例如 Wine Bottle in Bowl 从 15% 到 95%、Put Cream Cheese on Bowl 从 5% 到 90%。
6.3 零样本技能迁移
进化出的机制能零样本迁移到相似任务,因为它们作用于任务无关的物理变量(末端对准、接触稳定)而不是记忆源任务轨迹。以 RoboCasa 的 PnP-Stove 为例,三轮进化产出预抓取对准、抓取丢失后重抓、稳定放置三个累积能力,不做任何额外训练直接应用到三个相关任务:PnP-Sink 58%→82%、PnP-Cabinet 62%→80%、PnP-Toaster 72%→90%,迁移任务宏平均从 64% 到 84%(+20 个百分点)。铰接交互任务 TurnOffStove 上进化出的目标定位、避碰接近、稳定接触技能,零样本迁移到 TurnOnSinkFaucet、OpenCabinet、TurnOnMicrowave,宏平均 64%→80%。LIBERO-Pro 上,Goal-T8 发现的三个累积机制(预抓取暂存、抓取保持批评家、失败门控重试)零样本应用到 Goal-T2、Goal-T6 与 Goal-S3,其中 Goal-S3 从 9/20 提升到 20/20。
6.4 Z-Infra 性能
| 指标 | Zetta(无 Z-Infra) | RPent | Zetta + Z-Infra |
|---|---|---|---|
| 吞吐 @ 并发 16 | 2.88 ep/min | 1.72 ep/min | 22.09 ep/min(7.7× / 12.8×) |
| 吞吐 @ 并发 32 / 64 | 并发 16 以上 OOM | 32.8 / 35.1 ep/min(饱和) | |
| 单回合延迟 @ 并发 8→32→64 | 34s→112s(爆炸式,3.3×) | 392s→513s | 39s→57s→95s(亚线性) |
Z-Infra 把有效回滚吞吐从 1.7 提到 35.1 ep/min(20.6 倍),相比 RPent 推理延迟降低 91%(11.1 倍加速)。两个基线在并发超过 16 后都因显存不足崩溃,而 Z-Infra 的持久工作器设计、动态批处理与异步调度让延迟增长保持亚线性。延迟优势的根源在于:RPent 的 agent-in-the-loop 设计在每个决策点都要调用 LLM API,而 Zetta 只在离线"反思与进化"阶段调用智能体,线上回滚跑的是轻量运行时批评家监督下的纯 VLA 策略。
6.5 案例研究:失败前沿的移动
RoboCasa 的一个 PnP 回合展示了框架在单次执行内的多次干预:VLA 完成抓取运输后物体滑脱,批评家检测到抓取丢失并中断标称轨迹,恢复执行受控重接近并建立新抓取,控制权回到 VLA;随后初始重抓位姿不可行,批评家报告无效的接近几何,恢复调用 GraspGen 生成可行的末端位姿完成重抓;接近目标时,批评家检测近目标放置风险,交给基于 CAP 的稳定放置恢复,验证再入条件后结束回合。LIBERO-Pro Goal-S5 则展示了跨提升轮次的"失败前沿移动":第 0 轮父策略耗尽预算而无及时恢复交接;第 1 轮引入保持门控交接,但回合停在无法验证稳定抓取;第 2 轮加入闭合接触批评家与接触门控抓取恢复,盘子成功抓起,却在运输中丢失;第 3 轮用有界重抓重试解决运输丢失,回合直到官方灶台前关系成立才终止。每一轮提升的技能都把最早未解决的失败推向更晚的执行阶段。
七、局限性
作者自述:所有实验都在仿真中完成,未来工作明确指向把 Zetta 与 Z-Infra 扩展到真实机器人——通过弥合 sim-to-real 鸿沟实现快速大规模并行回滚采集与自进化,并把真实机器人环境作为一等工作器接入 Z-Infra。此外,进化依赖回滚预算,性能"随进化轮次持续上升"意味着当前数字受预算约束而非收敛值。
第三方视角补充三点。其一,收益结构不均:LIBERO-Pro 的增益集中在 Goal 设置(31→92.5 / 38→89.0),而 LIBERO-10 设置提升有限(50→63 / 9→40)——框架只能"修复"基础策略能力天花板内的失败,当失败源于策略本身的能力缺失(而非执行偏差)时,批评家-恢复机制无能为力。其二,进化成本披露不完整:离线进化智能体本身依赖大型 LLM,进化轮次的 token 成本、诊断耗时与人工监督程度未量化;8 卡 4090 的集群门槛也限制了可复现性。其三,对比协议较软:与 SOTA 的对比混合了不同版本的基线数字($\pi_{0.5}$、GR00T N1.5 均为各自报告的冻结基线),留出集协议由作者自定义,缺少与其他具身智能体框架在完全相同种子与预算下的同场对照。
八、总结与展望
Zetta 的贡献可以概括为三点。第一,把具身智能体的"执行框架"确立为独立于策略模型的可进化对象:冻结 $\pi$ 与 $\mathcal{A}_{orch}$,只进化代码化的批评家、恢复与工具(式 1–5),用动作频率、回合批、迭代三个时间尺度分离的循环分别承担闭环执行、候选生成与验证门控沉淀。第二,给这套进化装上了工程纪律:确定性路由与有效性判定保证失败统计干净(式 6–9),EOD 聚类与自顶向下诊断保证最小干预(式 10–11),再入契约与闭环验证保证修复不引入二次失败(式 12–13)。第三,用 Z-Infra 把回滚吞吐这个限速器提了 20.6 倍,使"环境即数据源"的自进化飞轮真正转得起来。仿真上 90.8%(LIBERO-Pro)与 93.6%(RoboCasa)的 SOTA 成绩、随轮次持续的扩展曲线、零样本技能迁移与"顿悟时刻",共同支撑了论文的核心主张:闭环框架自进化是通往可靠物理智能的一条可扩展路径。
展望层面,最值得关注的两个后续问题是:真实机器人上能否复现仿真中的进化速度(真机回滚成本远高于仿真,失败试错还受安全约束),以及当基础策略更弱或任务超出其能力天花板时,这套"修复式"进化能否与策略微调形成互补的混合闭环。
金句
"策略模型的权重一动不动,变的是围着它的批评家与恢复技能——Zetta 证明了物理智能可以不靠重新训练,而是靠把每一次失败都翻译成一行被验证过的代码。"
来源:arXiv:2608.16590(Zetta ζ,清华大学 AIR / Z-Trans AI,CC BY 4.0)。



