Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

机器人基础模型robot foundation modelVLA

π0.7:可操控的通用机器人基础模型与涌现能力

Physical Intelligence 提出可操控的机器人基础模型 π0.7:通过语言指令、子目标图像与任务元数据等多模态上下文条件化,在未见环境多阶段任务、零样本跨本体泛化中开箱即用,性能比肩 RL 微调专用策略,并展现涌现能力。

Physical Intelligence, Bo Ai, Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Greg Balke, Kevin Black, George Bokinsky, Shihao Cao, Thomas Charbonnier, Vedant Choudhary, Foster Collins, Ken Conley, Grace Connors, James Darpinian, Karan Dhabalia, Maitrayee Dhaka, Jared DiCarlo, Danny Driess, Michael Equi, Adnan Esmail, Yunhao Fang, Chelsea Finn, Catherine Glossop, Thomas Godden, Ivan Goryachev, Lachlan Groom, Haroun Habeeb, Hunter Hancock, Karol Hausman, Gashon Hussein, Victor Hwang, Brian Ichter, Connor Jacobsen, Szymon Jakubczak, Rowan Jen, Tim Jones, Gregg Kammerer, Ben Katz, Liyiming Ke, Mairbek Khadikov, Chandra Kuchi, Marinda Lamb, Devin LeBlanc, Brendon LeCount, Sergey Levine, Xinyu Li, Adrian Li-Bell, Vladislav Lialin, Zhonglin Liang, Wallace Lim, Yao Lu, Enyu Luo, Vishnu Mano, Nandan Marwaha, Aikys Mongush, Liam Murphy, Suraj Nair, Tyler Patterson, Karl Pertsch, Allen Z. Ren, Gavin Schelske, Charvi Sharma, Baifeng Shi, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, Will Stoeckle, Jiaming Tang, Jimmy Tanner, Shalom Tekeste, Marcel Torne, Kyle Vedder, Quan Vuong, Anna Walling, Haohuan Wang, Jason Wang, XuDong Wang, Chris Whalen, Samuel Whitmore, Blake Williams, Charles Xu, Sukwon Yoo, Lili Yu, Wuming Zhang, Zhuoyang Zhang, Ury Zhilinsky2026年4月16日4 分钟阅读
EN

论文:π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
作者:Physical Intelligence(90 位作者,含 Sergey Levine、Chelsea Finn、Karol Hausman、Danny Driess、Karl Pertsch、Lucy Xiaoyang Shi 等)
链接:arXiv:2604.15483(v2,2026-04-24)· 官方博客
代码状态:π0.7 代码与权重未开源;官方开源仓库 openpi 目前仅包含前代 π0 / π0.5 系列

一句话总结

Physical Intelligence 把机器人策略的上下文从一句「做什么」扩展成一份多模态任务说明书——子任务语言指令、由世界模型生成的子目标图像、以及描述这条数据「做得多快、多好、有没有犯错」的回合元数据。正是这套「多样化提示」让 π0.7 能够把失败回合、自主评测数据乃至人类视频一起倒进训练集,最终得到一个无需任何任务微调就能追平 RL 专家模型、并能零样本跨本体叠衣服、用语言「现场教学」学会用空气炸锅的可操控通用基础模型。

研究背景与动机

大语言模型之所以强大,不只是记住了训练语料,更在于能把语料中的能力以新的方式组合起来,解决从未见过的问题——这种组合泛化(compositional generalization)正是通用智能的标志。然而在物理世界里,视觉-语言-动作模型(VLA)虽然规模和性能不断增长,组合泛化却始终难以实现:多数模型连训练过的指令都需要任务级微调才能流畅执行,更不用说把技能重新组合去完成全新任务。

要走出这个困境,一个自然的方向是用更大、更多样的数据训练。但机器人数据的多样性带来一个独特的难题:不同操作员、不同策略、不同质量的轨迹混在一起,朴素的训练方式会让模型学到各种行为模式的「平均」,结果反而更差。失败回合、笨拙的自主探索、质量参差的演示,这些数据里其实包含大量关于状态分布和错误恢复的宝贵信息,直接扔掉是巨大的浪费,直接倒进去又会拖累性能。

π0.7 的解题思路借鉴了图像生成领域的「提示词扩展」(prompt expansion):与其清洗数据,不如给每条数据配上足够详细的上下文,让模型学会「在什么条件下做什么」。但在机器人场景里,光靠更详细的文字描述是不够的——有些关键信息很难用语言表达(比如「一件叠得整齐的 T 恤长什么样」),有些则属于策略层面的属性(比如这条轨迹的整体质量)。因此 π0.7 把上下文扩展为多模态的提示词:除了语言指令,还包括子目标图像、回合元数据与控制模式。这一改动看似温和,却从根本上改变了模型能消化什么样的数据,并最终催生出一系列涌现能力。

图 1:π0.7 是一个可操控的通用机器人基础模型,训练提示词中不仅包含任务描述,还包含详细语言、生成的子目标图像与回合元数据,告诉模型不仅「做什么」还有「怎么做」。

方法总览:把提示词变成多模态任务说明书

标准 VLA 的训练目标是给定观测历史与上下文,最大化动作块的对数似然:

$$\max_{\theta}\;\mathbb{E}_{\mathcal{D}}\left[\log\pi_{\theta}(\mathbf{a}_{t:t+H}\mid\mathbf{o}_{t-T:t},\mathcal{C}_{t})\right]$$

其中观测 $\mathbf{o}_{t}=[\mathbf{I}_{t}^{1},\ldots,\mathbf{I}_{t}^{n},\mathbf{q}_{t}]$ 由 $n$ 路相机图像与机器人本体状态 $\mathbf{q}_{t}$ 组成,$\mathbf{a}_{t:t+H}$ 是未来一段动作块。惯例上上下文 $\mathcal{C}_{t}$ 只是一条人工标注的语言指令 $\ell_{t}$(比如「清理厨房」)。π0.7 把它扩展为五个部分:$\mathcal{C}_{t}=(\ell_{t},\hat{\ell}_{t},\mathbf{g}_{t},m,c)$,分别是任务描述、子任务指令、多视角子目标图像、回合元数据和控制模式。训练时每个组件都被随机丢弃(dropout),使模型在测试时可以只用任意子集,灵活组合。

图 3:提示词总览。π0.7 的上下文包含子任务指令、子目标图像与回合元数据等多种模态,训练时对各组件做 dropout,测试时灵活组合。

一条真实的训练提示词长这样:

<Multi-view observation><Multi-view subgoals> Task: peel vegetables. Subtask: pick up the peeler. Speed: 8000. Quality: 5. Mistake: false. Control Mode: joint. <Proprioception>

提示词的四个扩展组件

子任务指令:语义级的分段标注

延续 π0.5 的做法,除了整体任务描述 $\ell_{t}$,提示词中还包含刻画当前语义子任务的中间指令 $\hat{\ell}_{t}$(例如「打开冰箱门」)。团队先在多样场景里采集数据,再对轨迹分段并配上细致的文字描述。这一设计带来一个额外红利:由于模型被训练去跟随多样的语言指令,人类可以在全新任务上逐步用语言「指导」机器人(比如把红薯装进从未见过的空气炸锅);这些指导数据随后可用于微调出一个高层语义策略,让机器人完全自主地完成任务。

子目标图像:用画面补齐语言说不清的细节

「打开冰箱门」并没有说明该以什么姿势抓住把手。子目标图像通过描绘场景在不远未来的期望状态,把语言难以表达的执行细节(环境/物体层面的结果,以及腕部视角下手臂/夹爪的姿态)直接画给策略看。π0.7 使用多视角子目标 $\mathbf{g}_{t}=[G_{t}^{1},\ldots,G_{t}^{n}]$,运行时由一个轻量世界模型 $g_{\psi}$ 生成。世界模型从具备网页级预训练的 BAGEL(14B 混合 Transformer 图像理解/编辑/生成模型)初始化,用条件流匹配目标训练:

$$\max_{\psi}\;\mathbb{E}_{\mathcal{D}_{g}}\left[\mathcal{L}_{\mathrm{CFM}}\left(\mathbf{g}_{t}^{\star},\;g_{\psi}(\mathbf{o}_{t},\hat{\ell}_{t},m)\right)\right]$$

其中真值子目标取分段末帧 $\mathbf{g}_{t}^{\star}=\mathbf{o}_{t_{\mathrm{end}}}$,训练集 $\mathcal{D}_{g}$ 是带有高质量子任务标注的分段子集。通过混入网页数据、第一视角人类视频和其他视频数据,世界模型获得的语义与物理概念经由子目标图像「注入」π0.7——这是一种把网页级知识迁移进低层策略的巧妙通道。

训练 VLA 时,子目标图像用真实未来帧与生成图像混合供给:以 0.25 的概率取分段末帧(与世界模型的预测目标一致),以 0.75 的概率在当前时刻之后 0–4 秒内均匀采样未来帧,同时大量加入世界模型生成的图像以弥合真实/生成图之间的训练-测试偏差。由于带子目标时动作预测几乎退化成「逆动力学」问题、训练显著变快,团队只在每个 batch 的 25% 样本中加入子目标图像。

回合元数据:给数据质量贴上显式标签

这是 π0.7 敢于消化低质数据的关键。每条训练轨迹都被标注上一组元数据 $m$:

  • 整体速度(Overall speed):回合时长(步数),按 500 步区间离散化,例如 1750–2250 步统一记作「2000 steps」。速度往往与质量正相关——快的回合通常错误更少。
  • 整体质量(Overall quality):1–5 分的执行质量打分,5 为最高。
  • 失误(Mistake):该动作分段内机器人是否犯错(如抓空、做错子任务),由人工粗标注。

训练时模型看到真实的回合速度、质量与失误标签;数据多样性提供了足够的信号,让模型学会把这些元数据与目标动作关联起来。测试时则反向使用:把速度设为该任务回合长度的 15 分位数、质量恒为 5、失误恒为 false,相当于命令模型「以接近最快、最高质量、零失误的方式执行」。这就是「可操控性」的直接来源。

控制模式:同一模型切换关节与末端执行器

训练同时包含关节级(joint)与末端执行器(ee)动作,并用文本标识符 $c\in\{\texttt{joint},\texttt{ee}\}$ 在提示词中声明,运行时可按任务选择。论文附录显示,对先前模型而言两种控制模式在跨本体任务上性能差异不大。

训练时的 dropout 配方

各组件的随机丢弃策略是精心设计的:25% 的样本带子目标图像;带子目标的样本中 30% 丢弃子任务指令(视觉子目标往往比文字描述更丰富,可以替代它);回合元数据整体以 15% 概率丢弃,其三个子项再各自以 5% 概率单独丢弃;控制模式从不丢弃。这套 dropout 使 π0.7 在测试时能接受任意提示词组合,甚至支持对上下文做无分类器引导(CFG)。

模型架构与训练配方

图 2:架构总览。π0.7 是 5B 参数的 VLA:4B VLM 主干 + MEM 风格视频历史编码器 + 860M 动作专家;运行时子任务指令来自同架构的高层语义策略,子目标图像来自基于 BAGEL 的轻量世界模型。

π0.7 在 π0.6 的 VLA 架构与 MEM 记忆系统基础上扩展而来,总参数约 5B:

  • VLM 主干:由 Gemma3 4B 初始化(含 400M 视觉编码器),输入至多 4 路相机图像(前视、双腕、可选后视),每路至多 6 帧历史,历史帧按 1 秒步长采样,图像统一缩放到 448×448。历史编码器沿用 MEM 设计,对历史做时空压缩,无论历史帧数多少都输出固定数量的 token;整体历史以 0.3 概率丢弃,后视图像也以 0.3 概率丢弃。
  • 注意力结构:采用块因果(block-causal)掩码——观测 token 与子目标 token 各自内部双向注意,子目标 token 还可注意到观测;后续文本 token 使用因果注意。
  • 本体感觉:状态 $\mathbf{q}_{t}$(含历史状态)不再像 π0.6 那样离散成文本 token,而是像 MEM 一样用线性投影映射到主干维度,每个历史状态作为独立 token,历史帧被丢弃时对应状态 token 也一并掩掉。
  • 动作专家:860M 参数的轻量 Transformer,用流匹配目标预测连续动作,通过 adaptive RMSNorm 注入时间步信息;固定处理 50 个动作 token(50 步动作块),块内双向注意并可注意主干激活。
  • 知识保温(KI):VLM 主干另用 FAST token 做离散交叉熵监督;动作专家可以读取主干全部激活,但梯度不回传进主干——让 VLM 以稳定的离散损失持续学习,不被动作回归损失破坏。
  • 实时动作块(RTC):训练时模拟 0–12 步推理延迟(50Hz 机器人上对应至多 240ms),保证推理延迟下的动作平滑。

图 4:实验中使用的部分机器人平台,包括双臂移动操作平台、静态双臂平台与 UR5e 等。

训练数据是本文与经典 VLA 流水线差异最大的地方。除了覆盖多种平台与环境(自建实验室/居家风格环境、真实住宅)的演示数据,π0.7 大量使用「次优数据」:失败回合、含大量失误的成功回合,以及先前模型(包括 RL 后训练的 $\pi^{*}_{0.6}$)在评测中产生的自主轨迹。后者等价于一种「蒸馏」:通用模型把 RL 专家的本领继承回单一预训练模型。此外还混入开源机器人数据集、第一视角人类视频,以及网页来源的非机器人辅助任务(物体定位与属性预测、视觉问答、纯文本预测、视频描述)。论文明确排除了所有用于泛化评测的自主数据,避免测试集泄漏。

运行时:异步推理与无分类器引导

部署时 π0.7 按任务需要自由组合上下文,无需任何任务级后训练。回合元数据固定为:速度取该任务回合长度的 15 分位数、质量 5、失误 false;子任务指令由高层语义策略(同架构微调而来)或人类指导者提供;使用子目标图像时,每当语义意图变化(新的 $\hat{\ell}_{t}$)或距上次生成已过 $\Delta=4$ 秒,就刷新一次子目标。整个流程异步执行:视觉子目标与子任务指令在独立线程生成,VLA 推理始终使用最新可用结果(论文算法 1)。动作生成用 5 步去噪产生 50 步动作块,实际执行其中 $\hat{H}\in\{15,25\}$ 步。

由于训练时对各上下文组件做了 dropout,π0.7 可以对任意组件施加无分类器引导。每个去噪步按下式更新:

$$\nabla_{\mathbf{a}}\log\pi_{\theta}(\mathbf{a}_{t:t+H}|\mathbf{o}_{t},\mathcal{C}_{t})+\beta\left(\nabla_{\mathbf{a}}\log\pi_{\theta}(\mathbf{a}_{t:t+H}|\mathbf{o}_{t},\mathcal{C}_{t})-\nabla_{\mathbf{a}}\log\pi_{\theta}(\mathbf{a}_{t:t+H}|\mathbf{o}_{t},\mathcal{C}_{t}^{\text{uncond}})\right)$$

其中 $\mathcal{C}_{t}^{\text{uncond}}$ 是去掉被引导组件的「无条件」上下文,$\beta$ 为引导权重。论文把 CFG 施加在回合元数据上以激发灵巧任务的最佳表现,取 $\beta\in\{1.3,1.7,2.2\}$ 的温和值。

把算法 1 的运行时工作流画出来,三股信息流(策略、高层语义策略、世界模型)异步协作:

flowchart TB
    A["task instruction l
+ episode metadata m
+ control mode c"] --> B["high-level semantic policy
same Gemma3-4B architecture"] B --> C["subtask instruction
l-hat refreshes on intent change"] C --> D["world model g-psi
BAGEL 14B, 4xH100 TP"] A --> D D --> E["subgoal images g-star
3 views, 25-step denoise, 1.25s"] C --> F["pi-0.7 VLA 5B
4B VLM + 860M action expert"] E --> F G["observations o
4 cameras, 6 history frames"] --> F F --> H["5-step flow matching denoise
50-step action chunk"] H --> I["execute H-hat = 15 or 25 steps
50Hz joint or ee control"] I -.next subtask.-> B E -.regenerate every 4s
or on new subtask.-> D

推理效率方面,π0.7 与高层策略共用单块 H100:经 RTC 后续优化,最小配置(3 路相机、5 步去噪)推理仅 38ms,加上 MEM 视觉编码器与子目标图像后最坏 127ms。14B 世界模型则是推理瓶颈——近万 token 序列上做迭代去噪开销巨大,团队用 4 路张量并行(4×H100)、8-bit 量化矩阵乘和修改版 SageAttention,把 25 步去噪(含文本与图像双 CFG)压到 1.25 秒,并以异步方式让策略在世界模型生成下一张子目标时继续执行。

实验结果

图 5:部分评测任务示意,其中两个长时程任务的完整过程被可视化为电影条带。

1. 开箱即用的灵巧性:通用模型追平 RL 专家

团队在十余个高灵巧任务上评测:来自 $\pi^{*}_{0.6}$ 发布的意式咖啡机操作、折纸箱、叠衣服三个任务(可与 RL 专家直接对比)、「机器人奥运会」任务(做花生酱三明治、把 T 恤翻面、开车穿门),以及整根切西葫芦、削皮(西葫芦/黄瓜/胡萝卜)、更换垃圾袋等长时程任务。结果显示:单一通用 π0.7 在所有任务上开箱即可与对应的任务级专家打平,在叠衣服与折纸箱这两个最难的任务上吞吐量甚至超过 RL 专家。与基于 π0.6 的 SFT 专家相比,π0.7 同样全面接近。

图 6:开箱即用的灵巧性。π0.7 无需任务微调即可执行大量高灵巧任务,与 RL/SFT 专家模型对比全面占优或持平。

消融实验揭示了性能来源:去掉全部自主评测数据(no eval data)或去掉回合元数据(no metadata)都会让所有任务显著掉点。评测数据质量参差,唯有配合元数据区分高低质量行为,才能把专家轨迹蒸馏进通用模型——「多样数据 + 详细上下文」的协同是这篇论文最核心的实证结论。在需要记忆的长时程任务上,开箱的 π0.7 也达到甚至超过任务微调的 π0.6-MEM 专家。

2. 指令跟随:在陌生环境里听懂复杂指令

团队在训练数据之外的 4 个厨房与 2 个卧室里,用 14 个包含 3–6 步指令的场景评测:整理物品、与家具交互、清理洒落物等。π0.7 的整体指令跟随成功率显著高于 π0.5 与 π0.6。在刻意设计的复杂指称指令上(如「拿起我喝汤时会用到的东西」「拿起最大盘子里的水果」),π0.7 同样领先,且加上世界模型生成的子目标图像(记作 π0.7 (GC))后进一步提升——网页级预训练带来的语义理解经由子目标图像注入策略。

图 9:陌生环境中的广泛指令跟随。14 个场景各含多步指令序列,π0.7 显著优于先前模型。

更有意思的是「逆数据偏置」实验:若机器人总是在某个场景里做同一件事,训练出的模型往往会无视语言、盲目复制数据行为。团队构造了两个反向任务——「反向收餐」(把垃圾放进收餐桶、餐具扔进垃圾桶,与训练数据完全相反)和「反向冰箱到微波炉」(训练数据只有从冰箱取出放进微波炉,测试时要求反着做)。π0.7 在这两个任务上大幅领先先前模型,说明它真正在关注指令本身;反向冰箱任务中子目标图像的引导尤为关键。

3. 跨本体迁移:零样本把叠衣服交给从没干过活的机械臂

团队沿「本体差距」逐级加码:餐桌布置(数据来自多种机器人,所有模型都迁移良好)→ 装袋/收纳保鲜盒(数据全部来自较大的 UR5e 双臂平台,测于较小的静态双臂平台,π0.5 崩溃而 π0.6/π0.7 依然稳健)→ 衬衫装袋(数据来自小静态双臂平台,测于单臂 UR5e——目标机器人只有一条更重更大的手臂,必须彻底换策略,π0.7 显著领先所有先前模型)。

图 12:跨本体迁移。随本体差距增大,π0.7 的优势愈发明显;叠衣服这类灵巧任务迁移时,子目标图像进一步提升表现。

最大的挑战是灵巧任务:叠衣服数据全部采自轻量静态双臂机器人,UR5e 双臂系统没有任何折叠数据,其工作空间、惯性与可操控性都差异显著。π0.7 却在 UR5e 上成功叠起毛巾与 T 恤,并自发涌现出适配目标本体的新策略:源机器人上人类操作员习惯倾斜末端执行器、把布料压在桌沿再提起;UR5e 上模型改用更适合该臂运动学的垂直抓取。论文还发现子目标图像让世界模型为目标机器人「想象」合理的抓取与布料状态,进一步改善迁移。

图 13:跨本体迁移涌现出适配目标本体的策略。(a) 源机器人双臂协作撑袋,UR5e 改用单臂取放;(b) 源机器人倾斜抓取,UR5e 改用垂直抓取。

为量化这一结果,团队招募了 10 位资深遥操作员(平均 375 小时经验、均位于操作员队伍前 2%),让他们同样零样本首次在 UR5e 双臂系统上叠 T 恤:人类取得 90.9% 任务进度与 80.6% 成功率,而 π0.7 取得 85.6% 任务进度与 80% 成功率——与顶尖人类操作员的首次尝试相当。这一结果的工程含义是:灵巧技能可以从廉价、易遥操作的轻量平台采集,再零样本迁移到人工示教成本极高的大负载工业臂上。

4. 组合泛化:语言「现场教学」学会使用新家电

对短时程新任务,π0.7 可以直接提示完成:按法压壶压杆、舀米进电饭煲、用布擦办公用品、转动桌面风扇——这些任务没有专门采集过任何机器人数据。对「用空气炸锅烤红薯」这类需要多阶段、长达 5 分钟交互的复杂任务,直接提示行不通,但人类可以像教人一样逐步用语言指导机器人(「拿起红薯」「打开空气炸锅」)。在装/卸空气炸锅、烤百吉饼三个完全未见过的厨房任务上,π0.7 被指导的成功率远超先前模型,配合生成子目标图像后更好。

图 14:语言指导示例。人类逐步给出语言指令即可「教会」π0.7 全新任务;这些指令随后可用于训练高层策略,实现完全自主执行。

指导数据还有更进一步的用法:把逐步指令当作监督信号,微调出一个高层语言策略(π0.7 自身架构),由它在运行时持续输出下一步子任务指令。在 5 个任务上,这样得到的自主策略(π0.7 autonomous)大致追平了人工指导回合(π0.7 coaching)的表现——没有采集任何遥操作动作数据,新任务就此「入账」。

5. 数据扩展:混合质量数据从毒药变养料

在受控实验中,团队把叠衣服任务的人类演示按折叠质量与速度分成四个桶(前 30%、前 50%、前 80%、全部),从零训练 8 个模型(带/不带元数据 × 四个桶)。结果:不带元数据的模型在加入更低质数据后性能反而下降;带元数据的 π0.7 却随数据量持续提升——尽管平均质量在下降。回合元数据把质量与策略的歧义解开,让模型在大而杂的数据集上获得了更好的可扩展性。

最有代表性的量化结果来自叠 T 恤跨本体实验(UR5e 双臂,源本体为轻量静态双臂机器人)。论文招募了 10 位平均遥操作经验 375 小时、位列操作员前 2% 的资深人类选手做零样本对照——他们同样从未在 UR5e 上叠过衣服:

选手任务进度成功率条件
资深人类遥操作员(10 人,平均 375 小时)90.9%80.6%零样本,首次操作 UR5e
π0.7(GC,带生成子目标)85.6%80.0%零样本,无任何 UR5e 叠衣数据

表 1:零样本跨本体叠衣——策略与顶级人类遥操作员打平(论文第 IX-C 节与附录 A-F)。

论文还在「洗衣(T 恤与短裤)」任务上做了数据桶消融:按折叠质量与速度把人类操作数据分成四档,分别训练带/不带回合元数据的模型(共 8 个),结论整理如下:

数据桶数据构成π0.7(带元数据)π0.7(不带元数据)
桶 1质量+速度前 30%基线水平基线水平
桶 2前 50%持续提升小幅波动
桶 3前 80%持续提升开始退化
桶 4全部数据(平均质量最低)仍然最好明显变差

表 2:混合质量数据消融。带元数据时模型从「更大但更脏」的数据中持续受益,不带元数据则随低质数据增多而退化(论文图 18 左)。

图 18:泛化随数据与上下文多样性的扩展。左:带元数据时,更多(哪怕更低质)的数据持续提升性能;不带元数据则退化。右:移除任务多样性最高的 20% 数据会显著损害泛化。

另一组对照:分别移除「任务多样性最高的 20%」与「随机 20%」数据训练(数据量相同)。在多个未见短时程任务上,移除多样性最高的数据造成显著性能损失,随机移除则无此影响——π0.7 确实能把任务多样性转化为组合泛化能力。

局限性

  • 零样本成功率仍有落差:见过的任务成功率常在 90% 以上,而未见任务或「未见任务×未见机器人」组合的成功率在 60–80% 区间,距离可靠部署还有距离。
  • 「见过/没见过」无法严格界定:训练集规模与多样性大到难以追溯某个行为究竟源自哪些数据,所谓「新任务」很可能只是已见技能的新组合——作者坦言这与理解 LLM 泛化的困境如出一辙,并认为这种「重混」恰恰就是组合泛化的本质。
  • 评测封闭性:全部实验在 Physical Intelligence 自有的机器人车队、内部数据与评测协议上进行,尚无第三方复现;元数据中的质量与失误标签依赖人工粗标注,标注成本与一致性论文未展开。
  • 推理成本:5B 策略需要单块 H100,14B 世界模型需要 4×H100 做张量并行才能把子目标生成压到 1.25 秒,规模化部署的硬件门槛不低。

总结与展望

π0.7 的核心贡献不是新架构,而是一套方法论:用足够丰富的上下文把「数据质量参差」从训练难题变成条件生成问题。元数据、子目标图像与详细语言共同告诉模型每条数据「在什么条件下以什么方式执行」,失败与次优轨迹由此从毒药变成养料,RL 专家的本领也能被蒸馏回单一通用模型。回报是一系列涌现能力:开箱追平任务级专家、零样本跨本体迁移灵巧技能、逆数据偏置的指令跟随、以及用语言指导 + 高层策略自举学习全新长时程任务。

作者指出的下一步,是让 π0.7 利用自身的高可操控性在测试任务上高效学习——更细致的语言指导,乃至自主强化学习;更进一步,让模型「思考」可能的执行方式、用多样的提示词把思考落地为动作、再根据结果反思修正计划。当提示与跟随足够强大,机器人的能力获取方式将从「为每个新任务采集动作数据」转向「提示它、指导它、向它解释」。

金句

"具备规模化组合泛化的模型,将彻底改变我们做机器人学习的方式——我们可以直接提示机器人、指导它、向它解释,而不必再为每个新任务采集动作数据。"
"在机器人领域,光给数据配上更详细的文字是不够的——决定成败的细节要么微妙到难以言说(比如这条轨迹的整体质量),要么根本无法用语言表达(比如一件叠得整齐的 T 恤长什么样)。"