PAPER DEEP DIVE
π0.7:可操控的通用机器人基础模型与涌现能力
Physical Intelligence 提出可操控的机器人基础模型 π0.7:通过语言指令、子目标图像与任务元数据等多模态上下文条件化,在未见环境多阶段任务、零样本跨本体泛化中开箱即用,性能比肩 RL 微调专用策略,并展现涌现能力。
论文:π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
作者:Physical Intelligence(90 位作者,含 Sergey Levine、Chelsea Finn、Karol Hausman、Danny Driess、Karl Pertsch、Lucy Xiaoyang Shi 等)
链接:arXiv:2604.15483(v2,2026-04-24)·
官方博客
代码状态:π0.7 代码与权重未开源;官方开源仓库 openpi 目前仅包含前代 π0 / π0.5 系列
一句话总结
Physical Intelligence 把机器人策略的上下文从一句「做什么」扩展成一份多模态任务说明书——子任务语言指令、由世界模型生成的子目标图像、以及描述这条数据「做得多快、多好、有没有犯错」的回合元数据。正是这套「多样化提示」让 π0.7 能够把失败回合、自主评测数据乃至人类视频一起倒进训练集,最终得到一个无需任何任务微调就能追平 RL 专家模型、并能零样本跨本体叠衣服、用语言「现场教学」学会用空气炸锅的可操控通用基础模型。
研究背景与动机
大语言模型之所以强大,不只是记住了训练语料,更在于能把语料中的能力以新的方式组合起来,解决从未见过的问题——这种组合泛化(compositional generalization)正是通用智能的标志。然而在物理世界里,视觉-语言-动作模型(VLA)虽然规模和性能不断增长,组合泛化却始终难以实现:多数模型连训练过的指令都需要任务级微调才能流畅执行,更不用说把技能重新组合去完成全新任务。
要走出这个困境,一个自然的方向是用更大、更多样的数据训练。但机器人数据的多样性带来一个独特的难题:不同操作员、不同策略、不同质量的轨迹混在一起,朴素的训练方式会让模型学到各种行为模式的「平均」,结果反而更差。失败回合、笨拙的自主探索、质量参差的演示,这些数据里其实包含大量关于状态分布和错误恢复的宝贵信息,直接扔掉是巨大的浪费,直接倒进去又会拖累性能。
π0.7 的解题思路借鉴了图像生成领域的「提示词扩展」(prompt expansion):与其清洗数据,不如给每条数据配上足够详细的上下文,让模型学会「在什么条件下做什么」。但在机器人场景里,光靠更详细的文字描述是不够的——有些关键信息很难用语言表达(比如「一件叠得整齐的 T 恤长什么样」),有些则属于策略层面的属性(比如这条轨迹的整体质量)。因此 π0.7 把上下文扩展为多模态的提示词:除了语言指令,还包括子目标图像、回合元数据与控制模式。这一改动看似温和,却从根本上改变了模型能消化什么样的数据,并最终催生出一系列涌现能力。
图 1:π0.7 是一个可操控的通用机器人基础模型,训练提示词中不仅包含任务描述,还包含详细语言、生成的子目标图像与回合元数据,告诉模型不仅「做什么」还有「怎么做」。
方法总览:把提示词变成多模态任务说明书
标准 VLA 的训练目标是给定观测历史与上下文,最大化动作块的对数似然:
$$\max_{\theta}\;\mathbb{E}_{\mathcal{D}}\left[\log\pi_{\theta}(\mathbf{a}_{t:t+H}\mid\mathbf{o}_{t-T:t},\mathcal{C}_{t})\right]$$
其中观测 $\mathbf{o}_{t}=[\mathbf{I}_{t}^{1},\ldots,\mathbf{I}_{t}^{n},\mathbf{q}_{t}]$ 由 $n$ 路相机图像与机器人本体状态 $\mathbf{q}_{t}$ 组成,$\mathbf{a}_{t:t+H}$ 是未来一段动作块。惯例上上下文 $\mathcal{C}_{t}$ 只是一条人工标注的语言指令 $\ell_{t}$(比如「清理厨房」)。π0.7 把它扩展为五个部分:$\mathcal{C}_{t}=(\ell_{t},\hat{\ell}_{t},\mathbf{g}_{t},m,c)$,分别是任务描述、子任务指令、多视角子目标图像、回合元数据和控制模式。训练时每个组件都被随机丢弃(dropout),使模型在测试时可以只用任意子集,灵活组合。
图 3:提示词总览。π0.7 的上下文包含子任务指令、子目标图像与回合元数据等多种模态,训练时对各组件做 dropout,测试时灵活组合。
一条真实的训练提示词长这样:
<Multi-view observation><Multi-view subgoals> Task: peel vegetables. Subtask: pick up the peeler. Speed: 8000. Quality: 5. Mistake: false. Control Mode: joint. <Proprioception>
提示词的四个扩展组件
子任务指令:语义级的分段标注
延续 π0.5 的做法,除了整体任务描述 $\ell_{t}$,提示词中还包含刻画当前语义子任务的中间指令 $\hat{\ell}_{t}$(例如「打开冰箱门」)。团队先在多样场景里采集数据,再对轨迹分段并配上细致的文字描述。这一设计带来一个额外红利:由于模型被训练去跟随多样的语言指令,人类可以在全新任务上逐步用语言「指导」机器人(比如把红薯装进从未见过的空气炸锅);这些指导数据随后可用于微调出一个高层语义策略,让机器人完全自主地完成任务。
子目标图像:用画面补齐语言说不清的细节
「打开冰箱门」并没有说明该以什么姿势抓住把手。子目标图像通过描绘场景在不远未来的期望状态,把语言难以表达的执行细节(环境/物体层面的结果,以及腕部视角下手臂/夹爪的姿态)直接画给策略看。π0.7 使用多视角子目标 $\mathbf{g}_{t}=[G_{t}^{1},\ldots,G_{t}^{n}]$,运行时由一个轻量世界模型 $g_{\psi}$ 生成。世界模型从具备网页级预训练的 BAGEL(14B 混合 Transformer 图像理解/编辑/生成模型)初始化,用条件流匹配目标训练:
$$\max_{\psi}\;\mathbb{E}_{\mathcal{D}_{g}}\left[\mathcal{L}_{\mathrm{CFM}}\left(\mathbf{g}_{t}^{\star},\;g_{\psi}(\mathbf{o}_{t},\hat{\ell}_{t},m)\right)\right]$$
其中真值子目标取分段末帧 $\mathbf{g}_{t}^{\star}=\mathbf{o}_{t_{\mathrm{end}}}$,训练集 $\mathcal{D}_{g}$ 是带有高质量子任务标注的分段子集。通过混入网页数据、第一视角人类视频和其他视频数据,世界模型获得的语义与物理概念经由子目标图像「注入」π0.7——这是一种把网页级知识迁移进低层策略的巧妙通道。
训练 VLA 时,子目标图像用真实未来帧与生成图像混合供给:以 0.25 的概率取分段末帧(与世界模型的预测目标一致),以 0.75 的概率在当前时刻之后 0–4 秒内均匀采样未来帧,同时大量加入世界模型生成的图像以弥合真实/生成图之间的训练-测试偏差。由于带子目标时动作预测几乎退化成「逆动力学」问题、训练显著变快,团队只在每个 batch 的 25% 样本中加入子目标图像。
回合元数据:给数据质量贴上显式标签
这是 π0.7 敢于消化低质数据的关键。每条训练轨迹都被标注上一组元数据 $m$:
- 整体速度(Overall speed):回合时长(步数),按 500 步区间离散化,例如 1750–2250 步统一记作「2000 steps」。速度往往与质量正相关——快的回合通常错误更少。
- 整体质量(Overall quality):1–5 分的执行质量打分,5 为最高。
- 失误(Mistake):该动作分段内机器人是否犯错(如抓空、做错子任务),由人工粗标注。
训练时模型看到真实的回合速度、质量与失误标签;数据多样性提供了足够的信号,让模型学会把这些元数据与目标动作关联起来。测试时则反向使用:把速度设为该任务回合长度的 15 分位数、质量恒为 5、失误恒为 false,相当于命令模型「以接近最快、最高质量、零失误的方式执行」。这就是「可操控性」的直接来源。
控制模式:同一模型切换关节与末端执行器
训练同时包含关节级(joint)与末端执行器(ee)动作,并用文本标识符 $c\in\{\texttt{joint},\texttt{ee}\}$ 在提示词中声明,运行时可按任务选择。论文附录显示,对先前模型而言两种控制模式在跨本体任务上性能差异不大。
训练时的 dropout 配方
各组件的随机丢弃策略是精心设计的:25% 的样本带子目标图像;带子目标的样本中 30% 丢弃子任务指令(视觉子目标往往比文字描述更丰富,可以替代它);回合元数据整体以 15% 概率丢弃,其三个子项再各自以 5% 概率单独丢弃;控制模式从不丢弃。这套 dropout 使 π0.7 在测试时能接受任意提示词组合,甚至支持对上下文做无分类器引导(CFG)。
模型架构与训练配方
图 2:架构总览。π0.7 是 5B 参数的 VLA:4B VLM 主干 + MEM 风格视频历史编码器 + 860M 动作专家;运行时子任务指令来自同架构的高层语义策略,子目标图像来自基于 BAGEL 的轻量世界模型。
π0.7 在 π0.6 的 VLA 架构与 MEM 记忆系统基础上扩展而来,总参数约 5B:
- VLM 主干:由 Gemma3 4B 初始化(含 400M 视觉编码器),输入至多 4 路相机图像(前视、双腕、可选后视),每路至多 6 帧历史,历史帧按 1 秒步长采样,图像统一缩放到 448×448。历史编码器沿用 MEM 设计,对历史做时空压缩,无论历史帧数多少都输出固定数量的 token;整体历史以 0.3 概率丢弃,后视图像也以 0.3 概率丢弃。
- 注意力结构:采用块因果(block-causal)掩码——观测 token 与子目标 token 各自内部双向注意,子目标 token 还可注意到观测;后续文本 token 使用因果注意。
- 本体感觉:状态 $\mathbf{q}_{t}$(含历史状态)不再像 π0.6 那样离散成文本 token,而是像 MEM 一样用线性投影映射到主干维度,每个历史状态作为独立 token,历史帧被丢弃时对应状态 token 也一并掩掉。
- 动作专家:860M 参数的轻量 Transformer,用流匹配目标预测连续动作,通过 adaptive RMSNorm 注入时间步信息;固定处理 50 个动作 token(50 步动作块),块内双向注意并可注意主干激活。
- 知识保温(KI):VLM 主干另用 FAST token 做离散交叉熵监督;动作专家可以读取主干全部激活,但梯度不回传进主干——让 VLM 以稳定的离散损失持续学习,不被动作回归损失破坏。
- 实时动作块(RTC):训练时模拟 0–12 步推理延迟(50Hz 机器人上对应至多 240ms),保证推理延迟下的动作平滑。
图 4:实验中使用的部分机器人平台,包括双臂移动操作平台、静态双臂平台与 UR5e 等。
训练数据是本文与经典 VLA 流水线差异最大的地方。除了覆盖多种平台与环境(自建实验室/居家风格环境、真实住宅)的演示数据,π0.7 大量使用「次优数据」:失败回合、含大量失误的成功回合,以及先前模型(包括 RL 后训练的 $\pi^{*}_{0.6}$)在评测中产生的自主轨迹。后者等价于一种「蒸馏」:通用模型把 RL 专家的本领继承回单一预训练模型。此外还混入开源机器人数据集、第一视角人类视频,以及网页来源的非机器人辅助任务(物体定位与属性预测、视觉问答、纯文本预测、视频描述)。论文明确排除了所有用于泛化评测的自主数据,避免测试集泄漏。
运行时:异步推理与无分类器引导
部署时 π0.7 按任务需要自由组合上下文,无需任何任务级后训练。回合元数据固定为:速度取该任务回合长度的 15 分位数、质量 5、失误 false;子任务指令由高层语义策略(同架构微调而来)或人类指导者提供;使用子目标图像时,每当语义意图变化(新的 $\hat{\ell}_{t}$)或距上次生成已过 $\Delta=4$ 秒,就刷新一次子目标。整个流程异步执行:视觉子目标与子任务指令在独立线程生成,VLA 推理始终使用最新可用结果(论文算法 1)。动作生成用 5 步去噪产生 50 步动作块,实际执行其中 $\hat{H}\in\{15,25\}$ 步。
由于训练时对各上下文组件做了 dropout,π0.7 可以对任意组件施加无分类器引导。每个去噪步按下式更新:
$$\nabla_{\mathbf{a}}\log\pi_{\theta}(\mathbf{a}_{t:t+H}|\mathbf{o}_{t},\mathcal{C}_{t})+\beta\left(\nabla_{\mathbf{a}}\log\pi_{\theta}(\mathbf{a}_{t:t+H}|\mathbf{o}_{t},\mathcal{C}_{t})-\nabla_{\mathbf{a}}\log\pi_{\theta}(\mathbf{a}_{t:t+H}|\mathbf{o}_{t},\mathcal{C}_{t}^{\text{uncond}})\right)$$
其中 $\mathcal{C}_{t}^{\text{uncond}}$ 是去掉被引导组件的「无条件」上下文,$\beta$ 为引导权重。论文把 CFG 施加在回合元数据上以激发灵巧任务的最佳表现,取 $\beta\in\{1.3,1.7,2.2\}$ 的温和值。
把算法 1 的运行时工作流画出来,三股信息流(策略、高层语义策略、世界模型)异步协作:
flowchart TB
A["task instruction l
+ episode metadata m
+ control mode c"] --> B["high-level semantic policy
same Gemma3-4B architecture"]
B --> C["subtask instruction
l-hat refreshes on intent change"]
C --> D["world model g-psi
BAGEL 14B, 4xH100 TP"]
A --> D
D --> E["subgoal images g-star
3 views, 25-step denoise, 1.25s"]
C --> F["pi-0.7 VLA 5B
4B VLM + 860M action expert"]
E --> F
G["observations o
4 cameras, 6 history frames"] --> F
F --> H["5-step flow matching denoise
50-step action chunk"]
H --> I["execute H-hat = 15 or 25 steps
50Hz joint or ee control"]
I -.next subtask.-> B
E -.regenerate every 4s
or on new subtask.-> D
推理效率方面,π0.7 与高层策略共用单块 H100:经 RTC 后续优化,最小配置(3 路相机、5 步去噪)推理仅 38ms,加上 MEM 视觉编码器与子目标图像后最坏 127ms。14B 世界模型则是推理瓶颈——近万 token 序列上做迭代去噪开销巨大,团队用 4 路张量并行(4×H100)、8-bit 量化矩阵乘和修改版 SageAttention,把 25 步去噪(含文本与图像双 CFG)压到 1.25 秒,并以异步方式让策略在世界模型生成下一张子目标时继续执行。
实验结果
图 5:部分评测任务示意,其中两个长时程任务的完整过程被可视化为电影条带。
1. 开箱即用的灵巧性:通用模型追平 RL 专家
团队在十余个高灵巧任务上评测:来自 $\pi^{*}_{0.6}$ 发布的意式咖啡机操作、折纸箱、叠衣服三个任务(可与 RL 专家直接对比)、「机器人奥运会」任务(做花生酱三明治、把 T 恤翻面、开车穿门),以及整根切西葫芦、削皮(西葫芦/黄瓜/胡萝卜)、更换垃圾袋等长时程任务。结果显示:单一通用 π0.7 在所有任务上开箱即可与对应的任务级专家打平,在叠衣服与折纸箱这两个最难的任务上吞吐量甚至超过 RL 专家。与基于 π0.6 的 SFT 专家相比,π0.7 同样全面接近。
图 6:开箱即用的灵巧性。π0.7 无需任务微调即可执行大量高灵巧任务,与 RL/SFT 专家模型对比全面占优或持平。
消融实验揭示了性能来源:去掉全部自主评测数据(no eval data)或去掉回合元数据(no metadata)都会让所有任务显著掉点。评测数据质量参差,唯有配合元数据区分高低质量行为,才能把专家轨迹蒸馏进通用模型——「多样数据 + 详细上下文」的协同是这篇论文最核心的实证结论。在需要记忆的长时程任务上,开箱的 π0.7 也达到甚至超过任务微调的 π0.6-MEM 专家。
2. 指令跟随:在陌生环境里听懂复杂指令
团队在训练数据之外的 4 个厨房与 2 个卧室里,用 14 个包含 3–6 步指令的场景评测:整理物品、与家具交互、清理洒落物等。π0.7 的整体指令跟随成功率显著高于 π0.5 与 π0.6。在刻意设计的复杂指称指令上(如「拿起我喝汤时会用到的东西」「拿起最大盘子里的水果」),π0.7 同样领先,且加上世界模型生成的子目标图像(记作 π0.7 (GC))后进一步提升——网页级预训练带来的语义理解经由子目标图像注入策略。
图 9:陌生环境中的广泛指令跟随。14 个场景各含多步指令序列,π0.7 显著优于先前模型。
更有意思的是「逆数据偏置」实验:若机器人总是在某个场景里做同一件事,训练出的模型往往会无视语言、盲目复制数据行为。团队构造了两个反向任务——「反向收餐」(把垃圾放进收餐桶、餐具扔进垃圾桶,与训练数据完全相反)和「反向冰箱到微波炉」(训练数据只有从冰箱取出放进微波炉,测试时要求反着做)。π0.7 在这两个任务上大幅领先先前模型,说明它真正在关注指令本身;反向冰箱任务中子目标图像的引导尤为关键。
3. 跨本体迁移:零样本把叠衣服交给从没干过活的机械臂
团队沿「本体差距」逐级加码:餐桌布置(数据来自多种机器人,所有模型都迁移良好)→ 装袋/收纳保鲜盒(数据全部来自较大的 UR5e 双臂平台,测于较小的静态双臂平台,π0.5 崩溃而 π0.6/π0.7 依然稳健)→ 衬衫装袋(数据来自小静态双臂平台,测于单臂 UR5e——目标机器人只有一条更重更大的手臂,必须彻底换策略,π0.7 显著领先所有先前模型)。
图 12:跨本体迁移。随本体差距增大,π0.7 的优势愈发明显;叠衣服这类灵巧任务迁移时,子目标图像进一步提升表现。
最大的挑战是灵巧任务:叠衣服数据全部采自轻量静态双臂机器人,UR5e 双臂系统没有任何折叠数据,其工作空间、惯性与可操控性都差异显著。π0.7 却在 UR5e 上成功叠起毛巾与 T 恤,并自发涌现出适配目标本体的新策略:源机器人上人类操作员习惯倾斜末端执行器、把布料压在桌沿再提起;UR5e 上模型改用更适合该臂运动学的垂直抓取。论文还发现子目标图像让世界模型为目标机器人「想象」合理的抓取与布料状态,进一步改善迁移。
图 13:跨本体迁移涌现出适配目标本体的策略。(a) 源机器人双臂协作撑袋,UR5e 改用单臂取放;(b) 源机器人倾斜抓取,UR5e 改用垂直抓取。
为量化这一结果,团队招募了 10 位资深遥操作员(平均 375 小时经验、均位于操作员队伍前 2%),让他们同样零样本首次在 UR5e 双臂系统上叠 T 恤:人类取得 90.9% 任务进度与 80.6% 成功率,而 π0.7 取得 85.6% 任务进度与 80% 成功率——与顶尖人类操作员的首次尝试相当。这一结果的工程含义是:灵巧技能可以从廉价、易遥操作的轻量平台采集,再零样本迁移到人工示教成本极高的大负载工业臂上。
4. 组合泛化:语言「现场教学」学会使用新家电
对短时程新任务,π0.7 可以直接提示完成:按法压壶压杆、舀米进电饭煲、用布擦办公用品、转动桌面风扇——这些任务没有专门采集过任何机器人数据。对「用空气炸锅烤红薯」这类需要多阶段、长达 5 分钟交互的复杂任务,直接提示行不通,但人类可以像教人一样逐步用语言指导机器人(「拿起红薯」「打开空气炸锅」)。在装/卸空气炸锅、烤百吉饼三个完全未见过的厨房任务上,π0.7 被指导的成功率远超先前模型,配合生成子目标图像后更好。
图 14:语言指导示例。人类逐步给出语言指令即可「教会」π0.7 全新任务;这些指令随后可用于训练高层策略,实现完全自主执行。
指导数据还有更进一步的用法:把逐步指令当作监督信号,微调出一个高层语言策略(π0.7 自身架构),由它在运行时持续输出下一步子任务指令。在 5 个任务上,这样得到的自主策略(π0.7 autonomous)大致追平了人工指导回合(π0.7 coaching)的表现——没有采集任何遥操作动作数据,新任务就此「入账」。
5. 数据扩展:混合质量数据从毒药变养料
在受控实验中,团队把叠衣服任务的人类演示按折叠质量与速度分成四个桶(前 30%、前 50%、前 80%、全部),从零训练 8 个模型(带/不带元数据 × 四个桶)。结果:不带元数据的模型在加入更低质数据后性能反而下降;带元数据的 π0.7 却随数据量持续提升——尽管平均质量在下降。回合元数据把质量与策略的歧义解开,让模型在大而杂的数据集上获得了更好的可扩展性。
最有代表性的量化结果来自叠 T 恤跨本体实验(UR5e 双臂,源本体为轻量静态双臂机器人)。论文招募了 10 位平均遥操作经验 375 小时、位列操作员前 2% 的资深人类选手做零样本对照——他们同样从未在 UR5e 上叠过衣服:
| 选手 | 任务进度 | 成功率 | 条件 |
|---|---|---|---|
| 资深人类遥操作员(10 人,平均 375 小时) | 90.9% | 80.6% | 零样本,首次操作 UR5e |
| π0.7(GC,带生成子目标) | 85.6% | 80.0% | 零样本,无任何 UR5e 叠衣数据 |
表 1:零样本跨本体叠衣——策略与顶级人类遥操作员打平(论文第 IX-C 节与附录 A-F)。
论文还在「洗衣(T 恤与短裤)」任务上做了数据桶消融:按折叠质量与速度把人类操作数据分成四档,分别训练带/不带回合元数据的模型(共 8 个),结论整理如下:
| 数据桶 | 数据构成 | π0.7(带元数据) | π0.7(不带元数据) |
|---|---|---|---|
| 桶 1 | 质量+速度前 30% | 基线水平 | 基线水平 |
| 桶 2 | 前 50% | 持续提升 | 小幅波动 |
| 桶 3 | 前 80% | 持续提升 | 开始退化 |
| 桶 4 | 全部数据(平均质量最低) | 仍然最好 | 明显变差 |
表 2:混合质量数据消融。带元数据时模型从「更大但更脏」的数据中持续受益,不带元数据则随低质数据增多而退化(论文图 18 左)。
图 18:泛化随数据与上下文多样性的扩展。左:带元数据时,更多(哪怕更低质)的数据持续提升性能;不带元数据则退化。右:移除任务多样性最高的 20% 数据会显著损害泛化。
另一组对照:分别移除「任务多样性最高的 20%」与「随机 20%」数据训练(数据量相同)。在多个未见短时程任务上,移除多样性最高的数据造成显著性能损失,随机移除则无此影响——π0.7 确实能把任务多样性转化为组合泛化能力。
局限性
- 零样本成功率仍有落差:见过的任务成功率常在 90% 以上,而未见任务或「未见任务×未见机器人」组合的成功率在 60–80% 区间,距离可靠部署还有距离。
- 「见过/没见过」无法严格界定:训练集规模与多样性大到难以追溯某个行为究竟源自哪些数据,所谓「新任务」很可能只是已见技能的新组合——作者坦言这与理解 LLM 泛化的困境如出一辙,并认为这种「重混」恰恰就是组合泛化的本质。
- 评测封闭性:全部实验在 Physical Intelligence 自有的机器人车队、内部数据与评测协议上进行,尚无第三方复现;元数据中的质量与失误标签依赖人工粗标注,标注成本与一致性论文未展开。
- 推理成本:5B 策略需要单块 H100,14B 世界模型需要 4×H100 做张量并行才能把子目标生成压到 1.25 秒,规模化部署的硬件门槛不低。
总结与展望
π0.7 的核心贡献不是新架构,而是一套方法论:用足够丰富的上下文把「数据质量参差」从训练难题变成条件生成问题。元数据、子目标图像与详细语言共同告诉模型每条数据「在什么条件下以什么方式执行」,失败与次优轨迹由此从毒药变成养料,RL 专家的本领也能被蒸馏回单一通用模型。回报是一系列涌现能力:开箱追平任务级专家、零样本跨本体迁移灵巧技能、逆数据偏置的指令跟随、以及用语言指导 + 高层策略自举学习全新长时程任务。
作者指出的下一步,是让 π0.7 利用自身的高可操控性在测试任务上高效学习——更细致的语言指导,乃至自主强化学习;更进一步,让模型「思考」可能的执行方式、用多样的提示词把思考落地为动作、再根据结果反思修正计划。当提示与跟随足够强大,机器人的能力获取方式将从「为每个新任务采集动作数据」转向「提示它、指导它、向它解释」。
金句
"具备规模化组合泛化的模型,将彻底改变我们做机器人学习的方式——我们可以直接提示机器人、指导它、向它解释,而不必再为每个新任务采集动作数据。"
"在机器人领域,光给数据配上更详细的文字是不够的——决定成败的细节要么微妙到难以言说(比如这条轨迹的整体质量),要么根本无法用语言表达(比如一件叠得整齐的 T 恤长什么样)。"