Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

VLA具身智能世界模型

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu2026年8月16日3 分钟阅读
EN

论文元信息

标题:GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

团队:GigaBrain Team
发布日期:2026-08-16
论文链接:arXiv 2608.15875
项目页:gigaai.cc/blog/gigabrain07
代码状态:giga-brain-0 已开源,2026-08-25 已发布代码、模型与样例数据;评测代码仍在仓库 TODO 中。

一句话总结

GigaBrain-0.7 把任务理解、未来预测、价值评估与连续动作控制放进一个三系统闭环,用三万七千多小时跨本体具身数据完成单阶段 VLA 预训练,并在真实机器人、仿真基准与经验强化中验证了大规模异构数据带来的能力提升。

研究背景与动机

视觉-语言-动作模型正在成为通用机器人的主流范式,但具身智能的扩展并不只是把更多轨迹塞进更大的策略网络。机器人数据跨越不同本体、自由度、坐标系、控制接口和场景条件;如果缺少统一表示和对齐训练,多样性反而会削弱知识迁移。论文把这个问题拆成数据对齐、架构耦合、时空上下文与经验更新四个层面。

多数现有 VLA 仍然把物理交互建模成“当前观测到动作”的反应式映射。这种设计在短程抓取上有效,但在衣服折叠、礼品包装、轴承装配和穿线绑扎这类任务里,动作是否正确取决于上一段交互留下的状态。机器人需要知道刚刚发生过什么、下一阶段可能变成什么样,以及当前轨迹是否真的在推进任务。

论文没有把“理解、预测、控制”压缩进一个统一的黑箱,而是提出三个功能接口。System 2 负责从视觉和历史信息中推理当前子任务;System 3 预测未来观测并估计任务进度;System 1 把这些信号与本体状态一起转成连续动作块。三个系统保留专门目标,但通过语义、图像和值信号互相耦合。

数据侧同样不能靠单一来源。真实机器人轨迹提供本体验证和接触控制,UMI 数据提供近手操作观察,第一人称 EGO 数据扩展人类交互分布,仿真与世界模型生成数据覆盖长尾状态。论文统一转换为 LeRobot v3.0 格式,并用掩码区分缺失维度与真实零值,为跨本体训练打下基础。

作者还想解决多阶段训练的割裂。传统流程往往先训练视觉语言模型,再微调动作头,导致语言理解和动作控制缺少同一轮次的联合监督。GigaBrain-0.7 在预训练中同时优化语言、子任务、离散动作和连续动作,让具身能力与通用视觉语言能力一起增长。

GigaBrain-0.7 总览

图 1:三系统架构与异构数据的总体框架。

预备知识

论文的核心动作头采用条件流匹配。给定真实动作块和高斯噪声,训练时在两者之间构造一条线性插值路径;模型不直接输出动作,而是预测把噪声带向动作的向量场。推理时沿该向量场积分,就能得到适合精确控制的连续动作块。相比离散动作 token,这条路径保留了幅值与连续接触中的细粒度变化。

跨本体策略的第二个关键是本体验证掩码。不同机器人的状态和动作维度并不总是一致,把缺失关节记为零会把“没有这个维度”和“该关节位于零位”混为一谈。GigaBrain-0.7 用有效位掩码排除无效维度,同时让输入输出投影承担本体差异,主 Action Expert 则共享跨本体知识。

方法详解

System 2:理解与规划。System 2 使用 PaliGemma2 3B,把当前视觉观测与高层任务指令转换成链条式推理和可执行子任务。例如“把物品挂到衣架上”会先被分解成“拿起红色帽子”。这个中间表示既让低层动作有明确目标,也为 System 3 的未来预测提供条件。

System 3:预测与评估。System 3 是独立的 GigaWorld-1 世界值模型,参数规模为 5B。它接收当前观测、本体状态和子任务描述,生成与动作块同跨度的未来视频;最后一帧被提取为子目标图像。它同时估计标量进度值,并把相邻状态的进度差离散成正负优势条件。

System 1:动作与控制。System 1 由 PaliGemma2 3B 骨干和 0.5B Action Expert 组成。视觉语言流保留因果自注意力,动作专家则在每个 Transformer 层与两个流联合注意力。这样动作专家可以读取完整语义上下文,而动作特定的梯度不会完全冲乱视觉语言表示。

GigaBrain-0.7 架构

图 6:System 1、System 2 与 System 3 的接口关系。

双流耦合可以形式化为下面三式。视觉语言流只对自己做因果注意力,动作专家则以自身为查询、以视觉语言流和动作流拼接后的上下文为键值;两者各自保留前馈层参数。

$$\mathbf{O}^{\mathrm{VL}}_{l}=\mathrm{CausalAttn}_{l}\!\left(\mathbf{H}^{\mathrm{VL}}_{l};\mathbf{H}^{\mathrm{VL}}_{l}\right)$$

$$\mathbf{O}^{\mathrm{AE}}_{l}=\mathrm{Attn}_{l}\!\left(\mathbf{H}^{\mathrm{AE}}_{l};\left[\mathbf{H}^{\mathrm{VL}}_{l},\mathbf{H}^{\mathrm{AE}}_{l}\right]\right)$$

$$\mathbf{H}^{\mathrm{VL}}_{l+1}=\mathrm{FFN}^{\mathrm{VL}}_{l}\!\left(\mathbf{O}^{\mathrm{VL}}_{l}\right),\quad \mathbf{H}^{\mathrm{AE}}_{l+1}=\mathrm{FFN}^{\mathrm{AE}}_{l}\!\left(\mathbf{O}^{\mathrm{AE}}_{l}\right)$$

软知识隔离。完整隔离能保护预训练 VLM,但会让动作学习无法改变语义表征;完全不隔离又可能造成灾难性干扰。Soft KI 选择折中:Action Expert 内部的流匹配梯度全部回传,进入 VLM 骨干前乘一个小于 1 的系数。这样视觉语言模型既保留通用能力,也能发展具身感知表征。

$$\nabla_{\theta_{\mathrm{VL}}}\mathcal{L}_{\mathrm{VLA}}=\nabla_{\theta_{\mathrm{VL}}}\mathcal{L}_{\mathrm{NTP}}+\alpha_{\mathrm{KI}}\nabla_{\theta_{\mathrm{VL}}}\mathcal{L}_{\mathrm{FM}},\quad 0<\alpha_{\mathrm{KI}}<1$$

短期视觉记忆。重复视觉状态是长程操作的常见陷阱。当前帧可能看起来一样,但它们出现在不同交互阶段。Temporal-Spatial Block 先在时间维上因果融合近期帧,再在空间维上聚合当前观测,最后只把增强后的当前帧 token 送入 VLA 骨干。历史 token 不被直接拼接,上下文长度接近单帧输入。

预训练目标。自动回归目标覆盖语言、子任务、离散动作和视觉语言问答;流匹配目标覆盖连续动作块。两条通路在同一批次中联合优化:

$$\mathcal{L}_{\mathrm{NTP}}=-\mathbb{E}\left[\sum_{j=1}^{M}m_j\log p_{\theta}\left(y_j\mid c,y_{<j}\right)\right]$$

$$a_{t:t+H}^{\tau}=\tau a_{t:t+H}+(1-\tau)\epsilon,\quad \epsilon\sim\mathcal{N}(0,I)$$

$$\mathcal{L}_{\mathrm{FM}}=\mathbb{E}_{a,\epsilon,\tau}\left[\left\|v_{\theta}\left(a_{t:t+H}^{\tau},c,\tau\right)-\left(a_{t:t+H}-\epsilon\right)\right\|_2^2\right]$$

$$\mathcal{L}_{\mathrm{VLA}}=\mathcal{L}_{\mathrm{NTP}}+\mathcal{L}_{\mathrm{FM}}$$

源码中的 add_noise 正是这条插值路径的实现。它按动作有效掩码同步遮蔽动作与噪声,采样后得到 x_t,并把 noise - actions 存为目标流场。见 giga_brain_0/giga_brain_0_loss.py:225-230

time_expanded = time[:, None, None]
x_t = time_expanded * noise + (1 - time_expanded) * actions
u_t = noise - actions
self.u_t = u_t
return x_t, time

本体外壳在 giga_brain_0/giga_brain_0_transforms.py:27-37 中由八个 EmbodimentId 表达,随后通过 robot_type_mapping 把上百个数据集机器人类型映射到这些共享类别。这样核心 Transformer 不需要为每个数据集复制一份,输入输出投影负责物理差异。

class EmbodimentId(IntEnum):
    AGILEX = 0
    AGIBOT_G1 = 1
    AGIBOT_DEX = 2
    UMI_OMIN = 3
    EGO_DEX = 4
    EGODEX_EEF_HANDBASE = 5
    ROBOCOIN_AGILEX_COBOT_MAGIC = 6
    H01_ROBOT = 7

数据管线。三万七千多小时数据首先转换成统一格式,再做本体表示归一、指令重写和子任务标注,最后经过几何一致性、时间一致性、答案格式、低置信度抽检等多级清洗。VLM 样本约 2.72 亿,覆盖可供性、空间关系、任务规划和动作后果。这种结构化标注让 System 2 的推理不是无监督涌现,而是有明确监督。

数据组成

图 2:真实机器人、UMI、EGO、仿真与世界模型数据组成。

System 3 训练。第一步在真实机器人和仿真数据上继续训练机器人中心视频模型;第二步扩展为混合 Transformer 世界值模型,用轨迹级完成标注监督标量进度。System 3 训练完成后冻结。任务后训练时,它为每个样本生成 g_tV_t,但不再接收梯度。

值条件转成优势。System 3 的连续进度值并不是直接塞给策略,而是在动作块内取两个时间点,比较进度是否增加:

$$A_t=\mathbb{1}\!\left[V_{t+\delta_t}-V_t>0\right]\in\{0,1\}$$

后训练上下文。System 1 的后训练输入包含基础上下文、预测子目标图像和优势条件:

$$c_t^{\mathrm{post}}=\left(c_t^{\mathrm{base}},g_t,A_t\right)$$

子目标图像和值条件分别以 0.50、0.15 概率独立丢弃,因此策略会看到四种条件组合。这避免了后训练模型只能依赖世界模型,也保留了两者联合时的最大收益。

经验强化。真实部署会暴露离线数据没有覆盖的失败状态。论文先收集成功、失败和人工纠正轨迹,用优势加权回归离线更新,再重新部署并用 actor-critic 做在线强化。离线优势定义为:

$$\tilde{A}_t=G_t-\tilde{V}_t$$

在线阶段使用人类干预在难点状态处标注动作段,奖励结合块级进度差与终局成功信号。整个循环可以写成:

$$\pi^{(k)}\rightarrow\mathcal{D}_{\mathrm{rollout}}^{(k)}\rightarrow\mathrm{Update}\!\left(\pi^{(k)},\mathcal{D}_{\mathrm{rollout}}^{(k)}\right)\rightarrow\pi^{(k+1)}$$

经验强化

图 7:监督微调、离线经验强化与在线人工纠正强化。

flowchart TD
  A[Heterogeneous Data] --> B[Unified LeRobot Pipeline]
  B --> C[System 1 VLA Pretraining]
  B --> D[System 2 Planning]
  C --> E[World Value Model]
  D --> E
  E --> F[Subgoal Image gt]
  E --> G[Progress Value Vt]
  F --> H[System 1 Post Training]
  G --> H
  H --> I[Real Robot Rollouts]
  I --> J[Offline AWR]
  J --> K[Online Human Correction]
  K --> I
  K --> L[Deployed Policy Update]

实验结果

架构选择。论文先固定双流 VLA,比较 PaliGemma2、Qwen3.5 和 Gemma 4。Gemma 4 在结构化清洁桌面上很强,但衣服折叠为零;PaliGemma2 是唯一在折叠任务上取得非零成功率且水果操作具有竞争力的骨干。随后比较三种耦合方式,双层双流在三个任务上均最强,虽然推理慢于最后层交叉注意力。

骨干总参数清洁桌面水果采摘衬衫折叠
PaliGemma23.5B50%88%30%
Qwen3.55B60%12%0%
Gemma 48.5B100%*92%0%

数据扩展。预训练数据增加时验证损失持续下降。机器人数据规模增加后,水果操作较平滑提升,混沌衣物折叠提升更陡,说明长程可变形物体对状态覆盖更敏感。加入 UMI 与 EGO 后,模型不再只依赖机器人轨迹,人类经验带来的先验在任务后训练后仍然保留。

数据规模

图 8:验证损失、真实机器人成功率与 UMI/EGO 数据消融。

System 3 消融。衣服折叠中四个配置都达到 100% 成功,但加入子目标图像后平均分从 68.3% 升至 81.7%,加入值条件后达到 85.0%,两者联合达到 88.3%,完成时间从 107 秒降到 75 秒。礼品包装更难,基础模型失败;只加子目标图像成功 20%,只加值条件成功 60%,两者联合成功 80%。

任务Base+SubImage+Value+SubImage+Value
衣服折叠成功率100%100%100%100%
衣服折叠平均分68.3%81.7%85.0%88.3%
礼品包装成功率0%20%60%80%
礼品包装平均分61.1%71.4%93.3%96.7%

仿真基准。RoboTwin 2.0 的 Co-Train 协议要求一个策略联合训练全部 50 个任务,每任务只用 50 条干净演示。GigaBrain-0.7 的 Easy 成功率为 66.8%,低于部分干净环境更优的方法,但 Hard 成功率达到 67.9%,总均值为 67.35%。这说明它的优势不是脆弱拟合,而是域随机化后的稳健性。

模型协议EasyHardOverall
π0Single46.42%16.34%31.38%
X-WAMCo-Train70.00%25.80%47.90%
π0.5Co-Train70.70%46.00%58.35%
GigaBrain-0.7Co-Train66.80%67.90%67.35%

更多基准。EBench 上,GigaBrain-0.7 取得 33.30% 成功率和 46.1 分。RoboColiseum 的 Real2Sim2Real 四项指标均第一:指令跟随 0.8166、空间推理 0.4729、鲁棒性 0.6800、通用操作 0.6092。MiMo-Embodied 中,进入 MiMo 数据前的模型 Overall 为 0.4621;最终检查点为 0.5704,但作者明确说明后者不是 held-out 评测。

经验强化。四个真实任务的 SFT 平均成功率为 30%。离线强化后升至 57.5%,在线强化后全部达到 100%。其中穿线绑扎从 0% 到 40% 再到 100%,轴承装配从 20% 到 60% 再到 100%。这个结果的价值在于,离线数据先教会模型识别部分进展,在线人工纠正再在更新后的策略分布中补上难点状态。

任务SFTOffline RLOnline RL
Link Installation20%40%100%
Gift Box Packing80%90%100%
Cable Tie Insertion and Tying0%40%100%
Bearing Installation20%60%100%

局限性

作者承认分布外差距仍然明显。预训练模型在未见对象、布局和交互条件上有进展,但从分布内到分布外的性能下降并没有消失;这仍是具身基础模型的核心难点。随着任务更接近接触密集和精确定位,泛化错误也更容易表现为物理失败。

System 3 很有效,但会引入依赖。如果不做条件丢弃,策略可能学会只在有子目标图像和优势 token 时行动。论文采用 0.50 与 0.15 的独立丢弃,然而如何在推理时保证世界模型误差不把策略推向错误未来,仍需要更长部署周期验证。

在线强化的完整协议尚未在本文展开。作者说会留在后续 GigaBrain 报告中,因此人类干预频率、奖励设计、状态分布更新和收敛稳定性都不能从当前论文完全复现。表 12 的 100% 是报告评测范围内的结果,不宜直接外推为工业级鲁棒性。

代码与评测覆盖还不完整。训练代码、模型和样例数据已经发布,但 VLM 评测、RoboColiseum、RoboTwin 2.0 与 EBench 基准代码仍在 TODO 中。这使得第三方复现指标时必须依赖外部基准实现和论文协议描述。

总结与展望

GigaBrain-0.7 的意义不在单一指标,而在把具身模型的生命周期连起来:统一数据处理、单阶段 VLA 预训练、世界模型预测与值评估、任务后训练、离线经验强化和在线人工纠正共同形成闭环。System 3 的消融尤其有说服力——即使二值成功率饱和,任务分数和完成时间仍能改进,说明未来预测不只是提升成功率,也在塑造更高质量的中间行为。

从工程角度看,Soft KI 和本体验证掩码是最容易复用的设计。前者提供了一个可调旋钮,用来权衡预训练语义保护与动作适应;后者避免了把缺失维度当作真实零值,这是跨本体训练里经常被忽略的细节。双流 Action Expert 的性能优势也提示,动作生成需要比末端交叉注意力更宽的信息通道。

下一步值得看三件事:一是世界值模型在更长部署和更多任务中的误差累积;二是完整在线 RL 协议能否公开;三是 16 个本体的数据权重和课程设计。若这些被补齐,GigaBrain-0.7 的大规模经验闭环会更接近可复现的具身基础模型训练栈。

金句

“理解当前状态还不够,机器人必须能想象下一步并判断那条路是否在推进任务。”

相关论文

FlashVLA:流式动作解码实现快速异步 VLA 推理

FlashVLA:流式动作解码实现快速异步 VLA 推理

视觉-语言-动作(VLA)模型在机器人操作领域前景广阔,但实际部署受制于高推理延迟与不稳定的异步执行——在基于流匹配(flow-matching)的 VLA 模型中尤为突出:动作解码需要在 VLM 上下文条件下进行多步迭代。高效推理方法能提升控制频率,异步方法能减少执行空等,但现有方案往往无法同时兼顾低延迟推理与精确、时序一致的异步执行。FlashVLA 提出一个统一的流式动作解码框架:维护一个包含多个不同噪声水平动作块的流式缓冲区,并用块级因果注意力(chunk-wise causal attention)解码,每个推理步即可产出一个可执行动作块;块级自回归结构隐式保持动作连续性,无需额外的未来状态条件即可平滑异步执行。大量仿真与真机实验表明,FlashVLA 在保持强任务性能的同时大幅提升推理速度,单 GPU 即可达到 ≥30Hz 控制频率并实现平滑异步真机部署。

VLAflow matching流式解码2026年8月27日
Zetta:冻结策略模型,让执行框架自进化出物理智能

Zetta:冻结策略模型,让执行框架自进化出物理智能

清华AIR提出Zetta闭环具身执行框架:基础VLA策略全程冻结,通过动作频率治理、回合批失败诊断、验证门控技能沉淀三个时间尺度循环,在线进化代码化运行时批评家与恢复技能;配合20.6倍吞吐的Z-Infra回滚基础设施,LIBERO-Pro成功率34.5%→90.8%,RoboCasa 73.6%→93.6%,并出现机器人顿悟时刻与零样本技能迁移。

具身智能Embodied AIVLA2026年8月17日
TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

TemporalFlow-VLA:用机器人表面时间流为长时程操作学习执行历史

提出 TemporalFlow-VLA:用记录的关节状态、机器人几何与标定相机把机器人运动投影到图像平面,构造“机器人表面时间流”作为训练期监督,驱动两个与动作块对齐的时间查询 Q8/Q15 向动作专家提供结构化历史。部署时无需几何计算,配合异步历史特征缓存。LIBERO 平均成功率 97.63±0.26%,RoboTwin 2.0 十二任务 Clean/Randomized 85.5%/84.2%,AgiBot A3 真机三阶段任务分别提升 20.0/11.1 个百分点。

VLA视觉-语言-动作时间流2026年8月27日
超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进

超越模仿:通过离线策略 Q-Planning 实现机器人策略自我改进

Q-Planning 冻结大型行为克隆策略,只训练一个约十亿参数的离线 Q 函数。推理时,Q 对 BC 采样出的多个候选动作块做单步加权平均;在线自改进时,成功与失败回放都只用于更新 Q。10 轮迭代将 LIBERO 平均成功率从 92.1% 提升到 97.6%,双臂真机堆杯与插卡任务分别从 40%/25% 提升到 90%/80%。

机器人操控强化学习行为克隆2026年8月21日