Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

多模态Multimodal预训练

从零开始的规模化原生多模态预训练

大规模语言模型能力强,本文研究从零开始的原生多模态预训练的规模化方法。

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu2026年7月24日3 分钟阅读
EN

从零开始缩放原生多模态预训练

论文:Scaling Native Multimodal Pre-Training From Scratch

作者:Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

机构:香港中文大学 / 腾讯 LLM 部门

链接arXiv:2607.22043


一句话总结

本文系统研究原生多模态预训练的缩放规律,发现在固定计算预算下语言目标的最优分配是数据组成不变的幂律,而多模态目标的最优分配高度依赖数据组成——文本密集混合在大规模时才计算高效——并推导出指定模型大小、token 数和数据混合精确配置的效率前沿,同时发现原生多模态预训练引发正向跨模态迁移,增强纯文本空间推理并实现鲁棒的多模态上下文学习。


研究背景与动机

大语言模型展现出卓越的推理能力,但纯文本预训练从根本上受限于无法将多模态概念扎根于物理世界。当前主流的多模态预训练范式依赖后融合——将预训练语言模型与视觉编码器通过投影层耦合,再在多模态数据上继续训练。虽然高效利用现有权重,但引入了根本性不对称:视觉和语言表示从不同数据分布、在不同优化目标下独立学习。

原生多模态预训练通过从零开始训练解决这一不对称,实现深度模态整合和共享表示容量。然而这一范式的缩放特性尚未被系统刻画。核心实践问题是:在固定计算预算下,如何在模型大小和数据(token 数)间最优分配资源?对单模态语言模型,这由计算最优缩放律指导(Chinchilla 等),但原生多模态预训练中语言和多模态目标竞争共享参数,最优分配仍是开放问题。

本文研究基于 Transformer 的视觉语言模型在固定计算预算下的最优模型大小和 token 数,揭示语言和多模态目标的不同缩放行为,并推导效率前沿。实验覆盖从 71M 到 3B 的模型规模,数据混合比 $r$ 从 0 到 0.3,总训练 token 达 250B 文本和 75B 多模态。评估涵盖 16 个文本基准和 21 个多模态基准,包括空间推理、编码、数学和逻辑推理等维度。

IsoFLOP语言目标图1:语言目标的 IsoFLOP 曲线。不同模型大小调整训练 token 数以保持恒定最终 FLOPs。


方法详解

1. 计算最优分配框架

设模型参数量为 $N$,训练 token 数为 $D$,数据混合比为 $r$(多模态 token 占比)。总计算预算为 $C_{\text{total}}$,分为文本计算 $C_{\text{text}}$ 和多模态计算 $C_{\text{mm}}$。计算最优缩放律形式为:

$$ L(C) = \alpha \cdot C^{-\beta}, \quad N_{\text{opt}} \propto C^{a}, \quad D_{\text{opt}} \propto C^{b}, \quad a + b \approx 1 $$

其中 $a$ 为参数缩放指数,$b$ 为数据缩放指数。最小目标损失遵循可预测的计算律: $$ L_{\text{text}} = \alpha_t \cdot C_{\text{text}}^{-\beta_t}, \quad L_{\text{mm}} = \alpha_m(r) \cdot C_{\text{mm}}^{-\beta_m(r)} $$ 其中语言目标的 $\alpha_t, \beta_t$ 不随 $r$ 变化,而多模态目标的 $\alpha_m, \beta_m$ 依赖 $r$。对语言目标 $L_{\text{text}}$ 和多模态目标 $L_{\text{mm}}$ 分别分析其缩放行为。总损失为两者的加权和,权重由数据混合比 $r$ 决定。

2. 语言目标:组成不变

语言目标最优分配图3:语言目标的计算最优分配。(a) 最优模型大小 $N_{\text{opt}}$ 和 (b) 最优 token 数 $D_{\text{opt}}$ 作为 $C_{\text{text}}$ 的函数。斜率几乎不随 $r$ 变化。

对每个模型大小 $N$,调整训练 token 数 $D$ 使最终 FLOPs 恒定,IsoFLOP 曲线在各个 $r$ 值上展现稳定的抛物线极小值。极小值处满足: $$ \frac{\partial L}{\partial N}\bigg|_{N=N_{\text{opt}}} = 0, \quad N_{\text{opt}} = \arg\min_N L(N, D(N)) $$ IsoFLOP 曲线在各个 $r$ 值上展现稳定的抛物线极小值,训练曲线包络严格遵循幂律。关键发现:语言目标的计算最优分配高度组成不变——最小化 $L_{\text{text}}$ 所需的参数容量严格由隔离预算 $C_{\text{text}}$ 决定,对多模态 token 的引入具有经验鲁棒性。两种估计方法(IsoFLOP 拟合和训练曲线包络)一致确认无单调下降趋势。

3. 多模态目标:组成敏感

IsoFLOP多模态目标图4:多模态目标的 IsoFLOP 曲线。损失曲线的明显谷值表明对给定 FLOP 预算存在最优模型大小。

与语言目标形成鲜明对比,多模态目标的缩放行为严格组成变化。随 $r$ 从 0.1 增至 0.3,最优模型大小指数显著下降,训练曲线包络展现一致下降趋势。两种估计器的强一致性确认这是鲁棒缩放律而非局部拟合伪影:

$$ a_{\text{mm}}(r): \quad r=0.1 \to \text{较高}, \quad r=0.3 \to \text{显著降低} $$

这反映了跨模态对齐固有的数据饥渴性:处理越来越密集的多模态数据持续压平最优参数缩放曲线,将最优计算分配从参数扩展转向数据扩展。文本密集混合仅在大规模时才计算高效,将资源分配推向更大的模型容量。

4. 联合 Pareto 前沿

多模态目标最优分配图6:多模态目标的计算最优分配。斜率随 $r$ 显著变化,表明组成敏感性。

实际预训练须在统一预算 $C_{\text{total}}$ 下优化共享参数 $N$。$L_{\text{text}}$ 和 $L_{\text{mm}}$ 间的竞争在不同 $r$ 下建立 Pareto 前沿。采用非对称建模:组成不变的语言目标配组成变化的多模态目标。全局最优分配指数 $a(r)$ 和 $b(r)$ 揭示:

$$ r=0.1: \quad N_{\text{opt}} \propto C_{\text{total}}^{0.69}; \qquad r=0.3: \quad N_{\text{opt}} \propto C_{\text{total}}^{0.66}, \quad D_{\text{opt}} \propto C_{\text{total}}^{0.34} $$

增加多模态分配将密集多模态输入的大量数据需求施加于整个系统,降低参数缩放比例,要求更激进的全系统 token 分配缩放。

flowchart TD
    A["固定计算预算 C_total"] --> B["数据混合比 r
多模态token占比"] B --> C["文本计算 C_text"] B --> D["多模态计算 C_mm"] C --> E["语言目标 L_text
组成不变缩放"] D --> F["多模态目标 L_mm
组成敏感缩放"] E --> G["a_text 不随 r 变化
参数容量由 C_text 决定"] F --> H["a_mm(r) 随 r 增大而降低
数据饥渴性压平参数曲线"] G --> I["联合 Pareto 前沿
a(r) + b(r) ≈ 1"] H --> I I --> J["效率前沿
指定 N_opt, D_opt, r 的精确配置"] J --> K["r=0.1: N∝C^0.69
r=0.3: N∝C^0.66, D∝C^0.34"] style E fill:#e1f5fe style F fill:#fff3e0 style J fill:#e8f5e9

实验结果

下游评估

训练曲线包络图2:语言目标的训练曲线包络。从曲线提取每 FLOP 的最小损失包络估计最优分配。

表1:缩放行为总结——语言 vs 多模态目标
目标组成敏感性参数缩放指数 $a$数据缩放指数 $b$关键发现
语言 $L_{\text{text}}$不变不随 $r$ 变化不随 $r$ 变化参数容量由 $C_{\text{text}}$ 严格决定
多模态 $L_{\text{mm}}$敏感$r=0.1$: 较高; $r=0.3$: 降低互补增大跨模态对齐数据饥渴,压平参数曲线
联合 ($r=0.1$)-0.690.31参数扩展优先
联合 ($r=0.3$)-0.660.34数据扩展更激进

跨模态迁移

表2:下游任务关键发现
发现详情
文本性能保持不同 $r$ 的模型在 16 个文本基准上性能差异 <1pp,无干扰
空间推理迁移$r=0.3$ 多模态模型在 SpatialEval(MazeNav, SpatialMap)纯文本任务上一致超越 $r=0$ 基线,优势随模型增大而扩大
上下文学习涌现3B 模型 3-shot 比 0-shot 提升 +2.43pp,小模型无收益
少shot集中在空间推理空间推理基准改善最显著,OCR/识别基准无改善甚至退化
多模态训练曲线图5:多模态目标的训练曲线包络,跨不同 $r$ 值和模型大小。


局限性

  1. 模型规模上限:实验最大规模为 3B 参数,推导的缩放律在更大规模(如 70B+)的外推准确性未验证,幂律外推可能存在偏差。
  2. 模态覆盖有限:仅研究视觉-语言双模态,未涵盖音频、视频等更多模态的原生预训练缩放行为。
  3. 数据混合维度简化:仅以多模态 token 占比 $r$ 作为混合参数,未考虑多模态数据内部的质量和多样性差异对缩放律的影响。

总结与展望

本文系统刻画了原生多模态预训练的缩放规律,揭示语言目标的组成不变性和多模态目标的组成敏感性这一根本非对称。通过联合 Pareto 前沿推导出指定模型大小、token 数和数据混合的效率前沿。下游评估发现原生多模态预训练引发正向跨模态迁移——增强纯文本空间推理并使多模态上下文学习随规模涌现。这为可预测地缩放多模态基础模型奠定了基础。

金句:「语言目标的缩放是组成不变的——参数容量由文本计算预算严格决定;而多模态目标的缩放高度组成敏感——跨模态对齐的数据饥渴性随多模态比例增大而压平参数曲线,迫使最优分配从参数扩展转向数据扩展。」

相关论文