Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

世界模型World Model声音

Music-JEPA:从动作学习声音世界模型

联合嵌入预测架构(JEPA)近期兴起,本文将其扩展为从动作学习声音的世界模型。

Ziyu Wang, Kun Fang, Yann LeCun2026年7月24日2 分钟阅读
EN

Music-JEPA:从动作学习钢琴声音的世界模型

论文:Music-JEPA: Learning a World Model of Sound from Action

链接arXiv:2607.22000 · 演示页面


一句话总结

Music-JEPA 将音乐建模为动作条件系统——音频为状态、钢琴卷帘为动作——通过联合嵌入预测架构(JEPA)在潜在空间预测动作条件下的未来音频状态,采用 EMA 训练防止表示坍塌,学习到的表示支持节拍追踪、作曲家识别和调性估计等下游任务,并可通过潜在空间规划实现钢琴转录。


研究背景与动机

人类对音乐的理解通常源于主动参与:学习钢琴涉及与乐器交互,理解键盘上的动作如何产生声学结果。认知研究表明,人类发展出内部表征,能在无直接听觉输入时预判和心理模拟音乐结果。这一学习过程自然暗示了音乐世界模型——通过建模动作(如演奏乐器)与结果状态(如声音)间的时序动态来学习音乐表示的自监督框架。

联合嵌入预测架构(JEPA)是学习世界模型的范式,通过预测潜在表示而非重建原始观测来避免建模不必要细节的负担。然而,现有音乐领域的 JEPA 工作主要将其作为被动学习通用音频表示的自监督方法,不建模音乐如何随时间演化,也很少在调性、和弦或节拍等音乐特定概念上评估。JEPA 表示能否捕获音乐理解和规划所需的时序动态仍不清楚。

Music-JEPA 的核心洞察是将音乐建模为动作条件系统:2 秒钢琴音频段为状态,对应的钢琴卷帘和延音踏板信号为动作。模型从先前状态和当前动作直接在潜在空间预测下一状态,无需重建原始音频。

模型架构图1:Music-JEPA 模型图。$\mathcal{E}_s$、$\mathcal{E}_a$、$f$、$g$ 分别为状态编码器、动作编码器、状态预测器和动作预测器。阴影区域为潜在时序动态。


方法详解

1. 数据表示

状态为 2 秒钢琴音频段,转换为频谱图后切分为 $K_s = 16 \times 16 = 256$ 个 $25 \times 15$ patch。动作为对应的钢琴卷帘加延音踏板信号,切分为 $K_a = 16 \times 15 = 240$ 个 $25 \times 6$ patch。嵌入维度 $D = 256$,状态和动作表示分别为 $(256, 256)$ 和 $(240, 256)$。

2. 模型架构

状态编码器使用 12 层 Transformer,动作编码器使用 8 层,状态和动作预测器各 6 层。所有模块使用 $d_{\text{model}}=256$、$d_{\text{ff}}=512$、4 个注意力头。总参数约 19M。

3. 训练目标与正则化

状态预测器从当前状态和下一动作预测下一状态,动作预测器从当前动作预测下一动作。采用 EMA 训练方案防止表示坍塌——教师网络参数为学生网络的指数移动平均:

$$ \theta_{\text{tea}} \leftarrow \tau \cdot \theta_{\text{tea}} + (1 - \tau) \cdot \theta_{\text{stu}}, \quad \tau = 0.95 $$

训练损失为状态预测损失加动作预测损失:

$$ \mathcal{L} = \text{MSE}\bigl(f(s_t, a_{t+1}),\, \mathrm{sg}(\mathcal{E}_s^{\text{tea}}(x_{t+1}))\bigr) + \lambda \cdot \text{MSE}\bigl(g(a_t),\, \mathrm{sg}(\mathcal{E}_a^{\text{tea}}(y_{t+1}))\bigr) $$

其中 $\mathrm{sg}$ 为 stop-gradient 操作符,$\lambda = 0.5$。教师目标使用 stop-gradient 防止梯度回传到教师网络。教师目标的具体形式为: $$ s_{t+1}^{ ext{tgt}} = \mathrm{sg}igl( ext{LN}(\mathcal{E}_s^{ ext{tea}}(x_{t+1}))igr), \quad a_{t+1}^{ ext{tgt}} = \mathrm{sg}igl( ext{LN}(\mathcal{E}_a^{ ext{tea}}(y_{t+1}))igr) $$ 其中 $ ext{LN}$ 为层归一化。学生表示同样经过层归一化:$s_{ ext{curr}} = ext{LN}(\mathcal{E}_s^{ ext{stu}}(x_{ ext{curr}}))$。预测在归一化后的潜在空间中进行,避免重建原始频谱图的负担。模型在 MAESTRO v3.0.0 数据集(约 200 小时钢琴录音,时间对齐 MIDI)上训练,使用 Adam 优化器,学习率 $6 imes 10^{-4}$,权重衰减 $10^{-4}$,批大小 128,在单张 A100 上训练 15-25 个 epoch。

4. 下游任务与规划

训练后冻结模型,状态编码器作为特征提取器。对于长度 $T$ 秒的音频,表示沿时间维度拼接为 $(\frac{T}{2} \times K_s, D)$。学习的动态还支持通过潜在空间规划实现钢琴转录——搜索最佳解释目标声音的动作序列:

$$ a_{1:T}^{*}=\operatorname*{argmin}_{a_{1:T}}\sum_{t=1}^{T-1}\Big(\|f(s_{t},a_{t+1})-s_{t+1}\|^{2}+\|g(a_{t})-a_{t+1}\|^{2}\Big) $$

由于动作空间高维,采用摊销优化——训练逆预测器 $a_{t+1} = h(s_t, s_{t+1}, a_t)$ 近似解,预测的潜在动作通过单独训练的动作解码器映射回观测空间。

flowchart TD
    A["钢琴音频 x_t
频谱图 256 patches"] --> B["状态编码器 Es_stu
12层Transformer"] B --> C["状态表示 s_t
(256, 256)"] D["钢琴卷帘+踏板 y_t
240 patches"] --> E["动作编码器 Ea_stu
8层Transformer"] E --> F["动作表示 a_t
(240, 256)"] C --> G["状态预测器 f
6层Transformer"] F2["下一动作 a_{t+1}"] --> G G --> H["预测状态 s_hat_{t+1}"] H --> I{"MSE vs
教师目标 sg(Es_tea(x_{t+1}))"} F --> J["动作预测器 g"] J --> K["预测动作 a_hat_{t+1}"] K --> L{"MSE vs
教师目标 sg(Ea_tea(y_{t+1}))"} I --> M["总损失 L
= MSE_state + λ·MSE_action"] L --> M M --> N["EMA 更新教师网络
τ=0.95"] style B fill:#e1f5fe style G fill:#fff3e0 style N fill:#e8f5e9

实验结果

潜在动态评估

扰动敏感性图2:扰动敏感性测量。损失差异 $\Delta\mathcal{L}$ 在输入状态、目标状态和动作扰动下的分布。

评估模型是否捕获动作条件的时序动态。给定输入状态 $s_t$ 和动作 $a_{t+1}$,模型预测 $\hat{s}_{t+1} = f(s_t, a_{t+1})$,测量与真实 $s_{t+1}^{\text{gt}}$ 的误差:

$$ \mathcal{L}(s_{t},a_{t+1},s_{t+1}^{\text{gt}})=\|f(s_{t},a_{t+1})-s_{t+1}^{\text{gt}}\|^{2} $$

良好的动态模型对正确的状态-动作-目标三元组分配低误差,对扰动组件分配高误差。胜率定义为 $\Delta\mathcal{L} > 0$ 的比例。

表1:时间扰动和随机扰动下的胜率——Music-JEPA 在时间扰动上显著优于 AO-JEPA
模型输入状态-时间输入状态-随机目标状态-时间目标状态-随机
Music-JEPA0.9290.9990.9910.992
AO-JEPA0.7870.9860.5760.984

Music-JEPA 在时间扰动上显著优于 AO-JEPA(输入状态 0.929 vs 0.787,目标状态 0.991 vs 0.576),表明动作条件建模显著提升了时序动态捕获能力。音高偏移影响最强,特别是三全音等不协和音程。

下游 MIR 任务

表2:三个下游 MIR 任务上的预训练音乐表示对比
模型参数节拍 F1@70ms作曲家 wF1调性 wF1
Music-JEPA6M0.62080.55200.7617
AO-JEPA6M0.60130.46060.7615
MERT95M0.57800.66900.6469

评估使用三类下游任务:节拍追踪(70ms 和 100ms 容差的精确率、召回率、F1)、作曲家识别(加权 F1 和 Top-1/3/5 准确率)、调性识别(加权精确率、召回率、F1)。Music-JEPA 以仅 6M 参数在节拍追踪和调性识别上超越 95M 参数的 MERT,在作曲家识别上次于 MERT 但优于 AO-JEPA。动作条件建模带来的时序动态理解直接转化为下游音乐理解任务的提升。

动作条件合成图3:四个动作条件合成示例。每组:左为真实、中为模型预测、右为不同动作的反事实预测。

输入状态扰动图4:输入状态扰动下的损失差异分布。


局限性

  1. 仅限钢琴:模型仅在 MAESTRO 数据集的钢琴录音上训练和评估,未验证对其他乐器或多乐器音乐的泛化能力。
  2. 离线训练限制:虽然以动作条件方式建模,但训练完全离线使用配对音频-钢琴卷帘数据,无环境交互——与真正的交互式世界模型仍有差距。
  3. 规划空间高维挑战:钢琴转录的规划需在高维潜在动作空间中优化,梯度规划仍具挑战性,需依赖摊销逆预测器近似,而非直接优化。

总结与展望

Music-JEPA 通过将音乐建模为动作条件系统,在 JEPA 框架内学习钢琴声音的世界模型。状态预测器从当前音频状态和钢琴卷帘动作预测下一音频状态,EMA 训练防止坍塌。学习到的表示在节拍追踪、作曲家识别和调性估计上优于被动 JEPA 和更大规模的 MERT,并支持通过潜在空间规划实现钢琴转录。这表明动作条件建模对音乐时序动态理解至关重要。

金句:「将音乐建模为动作条件系统——音频为状态、演奏动作为输入——使 JEPA 从被动表示学习变为主动世界模型,捕获动作如何产生声音的因果动态。」

相关论文

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7:用三系统架构扩展具身基础模型的涌现能力

GigaBrain-0.7 统一任务理解、未来预测、价值评估与连续动作控制,在三万七千多小时跨本体具身数据和约2.72亿VLM样本上完成单阶段预训练,并通过仿真与真机经验强化显著提升成功率。

VLA具身智能世界模型2026年8月16日
LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA:无需启发式技巧的高效可扩展视频预训练

LeVJEPA 用单个编码器、单个损失函数和一个固定超参数(λ=0.02)完成视频自监督预训练:不变性损失加 SIGReg 正则从数学上排除表征坍缩,无需目标编码器、预测器、stop-gradient 或像素重建;训练计算量比 V-JEPA 2 少 5.6–20.8 倍,FLOP 对齐下 ImageNet-1K 领先 7.6 个百分点,并免费获得块因果注意力,为流式感知与自回归世界模型铺路。

视频自监督预训练JEPA表征坍缩2026年8月27日
Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

Zero-WAM:基于人类视频上下文提示的世界-动作建模,实现开放任务泛化

零样本跨任务泛化——策略要执行训练时从未见过的操作任务——仍是机器人学习的核心难题。大语言模型只需在上下文中指定新任务即可完成,无需更新参数。Zero-WAM 把这种上下文学习范式带入机器人操作:作者认为操作任务最自然的"任务说明书"是人类视频——它比语言提供了更丰富的任务演化视觉线索。Zero-WAM 是一个因果视频-动作模型,通过跟随上下文人类视频提示执行未见任务。为解决任务丰富的人机配对数据稀缺问题,论文提出自动流水线把按任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集:7.42 万条人机上下文学习对,覆盖 8600 个任务。训练目标上引入上下文未来块预测 (IFP),抑制从已见任务学到的捷径,迫使策略真正从视频提示中提取任务信息。在 RoboTwin 2.0 的 7 个未见任务上,Zero-WAM 平均成功率 47.0%,比最强视频-动作基线绝对提升 29.5 个百分点;真实世界评测中,它能跟随人类视频提示泛化到多物体场景、长时序操作与精细插装等未见任务配置。

世界模型上下文学习人类视频示教2026年8月26日
DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM:面向腿式移动操作的解耦全身世界-动作模型

DECOWAM 在冻结的 FastWAM 视频-动作主干上,通过未来等价瓶颈、底盘/手臂因子化与自我运动条件三个解耦接口建模腿式移动操作,Stage-2 可训练参数减少 232 倍,真机任务成功率 58.2%。

世界模型VLA移动操作2026年8月20日