PAPER DEEP DIVE
Music-JEPA:从动作学习声音世界模型
联合嵌入预测架构(JEPA)近期兴起,本文将其扩展为从动作学习声音的世界模型。
Music-JEPA:从动作学习钢琴声音的世界模型
论文:Music-JEPA: Learning a World Model of Sound from Action
链接:arXiv:2607.22000 · 演示页面
一句话总结
Music-JEPA 将音乐建模为动作条件系统——音频为状态、钢琴卷帘为动作——通过联合嵌入预测架构(JEPA)在潜在空间预测动作条件下的未来音频状态,采用 EMA 训练防止表示坍塌,学习到的表示支持节拍追踪、作曲家识别和调性估计等下游任务,并可通过潜在空间规划实现钢琴转录。
研究背景与动机
人类对音乐的理解通常源于主动参与:学习钢琴涉及与乐器交互,理解键盘上的动作如何产生声学结果。认知研究表明,人类发展出内部表征,能在无直接听觉输入时预判和心理模拟音乐结果。这一学习过程自然暗示了音乐世界模型——通过建模动作(如演奏乐器)与结果状态(如声音)间的时序动态来学习音乐表示的自监督框架。
联合嵌入预测架构(JEPA)是学习世界模型的范式,通过预测潜在表示而非重建原始观测来避免建模不必要细节的负担。然而,现有音乐领域的 JEPA 工作主要将其作为被动学习通用音频表示的自监督方法,不建模音乐如何随时间演化,也很少在调性、和弦或节拍等音乐特定概念上评估。JEPA 表示能否捕获音乐理解和规划所需的时序动态仍不清楚。
Music-JEPA 的核心洞察是将音乐建模为动作条件系统:2 秒钢琴音频段为状态,对应的钢琴卷帘和延音踏板信号为动作。模型从先前状态和当前动作直接在潜在空间预测下一状态,无需重建原始音频。
图1:Music-JEPA 模型图。$\mathcal{E}_s$、$\mathcal{E}_a$、$f$、$g$ 分别为状态编码器、动作编码器、状态预测器和动作预测器。阴影区域为潜在时序动态。
方法详解
1. 数据表示
状态为 2 秒钢琴音频段,转换为频谱图后切分为 $K_s = 16 \times 16 = 256$ 个 $25 \times 15$ patch。动作为对应的钢琴卷帘加延音踏板信号,切分为 $K_a = 16 \times 15 = 240$ 个 $25 \times 6$ patch。嵌入维度 $D = 256$,状态和动作表示分别为 $(256, 256)$ 和 $(240, 256)$。
2. 模型架构
状态编码器使用 12 层 Transformer,动作编码器使用 8 层,状态和动作预测器各 6 层。所有模块使用 $d_{\text{model}}=256$、$d_{\text{ff}}=512$、4 个注意力头。总参数约 19M。
3. 训练目标与正则化
状态预测器从当前状态和下一动作预测下一状态,动作预测器从当前动作预测下一动作。采用 EMA 训练方案防止表示坍塌——教师网络参数为学生网络的指数移动平均:
$$ \theta_{\text{tea}} \leftarrow \tau \cdot \theta_{\text{tea}} + (1 - \tau) \cdot \theta_{\text{stu}}, \quad \tau = 0.95 $$训练损失为状态预测损失加动作预测损失:
$$ \mathcal{L} = \text{MSE}\bigl(f(s_t, a_{t+1}),\, \mathrm{sg}(\mathcal{E}_s^{\text{tea}}(x_{t+1}))\bigr) + \lambda \cdot \text{MSE}\bigl(g(a_t),\, \mathrm{sg}(\mathcal{E}_a^{\text{tea}}(y_{t+1}))\bigr) $$其中 $\mathrm{sg}$ 为 stop-gradient 操作符,$\lambda = 0.5$。教师目标使用 stop-gradient 防止梯度回传到教师网络。教师目标的具体形式为: $$ s_{t+1}^{ ext{tgt}} = \mathrm{sg}igl( ext{LN}(\mathcal{E}_s^{ ext{tea}}(x_{t+1}))igr), \quad a_{t+1}^{ ext{tgt}} = \mathrm{sg}igl( ext{LN}(\mathcal{E}_a^{ ext{tea}}(y_{t+1}))igr) $$ 其中 $ ext{LN}$ 为层归一化。学生表示同样经过层归一化:$s_{ ext{curr}} = ext{LN}(\mathcal{E}_s^{ ext{stu}}(x_{ ext{curr}}))$。预测在归一化后的潜在空间中进行,避免重建原始频谱图的负担。模型在 MAESTRO v3.0.0 数据集(约 200 小时钢琴录音,时间对齐 MIDI)上训练,使用 Adam 优化器,学习率 $6 imes 10^{-4}$,权重衰减 $10^{-4}$,批大小 128,在单张 A100 上训练 15-25 个 epoch。
4. 下游任务与规划
训练后冻结模型,状态编码器作为特征提取器。对于长度 $T$ 秒的音频,表示沿时间维度拼接为 $(\frac{T}{2} \times K_s, D)$。学习的动态还支持通过潜在空间规划实现钢琴转录——搜索最佳解释目标声音的动作序列:
$$ a_{1:T}^{*}=\operatorname*{argmin}_{a_{1:T}}\sum_{t=1}^{T-1}\Big(\|f(s_{t},a_{t+1})-s_{t+1}\|^{2}+\|g(a_{t})-a_{t+1}\|^{2}\Big) $$由于动作空间高维,采用摊销优化——训练逆预测器 $a_{t+1} = h(s_t, s_{t+1}, a_t)$ 近似解,预测的潜在动作通过单独训练的动作解码器映射回观测空间。
flowchart TD
A["钢琴音频 x_t
频谱图 256 patches"] --> B["状态编码器 Es_stu
12层Transformer"]
B --> C["状态表示 s_t
(256, 256)"]
D["钢琴卷帘+踏板 y_t
240 patches"] --> E["动作编码器 Ea_stu
8层Transformer"]
E --> F["动作表示 a_t
(240, 256)"]
C --> G["状态预测器 f
6层Transformer"]
F2["下一动作 a_{t+1}"] --> G
G --> H["预测状态 s_hat_{t+1}"]
H --> I{"MSE vs
教师目标 sg(Es_tea(x_{t+1}))"}
F --> J["动作预测器 g"]
J --> K["预测动作 a_hat_{t+1}"]
K --> L{"MSE vs
教师目标 sg(Ea_tea(y_{t+1}))"}
I --> M["总损失 L
= MSE_state + λ·MSE_action"]
L --> M
M --> N["EMA 更新教师网络
τ=0.95"]
style B fill:#e1f5fe
style G fill:#fff3e0
style N fill:#e8f5e9
实验结果
潜在动态评估
图2:扰动敏感性测量。损失差异 $\Delta\mathcal{L}$ 在输入状态、目标状态和动作扰动下的分布。
评估模型是否捕获动作条件的时序动态。给定输入状态 $s_t$ 和动作 $a_{t+1}$,模型预测 $\hat{s}_{t+1} = f(s_t, a_{t+1})$,测量与真实 $s_{t+1}^{\text{gt}}$ 的误差:
$$ \mathcal{L}(s_{t},a_{t+1},s_{t+1}^{\text{gt}})=\|f(s_{t},a_{t+1})-s_{t+1}^{\text{gt}}\|^{2} $$良好的动态模型对正确的状态-动作-目标三元组分配低误差,对扰动组件分配高误差。胜率定义为 $\Delta\mathcal{L} > 0$ 的比例。
| 模型 | 输入状态-时间 | 输入状态-随机 | 目标状态-时间 | 目标状态-随机 |
|---|---|---|---|---|
| Music-JEPA | 0.929 | 0.999 | 0.991 | 0.992 |
| AO-JEPA | 0.787 | 0.986 | 0.576 | 0.984 |
Music-JEPA 在时间扰动上显著优于 AO-JEPA(输入状态 0.929 vs 0.787,目标状态 0.991 vs 0.576),表明动作条件建模显著提升了时序动态捕获能力。音高偏移影响最强,特别是三全音等不协和音程。
下游 MIR 任务
| 模型 | 参数 | 节拍 F1@70ms | 作曲家 wF1 | 调性 wF1 |
|---|---|---|---|---|
| Music-JEPA | 6M | 0.6208 | 0.5520 | 0.7617 |
| AO-JEPA | 6M | 0.6013 | 0.4606 | 0.7615 |
| MERT | 95M | 0.5780 | 0.6690 | 0.6469 |
评估使用三类下游任务:节拍追踪(70ms 和 100ms 容差的精确率、召回率、F1)、作曲家识别(加权 F1 和 Top-1/3/5 准确率)、调性识别(加权精确率、召回率、F1)。Music-JEPA 以仅 6M 参数在节拍追踪和调性识别上超越 95M 参数的 MERT,在作曲家识别上次于 MERT 但优于 AO-JEPA。动作条件建模带来的时序动态理解直接转化为下游音乐理解任务的提升。
图3:四个动作条件合成示例。每组:左为真实、中为模型预测、右为不同动作的反事实预测。
图4:输入状态扰动下的损失差异分布。
局限性
- 仅限钢琴:模型仅在 MAESTRO 数据集的钢琴录音上训练和评估,未验证对其他乐器或多乐器音乐的泛化能力。
- 离线训练限制:虽然以动作条件方式建模,但训练完全离线使用配对音频-钢琴卷帘数据,无环境交互——与真正的交互式世界模型仍有差距。
- 规划空间高维挑战:钢琴转录的规划需在高维潜在动作空间中优化,梯度规划仍具挑战性,需依赖摊销逆预测器近似,而非直接优化。
总结与展望
Music-JEPA 通过将音乐建模为动作条件系统,在 JEPA 框架内学习钢琴声音的世界模型。状态预测器从当前音频状态和钢琴卷帘动作预测下一音频状态,EMA 训练防止坍塌。学习到的表示在节拍追踪、作曲家识别和调性估计上优于被动 JEPA 和更大规模的 MERT,并支持通过潜在空间规划实现钢琴转录。这表明动作条件建模对音乐时序动态理解至关重要。
金句:「将音乐建模为动作条件系统——音频为状态、演奏动作为输入——使 JEPA 从被动表示学习变为主动世界模型,捕获动作如何产生声音的因果动态。」



