MuScriptor-large:13.66 亿参数完整混音转多轨 MIDI 的证据与边界
核对旗舰 checkpoint 的精确参数、事件建模、私有与跨域评测、Type-1 MIDI 输出,以及受门控的非商业许可边界。

自动音乐转录
MuScriptor-large 是 MuScriptor 公开系列中参数量最大、官方定位为最佳质量的 checkpoint。它把 16 kHz 单声道音频切成 5 秒片段,经过 512-bin mel 表示与 48 层 decoder-only Transformer,生成音高、起止时间、乐器和鼓点事件,再写成 Type-1 多轨 MIDI。公开权重的精确规模为 1,366,399,488 个 F32 参数,单个 safetensors 文件为 5,465,642,136 bytes。
“最大模型”与“通用 SOTA”并不是同一个判断。论文在私有 D_Test 上报告 MuScriptor-large 相对 YourMT3+ 的显著提升,也给出八个外部数据集的跨域结果;后者并非每项全胜。D_Real、D_RL 与 D_Test 没有公开,MIROS 也没有在同一音频、同一指标和同一后处理下与它正面对比,因此目前最稳妥的表述是:它属于公开权重、通用多乐器 AMT 中最强的新候选之一,并拥有作者报告的领先结果。
1. 旗舰档位来自精确 checkpoint,而不是名称推断
MuScriptor 公开 small、medium 与 large 三个档位。仓库文件给出的精确参数量分别是 102,968,832、307,030,528 与 1,366,399,488;large 约为 medium 的 4.45 倍,也是模型卡明确标注的旗舰、最佳质量版本。论文消融表使用 60M、100M、300M、1.3B 这组实验规模标签,不能把这些标签直接改写成公开 checkpoint 的精确参数量。排行榜若展示论文表 4,应保留论文原始行名;模型卡则应显示实际仓库参数。
权重仓库在 revision 8809fdfbed2affa7ade94a7059e746e3880720e7 下包含一个 5,465,642,136-byte 的 model.safetensors,其余配置文件只占很小一部分。源码则固定到 commit 302343e8992bdfc619f77f1988168374ed5d675d。这两个标识把网络结构、tokenizer、推理默认值和实际权重绑定在一起,避免“页面写 large,执行时却加载 medium”或依赖浮动主分支的情况。
模型文件采用 F32 存储不等于每一步计算都必须用 F32,也不等于可以在没有证据时声称某个量化版本等价。公开发行物没有 small/medium 之外的官方低比特质量对照;质量优先的入口应只接受 large 的精确身份,加载失败就明确失败,而不是悄悄切换较小档位。

2. 声学输入怎样变成条件事件序列
输入先转成 16 kHz 单声道。短时傅里叶变换使用 2,048 点窗口和 160-sample hop,因此每秒得到 100 帧;随后投影为 512 维 mel 频谱。5 秒片段约含 500 个声学帧,送入维度 1,536、24 个注意力头、48 层的 decoder-only Transformer。网络在同一序列中联合建模时间、乐器与音符,无需先拆成固定 stem 再逐轨转录。
p(y|x,c)=∏n=1N p(yn|y<n, Enc(x), c)x5 秒音频片段的 mel 表示c可选的乐器条件;空集合表示自动检测yn时间、乐器、音高或终止事件 token
自回归分解让前面已经生成的乐器和和弦信息参与后续判断,适合处理完整混音中的跨乐器关系;代价是错误也会沿序列传播。一次错误的时间移动会推迟后续音符,遗漏 note-off 会产生悬挂长音,乐器 token 漂移则会把正确音高送入错误轨道。
当前官方示例采用 batch size 1、beam size 1、cfg_coef=1 与 prelude forcing。这里的 beam size 1 实际是确定性 argmax 路径。更宽 beam 会增加候选前缀与显存,并不自动改善物理时间边界;没有同口径消融时,把 beam 4 写成“最高质量”缺少依据。
Classifier-free guidance 用条件与无条件 logits 的差异强化所选条件,可写为 ℓ=ℓu+s(ℓc−ℓu)。论文最终表的 CFG=1 与 CFG=2 很接近,但 Multi F1 分别为 48.2 与 47.8;公开默认值因此保持 1,而不是追求更大的 guidance 数字。
3. 145 万份 MIDI、1.1 万小时真实录音与 300 首人工确认样本
论文把训练来源分成三层。D_Synth 约含 145 万份 MIDI,来源包括 Lakh MIDI 与商业数据提供方,并用 250 多套 SoundFont 渲染;移调、速度、力度、乐器映射和 detune 扩增让同一符号内容覆盖更多音色。合成数据提供精确事件边界,却无法完整模拟麦克风串音、母带处理、演奏噪声和真实音色的长尾。
D_Real 约含 17 万首内部真实录音,总长约 1.1 万小时。符号标注来自音频—符号对齐,不是采样级人工逐音校订。真实混音扩大了音色与制作分布,也引入标题匹配、版本差异、插件延迟和对齐误差。D_RL 则从真实数据中选择 300 首高质量转写,由人工确认后用于 GRPO/REINFORCE 类后训练。三层数据依次解决覆盖、域差异与序列偏好,但其中真实数据和奖励数据没有公开。
论文将监督目标写成 token 级负对数似然,后训练奖励则由 onset、offset、frame、drums 与 multi-instrument 等指标组合。奖励优化关注整段序列的可用性,而不是只把每个 token 当作独立分类。由于奖励来自有限的 300 首确认样本,改善是否覆盖罕见乐器、极端速度和非西方调式,仍需在公开数据上复验。
LSFT=−Σn log p(yn|y<n,x,c), J(θ)=E[R(y)]LSFT监督阶段的序列交叉熵R(y)整段转写的组合奖励D_RL300 首人工确认转写,不等同于公开测试集
4. 35 个界面名称与 36 个学习组之间的白名单
MuScriptor 将 General MIDI 的 128 个 program 归并为 MT3_FULL_PLUS 的乐器组。模型内部学习 36 个组,公开演示为用户列出 35 个可选名称,包括原声钢琴、电钢琴、原声吉他、清音与失真电吉他、弦乐、铜管、木管、合成器、voice 与 drums。数量差异来自内部表示与可选显示集合的口径,不应把界面选项数写成模型全部类别数。
乐器框留空时,模型可以自动返回任意支持组;一旦选择一个或多个名称,解码器会对其他乐器 token 施加硬掩码,形成严格白名单。它能减少已知编制中的乐器泄漏,也可能把未列出的真实声部彻底压掉。四重奏录音已知只有钢琴、贝斯、鼓时,白名单有实际价值;编制不确定时,自动检测更安全。
硬约束必须从界面一路传到 tokenizer 的 token mask。若前端只显示选中 chips,后端却丢弃参数,用户看到的是虚假控制;若后端接受任意字符串,拼写错误可能在运行中才暴露。可靠接口只接受官方 35 项枚举、拒绝重复值,并把空数组明确解释为自动检测。

5. 私有 D_Test 上的大幅领先应当怎样阅读
论文表 1 在同一套私有 D_Test 上比较 YourMT3+ YPTF.MoE+Multi (noPS) 与 MuScriptor 的训练阶段。最终 large 模型在 CFG=1 时报告 Onset 60.4、Frame 73.3、Offset 49.0、Drums 50.2、Multi 48.2;YourMT3+ 对应为 32.52、45.54、17.79、41.4、21.9。差距很大,说明在作者选择的真实混音分布和标注协议下,扩大数据、模型与后训练具有实质效果。
| 同一私有 D_Test | Onset F1 | Frame F1 | Offset F1 | Drums F1 | Multi F1 |
|---|---|---|---|---|---|
| YourMT3+ | 32.52 | 45.54 | 17.79 | 41.4 | 21.9 |
| MuScriptor-large,CFG=1 | 60.4 | 73.3 | 49.0 | 50.2 | 48.2 |
Multi F1 要求乐器、音高、onset 与 offset 同时满足匹配条件,因此不能与只检查部分字段的分数直接互换。MIROS 在 2025 AMT Challenge 的 0.5998 使用另一套 76 个约 20 秒合成片段,以及 program + pitch + onset 的 Multi Onset F1;MuScriptor 没有参加这套同口径测试。把 48.2 与 0.5998 排成一列既不公平,也没有统计意义。
D_Test 共 372 首多乐器作品,来自内部数据并通过标题过滤减少训练—测试泄漏。过滤能降低明显重复,不等于公开可复现的去重证明。音频、标注、版本选择与重叠音清理规则都未开放,第三方目前无法完整重算表 1。页面因此只能标注“作者报告的私有测试结果”,不能去掉证据限定词。
6. 跨域表与重叠音符消融揭示了失败区域
八个外部数据集给出了比单一 headline 更完整的轮廓。相对 YourMT3+,MuScriptor 在 Frame F1 上赢 7/8,在 Multi F1 上赢 6/8,但 Onset F1 只赢 4/8。RWC-C 的 onset、frame、offset 与 multi 均落后;RWC-R 的 offset、drums 与 multi 也落后;Bach10 的 onset 与 offset 同样没有领先。持续音高活动和整体多轨内容较强,不代表所有瞬态、所有乐器与所有录音年代都占优。
tokenizer 还有一个明确限制:同一乐器、同一音高的同时重叠音符无法完整表示。论文在 D_Test 中删除较短的重叠音后评测;不删除时,Onset F1 从 60.4 降到 51.8,Offset 从 49.0 降到 41.9,Multi 从 48.2 降到 42.0。钢琴踏板下的重复同音、弦乐齐奏和叠录吉他都可能触发这类表示冲突。
模型规模消融也要与最终表分开。论文表 4 只使用 D_Real 训练并开启乐器条件,60M、100M、300M、1.3B 的 Multi F1 依次为 35.2、38.2、39.7、40.5。它证明在该设置下扩大模型仍有收益,却没有包含最终的合成预训练与强化后训练组合,也不是 small、medium、large 三个公开 checkpoint 的直接横评。
| 论文规模标签 | Onset | Frame | Offset | Drums | Multi |
|---|---|---|---|---|---|
| 60M | 47.7 | 65.7 | 35.3 | 39.8 | 35.2 |
| 100M | 51.2 | 67.2 | 38.7 | 41.5 | 38.2 |
| 300M | 52.4 | 68.0 | 40.3 | 42.0 | 39.7 |
| 1.3B | 53.2 | 68.7 | 41.0 | 42.5 | 40.5 |
真实歌曲审听应特别检查密集同音、鼓与贝斯共瞬态、失真吉他、合唱、罕见音色和强混响。总分可能保持良好,局部轨道仍会出现短碎音、跨轨泄漏、长音截断或同一乐器被拆成多个通道。统计表描述平均行为,不能替代逐轨 piano-roll 与合成回放。
7. Type-1 多轨 MIDI 保存了什么,又固定了什么
当前写出器生成 Type-1 MIDI:元信息位于独立轨道,各乐器轨道包含名称、program、channel、note-on 与 note-off;鼓使用 General MIDI 的 channel 10 语义。与把全部事件压进 Type-0 相比,多轨结构便于 DAW 中静音、独奏和逐轨修订,也让乐器漂移更容易被发现。
输出并不恢复真实力度。公开代码将音符 velocity 统一写为 100;MIDI 中出现 velocity 字段,只说明文件格式需要该值,不代表模型从录音推断了演奏强弱。鼓只预测 onset。模型也不输出原曲 tempo map、拍号或节拍网格,写出器使用固定 120 BPM tempo event 来保持秒时间换算。页面必须把“固定 120 BPM”与“检测到 120 BPM”区分开。
连续秒时间可以近似保留,导入制谱软件后看到的拍值却依赖固定 tempo 与后续量化。自由速度、rubato、swing 和变拍录音需要另行估计节拍与段落;直接把 MIDI 的 120 BPM 当成歌曲速度会得到错误结论。可播放事件、可编辑多轨与可出版乐谱是三个层级,后两层仍需要声部整理、连音、踏板、和声拼写与表情标注。
长音频通过重叠切片处理时,片段边界必须按全局秒时间归属 onset,并保留跨边界尚未结束的音符。仅把每段 MIDI 顺序拼接会重复边界起音、截断持续音或丢失 track name、program 与鼓通道。验收应检查无悬挂 note、轨道元信息未扁平化,以及同一输入在切片前后没有系统性节拍漂移。
8. 许可信息
MuScriptor 源码采用 MIT 许可,large 权重采用 CC BY-NC 4.0,并通过 Hugging Face 门控页发放。访问页面需要登录、接受页面条款,并确认拥有被转写音乐的必要权利。
源码与权重适用不同许可。取得权重文件不会改变其中的 NonCommercial 条件,允许用途应以固定 revision 的模型卡和许可文本为准。
9. 结论与一手来源
MuScriptor-large 的价值很具体:公开系列中最大、约 13.66 亿参数;面向真实完整混音;支持严格乐器白名单;生成可编辑的 Type-1 多轨 MIDI;作者在私有 D_Test 上报告远高于 YourMT3+ 的结果。它的边界同样具体:缺少公开训练与 headline 测试数据,跨域指标并非全胜,重叠同音受 tokenizer 限制,力度与真实 tempo map 不在输出内,权重许可限定非商业用途。
在这些事实下,“MuScriptor 系列最高质量模型”成立;“已经独立确认的所有音频转 MIDI 通用 SOTA”不成立。后续若出现与 MIROS、YourMT3+ 同音频、同事件定义、同容忍窗口的公开复现,排名才有条件更新。