四轨音频分离技术解析:从 MSS 架构演进看 Huge-SCNet 的模型取舍
TelkNet 当前四轨工具使用 Huge-SCNet-4stems V1.2,把完整混音分离为 Vocals、Drums、Bass 和 Other。文章从 MSS 架构演进、Mel-Band RoFormer 的强项与局限、SCNet 的子带建模和公开四轨分数解释这次模型取舍。
TelkNet 当前四轨工具使用 Huge-SCNet-4stems V1.2,把完整混音分离为 Vocals、Drums、Bass 和 Other。文章从 MSS 架构演进、Mel-Band RoFormer 的强项与局限、SCNet 的子带建模和公开四轨分数解释这次模型取舍。
技术解析 / Audio MSS
音乐源分离(Music Source Separation, MSS)的评价目标已经从“分得出来”转向“分轨是否可编辑”。重混、扒带、采样、Music-to-MIDI、空间音频重编和素材清理都要求 stem 经得住二次处理,并能直接进入 DAW 继续编曲。
标准四轨分离的目标,是把完整混音拆成人声、鼓、贝斯和其它器乐四个标准声部,而不是简单输出“人声 + 伴奏”。这意味着模型必须同时处理主唱语义、鼓组瞬态、低频骨架和高频器乐边界。一个模型在人声上很强,不代表它在四轨里一定最适合;一个平台 ensemble 很强,也不代表它是一个可下载、可复现、可单体比较的模型文件。
Huge-SCNet-4stems V1.2 是一份面向标准四轨输出的公开 checkpoint。MVSep Ensemble、SCNet XL IHF、BS-RoFormer、Mel-Band RoFormer 和 HTDemucs 分属架构、公开权重或平台级工作流,比较时需要保留这些层级差异。
传统二轨分离把结果分成“人声”和“伴奏”,适合卡拉 OK、翻唱、简单混音和清唱提取。标准四轨会继续拆开伴奏,得到 Drums、Bass 和 Other 三个结构不同的声部,主唱只是四个输出之一。
Vocals 承载主唱语义、咬字、气声、和声与混响尾巴;Drums 负责底鼓、军鼓、通鼓、镲片以及打击乐瞬态;Bass 提供低频骨架、基音和部分泛音;Other 收纳吉他、钢琴、弦乐、合成器、管乐、采样音效和所有没有被前三类覆盖的器乐。Other 内部成分最杂,通常也是四轨任务里最容易出错的一轨。
这个口径来自音乐源分离长期使用的基准传统。MUSDB18 / MUSDB18-HQ 数据集围绕 vocals、drums、bass 和 other 组织 stem,社区讨论 4-stem 模型时,通常默认就是这个输出目标。平时听到的“伴奏”,在数学上更接近 drums、bass 和 other 三条轨道重新相加后的结果,而不是一个天然存在的单独声源。
这一区分会直接影响模型选择。如果只是做无人声伴奏,人声分离模型足够直接;如果要单独练鼓、分析贝斯线、把吉他或钢琴作为采样素材继续加工,二轨模型就会把太多东西混在一起。四轨分离的价值在于给后期制作留下可操作空间,而不是只交付一个“听起来像伴奏”的文件。
标准四轨输出对应 vocals、drums、bass、other,而非“主唱 / 伴奏 / 节奏 / 其它”一类含糊口径。人声、鼓、贝斯和其它器乐各自独立后,重混、扒带、降噪、采样或转写才能沿着明确的 stem 边界继续处理。
音频源分离的本质,是在时间和频率交织的声学空间里,把一个混合波形重新拆回多个声源。早期模型已经能给出可听结果,但常见问题也很稳定:人声串入其它轨道、鼓点残留在伴奏里、贝斯和底鼓互相糊住、高频泛音被抹平,或者密集编曲高潮段出现电子感 artifacts。
U-Net 和 VR 类路线把 STFT 后的频谱当成图像处理,解决了“能不能分”的问题,但它们更擅长局部纹理,不擅长理解长距离音乐结构。HTDemucs 和 MDX-Net 把时域与频域结合起来,重建质量明显提升,也让很多产品第一次进入可用阶段。到了 BS-RoFormer 和 Mel-Band RoFormer,Transformer、频带拆分和 RoPE 开始让模型更擅长追踪跨时间的频率轨迹,尤其在人声、和声、滑音和长延音上表现突出。
SCNet 把关注点转向混合频谱的信息密度:保留主要信号区域,压缩低信息区域,同时保护不同声部的边界。四轨任务需要在四个 stem 之间分配建模能力,这种处理方式比单独优化人声更贴近任务本身。
| 阶段 | 代表路线 | 核心进展 | 仍然存在的问题 |
|---|---|---|---|
| 2020-2021 | VR Architecture / U-Net | 把频谱图当成图像处理,让基础人声/伴奏分离变得实用。 | 局部卷积窗口难以覆盖长程音乐结构和相位关系。 |
| 2022-2023 | HTDemucs / MDX-Net | 结合波形域和频谱域建模,重建质量与稳定性提高。 | 密集高潮、重混响和复杂瞬态仍可能产生 artifacts。 |
| 2023-2024 | BS-RoFormer / Mel-Band RoFormer | 使用频带拆分、RoPE 和更强的时频建模处理人声、和声、滑音与延音。 | 人声优势不等于所有四轨乐器都能被同样稳地拆开。 |
| 2024-2026 | SCNet / Huge-SCNet | 通过子带建模和稀疏压缩,把算力集中到信息更密集的时频区域。 | 目标是标准四轨,不应被混写成六轨或平台 ensemble。 |
这条演进线解释了一个容易被忽略的判断:模型选型不能只看“谁在人声上听起来最干净”。四轨分离还要保护鼓的瞬态、贝斯的基频与泛音、人声边界,以及 Other 里的高频乐器细节。任何一项被牺牲,都会在后期编辑里变成真实成本。
SCNet 论文在 2024 年 1 月公开,Huge-SCNet-4stems V1.2 则是后续社区权重和产品选型语境里的公开 checkpoint。时间线据此把 SCNet 架构与后续权重放在 2024-2026 区间。
Mel-Band RoFormer 由字节跳动 Speech, Audio, and Music Intelligence(SAMI)团队提出。论文作者为 Ju-Chiang Wang、Wei-Tsung Lu 和 Minz Won,机构署名按论文首页的 SAMI, ByteDance 记录。
它的核心吸引力在于把频带组织方式改得更接近人耳。人类对频率的感知不是线性的,100Hz 到 200Hz 的变化很明显,但 10000Hz 到 10100Hz 的变化就不一定容易察觉。Mel-scale 正是声学里常用的非线性频率尺度。Mel-Band RoFormer 把频谱 bins 映射到按梅尔刻度组织的重叠子带里,让中低频区域获得更细的表达。
这对人声尤其有利。主唱基频、共振峰、辅音、气声、颤音、滑音和许多混响尾巴都与中低频及相邻频段的连续变化有关。Mel-band 投影让模型更容易追踪这些变化,而不是把它们看成一堆孤立的频谱块。对清唱、人声/伴奏、主唱/和声这类任务,它的优势非常直接。
RoFormer 部分采用 RoPE,也就是旋转位置编码。它分别作用在时间序列和子带序列上,让注意力分数显式保留相对位置关系。滑音、延音与跨小节重复都包含连续的位置变化;RoPE 对这些现象的帮助是结构层面的解释,论文直接验证的是有无 RoPE 的受控模型差异,并未单独报告滑音或长和声指标。
设 qm=RΘ,mdq、kn=RΘ,ndk。旋转后的 query 与 key 内积可写为:
内积只显式依赖相对位移 n−m。BS-RoFormer 在时间轴和子带轴上分别使用 RoPE;论文消融显示,移除 RoPE 后模型训练更慢、SDR 明显下降。至于滑音、延音与和声连续性,可以把它们视为这种相对位置建模的工程解释,不能写成论文单独测得的分项结论。
它的名字基本就是技术路线本身:Mel 指梅尔频带,Ro 指 RoPE 旋转位置编码,Former 指 Transformer / 轴向注意力。需要特别澄清的是,SDX23 第一名的核心系统是它的前身 BS-RoFormer;Mel-Band RoFormer 是后续把 band-split 改成 mel-band 映射后的改进路线。两者关系很近,但不能把比赛结果、论文改进和社区权重混成一句话。
三个数字来自不同训练条件或评测集合:9.80 与 11.99 属于论文 MUSDB18HQ 表,9.97 属于 SDX23 私有榜单。它们能说明 BS-RoFormer 的研究与比赛表现,却不能拼成 Mel-Band RoFormer 的“官方四轨成绩”。
BS-RoFormer 不是直接在波形上“认出人声”。它先对混音做短时傅里叶变换,把波形变成复数频谱 X;频带投影与分层 Transformer 在这个时频表示上估计复数掩码 M̂;掩码与原混音频谱逐点相乘后,再经逆 STFT 回到目标波形。Mel-RoFormer 改动的重点位于 fθ 内部:它把启发式、互不重叠的 band split 换成按 mel scale 组织的重叠频带,而不是另起一套解码器。
论文与可部署权重之间还隔着完整的训练工程。论文披露了数据构成、8 秒训练片段、随机增益与静音替换等增广、AdamW、学习率以及部分精度设置,但没有公开内部训练歌曲、原始 optimizer state 或最终比赛 checkpoint。社区权重和平台仍要自行决定完整数据配方、分块长度、overlap 与后处理;共享架构并不等于共享最终性能。
2023 年 9 月,BS-RoFormer 论文公开。论文记录了 SAMI-ByteDance 参加 SDX23 Music Separation Track 的系统:MUSDB18HQ 加 500 首内部歌曲训练出的 L=12 模型拿到私有榜单第一名;同一篇论文还用只训练 MUSDB18HQ 的小模型做消融,让 RoPE、分带方式和 overlap & average 的作用可以被单独比较。这里公开的是结构、训练条件和结果表。论文页面没有附上原始 SDX23 checkpoint,也没有链接 ByteDance/SAMI 官方训练仓库或完整推理包。
2023 年 10 月出现的 Mel-Band RoFormer 不是另起炉灶。作者沿着前一篇论文留下的问题继续往前走:BS-RoFormer 的 62 个非重叠频带来自经验设计,低频切得很细,却缺少统一的声学坐标。Mel-RoFormer 把前端换成 60 个相互重叠的 Mel bands,保留 RoPE、inner-band / inter-band Transformer 和复数掩码重建。两篇论文前后只隔约一个月,后者更像一次针对频带投影的公开修订,而不是随论文发布的新一代官方模型包。
可运行代码是在论文之外逐渐拼起来的。lucidrains 的 BS-RoFormer 仓库把公式和结构图写成 PyTorch 类,同时在 README 里直接邀请社区一起复现公开的音乐分离器。这个实现后来增加了立体声、多 stem 输出和 Mel-Band 版本;它让研究结构可以实例化、前向计算和训练,但不会自动还原比赛使用的内部歌曲、训练时长、优化器状态和最终参数。
接下来出现的 Music-Source-Separation-Training 更像一间公共训练工坊。模型类被接入统一的数据读取、增广、训练、验证、断点续训、分块推理和 ensemble 脚本,配置文件开始记录 FFT、hop、batch、loss、chunk 与 overlap。仓库注明 RoFormer 结构由 lucidrains 按论文复现,也开放了提交模型的入口。于是同一个网络骨架可以被训练成人声/伴奏、四轨、鼓组细分或其它专用模型;这些方向并不存在唯一的“标准权重”。
Kimberley Jensen 的人声模型让这段历史第一次有了容易下载和复现的具体样本。仓库说明该权重使用更多数据训练,训练代码来自 ZFTurbo,默认 chunk 为 352800 个采样点,也就是 8 秒;推理时提高 num_overlap 可以减轻音频块重新拼接处的伪影,同时会拉长处理时间。其致谢还记录了数据贡献者。一个 checkpoint 的听感由此落到了数据、窗口、重叠和训练资源这些细节上,不再只是论文里的架构名。
MVSep 当前算法页把首批高质量公开权重归于 Kimberley Jensen,并说明后续版本在开放权重上修改、继续训练;同页还列出 Bas Curtiz、unwa、becruily、gabox 等不同版本。它们有的追求更少人声串音,有的保留更多伴奏完整度,也有页面直接标注“更饱满但更嘈杂”。这已经是一棵不断分叉的权重谱系:共享 Mel-Band RoFormer 结构,不共享训练集、目标函数、微调历史或最终听感。
| 文案里出现的名称 | 它能说明什么 | 还要补哪项来源 |
|---|---|---|
| BS-RoFormer / Mel-Band RoFormer | 网络采用哪种频带投影、RoPE 与双轴序列建模。 | 具体 checkpoint 的训练者、数据、目标 stem 和评测集。 |
| 某个公开 checkpoint 文件 | 一组可以下载和推理的参数,通常还需要匹配 config。 | 它是否来自论文作者、社区训练或后续微调,不能从文件名猜。 |
| 平台中的 Mel-Band / BS-RoFormer 工具 | 平台已经选定权重、分块、重叠和输出格式。 | 平台实测分数不能改写成 SDX23 或论文原始成绩。 |
这段发展史会直接改变产品文案。同一架构名下面可能同时存在比赛系统、论文消融模型、人声专用 checkpoint、四轨 checkpoint 和平台融合版本。准确写法至少要让读者看出三件事:架构由谁提出,当前权重从哪里来,平台用什么推理配置交付结果。缺少其中一项,“ByteDance 官方模型”“Mel-Band 四轨比赛分数”这类说法就很容易把不同年代、不同产物拼在一起。
2023 年论文里的受控对照最适合判断 Mel-band 改动。两组模型都只使用 MUSDB18HQ,不加额外歌曲;同一深度下,主要变量是前端从 BS-RoFormer 的非重叠启发式频带,换成 60 个互相重叠的 Mel bands。MVSep 页面、人声榜和其它社区权重使用了不同训练条件,不能拼进这组实验。
各 stem 的变化方向并不一致。L=6 时,人声从 10.78 提高到 11.21 dB,鼓从 9.61 提高到 9.91 dB;bass 从 11.43 降到 9.64 dB,Other 从 7.86 小幅降到 7.81 dB,平均值由 9.92 降为 9.64 dB。L=9 时,人声提高 0.58 dB、Other 提高 0.13 dB,鼓下降 0.32 dB;bass 因训练进展过慢没有报告,平均值也无法计算。
| 论文模型(MUSDB18HQ,无额外数据) | Vocals | Bass | Drums | Other | 平均 SDR | 参数量 |
|---|---|---|---|---|---|---|
| BS-RoFormer L=6 | 10.78 | 11.43 | 9.61 | 7.86 | 9.92 | 72.2M |
| Mel-RoFormer L=6 | 11.21 | 9.64 | 9.91 | 7.81 | 9.64 | 84.2M |
| BS-RoFormer L=9 | 11.02 | 11.58 | 9.66 | 7.80 | 10.02 | 82.8M |
| Mel-RoFormer L=9 | 11.60 | 未报告 | 9.34 | 7.93 | 未报告 | 94.8M |
论文把原因指向频带映射:BS-RoFormer 的人工分带在低频切得更细,恰好适合能量集中于低频的 bass;Mel 映射对人声更友好,却不是所有音色的完美坐标。这个结论比“Mel 更符合人耳,所以一定更强”更有工程价值,因为它提醒部署者按目标 stem 选权重,而不是按架构热度选模型。
SCNet(Sparse Compression Network,稀疏压缩网络)从另一个角度处理音乐源分离:它更关注频谱内部的信息分布,而不是把所有表达能力都押在某一个听感优势区。论文作者包括 Weinan Tong、Jiaxu Zhu、Jun Chen、Shiyin Kang、Tao Jiang、Yang Li、Zhiyong Wu 和 Helen Meng;首页列出的机构包括清华大学深圳国际研究生院、Skywork AI、鹏城实验室和香港中文大学。
它的核心思路之一是子带建模。不同乐器在频谱里的位置、能量和稀疏性并不相同:贝斯主要占低频,但泛音会向上延伸;鼓有极短瞬态,也有镲片高频空气感;人声有清晰语义,也有混响尾巴;Other 更复杂,可能同时包含吉他、钢琴、弦乐、合成器和效果声。把这些都压进同一种粗粒度表示里,必然会造成互相串扰。
SCNet 通过稀疏压缩削减有效信号较少、信息密度较低的时频区域,把建模能力集中到拥挤、容易混淆的声部边界。不同频段获得的处理力度并不平均,目标是在保留有效信息的同时降低计算冗余。四轨任务最终要让多个 stem 同时可用,单独把某一轨做得很漂亮仍不够。
SCNet 论文把完整系统描述为 audio encoder、基于 dual-path RNN 的 separation network 和 audio decoder。编码器把混合音频映射到频域子带表示,分离网络沿时间和频率建模,解码器再重建目标 stem。放到产品语言里,它的价值就是:鼓的瞬态不要被糊掉,贝斯不要和底鼓粘住,人声不要带太多伴奏残留,Other 也不要变成一团高频雾。
Huge-SCNet-4stems V1.2 属于这条路线。它把输出固定为人声、鼓、贝斯和 Other,四个 stem 可以分别进入再混音、扒谱与后期处理;这种均衡目标与只追求人声干净的二轨模型并不相同。
SCNet 论文给出稀疏压缩网络架构、子带设计和 MUSDB18-HQ 结果;Huge-SCNet-4stems V1.2 是 Hugging Face 上可下载的四轨 checkpoint,文件名为 huge_scnet_4stems_v1.2.ckpt。这份社区权重不能沿用 SCNet 论文的 9.0 dB MUSDB18-HQ 结果,二者的数据与发布主体不同。
论文作者公开了 thuhcsi/SCNet 实现仓库,但仓库说明训练代码仍待补齐,并建议临时使用 HTDemucs、Music-Source-Separation-Training 或 SCNet-PyTorch 等训练框架。Huge-SCNet-4stems V1.2 的完整表述是“基于 SCNet 路线的公开四轨 checkpoint”,其来源不等同于论文作者的官方模型包。
MVSep Ensemble 2025.06.30 是平台级多模型流程。公开算法页按 stem 和任务特点组合多种模型:人声路径可能使用 UVR-MDX-NET、Demucs、MDX23C、VitLarge23、BS Roformer、Mel Roformer、SCNet XL,贝斯、鼓和 Other 又可能调用不同 Demucs 或相关模型。它不属于单一模型家族。
这种 ensemble 的强项来自分工:把人声强的材料交给人声专家,把低频和瞬态密集材料交给更强的乐器分离器,再融合结果。它可以作为质量上限参考,但它不是一个 checkpoint,也不是用户下载一个文件就能复现的单体模型。把它放进“单体模型排行榜”里,会让比较对象从模型架构变成托管工作流。
MVSep 页面把 2025.06.30 版 ensemble 的平均 SDR 列到 13.67,这个数字可以说明托管平台把多条模型链路组合后的上限,但不能拿来和单体 checkpoint 直接同列。它背后包含人声、伴奏、贝斯、鼓、Other 以及额外细分乐器路径的融合逻辑,工程含义更接近“服务端流水线”,不是“一个模型文件”。
MVSep Ensemble 描述的是多模型组合后的平台上限;Huge-SCNet-4stems V1.2 描述的是当前四轨工具选用的公开单体 checkpoint。两者的评测对象和复现成本都不同。
下表使用公开可追溯的四轨参考数字。SDR 越高,通常表示目标 stem 相对参考轨的失真更少,但平均 SDR 不能替代试听,也不能把每个 stem 压成一个答案。一个模型可能贝斯和鼓很强,另一个模型可能人声更干净;Other 尤其困难,因为它包含许多乐器,且乐器类型会随歌曲风格大幅变化。
这张表描述的是标准四轨任务中的整体取舍。四个 stem 都保持可编辑,与把某一轨做到听感上最突出,是两种不同的优化方向;前者更接近分轨素材,后者可能更适合一次性试听。
表格口径也做了收窄:Huge-SCNet-4stems V1.2 的 10.02 dB 来自公开 HF / MVSep 参考行;SCNet XL IHF、BS Roformer 和 HTDemucs4 使用 ZFTurbo / MVSep Multisong 公开行。它不是 SCNet 论文 MUSDB18-HQ 表、不是 Mel-Band 人声页,也不是 MVSep Ensemble 页面的托管工作流分数混排。
| 模型 / 架构路线 | 平均 4-Stem SDR | Vocals | Drums | Bass | Other | 定位说明 |
|---|---|---|---|---|---|---|
| Huge-SCNet-4stems V1.2 | 10.02 dB | 9.6073 dB | 11.7422 dB | 12.0639 dB | 6.6485 dB | 当前四轨工具核心模型,四个 stem 的综合平衡度突出。 |
| SCNet XL IHF 4-stem | 9.92 dB | 9.68 dB | 11.58 dB | 11.94 dB | 6.48 dB | 强单体四轨候选,鼓和贝斯表现扎实,是重要参考线。 |
| BS Roformer 4-stem | 9.38 dB | 9.19 dB | 11.29 dB | 11.08 dB | 5.96 dB | RoFormer 路线的四轨参考,可观察到 Other 轨上的取舍。 |
| HTDemucs4 | 9.16 dB | 8.24 dB | 10.88 dB | 11.76 dB | 5.74 dB | 成熟经典基线,生态熟悉度高,但已不是当前单体四轨质量上限。 |
Huge-SCNet-4stems V1.2 的核心价值,在于它保持公开单体模型、标准四轨输出和可追溯参考分数的前提下,实现了各个声部的最大公约数平衡。SCNet XL IHF 仍是重要对照,MVSep Ensemble 仍是质量上限参考,但它们回答的是不同问题。
四轨和六轨经常被混在一起讨论,但它们并不是同一件事。四轨任务的核心是平衡:把混音拆成人声、鼓、贝斯和 Other,并尽量让每一轨都能继续编辑。六轨任务则进一步把 Other 拆开,通常会额外关注吉他、钢琴等器乐细分目标。
这会改变模型选择。六轨分离对吉他扫弦、钢琴击弦、键盘纹理和高频泛音更敏感,也更容易在边界处出现误判。六轨工具使用 BS Roformer SW 6-stem,这是和 Huge-SCNet-4stems V1.2 不同的模型,也是不一样的产品承诺。四轨工具不能承诺六轨结果,六轨模型也不能被简单拿来替代四轨判断。
RoFormer 的架构表现、Mel-Band 的人声优势、SCNet 的四轨均衡性和 MVSep Ensemble 的托管流程上限分别对应不同问题。架构、输出目标、权重来源和工作流形态构成四条独立证据线。
音频分离模型在时间、频率和信息稀疏度上的取舍,决定了不同 stem 的边界与后期可编辑性。热门架构名本身不能代替任务适配判断。
Huge-SCNet-4stems V1.2 围绕标准四轨的可编辑性展开。Mel-Band RoFormer 代表人声分离的重要架构路线,MVSep Ensemble 代表托管多模型流程的质量参照;前者是可下载 checkpoint,后者是组合工作流。二者与 SCNet 论文的研究结果都应保留各自边界。