Separação de áudio em quatro stems: por que Huge-SCNet combina com MSS
A ferramenta atual de quatro stems da TelkNet usa Huge-SCNet-4stems V1.2 para dividir um mix completo em vocais, bateria, baixo e outros. O artigo explica a escolha pela história de MSS, limites do Mel-Band RoFormer, modelagem por sub-bandas do SCNet e pontuações públicas.
ANÁLISE DE MODELO / TelkNet
A ferramenta atual de quatro stems da TelkNet usa Huge-SCNet-4stems V1.2 para dividir um mix completo em vocais, bateria, baixo e outros. O artigo explica a escolha pela história de MSS, limites do Mel-Band RoFormer, modelagem por sub-bandas do SCNet e pontuações públicas.
Escolha de arquitetura
Mel-Band RoFormer é forte em detalhes vocais por causa de mel-band e RoPE, mas a separação em quatro stems também precisa proteger bateria, baixo e detalhes de alta frequência em outros.
A rota SCNet usa modelagem por sub-bandas e compressão esparsa para equilibrar os quatro stems; por isso Huge-SCNet-4stems V1.2 é o limite de modelo atual.
MVSep Ensemble pode servir como referência de teto de qualidade, mas deve ser descrito como workflow multi-modelo, não como um único modelo.
Referências
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs