Separacja audio na cztery stemsy: dlaczego Huge-SCNet pasuje do celu MSS
Aktualne narzędzie TelkNet do czterech stemsów używa Huge-SCNet-4stems V1.2, aby podzielić pełny miks na wokal, perkusję, bas i pozostałe. Artykuł wyjaśnia wybór przez historię MSS, mocne strony i ograniczenia Mel-Band RoFormer, modelowanie subband SCNet oraz publiczne wyniki.
ANALIZA MODELU / TelkNet
Aktualne narzędzie TelkNet do czterech stemsów używa Huge-SCNet-4stems V1.2, aby podzielić pełny miks na wokal, perkusję, bas i pozostałe. Artykuł wyjaśnia wybór przez historię MSS, mocne strony i ograniczenia Mel-Band RoFormer, modelowanie subband SCNet oraz publiczne wyniki.
Kompromis architektury
Mel-Band RoFormer dobrze chroni szczegóły wokalu dzięki mel-band i RoPE, ale separacja czterech stemsów musi też zachować perkusję, bas i wysokoczęstotliwościowe detale w pozostałych.
Ścieżka SCNet używa modelowania subband i sparse compression, aby równoważyć cztery stemsy. Dlatego Huge-SCNet-4stems V1.2 jest aktualną granicą modelu narzędzia.
MVSep Ensemble jest użyteczny jako punkt odniesienia jakości, ale należy opisywać go jako workflow wielu modeli, nie jeden model.
Źródła
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs