Separazione audio a quattro stem: perché Huge-SCNet è adatto al target MSS
Lo strumento TelkNet per quattro stem usa Huge-SCNet-4stems V1.2 per separare un mix completo in voci, batteria, basso e altro. L’articolo spiega la scelta tramite storia MSS, punti di forza e limiti di Mel-Band RoFormer, modellazione a sottobande SCNet e punteggi pubblici.
ANALISI DEL MODELLO / TelkNet
Lo strumento TelkNet per quattro stem usa Huge-SCNet-4stems V1.2 per separare un mix completo in voci, batteria, basso e altro. L’articolo spiega la scelta tramite storia MSS, punti di forza e limiti di Mel-Band RoFormer, modellazione a sottobande SCNet e punteggi pubblici.
Scelta architetturale
Mel-Band RoFormer è forte sui dettagli vocali grazie a mel-band e RoPE, ma la separazione a quattro stem deve proteggere anche batteria, basso e dettagli ad alta frequenza in altro.
La via SCNet usa modellazione a sottobande e compressione sparsa per bilanciare i quattro stem; per questo Huge-SCNet-4stems V1.2 è il confine attuale dello strumento.
MVSep Ensemble è utile come riferimento di qualità massima, ma va descritto come workflow multi-modello e non come modello singolo.
Riferimenti
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs