Separación de audio en cuatro stems: por qué Huge-SCNet encaja con MSS
La herramienta actual de cuatro stems de TelkNet usa Huge-SCNet-4stems V1.2 para dividir una mezcla completa en voces, batería, bajo y otros. El artículo explica la elección con la evolución de MSS, los límites de Mel-Band RoFormer, el modelado por subbandas de SCNet y puntuaciones públicas de cuatro stems.
ANÁLISIS DE MODELO / TelkNet
La herramienta actual de cuatro stems de TelkNet usa Huge-SCNet-4stems V1.2 para dividir una mezcla completa en voces, batería, bajo y otros. El artículo explica la elección con la evolución de MSS, los límites de Mel-Band RoFormer, el modelado por subbandas de SCNet y puntuaciones públicas de cuatro stems.
Compromiso de arquitectura
Mel-Band RoFormer favorece el detalle vocal con mel-band y RoPE, pero la separación de cuatro stems también debe proteger batería, bajo y detalles instrumentales de alta frecuencia en otros.
La ruta SCNet usa modelado por subbandas y compresión dispersa para equilibrar los cuatro stems; por eso Huge-SCNet-4stems V1.2 marca el límite actual de la herramienta.
MVSep Ensemble puede usarse como techo de calidad, pero debe describirse como flujo multi-modelo, no como un modelo único.
Referencias
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs