Séparation audio quatre stems : pourquoi Huge-SCNet correspond à la cible MSS
L’outil quatre stems actuel de TelkNet utilise Huge-SCNet-4stems V1.2 pour diviser un mix complet en voix, batterie, basse et autres. L’article explique ce choix par l’historique MSS, les forces et limites de Mel-Band RoFormer, la modélisation en sous-bandes de SCNet et les scores publics quatre stems.
ANALYSE DE MODÈLE / TelkNet
L’outil quatre stems actuel de TelkNet utilise Huge-SCNet-4stems V1.2 pour diviser un mix complet en voix, batterie, basse et autres. L’article explique ce choix par l’historique MSS, les forces et limites de Mel-Band RoFormer, la modélisation en sous-bandes de SCNet et les scores publics quatre stems.
Compromis d’architecture
Mel-Band RoFormer est fort sur les détails vocaux grâce au mel-band et à RoPE, mais la séparation quatre stems doit aussi protéger la batterie, la basse et les détails haute fréquence dans autres.
La route SCNet utilise la modélisation en sous-bandes et la compression éparse pour équilibrer les quatre stems. C’est pourquoi Huge-SCNet-4stems V1.2 est la limite de modèle actuelle de l’outil.
MVSep Ensemble peut servir de référence haute qualité, mais il doit être décrit comme un workflow multi-modèle plutôt que comme un modèle unique.
Références
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs