Four-Stem-Audiotrennung: warum Huge-SCNet zum MSS-Ziel passt
Das aktuelle TelkNet-Werkzeug für vier Stems nutzt Huge-SCNet-4stems V1.2, um einen kompletten Mix in Vocals, Drums, Bass und Other zu trennen. Der Artikel erklärt die Wahl über MSS-Architektur, Mel-Band-RoFormer-Grenzen, SCNet-Subband-Modellierung und öffentliche Vier-Stem-Werte.
MODELLANALYSE / TelkNet
Das aktuelle TelkNet-Werkzeug für vier Stems nutzt Huge-SCNet-4stems V1.2, um einen kompletten Mix in Vocals, Drums, Bass und Other zu trennen. Der Artikel erklärt die Wahl über MSS-Architektur, Mel-Band-RoFormer-Grenzen, SCNet-Subband-Modellierung und öffentliche Vier-Stem-Werte.
Architekturabwägung
Mel-Band RoFormer ist durch mel-band-Gruppierung und RoPE stark bei Gesangsdetails, doch Four-Stem-Trennung muss auch Drums, Bass und hochfrequente Instrumente in Other schützen.
Die SCNet-Route nutzt Subband-Modellierung und sparse compression, um die vier Stems ausgewogener zu behandeln. Deshalb ist Huge-SCNet-4stems V1.2 die aktuelle Modellgrenze dieses Werkzeugs.
MVSep Ensemble ist als Qualitätsobergrenze hilfreich, sollte aber als Multi-Modell-Workflow und nicht als einzelnes Modell beschrieben werden.
Quellen
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs