Fire-stem lydseparasjon: hvorfor Huge-SCNet passer MSS-målet
TelkNets nåværende fire-stem-verktøy bruker Huge-SCNet-4stems V1.2 til å dele et helt miks i vokal, trommer, bass og annet. Artikkelen forklarer valget gjennom MSS-arkitektur, Mel-Band RoFormer-styrker og grenser, SCNet-subbandmodellering og offentlige fire-stem-tall.
MODELLANALYSE / TelkNet
TelkNets nåværende fire-stem-verktøy bruker Huge-SCNet-4stems V1.2 til å dele et helt miks i vokal, trommer, bass og annet. Artikkelen forklarer valget gjennom MSS-arkitektur, Mel-Band RoFormer-styrker og grenser, SCNet-subbandmodellering og offentlige fire-stem-tall.
Arkitekturavveining
Mel-Band RoFormer er sterk på vokaldetaljer gjennom mel-band og RoPE, men fire-stem-separasjon må også beskytte trommer, bass og høyfrekvente instrumentdetaljer i annet.
SCNet-ruten bruker subbandmodellering og sparse compression for å balansere de fire stemmene. Derfor er Huge-SCNet-4stems V1.2 den nåværende modellgrensen.
MVSep Ensemble er nyttig som kvalitetsreferanse, men bør beskrives som en multi-modell-workflow og ikke som én modell.
Referanser
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs