Поділ аудіо на чотири стеми: чому Huge-SCNet відповідає цілі MSS
Поточний інструмент TelkNet для чотирьох стемів використовує Huge-SCNet-4stems V1.2, щоб розділити повний мікс на вокал, барабани, бас та інше. Стаття пояснює вибір через історію MSS, межі Mel-Band RoFormer, субсмугове моделювання SCNet і публічні оцінки.
ОГЛЯД МОДЕЛІ / TelkNet
Поточний інструмент TelkNet для чотирьох стемів використовує Huge-SCNet-4stems V1.2, щоб розділити повний мікс на вокал, барабани, бас та інше. Стаття пояснює вибір через історію MSS, межі Mel-Band RoFormer, субсмугове моделювання SCNet і публічні оцінки.
Архітектурний компроміс
Mel-Band RoFormer сильний у вокальних деталях завдяки mel-band і RoPE, але поділ на чотири стеми також має зберігати барабани, бас і високочастотні деталі в іншому.
Маршрут SCNet використовує субсмугове моделювання і sparse compression, щоб збалансувати чотири стеми. Тому Huge-SCNet-4stems V1.2 є поточною межею моделі.
MVSep Ensemble можна використовувати як орієнтир верхньої якості, але його слід описувати як workflow кількох моделей, а не як одну модель.
Джерела
- huggingface.co/Aname-Tommy/Huge-SCNet-4stems/tree
- ZFTurbo pretrained models
- MVSep Multisong Leaderboard
- mvsep.com/algorithms/6
- mvsep.com/algorithms/49
- lucidrains/BS-RoFormer
- Kimberley Jensen Mel-Band Roformer Vocal Model
- Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
- sigsep.github.io/datasets/musdb.html
- SCNet
- github.com/thuhcsi/SCNet
- Mel-Band RoFormer
- BS-RoFormer
- HTDemucs