VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
arXiv - 2026
Lộ trình mặc định để tạo MIDI giọng hát có cấu trúc như bản nhạc từ phần hát sạch hơn; checkpoint cố định không có tham số suy luận chính thức cho người dùng điều chỉnh.