VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
arXiv - 2026
比較的クリーンな歌声から、楽譜に近い構造化されたボーカル MIDI を作る標準経路です。固定チェックポイントで、公式のユーザー調整用推論パラメータはありません。
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
入力
完全にサポートされているオーディオ ファイルまたはビデオ ファイル。ソースと必要な結果に一致するモデル プロファイルを選択します。
対応フォーマット
出力
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
ユースケース
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
比較的クリーンな歌声から、楽譜に近い構造化されたボーカル MIDI を作る標準経路です。固定チェックポイントで、公式のユーザー調整用推論パラメータはありません。
GAME は公式の境界、D3PM、推定設定で歌唱を MIDI に変換します。言語の既定値は自動/未指定で、中国語を強制しません。
ノイズや伴奏漏れを含む歌声に強い経路です。現在の公式チェックポイントは主に中国語(普通話)の歌唱で学習されています。
SOME は高速で軽量な歌唱 MIDI 化ルートです。公開モデル設定はなく、任意の MIDI テンポ補正は推論後に行われます。
arXiv - 2026
比較的クリーンな歌声から、楽譜に近い構造化されたボーカル MIDI を作る標準経路です。固定チェックポイントで、公式のユーザー調整用推論パラメータはありません。
ACL - 2024
ノイズや伴奏漏れを含む歌声に強い経路です。現在の公式チェックポイントは主に中国語(普通話)の歌唱で学習されています。
Official technical guide - 2026
GAME は公式の境界、D3PM、推定設定で歌唱を MIDI に変換します。言語の既定値は自動/未指定で、中国語を強制しません。
Official technical guide - 2023
SOME は高速で軽量な歌唱 MIDI 化ルートです。公開モデル設定はなく、任意の MIDI テンポ補正は推論後に行われます。
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
比較的クリーンな歌声から、楽譜に近い構造化されたボーカル MIDI を作る標準経路です。固定チェックポイントで、公式のユーザー調整用推論パラメータはありません。
GAME は公式の境界、D3PM、推定設定で歌唱を MIDI に変換します。言語の既定値は自動/未指定で、中国語を強制しません。
ノイズや伴奏漏れを含む歌声に強い経路です。現在の公式チェックポイントは主に中国語(普通話)の歌唱で学習されています。
SOME は高速で軽量な歌唱 MIDI 化ルートです。公開モデル設定はなく、任意の MIDI テンポ補正は推論後に行われます。
VocalParse、GAME、ROSVOT、SOME は、データセット、言語、ラベル規則、照合許容幅が異なる条件で結果を公開しています。配備する 4 チェックポイントすべてを覆う検証済みの共通公開条件はないため、総合順位は作りません。
| 論文およびベンチマークノート | モデル | MAE_pitch ↓ | 詳細指標 |
|---|---|---|---|
| 正解歌詞 + SOFA タイムスタンプ | ROSVOTTelkNetPaper Table 1 | 0.38 | MAE_note ↓0.45MAE_duration ↓0.40MAE_note-count ↓0.20 |
| 音声のみ | VocalParse 1.7BTelkNetPaper Table 1 | 0.56 | MAE_note ↓0.44MAE_duration ↓0.34MAE_note-count ↓0.11 |
| 音声 + 正解歌詞 | VocalParse 1.7BTelkNetPaper Table 1 | 0.35 | MAE_note ↓0.43MAE_duration ↓0.33MAE_note-count ↓0.11 |
ノイズや伴奏漏れを含む歌声に強い経路です。現在の公式チェックポイントは主に中国語(普通話)の歌唱で学習されています。
| 論文およびベンチマークノート | モデル | COnPOff F1 (%) | 詳細指標 |
|---|---|---|---|
| クリーン | ROSVOTTelkNetPaper Table 1 | 77.4 | COn F1 (%)94.0COff F1 (%)94.5Pitch AOR (%)97.0Melody RPA (%)87.6 |
| MUSAN ノイズ | ROSVOTTelkNetPaper Table 1 | 77.0 | COn F1 (%)93.8COff F1 (%)94.4Pitch AOR (%)97.1Melody RPA (%)87.4 |
VocalParse、GAME、ROSVOT、SOME は、データセット、言語、ラベル規則、照合許容幅が異なる条件で結果を公開しています。配備する 4 チェックポイントすべてを覆う検証済みの共通公開条件はないため、総合順位は作りません。
このツールはメンテナンス中です。後でもう一度お試しください。
ご提案やご要望をこちらに入力して送信してください。すべての声を真摯に受け止め、良いアイデアを実際の機能として実現できるよう努めています。
デモ
VocalParse、GAME、ROSVOT、SOMEを切り替え、譜面寄りの歌声、伴奏残り、速度重視の採譜に対応します。
VocalParse 1.7B