SoulX-Singer 与 YingMusic-Singer-Plus:乐谱控制和旋律参考的两种演唱合成
解释零样本音色提示、MIDI/元数据对齐、旋律编码和条件流匹配,并明确两种模型需要的输入不能互换。

演唱合成
SoulX-Singer 的 score 模式读取 MIDI 派生元数据;YingMusic-Singer-Plus 读取一段提供旋律的歌声和目标歌词。前者要求音符—歌词对齐,后者把旋律从参考音频编码出来。
歌声合成同时受语言与音乐结构约束。HMM 歌声系统、声学模型—声码器管线、扩散与流生成的演变,最终形成 SoulX-Singer 和 YingMusic-Singer-Plus 两种不同的参考音色、旋律与乐谱条件接口。

1. 从参数化歌声到统一生成模型
早期歌声合成将歌词转成音素,把乐谱音高、时长和力度送入 HMM 或深度声学模型,再由传统或神经声码器合成波形。管线结构清晰,时长与音高误差会沿阶段累积;过度平滑的谱包络也让声音缺少真实气声和动态。
WaveNet、GAN 声码器和扩散声学模型逐步提高波形细节,参考编码器又让零样本音色成为可能。新系统倾向在一个生成框架中联合歌词、音高、时值、参考音色与风格,减少显式中间误差,同时增加条件之间的耦合。
2. 歌声数据为何比语音数据更稀缺
完整歌曲容易获取,干净人声、准确歌词、音符级乐谱和歌手授权很少同时存在。自动分离留下伴奏与混响,自动扒谱产生时值和音高误差,歌词文本还可能对应另一发行版本。弱标签规模很大,却会把对齐噪声写进模型。
乐谱与真实演唱之间也没有严格一一对应。歌手会抢拍、拖拍、滑音、转音和换气,一个音节可能跨多个音符。过强对齐会抹去表现力,过弱对齐又难以精确唱谱。SoulX 与 YingMusic 的条件设计应连同数据对齐策略理解。

3. 歌声实验怎样同时观察歌词、音高、音色与音乐性
歌词可懂度可以借助 ASR 的 CER 或 WER 估计,歌唱中的长元音、转音和伴奏残留会让识别器产生额外偏差。F0 指标衡量旋律轮廓,平均误差又可能掩盖短暂八度跳变和颤音被过度平滑。
说话人嵌入观察整体音色,不充分描述歌手在不同音域的共鸣与力度。舒适音区很像目标,极高音却退回训练集中常见音色,平均 SIM 仍可能较高。歌声身份需要跨音域与跨元音样本。
乐谱跟随还应检查音符起止、歌词—音符对齐和伴奏同步。旋律参考路线可能更自然地继承微时值,却不容易局部修改;MIDI 条件更可编辑,也依赖乐谱质量。两者适合不同实验设计。
主观听评最终判断自然度和音乐性,样本选择会强烈影响结论。短副歌难以覆盖转调、快速咬字、极端音域和跨段音色。发布样例、共同测试集与整首歌实验应作为三层证据呈现。
4. 歌声合成从梅尔谱管线走向条件生成器
传统歌声合成把歌词转成音素,把乐谱转成音高和时值,再由声学模型预测梅尔谱,最后交给声码器。各阶段容易调试,却会把时长、音高和音色误差逐层传递。SoulX-Singer 与 YingMusic-Singer-Plus 所在的新路线更倾向把这些条件放进统一生成模型,让声学细节在参考音色与音乐结构的共同约束下形成。
统一模型并没有消除乐谱前端。一个汉字可能跨越多个音符,一个音节也可能包含辅音起音、元音延长与尾音,音素—音符对齐仍是歌声能否唱清的基础。模型只看到歌词和粗略旋律时,必须自行推断发音时值;提供 MIDI 或显式 note duration,则把一部分歧义交给输入。
乐谱驱动与旋律参考在控制上交换了自由度
乐谱驱动给出离散音高、起止时间和歌词对齐,适合修改某个音符或精确配合伴奏。它对乐谱质量敏感,也难以完整表达滑音、抢拍、气声与装饰音。旋律参考直接提供一段演唱轮廓,风格更自然,却把原演唱的节奏与表现一同带入,局部编辑变得困难。
零样本音色参考又增加第三个条件。参考片段太短时,模型可能抓住音高或元音而没有稳定身份;片段太长时,原歌手的房间、情绪和咬字被一并吸收。合成系统的可控性来自这些条件如何解耦,而不是输入项越多越好。
颤音、换气与辅音把歌声问题拉出普通 TTS
说话的基频变化相对自由,歌声必须在目标音符附近维持音高,同时保留颤音、滑音和力度。颤音可以近似为基频上的周期调制 f_0(t)=f_note(t)+a(t)sin(2πr(t)t),其中振幅与速率随歌手和乐句变化。过度平滑会像合成器,调制过强又会显得跑调。
辅音通常短而无明确音高,却决定歌词是否可懂;长元音承载旋律,也最容易暴露音色漂移。换气位置影响乐句结构,不能只由标点决定。歌声模型因此需要同时学习音素时长、连续 F0、能量和声学纹理,普通 TTS 的自然度分不能完整描述这些问题。
发布样例很难覆盖歌曲结构的长尾
短副歌样例通常旋律集中、歌词清晰,无法代表整首歌中的转调、极端音域、连续快速咬字和跨段音色保持。男低音、女高音、童声与强混声对训练分布的要求不同;同一模型在舒适音区的自然度不能外推到所有声部。
歌声还涉及作品、歌词、表演与声音身份等多层权利。开放代码或权重只说明软件和模型的许可,不自动授权输入旋律、歌词或目标歌手身份。技术文章应把模型能力与素材权利分开叙述,避免把“可以生成”写成“可以任意使用”。
歌声训练数据比语音数据更难对齐
公开歌曲容易取得混音,干净人声、准确歌词、音符级乐谱和歌手授权却很少同时存在。自动分离得到的人声带有伴奏残留,自动扒谱会产生音高和时值误差,网络歌词又可能与实际演唱版本不同。训练集规模很大时,这些弱标签噪声会以系统性方式进入模型。
高质量数据需要把音频、歌词、音素、音符、时长与歌手身份对齐。音符边界由乐谱给出,真实演唱可能抢拍或拖拍;强行对齐会把表现力记作错误,完全放开又难以学习符号控制。项目采用何种对齐与过滤策略,会直接影响模型在严格唱谱和自由演唱之间的位置。
评测也因此分成多条轴线:歌词可懂度可用 ASR 错误率近似,音高可比较 F0 或旋律轮廓,音色可用说话人嵌入,音乐性与自然度仍需要听评。每项指标都只能覆盖歌声的一部分,合成一个总分会隐藏跑调但音色相似等典型失败。
社区微调常用少量目标歌手数据强化音色,会缩小音域和语言覆盖,甚至记住训练歌曲的旋律片段。零样本模型与专人微调权重都能生成歌声,却来自不同训练问题;文章和模型列表应标清两者,避免把微调结果归到基础论文。
5. 乐谱条件与旋律参考不能互换
ŝ=G(lyrics, pitch, duration, e_timbre, c_style)pitch音高或旋律轮廓duration音符时值e_timbre授权参考提取的音色
SoulX-Singer 使用歌词、MIDI/元数据和参考音色;YingMusic-Singer-Plus 允许更灵活的旋律提示。pitch 与 duration 是可编辑乐谱条件,参考旋律则携带额外表现信息。
音高命中、音值、歌词清晰度、音色相似和气口是五个独立检查项。只挑一段高音样例,无法证明整首歌的稳定性。
论文、代码与权重可沿 SoulX-Singer / SoulX-Singer paper / YingMusic-Singer-Plus 查阅。
6. 参考音色与乐谱条件的两种路线
零样本参考更依赖提示音频,乐谱条件更强调音符和时值;传统管线则保留显式声学控制。
| 模型或路线 | 公开结果或结构 | 适用范围 |
|---|---|---|
| SoulX-Singer | 参考音色驱动的零样本歌声 | 身份、歌词和长句稳定性 |
| YingMusic-Singer-Plus | 歌词与旋律/乐谱条件 | 对齐、音域和节拍 |
| 传统歌声合成链 | 显式声学特征与声码器 | 控制清楚但跨域自然度有限 |
7. 从 4.2 万小时语料到 MIDI 编辑器,发布链把自动对齐的缺口写在明处
SoulX-Singer 官方资料披露超过 4.2 万小时对齐歌声、歌词和音符数据,覆盖普通话、英语与粤语。规模扩大了歌手、语言和风格分布,也提高了对齐工程的重要性:歌声中的拖音、转音和辅音常跨越多个音符,自动转录很难给出唯一边界。数据量不能抵消错误标签,只会让错误以更稳定的方式进入模型。
项目在 2026 年 2 月公开推理代码、模型与在线演示,随后发布评测集,并在 3 月加入 SVC 权重。仓库同时提供 MIDI Editor,并明确建议人工修正预处理生成的歌词—音符对齐。编辑器由此成为 score-conditioned 合成稳定、可靠工作的重要组成部分。
SoulX 的 F0 与 MIDI 两种控制提供不同自由度:F0 保留连续滑音和颤音,MIDI 给出明确音高与时值。YingMusic-Singer-Plus 用旋律音频代替逐音符乐谱,能够继承更完整的表演细节,也更容易把伴奏、和声或参考歌手的咬字带进条件。共同测试需要固定歌词与目标音色,再分别检查音高、节奏、歌词和身份。
歌声结果不能只用短句试听。主歌到副歌的音域变化、长音尾部、换气位置和跨语言辅音会暴露长程问题。至少应保留整段旋律、音节—音符对齐文件、参考音色、模型 revision 与后处理;人工修改过的 MIDI 也要与原自动结果并存,避免最终成品掩盖模型前端的真实误差。
音色克隆还需要单独记录授权。训练许可、代码许可与某段参考歌声的使用权并不相同;跨语言或改写歌词也可能改变原表演者能够预见的用途。公开样例应标识合成来源,并允许参考提供者撤回或限制后续使用。
结语:歌声合成的核心是语言与旋律同时成立
参考驱动路线保留连续表演与音色,乐谱驱动路线提供逐音符控制。两者交换的是表现自由度和编辑精度,无法用一个自然度分数概括。
歌词可懂度、F0、音色相似与音乐性各有独立指标,歌手身份和作品素材又有独立权利边界。模型能够生成一段歌声,不代表它自动获得旋律、歌词或目标声音的使用许可。
漏字、吞音与重复来自歌词条件,音符进入、滑音和颤音则更多受旋律表示影响。自然度可以很高,内容和音高仍可能分别出错。
调号、BPM、拍号和参考音频截取共同决定生成条件。参考片段若带伴奏或混响,模型可能把环境一起学入输出。
克隆歌手音色需要明确授权;生成结果不得用于冒充、欺骗或绕过表演者权益。
模型不能替代编曲和声乐指导。音域、咬字、情绪与语言习惯仍需人工调整。