MossFormer2 与 TIGER-speech:多人语音分离和 48 kHz 修复不是同一任务
从置换不变训练、SI-SNR、分离与增强的目标差异出发,梳理 SS 16K、SE 48K、SR 48K 与现实双人场景的处理链。

语音前端
SS 16K 估计“谁说了什么”;SE 48K 估计“同一个人原本有多干净”;SR 48K 补的是带宽。三者的监督目标和输出数量都不同。
语音分离、增强和超分辨率常被合并为“变清楚”,研究史和观测模型却各自独立。从谱减法、波束形成、深度聚类、PIT 到 MossFormer2 与 TIGER,任务分别落在恢复说话人、抑制退化和生成缺失带宽。

1. 三条研究线如何在现代语音前端汇合
语音增强早期依赖谱减、Wiener filter 和统计噪声模型,目标是在单人语音中压低稳定噪声;阵列处理则用波束形成利用空间差异。多人分离从鸡尾酒会问题出发,深度聚类和 PIT 解决混合归属与输出顺序。带宽扩展则估计低通和降采样后缺失的高频信息。
深度网络让三条路线共享编码器—解码器、掩码与波形损失,却没有统一目标。MossFormer2 用门控和长序列模块追踪说话人或增强目标,TIGER 从频带表示压低序列成本。相似骨干可以服务不同任务,采样率和输出数量仍决定训练监督。

2. 从短片段指标到长录音身份连续性
PIT 在每个训练样本内寻找最佳输出排列,避免通道编号产生矛盾监督。长录音被切成多个窗口后,每个窗口仍可能选择不同排列,speaker swap 因而出现在跨块位置。overlap-add 可以平滑波形接缝,却无法自动统一说话人身份。
增强和带宽恢复的长段错误不同。强降噪会逐渐削弱辅音与房间尾音,超分辨率可能在静音或摩擦音处生成统计上合理的高频。16 kHz 分离、48 kHz 增强和 48 kHz SR 处理的频点与目标都不同,速度、损失和听感只能在各自协议中解释。

3. 训练目标与下游用途:更干净不一定更有用
时域 L1/L2 损失鼓励波形接近参考,多分辨率 STFT 损失关注不同尺度的谐波与瞬态,SI-SDR 优化整体目标—误差比例,感知表示则更贴近内容。多目标系数决定模型愿意牺牲的失真类型,不能从骨干名称推断。
ASR 前端往往偏好更强噪声抑制,因为识别器不需要完整房间尾音;播客和影视后期更在意自然度,过度增强会让声音发干。声纹和取证场景还不能接受生成式高频被当成原始特征。相同输出在不同下游有不同合格线。
分离、增强和 SR 串联会传播误差。分离的金属声可能被带宽扩展补成更强高频,增强削弱的说话人线索又会增加后续换人。顺序改变了每个模型看到的分布,应在实验中单独记录。
实时因子也要与片段长度、采样率、说话人数和设备对应。16 kHz 双人分离与 48 kHz 全带增强的频点数量不同,参数少不等于所有算子更快。质量和速度只有在相同输入条件下才形成可解释的取舍。
4. 分离、增强、超分对应三种观测方程
多人分离观察到的是若干说话人波形叠加,目标是恢复每一位说话人;语音增强面对目标语音与噪声、混响的组合;带宽扩展只观察到低通或低采样率信号,需要推断缺失高频。三者都能让声音更清楚,却分别处理加性混合、环境退化和频谱缺失。
数学上可写成 y=Σ_s x_s+n,再按任务决定哪些项是目标。分离要估计全部 x_s,增强通常保留一个目标并压制 n,超分辨率则面对 y=D(h*x),其中高频经滤波 h 与降采样 D 后已经消失。目标不同,训练对、损失与输出声道都随之改变。
MossFormer2 如何在长语音里追踪说话人
语音分离需要同时看短时谐波与长时说话人特征。只看局部帧容易在相近音色之间交换输出,只做全局注意力又会让长录音的计算迅速增长。MossFormer 系列用门控和分块序列建模在两种尺度之间折中,让局部声学线索与较长的说话人连续性共同决定掩码。
训练常采用排列不变目标:对于两个输出,损失在所有目标排列中选择较小者。PIT 解决了“第一路必须对应谁”的标签任意性,却没有保证整段始终不换人。窗口切分、长停顿和第三人短暂插话仍可能造成跨块身份交换,因此需要沿时间观察同一路输出的连续性。
TIGER 的频带压缩针对的是计算冗余
语音频谱在低频有密集谐波,高频更多表现为摩擦音和噪声,均匀地给每个频点同样计算量并不经济。TIGER 一类高效模型通过频带表示与局部、全局序列模块,把容量集中到更有结构的区域,再重建复数频谱或时域波形。效率来自表示压缩,并非跳过高频输出。
模型规模和实时因子应与采样率、片段长度、说话人数和设备一起报告。16 kHz 的双人分离与 48 kHz 的全带增强处理的频点数不同;把前者的速度直接贴到后者,会把输入条件差异误写成架构优势。
带宽恢复生成的是相容高频
电话语音被低通后,擦音与气声的原始相位和细节已经不可逆地丢失。超分辨率模型可以根据低频谐波、音素和训练先验生成听起来合理的高频,但无法证明这些高频就是录音现场曾经存在的波形。感知改善与证据恢复属于不同概念。
前端串联还会传播误差。先做分离再做带宽扩展,分离产生的金属声可能被扩展模型放大成高频纹理;先增强再分离,降噪又可能削弱说话人线索。实验记录应注明顺序和每段输入输出,三种模型不能合并成一个笼统的“音质升级”。
前端模型的训练目标决定了它会牺牲什么
时域损失鼓励波形接近参考,频谱损失更关注不同时间—频率尺度的能量,SI-SDR 强调整体目标与误差比,感知损失则借助预训练表示衡量听觉内容。增强模型若过分追逐噪声抑制,会削掉辅音和房间尾音;分离模型若只优化平均 SDR,可能容忍短暂换人;带宽扩展若强调听感锐度,又可能生成过亮的摩擦音。
多目标训练常写成 L=λ_timeL_time+λ_specL_spec+λ_sepL_sep。系数不是附属参数,它定义了模型更愿意接受哪类失真。不同仓库即使使用相同骨干,只要损失权重、片段长度和混合增广不同,就会形成不同的听感与指标分布。
重叠推理通过窗口函数把相邻输出加权相加,主要减少切片接缝。窗口太短会频繁重置说话人状态,重叠太小容易产生断裂,重叠太大则增加计算并可能把两次不同的身份分配混在一起。推理配置属于结果的一部分,不应从模型名中省略。
语音前端的输出最终还要进入识别、通话或后期制作。ASR 可能偏好强降噪,即使人耳觉得声音发干;制作场景更在意残响自然和声像稳定。模型优劣要回到下游用途,无法由一个“清晰度”标签概括。
5. 说话人顺序未知时的置换不变目标
L_PIT=min_{π∈S_K} Σ_k ℓ(ŝ_k,s_{π(k)})S_KK 个说话人的排列集合π一次输出—参考匹配ℓ单条语音的重建损失
双人分离没有天然的“第一说话人”。PIT 在所有输出—参考排列中选择损失最小的一种,避免模型因通道编号受到矛盾监督。
SS 16K、SE 48K 和 SR 48K 的目标不同:前者拆人,后两者修复一条语音。把三者的分数混成总榜,会把数据、带宽和任务一起混掉。
论文、代码与权重可沿 ClearerVoice-Studio / MossFormer2 SS 16K / MossFormer2 SE 48K 查阅。
6. 三种前端处理对应三种观测问题
重叠说话人、噪声混响和带宽缺失采用不同输入假设与损失函数;三行展示的是问题分工。
| 模型或路线 | 条件与声学表示 | 研究侧重点 |
|---|---|---|
| MossFormer2 SS 16K | 重叠说话人分离 | 串音、身份交换、静音段 |
| MossFormer2 SE 48K | 宽带降噪与去混响 | 辅音损伤、音乐误删、空间尾音 |
| TIGER-speech | 效率取向的频带序列建模 | 耗时与质量必须在同一素材上测 |
7. ClearerVoice-Studio 的版本史说明了“语音变清楚”为何不是单任务
ClearerVoice-Studio 在 2024 年末公开仓库时,主体已经包含增强、分离和目标说话人提取;随后上传预训练权重、增加统一推理接口,并在 2025 年初加入 48 kHz 语音超分辨率。这条时间线体现了工具箱对不同观测问题的持续扩展。仓库目录也把推理、训练和 SpeechScore 分开,保留模型与评价协议的差别。
MossFormer2_SS_16K 面向多人混合,输出数量随说话人数与训练设定变化;MossFormer2_SE_48K 面向单路退化语音;超分模型把有效带宽较低的输入映射到 48 kHz。采样率数字只描述接口和输出带宽,不能说明真实高频是否被恢复。把 16 kHz 文件重采样为 48 kHz 也不会自动成为超分任务的有效输入。
官方 SpeechScore 集成 SNR、PESQ、STOI、DNSMOS 和 SI-SDR 等指标,恰好说明前端没有一个总分。PESQ 与 STOI偏向感知质量和可懂度,SI-SDR 适合有干净参考的分离,DNSMOS 可用于无参考估计却继承评价模型偏差。每个任务应选择与观测方程相符的指标,并保留真实听检。
串联实验还要记录顺序。分离产生的音乐噪声会被超分模型扩展为高频纹理,增强过度则可能抹去说话人线索。可分别测试原始输入、单模型输出和完整串联输出,用同一句语音比较内容、身份、噪声和带宽;只有这样,改进或退化才能定位到具体前端,而不是被“清晰度提升”四个字吞掉。
结语:前端处理应从观测模型开始选择
重叠说话人需要分离,噪声与混响需要增强,缺失高频需要生成式恢复。MossFormer2 与 TIGER 展示了现代序列模型如何复用声学表示,却没有把三种任务合成一项能力。
选择模型时先确定输入退化与目标输出,再讨论采样率、实时因子和损失。带宽扩展产生的是相容高频,不是原录音证据;PIT 解决标签排列,也不保证整段身份连续。
说话人身份可能在分离输出之间交换,擦音、吸气和尾部混响也容易被切掉。增强模型有时把辅音连同键盘声或空调声一起削弱;超分辨率生成的高频则可能只是统计上合理的纹理。
置换不变训练消除了输出顺序对损失的影响,却不保证长录音中的身份连续。speaker swap 常跨时间段出现,采样率、重采样和声道折叠又会改变模型输入。
单通道混音在两个说话人音色和基频高度相近时可能没有唯一解;输出数量也不能从音频中无限可靠地推断。
带宽恢复不是找回录音中真实丢失的每个高频细节。面向取证、声纹或医学用途时,生成的高频成分不能当作原始证据。