LongCat-AudioDiT 3.5B:把说话人条件写进音频扩散 Transformer
从条件扩散、APG/CFG、32 次函数评估和 Seed speaker similarity 出发,区分相似度、自然度与识别准确率。

论文精读 / 零样本语音克隆
LongCat-AudioDiT 3.5B 面向文本转语音和零样本克隆。参考音频先被压成说话人和韵律条件,扩散 Transformer 再生成新的声学潜变量。它的 Seed 数字适合讨论克隆相似度,不能替代 dots.tts 多语言通用模式的自然度、字错率和延迟检查。
拼接语音、声学模型—声码器管线、神经 codec 和连续流生成代表了 TTS 表示的几次变化。LongCat-AudioDiT 3.5B 重新组织文本、参考音频与声学轨迹,参数量、声音相似、内容准确和生成延迟仍要放回各自指标。

1. TTS 的三次表示迁移:波形单元、梅尔谱与神经潜变量
拼接式 TTS 从录音库选择音素或半音节片段,清晰度较高,却在跨片段韵律和新说话风格上受限。统计参数模型用 HMM 等方法预测声学参数,提高了可控性,声音也因平均化而显得平滑。Tacotron 类序列到序列模型随后把文本对齐与梅尔谱预测合并,神经声码器再把谱转换为波形。
神经 codec 与连续声学 VAE 改变了中间表示。离散 token 适合语言模型逐步预测,连续潜变量保留更细音色并适合扩散或流匹配。AudioDiT 属于后一条路线:Transformer 在时间条件下估计声学状态变化,参考音频提供身份与风格,解码器负责把潜变量还原为可播放声音。

2. 大规模语料并不自动带来可靠的长文本
长语音训练首先依赖字幕、说话人切分和文本规范化。网页、播客与有声书扩大语言和风格覆盖,也带来错字、重复、背景音乐与跨说话人切片。数字、日期、缩写和代码混排要在进入模型前确定读法;文本前端写错后,声学生成器只会更自然地说出错误内容。
参考片段同时携带身份、房间、麦克风和情绪。跨设备、跨环境的同说话人样本能够帮助解耦,固定录音条件则容易让模型把混响当成身份。3.5B 参数提供容量,长段稳定仍由语料切分、上下文长度、采样策略和解码器共同决定。
3. 评测与延迟:一段自然语音如何被拆成多项证据
WER 或 CER 借助外部 ASR 判断内容错误,识别器本身对口音、噪声和语言的偏差会进入分数。说话人 SIM 计算嵌入距离,适合观察身份轮廓,却看不到漏词、停顿和局部爆音。MOS 综合听感,结果又依赖听者数量、播放设备和样本选择。
首包延迟描述何时能够开始播放,实时因子比较总计算时间与音频时长,完整生成耗时还包含文本前端、参考编码和波形解码。流式模型可能很快给出第一包却在后段累计,自回归或流模型的速度也受批量和采样步数影响。
零样本评测必须保留参考时长、参考文本是否已知以及目标语言是否跨语种。干净同语言提示与带噪跨语言提示虽然都叫 voice cloning,难度完全不同。参数量和语料小时数无法替这些条件完成对照。
长文本还要按句子或语义块切分。固定字符切分会拆开数字和缩写,独立句子生成又会产生音色与响度跳变。重用历史可以维持连续,也会传播前文错误。模型报告与实际长文结果之间,仍有切分和拼接这一层工程变量。
4. AudioDiT 把语音生成写成连续声学轨迹
语音生成可以预测离散 codec token,也可以在连续声学潜空间里学习从噪声到目标语音的轨迹。AudioDiT 选择后者:文本提供内容条件,参考音频提供说话人和韵律线索,DiT 在时间 t 上估计声学状态的速度。采样时从高斯噪声出发,沿常微分方程积分得到连续潜变量,再由解码器还原波形。
3.5B 代表模型规模,不能单独解释声音质量。参数容量需要和语料覆盖、声学表示、文本规范化以及采样步数一起看。长文本中的数字、英文缩写和稀有人名首先受到文本前端影响;呼吸、停顿与句间音色则更依赖参考条件和长上下文训练。
参考音频同时携带身份、房间与说话方式
零样本克隆希望从短提示中提取说话人身份,可提示音频里还混有麦克风频响、房间混响、背景噪声、情绪与语速。编码器不会天然知道哪些因素该保留。训练数据若常把同一说话人与固定录音环境绑定,模型就可能把环境也当成身份的一部分。
因此,相似度很高的输出可能同时复制了提示中的鼻音、压缩失真或远场感。反过来,强降噪的参考会丢掉细小音色线索,使输出自然却不像目标说话人。身份保持与录音条件解耦需要跨设备、跨房间、跨情绪的同说话人数据,单靠更长提示不能解决。
扩散式语音与自回归 codec 各自积累误差
自回归系统按 token 顺序生成,前面的错误会改变后续条件,长句可能出现重复、漏词或停不下来;优势是天然适合流式输出。连续流模型可以并行描述一段声学轨迹,减少逐 token 暴露偏差,却需要多次网络求值,并可能在长段中产生音色或韵律的整体漂移。
首段延迟、实时因子与整段耗时也因此不能互换。流式模型可能很快吐出第一包音频,但完成整段仍需要较长解码;少步流模型总耗时较低,首包却要等完整条件准备。公开速度数字只有在硬件、音频时长、批量和采样步数一致时才可比较。
Seed 类语音评测把内容和身份拆成不同坐标
WER 或 CER 衡量识别器看到的文字错误,容易受所选 ASR 与语言影响;说话人 SIM 计算嵌入距离,不能代表情绪、自然度或音频清洁度;MOS 依赖听者判断,又会受到播放设备和样本选择影响。三个指标描述三个方向,任何一个领先都无法替另外两个下结论。
跨论文引用数值时还要保留提示长度、语言、是否使用转录文本以及是否零样本。某些测试给模型目标文本与干净参考,另一些把噪声提示直接输入;名字相近的“voice cloning”实际难度并不相同。AudioDiT 的公开成绩应留在原协议内阅读。
从训练语料到声音,文本规范化先决定读法
TTS 语料要把音频与逐字文本对齐,并过滤背景音乐、重叠说话、错误字幕和严重剪切。规模扩大会增加语言、口音与风格覆盖,也提高弱标签噪声。模型可能学会自然发音,却把训练字幕中长期存在的数字展开错误或标点停顿偏差一起吸收。
文本规范化负责把“2026/07/12”“3.5B”“¥12.50”等形式转换为可读序列。不同语言有不同读法,同一个数字在日期、型号和金额中也不同。规范化器出错时,声学模型不会知道原字符串的真实语义;内容准确性因此由文本前端与 AudioDiT 共同决定。
参考编码器与主生成器可能采用不同采样率和窗口。很短的提示不足以覆盖稳定音色,太长的提示增加内容泄漏与环境复制。训练时若参考和目标来自同一段切片,模型还可能依赖局部语音线索;跨片段、跨录音条件采样能更严格地学习身份。
公开的 3.5B 权重、论文结构和演示页面分别说明模型可取得、方法如何工作以及作者选择的样例。要重现结果,还需要 tokenizer、声码器、采样器与配置版本一致。缺少其中一环时,应把结论停留在已经公开的层级。
5. 说话人条件进入扩散去噪
L=E ||ε−εθ(z_t,t,c_text,c_spk)||²z_t第 t 步声学潜变量c_text文本条件c_spk参考音频提取的说话人条件
公式用通用条件扩散记号说明文本条件和说话人条件同时进入去噪器,不冒充仓库源码的逐行等式。32 次函数评估意味着一次生成要反复更新潜变量。
speaker similarity 与内容正确率是两条轴。参考音频越嘈杂,模型越可能把房间声当作音色条件;高相似度也不会证明数字、专名和停顿正确。
论文、代码与权重可沿 LongCat-AudioDiT source / LongCat-AudioDiT 3.5B weights 查阅。
6. Seed 相似度表的读数边界
页面使用官方 ZH、EN、ZH-Hard 三列的算术平均,只纳入三列齐全的行;自然度和 WER 仍须另看。
| 模型 | 三划分平均 SIM | 指标含义 |
|---|---|---|
| LongCat-AudioDiT 3.5B | 约 80.0 | WER、自然度、延迟 |
| Qwen3-TTS | 约 74.5 | 声线指令与克隆分开看 |
| VoxCPM | 约 74.4 | 长句连贯和实时率 |
7. 3.5B 权重之外,零样本克隆的实验单位是一组配对样本
LongCat-AudioDiT 的开源发布把代码和 3.5B 权重连接起来,使研究者能够检查文本条件、参考编码和扩散求解流程。参数量描述网络容量,不说明前端词典、参考裁剪、声学解码器和采样器是否相同。复现时只写“使用 LongCat”仍不足以定位结果,至少要保留模型 revision、推理脚本、采样步数与音频后处理。
零样本克隆的基本实验需要四项配对记录:参考片段、参考文本、目标文本和生成结果。参考文本若与实际发音不一致,模型可能把对齐错误归入说话人条件;参考片段包含混响、伴奏或多人重叠时,这些环境线索也可能被复制。相同目标文本应更换数段参考,才能分清身份特征与单段录音偶然因素。
Seed-TTS-Eval 一类协议把内容错误和说话人相似拆开,但识别器、说话人编码器、语言与参考长度都会改变读数。相似度高只能说明嵌入接近,不能排除漏字、错读数字或复制背景噪声;WER 较低也不能证明韵律自然。跨系统比较需要共同文本、共同参考和共同解码条件,发布方各自的表格只适合说明各自实验。
长文本还要观察误差随时间如何积累。可把同一稿件按短句、自然段和连续长段三种方式生成,记录首段延迟、完整实时率、句间音色漂移、语速变化和结尾截断。若只有短句试听,AudioDiT 的连续轨迹是否改善长程结构仍没有得到验证;若只报整段平均值,局部专名错误又会被时长稀释。
结语:AudioDiT 是完整语音链中的生成核心
LongCat-AudioDiT 把连续声学轨迹交给大规模 Transformer 建模,避开部分离散量化损失,也承担多步求解和长段漂移。参考编码、文本规范化与波形解码没有因此消失。
WER、SIM、MOS、首包延迟和实时因子分别描述内容、身份、听感与速度。它们构成一组坐标,而非可以相加的总分。按这组坐标阅读论文,才能判断模型适合旁白、克隆、跨语种还是长文生成。
同一句文本至少保留无参考和有参考两份输出。先听专名、数字和停顿,再判断音色、口音和韵律是否接近。若只先听“像不像”,很容易忽略漏字或把参考噪声一起复制。
参考片段宜保持单人、短而干净。多说话人、强混响和背景音乐会把身份与环境同时写入条件向量;同一文本需要多次采样,才能看出相似度、韵律和发音错误之间的波动。
speaker similarity 衡量嵌入接近程度,不证明生成者身份,也不授权使用某人的声音。参考素材的使用权仍由素材来源与授权决定。
公开仓库与 3.5B 模型卡共同构成可运行材料。论文表格中的相似度属于指定测试集,不能替代多语言发音、长句稳定和主观自然度的独立评价。