这里收录模型发布、研究进展与技术解读,并附论文、模型卡、代码仓库和相关图表。
从可学习频谱压缩、局部—长程序列建模和同协议 SI-SDR 出发,解释为何公开的 medium checkpoint 成为影视三分离质量默认。
从潜空间流匹配、少步蒸馏和编辑保持约束拆解三份开放权重,并比较 Base、Turbo 与 Edit 各自的失真风险。
把信息图拆成文字、版式和语义三条质量轴,解释 MoT 路由、BizGenEval hard 对照和生成后的 OCR/事实核验。
从条件扩散、APG/CFG、32 次函数评估和 Seed speaker similarity 出发,区分相似度、自然度与识别准确率。
从 CLAP 语义空间、时频掩码和混合一致性出发,解释 Hive 为何是文本查询分离而不是 283 个固定 stem,并说明 32 kHz 单声道输出范围。
在 DnR v2 的相同 stem 定义下,比较 BandIt 的非均匀频带建模和 TIGER 的高效序列设计;没有同协议数字时明确留空。
从置换不变训练、SI-SNR、分离与增强的目标差异出发,梳理 SS 16K、SE 48K、SR 48K 与现实双人场景的处理链。
比较事件级 CRNN、F0 分段和演奏技巧多任务学习,说明为何干净 solo、正确乐器路由与 onset/offset 定义比把所有 F1 混排更重要。
核对旗舰 checkpoint 的精确参数、事件建模、私有与跨域评测、Type-1 MIDI 输出,以及受门控的非商业许可边界。
从 20B MMDiT、6B 单流 DiT 与 9B rectified flow 出发,解释文字课程学习、少步蒸馏和多参考编辑为何形成三条不同路线。
用二值分割损失、掩码条件修复、生成式超分和色度回归解释四类目标函数,避免把抠图、补全、超分和上色混成同一排行榜。
拆解 AudioVAE、语义编码器、Qwen2.5 骨干和 AR 流匹配头,比较 SOAR 的 32 步质量模式与 MF 的 4 步低延迟模式。
解释零样本音色提示、MIDI/元数据对齐、旋律编码和条件流匹配,并明确两种模型需要的输入不能互换。
从内容编码、基频条件、说话人统计量和 rectified flow 出发解释零样本歌声转换,并给出参考音频与主唱 stem 的质量约束。
从多分辨率频谱、RoFormer 时序建模和位移容忍损失解释 final0 权重,并区分 beat、downbeat、BPM 与 MIDI 音符转写。
从时域编码、双向序列瓶颈和波形重建讲解萨克斯/伴奏二分离,并把 14.22 dB 的窄测试集结果限制在它真正支持的范围内。
比较自然语言声线设计、离散音频 token、上下文扩展和零样本参考音频;自然度、相似度和首包延迟必须分别测量。
从内容—风格与韵律量化器、流匹配声学生成和声码器重建解释零样本歌声条件,并说明参考音频不是 MIDI 乐谱的替代品。
TelkNet 当前四轨工具使用 Huge-SCNet-4stems V1.2,把完整混音分离为 Vocals、Drums、Bass 和 Other。文章从 MSS 架构演进、Mel-Band RoFormer 的强项与局限、SCNet 的子带建模和公开四轨分数解释这次模型取舍。
Krea AI 公开 Krea 2 Raw 和 Krea 2 Turbo 两组开放权重。官方技术报告将其描述为从零训练的 12B 参数文生图扩散模型,并披露数据过滤、caption 管线、后训练、强化学习和安全许可边界。
ChordEdit 是 CVPR 2026 Oral / Best Student Paper Honorable Mention 工作。它把 one-step 文本引导图像编辑重塑为源提示分布与目标提示分布之间的动态最优传输问题,用时间加权的 Chord Control Field 替代高能量朴素漂移差分,在单步编辑中兼顾目标语义与背景保留。
ZONOS2 是 Zyphra 开源的 MoE TTS / voice cloning 模型。官方模型卡确认其使用超过 600 万小时多语言语音训练数据,并以 nemo TN normalized UTF-8 bytes、ECAPA-TDNN speaker embedding、DAC tokens 与 MoE backbone 组成推理链路。架构、公式、语言分层和许可信息共同说明其技术取舍。
围绕 Google Magenta RealTime 2 的开放权重路线,解析 40ms 帧级自回归、约 200ms 端到端控制延迟、SpectroStream 离散音频 tokens、MusicCoCa 风格嵌入、MIDI 帧对齐条件注入,以及 Base 2.4B / Small 230M 双模型在实时音乐工作流中的取舍。