這裡收錄模型發布、研究進展與技術解讀,並附論文、模型卡、程式碼倉庫和相關圖表。
SFC-Locoformer 的架構、公開材料、已發表結果與比較範圍。
Boogu-Image 0.1 的架構、公開材料、已發表結果與比較範圍。
SenseNova-U1 Infographic V2 的架構、公開材料、已發表結果與比較範圍。
LongCat-AudioDiT 3.5B 的架構、公開材料、已發表結果與比較範圍。
AudioSep-Hive 的架構、公開材料、已發表結果與比較範圍。
BandIt and TIGER-DnR 的架構、公開材料、已發表結果與比較範圍。
MossFormer2 and TIGER-speech 的架構、公開材料、已發表結果與比較範圍。
Specialist audio-to-MIDI 的架構、公開材料、已發表結果與比較範圍。
MuScriptor-large 的架構、公開材料、已發表結果與比較範圍。
Qwen-Image, Z-Image and FLUX.2 Klein 的架構、公開材料、已發表結果與比較範圍。
BiRefNet, Moebius, VOSR and DDColor 的架構、公開材料、已發表結果與比較範圍。
dots.tts 的架構、公開材料、已發表結果與比較範圍。
SoulX-Singer and YingMusic-Singer-Plus 的架構、公開材料、已發表結果與比較範圍。
HQ-SVC and YingMusic-SVC 的架構、公開材料、已發表結果與比較範圍。
Beat This! 的架構、公開材料、已發表結果與比較範圍。
Demucs v3 for saxophone 的架構、公開材料、已發表結果與比較範圍。
Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 的架構、公開材料、已發表結果與比較範圍。
Vevo2 的架構、公開材料、已發表結果與比較範圍。
TelkNet 目前四軌工具使用 Huge-SCNet-4stems V1.2,把完整混音分離為 Vocals、Drums、Bass 和 Other。文章從 MSS 架構演進、Mel-Band RoFormer 的強項與局限、SCNet 的子帶建模和公開四軌分數解釋這次模型取捨。
Krea AI 公開 Krea 2 Raw 和 Krea 2 Turbo 兩組開放權重。官方技術報告將其描述為從零訓練的 12B 參數文生圖擴散模型,並披露資料過濾、caption 管線、後訓練、強化學習和安全許可邊界。
ChordEdit 是 CVPR 2026 Oral / Best Student Paper Honorable Mention 論文。它把 one-step 文字引導影像編輯寫成 source prompt 與 target prompt 之間的動態最優傳輸問題,並用 Chord Control Field 降低會扭曲物件、破壞背景的高能量漂移。官方 demo 提供 source_prompt、target_prompt、seed、sample count、time-window 和 step-scale 等參數。
Zyphra 以 Apache-2.0 發布 ZONOS2。它採用 8B 總參數、約 900M 啟用參數的 MoE TTS 架構,訓練資料超過 600 萬小時;TelkNet 已將 ZONOS2 Voice Cloning TTS 接入本站工具體驗。
以來源可核對的技術解析方式整理 MRT2 的 40ms 幀級自回歸、低延遲 MIDI/文字/音訊控制、2.4B/230M 雙模型結構、SpectroStream codec 路徑、MusicCoCa 風格嵌入與即時演奏邊界。