Articoli chiari sui modelli, con link alle fonti, schede dei modelli, repository e contesto visivo.
L’articolo analizza SFC-Locoformer attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Boogu-Image 0.1 attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza SenseNova-U1 Infographic V2 attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza LongCat-AudioDiT 3.5B attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza AudioSep-Hive attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza BandIt and TIGER-DnR attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza MossFormer2 and TIGER-speech attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Specialist audio-to-MIDI attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza MuScriptor-large attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Qwen-Image, Z-Image and FLUX.2 Klein attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza BiRefNet, Moebius, VOSR and DDColor attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza dots.tts attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza SoulX-Singer and YingMusic-Singer-Plus attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza HQ-SVC and YingMusic-SVC attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Beat This! attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Demucs v3 for saxophone attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
L’articolo analizza Vevo2 attraverso l’architettura, i materiali pubblicati, i risultati dichiarati e i limiti del confronto.
Lo strumento TelkNet per quattro stem usa Huge-SCNet-4stems V1.2 per separare un mix completo in voci, batteria, basso e altro. L’articolo spiega la scelta tramite storia MSS, punti di forza e limiti di Mel-Band RoFormer, modellazione a sottobande SCNet e punteggi pubblici.
Krea AI ha rilasciato Krea 2 Raw e Krea 2 Turbo come open weights. Il report tecnico descrive Krea 2 come un modello di diffusione text-to-image da 12B addestrato da zero e dettaglia filtraggio dei dati, pipeline di caption, post-training, reinforcement learning e confini di sicurezza e licenza.
ChordEdit è un paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Descrive l'editing testuale di immagini in un passaggio come un problema di trasporto ottimale dinamico tra source prompt e target prompt, poi usa un Chord Control Field per ridurre il drift ad alta energia che deforma oggetti e rovina gli sfondi. L'articolo collega il metodo a una superficie di editing con source_prompt, target_prompt, seed, sample count, time-window e step-scale della demo ufficiale.
Zyphra rilascia ZONOS2 con licenza Apache-2.0: 8B parametri totali, circa 900M attivi in un'architettura MoE TTS e oltre 6M ore di parlato. TelkNet lo presenta come strumento ZONOS2 Voice Cloning TTS.
Panoramica tecnica su MRT2: autoregressione frame-level da 40 ms, controllo MIDI/testo/audio a bassa latenza, struttura 2.4B/230M, percorso SpectroStream, embedding MusicCoCa e limiti della generazione musicale live.