Articles clairs sur les modèles, avec liens vers les sources, fiches de modèles, dépôts et contexte visuel.
Cet article analyse SFC-Locoformer à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Boogu-Image 0.1 à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse SenseNova-U1 Infographic V2 à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse LongCat-AudioDiT 3.5B à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse AudioSep-Hive à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse BandIt and TIGER-DnR à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse MossFormer2 and TIGER-speech à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Specialist audio-to-MIDI à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse MuScriptor-large à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Qwen-Image, Z-Image and FLUX.2 Klein à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse BiRefNet, Moebius, VOSR and DDColor à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse dots.tts à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse SoulX-Singer and YingMusic-Singer-Plus à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse HQ-SVC and YingMusic-SVC à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Beat This! à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Demucs v3 for saxophone à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
Cet article analyse Vevo2 à partir de son architecture, des ressources publiées, des résultats annoncés et des limites de comparaison.
L’outil quatre stems actuel de TelkNet utilise Huge-SCNet-4stems V1.2 pour diviser un mix complet en voix, batterie, basse et autres. L’article explique ce choix par l’historique MSS, les forces et limites de Mel-Band RoFormer, la modélisation en sous-bandes de SCNet et les scores publics quatre stems.
Krea AI publie Krea 2 Raw et Krea 2 Turbo sous forme de poids ouverts. Le rapport technique décrit Krea 2 comme un modèle de diffusion texte-vers-image 12B entraîné depuis zéro et détaille le filtrage des données, le pipeline de captions, le post-entraînement, l'apprentissage par renforcement et les limites de sécurité et de licence.
ChordEdit est un paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Il formule l'édition d'image guidée par texte en une étape comme un problème de transport optimal dynamique entre source prompt et target prompt, puis utilise un Chord Control Field pour réduire la dérive haute énergie qui déforme les objets et abîme les arrière-plans. L'article associe la méthode à une surface d'édition avec source_prompt, target_prompt, seed, sample count, time-window et step-scale issus de la demo officielle.
Zyphra publie ZONOS2 sous Apache-2.0 : 8B paramètres au total, environ 900M actifs dans une architecture MoE TTS et plus de 6M heures de parole. TelkNet le présente comme l'outil ZONOS2 Voice Cloning TTS.
Présentation technique de MRT2 couvrant l'autorégression par frames de 40 ms, le contrôle MIDI/texte/audio à faible latence, la structure 2.4B/230M, le codec SpectroStream, les embeddings MusicCoCa et les limites de la génération musicale live.