Verständliche Modellberichte mit Quellenlinks, Modellkarten, Repositorys und visueller Einordnung.
Der Artikel untersucht SFC-Locoformer anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Boogu-Image 0.1 anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht SenseNova-U1 Infographic V2 anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht LongCat-AudioDiT 3.5B anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht AudioSep-Hive anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht BandIt and TIGER-DnR anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht MossFormer2 and TIGER-speech anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Specialist audio-to-MIDI anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht MuScriptor-large anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Qwen-Image, Z-Image and FLUX.2 Klein anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht BiRefNet, Moebius, VOSR and DDColor anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht dots.tts anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht SoulX-Singer and YingMusic-Singer-Plus anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht HQ-SVC and YingMusic-SVC anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Beat This! anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Demucs v3 for saxophone anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Der Artikel untersucht Vevo2 anhand der Architektur, der veröffentlichten Materialien, der berichteten Ergebnisse und der Grenzen des Vergleichs.
Das aktuelle TelkNet-Werkzeug für vier Stems nutzt Huge-SCNet-4stems V1.2, um einen kompletten Mix in Vocals, Drums, Bass und Other zu trennen. Der Artikel erklärt die Wahl über MSS-Architektur, Mel-Band-RoFormer-Grenzen, SCNet-Subband-Modellierung und öffentliche Vier-Stem-Werte.
Krea AI veröffentlicht Krea 2 Raw und Krea 2 Turbo als Open Weights. Der technische Bericht beschreibt Krea 2 als ein von Grund auf trainiertes 12B-Text-zu-Bild-Diffusionsmodell und erläutert Datenfilterung, Caption-Pipeline, Post-Training, Reinforcement Learning sowie Sicherheits- und Lizenzgrenzen.
ChordEdit ist ein CVPR 2026 Oral / Best Student Paper Honorable Mention Paper. Es beschreibt textgesteuerte one-step-Bildbearbeitung als dynamisches Optimal-Transport-Problem zwischen source prompt und target prompt und nutzt ein Chord Control Field, um hochenergetischen Drift zu reduzieren, der Objekte verzieht und Hintergründe beschädigt. Der Artikel ordnet die Methode einer Bildbearbeitungsoberfläche mit source_prompt, target_prompt, seed, sample count, time-window und step-scale aus der offiziellen Demo zu.
Zyphra veröffentlicht ZONOS2 unter Apache-2.0: 8B Gesamtparameter, rund 900M aktive MoE-TTS-Parameter und mehr als 6M Stunden Sprachdaten. Der Artikel ordnet es als ZONOS2 Voice-Cloning-TTS-Workflow ein.
Ein quellenbezogener technischer Überblick zu MRT2s 40ms Frame-Level-Autoregression, latenzarmer MIDI/Text/Audio-Steuerung, 2.4B/230M-Modellstruktur, SpectroStream-Codec, MusicCoCa-Style-Embeddings und den Grenzen live steuerbarer Musikgenerierung.