Czytelne artykuły o modelach z odnośnikami do źródeł, kartami modeli, repozytoriami i materiałami wizualnymi.
Artykuł analizuje SFC-Locoformer na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Boogu-Image 0.1 na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje SenseNova-U1 Infographic V2 na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje LongCat-AudioDiT 3.5B na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje AudioSep-Hive na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje BandIt and TIGER-DnR na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje MossFormer2 and TIGER-speech na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Specialist audio-to-MIDI na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje MuScriptor-large na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Qwen-Image, Z-Image and FLUX.2 Klein na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje BiRefNet, Moebius, VOSR and DDColor na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje dots.tts na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje SoulX-Singer and YingMusic-Singer-Plus na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje HQ-SVC and YingMusic-SVC na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Beat This! na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Demucs v3 for saxophone na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Artykuł analizuje Vevo2 na podstawie architektury, opublikowanych materiałów, zgłoszonych wyników i granic porównania.
Aktualne narzędzie TelkNet do czterech stemsów używa Huge-SCNet-4stems V1.2, aby podzielić pełny miks na wokal, perkusję, bas i pozostałe. Artykuł wyjaśnia wybór przez historię MSS, mocne strony i ograniczenia Mel-Band RoFormer, modelowanie subband SCNet oraz publiczne wyniki.
Krea AI opublikowała Krea 2 Raw i Krea 2 Turbo jako open weights. Raport techniczny opisuje Krea 2 jako model dyfuzyjny text-to-image 12B trenowany od zera i omawia filtrowanie danych, pipeline captionów, post-training, reinforcement learning oraz granice bezpieczeństwa i licencji.
ChordEdit to paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Opisuje tekstową edycję obrazu w jednym kroku jako dynamiczny problem optymalnego transportu między source prompt i target prompt, a następnie używa Chord Control Field, by ograniczyć wysokoenergetyczny dryf zniekształcający obiekty i tła. Artykuł mapuje metodę na powierzchnię edycji z parametrami source_prompt, target_prompt, seed, sample count, time-window i step-scale z oficjalnej demo.
Zyphra udostępnia ZONOS2 na Apache-2.0: 8B parametrów łącznie, ok. 900M aktywnych w MoE TTS i ponad 6M godzin mowy. TelkNet przedstawia go jako narzędzie ZONOS2 Voice Cloning TTS.
Zaktualizowany briefing z oficjalnymi grafikami Google o niskiej latencji, sterowaniu MIDI/tekstem/audio, strukturze 2.4B/230M, sprzęcie i limitach MRT2.