Зрозумілі статті про моделі з посиланнями на джерела, картками моделей, репозиторіями та ілюстраціями.
У статті SFC-Locoformer розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Boogu-Image 0.1 розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті SenseNova-U1 Infographic V2 розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті LongCat-AudioDiT 3.5B розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті AudioSep-Hive розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті BandIt and TIGER-DnR розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті MossFormer2 and TIGER-speech розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Specialist audio-to-MIDI розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті MuScriptor-large розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Qwen-Image, Z-Image and FLUX.2 Klein розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті BiRefNet, Moebius, VOSR and DDColor розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті dots.tts розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті SoulX-Singer and YingMusic-Singer-Plus розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті HQ-SVC and YingMusic-SVC розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Beat This! розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Demucs v3 for saxophone розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
У статті Vevo2 розглянуто через архітектуру, опубліковані матеріали, заявлені результати та межі порівняння.
Поточний інструмент TelkNet для чотирьох стемів використовує Huge-SCNet-4stems V1.2, щоб розділити повний мікс на вокал, барабани, бас та інше. Стаття пояснює вибір через історію MSS, межі Mel-Band RoFormer, субсмугове моделювання SCNet і публічні оцінки.
Krea AI випустила Krea 2 Raw і Krea 2 Turbo як відкриті ваги. Технічний звіт описує Krea 2 як 12B text-to-image diffusion model, навчений з нуля, і деталізує фільтрацію даних, caption pipeline, post-training, reinforcement learning, а також межі безпеки й ліцензії.
ChordEdit: це paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Він розглядає одноетапне текстове редагування зображень як динамічну задачу оптимального транспорту між source prompt і target prompt, а потім використовує Chord Control Field, щоб зменшити високоенергетичний дрейф, який спотворює об'єкти й фон. Стаття співвідносить метод із поверхнею редагування з параметрами source_prompt, target_prompt, seed, sample count, time-window і step_scale з офіційної demo.
Zyphra випустила ZONOS2 під Apache-2.0: 8B параметрів загалом, близько 900M активних у MoE TTS і понад 6M годин мовлення. TelkNet представляє його як інструмент ZONOS2 Voice Cloning TTS.
Оновлений огляд з офіційними графіками Google про низьку затримку, MIDI/текст/аудіо керування, структуру 2.4B/230M, обладнання і межі MRT2.