Понятные статьи о моделях со ссылками на источники, карточками моделей, репозиториями и иллюстрациями.
В статье SFC-Locoformer рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Boogu-Image 0.1 рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье SenseNova-U1 Infographic V2 рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье LongCat-AudioDiT 3.5B рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье AudioSep-Hive рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье BandIt and TIGER-DnR рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье MossFormer2 and TIGER-speech рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Specialist audio-to-MIDI рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье MuScriptor-large рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Qwen-Image, Z-Image and FLUX.2 Klein рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье BiRefNet, Moebius, VOSR and DDColor рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье dots.tts рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье SoulX-Singer and YingMusic-Singer-Plus рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье HQ-SVC and YingMusic-SVC рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Beat This! рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Demucs v3 for saxophone рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
В статье Vevo2 рассматривается через архитектуру, опубликованные материалы, заявленные результаты и границы сравнения.
Текущий инструмент TelkNet для четырех стемов использует Huge-SCNet-4stems V1.2, чтобы разделить полный микс на вокал, барабаны, бас и прочее. Статья объясняет выбор через историю MSS, сильные стороны и границы Mel-Band RoFormer, субполосное моделирование SCNet и публичные оценки.
Krea AI выпустила Krea 2 Raw и Krea 2 Turbo как открытые веса. Технический отчет описывает Krea 2 как 12B text-to-image diffusion model, обученную с нуля, и раскрывает фильтрацию данных, caption pipeline, post-training, reinforcement learning, а также границы безопасности и лицензии.
ChordEdit: это paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Он рассматривает одношаговое текстовое редактирование изображений как динамическую задачу оптимального транспорта между source prompt и target prompt, а затем использует Chord Control Field, чтобы уменьшить высокоэнергетический дрейф, искажающий объекты и фон. Статья сопоставляет метод с поверхностью редактирования с параметрами source_prompt, target_prompt, seed, sample count, time-window и step-scale из официальной demo.
Zyphra выпустила ZONOS2 под Apache-2.0: 8B параметров всего, около 900M активных в MoE TTS и более 6M часов речи. TelkNet представляет его как инструмент ZONOS2 Voice Cloning TTS.
Обновленный обзор с официальными графиками Google о низкой задержке, управлении MIDI/текстом/аудио, структуре 2.4B/230M, железе и ограничениях MRT2.