Artículos claros sobre modelos con enlaces a fuentes, tarjetas de modelo, repositorios y contexto visual.
El artículo analiza SFC-Locoformer a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Boogu-Image 0.1 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza SenseNova-U1 Infographic V2 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza LongCat-AudioDiT 3.5B a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza AudioSep-Hive a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza BandIt and TIGER-DnR a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza MossFormer2 and TIGER-speech a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Specialist audio-to-MIDI a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza MuScriptor-large a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Qwen-Image, Z-Image and FLUX.2 Klein a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza BiRefNet, Moebius, VOSR and DDColor a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza dots.tts a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza SoulX-Singer and YingMusic-Singer-Plus a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza HQ-SVC and YingMusic-SVC a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Beat This! a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Demucs v3 for saxophone a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
El artículo analiza Vevo2 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
La herramienta actual de cuatro stems de TelkNet usa Huge-SCNet-4stems V1.2 para dividir una mezcla completa en voces, batería, bajo y otros. El artículo explica la elección con la evolución de MSS, los límites de Mel-Band RoFormer, el modelado por subbandas de SCNet y puntuaciones públicas de cuatro stems.
Krea AI publicó Krea 2 Raw y Krea 2 Turbo como pesos abiertos. El informe técnico describe Krea 2 como un modelo de difusión texto-a-imagen de 12B entrenado desde cero y detalla filtrado de datos, pipeline de captions, post-entrenamiento, aprendizaje por refuerzo y límites de seguridad y licencia.
ChordEdit es un paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Plantea la edición de imágenes guiada por texto en un paso como un problema de transporte óptimo dinámico entre source prompt y target prompt, y usa Chord Control Field para reducir la deriva de alta energía que deforma objetos y daña fondos. El artículo mapea el método a una superficie de edición con source_prompt, target_prompt, seed, sample count, time-window y step-scale de la demo oficial.
Zyphra publicó ZONOS2 bajo Apache-2.0: 8B parámetros totales, unos 900M activos en una arquitectura MoE TTS y más de 6M horas de voz. TelkNet lo presenta como la herramienta ZONOS2 Voice Cloning TTS.
Panorama técnico de MRT2 con autorregresión por frames de 40 ms, control MIDI/texto/audio de baja latencia, estructura 2.4B/230M, ruta SpectroStream, embeddings de estilo MusicCoCa y límites prácticos de la generación musical en vivo.