Artículos claros sobre modelos con enlaces a fuentes, tarjetas de modelo, repositorios y contexto visual.
ModeloEl artículo analiza SFC-Locoformer a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza Boogu-Image 0.1 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza SenseNova-U1 Infographic V2 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza LongCat-AudioDiT 3.5B a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza AudioSep-Hive a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza BandIt and TIGER-DnR a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza MossFormer2 and TIGER-speech a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza Specialist audio-to-MIDI a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza MuScriptor-large a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza Qwen-Image, Z-Image and FLUX.2 Klein a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza BiRefNet, Moebius, VOSR and DDColor a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza dots.tts a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza SoulX-Singer and YingMusic-Singer-Plus a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza HQ-SVC and YingMusic-SVC a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículoEl artículo analiza Beat This! a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza Demucs v3 for saxophone a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículo
ModeloEl artículo analiza Vevo2 a partir de su arquitectura, los materiales publicados, los resultados comunicados y los límites de la comparación.
Leer el artículoLa herramienta actual de cuatro stems de TelkNet usa Huge-SCNet-4stems V1.2 para dividir una mezcla completa en voces, batería, bajo y otros. El artículo explica la elección con la evolución de MSS, los límites de Mel-Band RoFormer, el modelado por subbandas de SCNet y puntuaciones públicas de cuatro stems.
Leer el artículo
ModeloKrea AI publicó Krea 2 Raw y Krea 2 Turbo como pesos abiertos. El informe técnico describe Krea 2 como un modelo de difusión texto-a-imagen de 12B entrenado desde cero y detalla filtrado de datos, pipeline de captions, post-entrenamiento, aprendizaje por refuerzo y límites de seguridad y licencia.
Leer el artículo
ModeloChordEdit es un paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Plantea la edición de imágenes guiada por texto en un paso como un problema de transporte óptimo dinámico entre source prompt y target prompt, y usa Chord Control Field para reducir la deriva de alta energía que deforma objetos y daña fondos. El artículo mapea el método a una superficie de edición con source_prompt, target_prompt, seed, sample count, time-window y step-scale de la demo oficial.
Leer el artículoZyphra publicó ZONOS2 bajo Apache-2.0: 8B parámetros totales, unos 900M activos en una arquitectura MoE TTS y más de 6M horas de voz. TelkNet lo presenta como la herramienta ZONOS2 Voice Cloning TTS.
Leer el artículo
ModeloPanorama técnico de MRT2 con autorregresión por frames de 40 ms, control MIDI/texto/audio de baja latencia, estructura 2.4B/230M, ruta SpectroStream, embeddings de estilo MusicCoCa y límites prácticos de la generación musical en vivo.
Leer el artículo