Artigos sobre modelos com links para fontes, fichas de modelo, repositórios e contexto visual.
Este artigo analisa SFC-Locoformer a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Boogu-Image 0.1 a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa SenseNova-U1 Infographic V2 a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa LongCat-AudioDiT 3.5B a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa AudioSep-Hive a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa BandIt and TIGER-DnR a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa MossFormer2 and TIGER-speech a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Specialist audio-to-MIDI a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa MuScriptor-large a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Qwen-Image, Z-Image and FLUX.2 Klein a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa BiRefNet, Moebius, VOSR and DDColor a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa dots.tts a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa SoulX-Singer and YingMusic-Singer-Plus a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa HQ-SVC and YingMusic-SVC a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Beat This! a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Demucs v3 for saxophone a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
Este artigo analisa Vevo2 a partir da arquitetura, dos materiais publicados, dos resultados divulgados e dos limites de comparação.
A ferramenta atual de quatro stems da TelkNet usa Huge-SCNet-4stems V1.2 para dividir um mix completo em vocais, bateria, baixo e outros. O artigo explica a escolha pela história de MSS, limites do Mel-Band RoFormer, modelagem por sub-bandas do SCNet e pontuações públicas.
A Krea AI lançou Krea 2 Raw e Krea 2 Turbo como pesos abertos. O relatório técnico descreve o Krea 2 como um modelo de difusão texto-para-imagem de 12B treinado do zero e detalha filtragem de dados, pipeline de captions, pós-treinamento, aprendizado por reforço e limites de segurança e licença.
ChordEdit é um paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Ele trata a edição de imagem guiada por texto em uma etapa como um problema de transporte ótimo dinâmico entre source prompt e target prompt, e usa Chord Control Field para reduzir deriva de alta energia que distorce objetos e fundos. O artigo mapeia o método para uma superfície de edição com source_prompt, target_prompt, seed, sample count, time-window e step-scale da demo oficial.
A Zyphra lançou ZONOS2 sob Apache-2.0: 8B parâmetros totais, cerca de 900M ativos em MoE TTS e mais de 6M horas de fala. A TelkNet apresenta o modelo como a ferramenta ZONOS2 Voice Cloning TTS.
Visão técnica do MRT2 com autorregressão por frames de 40 ms, controle MIDI/texto/áudio de baixa latência, estrutura 2.4B/230M, caminho SpectroStream, embeddings MusicCoCa e limites práticos da geração musical ao vivo.