Læsbare modelartikler med kildelinks, modelkort, kodearkiver og visuel kontekst.
Artiklen analyserer SFC-Locoformer ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Boogu-Image 0.1 ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer SenseNova-U1 Infographic V2 ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer LongCat-AudioDiT 3.5B ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer AudioSep-Hive ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer BandIt and TIGER-DnR ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer MossFormer2 and TIGER-speech ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Specialist audio-to-MIDI ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer MuScriptor-large ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Qwen-Image, Z-Image and FLUX.2 Klein ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer BiRefNet, Moebius, VOSR and DDColor ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer dots.tts ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer SoulX-Singer and YingMusic-Singer-Plus ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer HQ-SVC and YingMusic-SVC ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Beat This! ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Demucs v3 for saxophone ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
Artiklen analyserer Vevo2 ud fra arkitektur, offentliggjort materiale, rapporterede resultater og sammenligningens grænser.
TelkNets aktuelle fire-stem-værktøj bruger Huge-SCNet-4stems V1.2 til at dele et helt mix i vokal, trommer, bas og andet. Artiklen forklarer valget gennem MSS-arkitektur, Mel-Band RoFormer-styrker og begrænsninger, SCNet-subbandmodellering og offentlige fire-stem-tal.
Krea AI udgav Krea 2 Raw og Krea 2 Turbo som åbne vægte. Den tekniske rapport beskriver Krea 2 som en 12B tekst-til-billede-diffusionsmodel trænet fra bunden og gennemgår datafiltrering, caption-pipeline, eftertræning, reinforcement learning samt sikkerheds- og licensgrænser.
ChordEdit er et CVPR 2026 Oral / Best Student Paper Honorable Mention paper. Det beskriver one-step tekststyret billedredigering som et dynamisk optimalt transportproblem mellem source prompt og target prompt, og bruger et Chord Control Field til at mindske højenergidrift, der kan forvride objekter og ødelægge baggrunde. Artiklen kortlægger metoden til en billedredigeringsflade med source_prompt, target_prompt, seed, sample count, time-window og step-scale fra den officielle demo.
Zyphra udgiver ZONOS2 under Apache-2.0: 8B parametre i alt, ca. 900M aktive i en MoE TTS-arkitektur og over 6M timers tale. TelkNet præsenterer det som ZONOS2 Voice Cloning TTS.
Opdateret briefing med officielle Google-figurer om lav latenstid, MIDI/tekst/lyd-kontrol, 2.4B/230M-struktur, hardwarekrav og praktiske grænser for MRT2.