บทความเกี่ยวกับโมเดลที่มีลิงก์แหล่งข้อมูล การ์ดโมเดล ที่เก็บโค้ด และภาพประกอบ
บทความนี้วิเคราะห์ SFC-Locoformer จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Boogu-Image 0.1 จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ SenseNova-U1 Infographic V2 จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ LongCat-AudioDiT 3.5B จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ AudioSep-Hive จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ BandIt and TIGER-DnR จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ MossFormer2 and TIGER-speech จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Specialist audio-to-MIDI จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ MuScriptor-large จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Qwen-Image, Z-Image and FLUX.2 Klein จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ BiRefNet, Moebius, VOSR and DDColor จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ dots.tts จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ SoulX-Singer and YingMusic-Singer-Plus จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ HQ-SVC and YingMusic-SVC จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Beat This! จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Demucs v3 for saxophone จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
บทความนี้วิเคราะห์ Vevo2 จากสถาปัตยกรรม เอกสารที่เผยแพร่ ผลลัพธ์ที่รายงาน และขอบเขตของการเปรียบเทียบ
เครื่องมือ 4 stem ปัจจุบันของ TelkNet ใช้ Huge-SCNet-4stems V1.2 เพื่อแยกมิกซ์เต็มเป็น vocals, drums, bass และ other บทความนี้อธิบายเหตุผลผ่านประวัติ MSS จุดแข็งและข้อจำกัดของ Mel-Band RoFormer การทำ subband ของ SCNet และคะแนนสาธารณะ
Krea AI เปิดตัว Krea 2 Raw และ Krea 2 Turbo เป็นน้ำหนักแบบเปิด รายงานทางเทคนิคอธิบายว่า Krea 2 เป็นโมเดล diffusion แบบ text-to-image ขนาด 12B ที่ฝึกจากศูนย์ และให้รายละเอียดเรื่องการกรองข้อมูล, caption pipeline, post-training, reinforcement learning รวมถึงขอบเขตด้านความปลอดภัยและไลเซนส์
ChordEdit เป็น paper ระดับ CVPR 2026 Oral / Best Student Paper Honorable Mention งานนี้มองการแก้ไขภาพด้วยข้อความแบบ one-step เป็นปัญหา optimal transport แบบไดนามิกระหว่าง source prompt และ target prompt แล้วใช้ Chord Control Field ลด drift พลังงานสูงที่ทำให้วัตถุและฉากหลังผิดรูป บทความนี้จับคู่แนวทางดังกล่าวกับพื้นผิวพารามิเตอร์แก้ไขภาพที่ใช้ source_prompt, target_prompt, seed, sample count, time-window และ step-scale ตาม demo ทางการ
Zyphra เปิดตัว ZONOS2 ภายใต้ Apache-2.0: พารามิเตอร์รวม 8B ใช้งานราว 900M ใน MoE TTS และข้อมูลเสียงกว่า 6M ชั่วโมง TelkNet นำเสนอเป็นเครื่องมือ ZONOS2 Voice Cloning TTS
บทสรุปที่อัปเดตพร้อมภาพทางการจาก Google เกี่ยวกับเวลาแฝงต่ำ การควบคุม MIDI/ข้อความ/เสียง โครงสร้าง 2.4B/230M ฮาร์ดแวร์ และข้อจำกัดของ MRT2