Các bài viết dễ đọc về mô hình, kèm liên kết nguồn, thẻ mô hình, kho mã và hình minh họa.
Bài viết phân tích SFC-Locoformer dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Boogu-Image 0.1 dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích SenseNova-U1 Infographic V2 dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích LongCat-AudioDiT 3.5B dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích AudioSep-Hive dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích BandIt and TIGER-DnR dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích MossFormer2 and TIGER-speech dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Specialist audio-to-MIDI dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích MuScriptor-large dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Qwen-Image, Z-Image and FLUX.2 Klein dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích BiRefNet, Moebius, VOSR and DDColor dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích dots.tts dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích SoulX-Singer and YingMusic-Singer-Plus dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích HQ-SVC and YingMusic-SVC dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Beat This! dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Demucs v3 for saxophone dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Qwen3-TTS, Fish S2 Pro, MOSS-TTS and VoxCPM2 dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Bài viết phân tích Vevo2 dựa trên kiến trúc, tài liệu đã công bố, kết quả được báo cáo và giới hạn so sánh.
Công cụ bốn stem hiện tại của TelkNet dùng Huge-SCNet-4stems V1.2 để tách bản mix đầy đủ thành vocals, drums, bass và other. Bài viết giải thích lựa chọn qua lịch sử kiến trúc MSS, điểm mạnh và giới hạn của Mel-Band RoFormer, mô hình subband của SCNet và điểm số công khai.
Krea AI phát hành Krea 2 Raw và Krea 2 Turbo dưới dạng trọng số mở. Báo cáo kỹ thuật mô tả Krea 2 là mô hình diffusion text-to-image 12B được huấn luyện từ đầu, đồng thời nêu chi tiết lọc dữ liệu, caption pipeline, post-training, reinforcement learning và ranh giới an toàn-giấy phép.
ChordEdit là paper CVPR 2026 Oral / Best Student Paper Honorable Mention. Công trình xem chỉnh sửa ảnh theo văn bản trong một bước như bài toán optimal transport động giữa source prompt và target prompt, rồi dùng Chord Control Field để giảm drift năng lượng cao làm méo vật thể và nền. Bài viết ánh xạ phương pháp này thành bề mặt tham số chỉnh sửa ảnh với source_prompt, target_prompt, seed, sample count, time-window và step-scale từ demo chính thức.
Zyphra phát hành ZONOS2 theo Apache-2.0: tổng 8B tham số, khoảng 900M kích hoạt trong MoE TTS và hơn 6M giờ tiếng nói. TelkNet giới thiệu mô hình này như công cụ ZONOS2 Voice Cloning TTS.
Bản cập nhật có hình chính thức từ Google về độ trễ thấp, điều khiển MIDI/văn bản/âm thanh, cấu trúc 2.4B/230M, phần cứng và giới hạn của MRT2.