Daftar beritaElevenLabs, Stability AI Merilis Model Musik AI Baru—Bisakah Mereka Mengejar Suno?
Decrypt2026-05-27 19:33:13 Peringatan

ElevenLabs, Stability AI Merilis Model Musik AI Baru—Bisakah Mereka Mengejar Suno?

ORIGINALElevenLabs, Stability AI Drop New AI Music Models—Can They Catch Suno?
Analisis Dampak AIGrok sedang menganalisis...
📄Artikel lengkap· Diambil secara otomatis oleh trafilaturaGemini 翻譯5719 kata
Singkatnya - ElevenLabs meluncurkan Music v2, yang mampu berpindah genre di tengah lagu, menyusun lagu bagian demi bagian, dan melakukan inpainting pada bagian tertentu. - Stability AI merilis Stable Audio 3.0, keluarga empat model dengan bobot terbuka untuk tiga varian, dilatih menggunakan data berlisensi, yang menghasilkan trek hingga enam menit dua puluh detik. - Kedua rilis tersebut sangat mengandalkan data pelatihan berlisensi—namun Suno, dengan valuasi $2,45 miliar dan sekitar 100 juta pengguna, masih menjadi platform yang paling banyak digunakan orang. Dua pembaruan musik AI yang signifikan hadir minggu ini, dan tidak ada satu pun yang berasal dari Suno. ElevenLabs, perusahaan AI suara yang didirikan di Polandia dengan valuasi $11 miliar setelah putaran pendanaan Series D sebesar $500 juta pada bulan Februari, meluncurkan Music v2. Stability AI—orang-orang di balik Stable Diffusion—merilis Stable Audio 3.0, keluarga empat model dengan bobot terbuka dan trek yang berdurasi lebih dari enam menit. Latar belakangnya adalah gugatan hak cipta dari Recording Industry Association of America pada tahun 2024 terhadap Suno dan Udio, yang menjadikan "dilatih dengan data berlisensi" sebagai frasa terpenting dalam setiap pengumuman musik AI. Baik ElevenLabs maupun Stability sangat mengandalkan hal tersebut, memastikan Anda tidak akan memiliki masalah dengan output yang Anda hasilkan. Music v2: Satu trek, dari opera hingga heavy metal, tanpa jeda Music v2 adalah model musik kedua dari ElevenLabs, yang hadir sekitar 10 bulan setelah yang pertama. Daya tarik utamanya adalah koherensi di bawah tekanan. Menurut ElevenLabs, satu trek dapat beralih dari opera ke heavy metal dan kembali lagi, tetap menyatu melalui rap cepat, dan menyematkan efek suara non-musik—semuanya tanpa membuat komposisi tersebut berantakan. Audio generatif cenderung berantakan saat prompt menjadi rumit, jadi inilah hal yang patut diperhatikan, terutama dalam komposisi yang lebih panjang. Inpainting kini benar-benar berguna: pilih bagian, buat ulang, biarkan bagian lainnya tidak tersentuh. Pengguna juga dapat menyusun lagu bagian demi bagian—intro, verse, chorus—dengan model yang menjaga kesinambungan di seluruh bagian alih-alih memperlakukan setiap klip sebagai generasi yang berdiri sendiri. Dukungan multibahasa juga telah ditingkatkan, meskipun ElevenLabs tidak mempublikasikan detailnya. Model ini mendukung tiga platform: ElevenMusic untuk kreator, ElevenAPI untuk pengembang, dan ElevenCreative untuk merek. Model ini sudah aktif di ElevenMusic dan ElevenCreative sekarang; akses API tersedia melalui akses awal dari tim penjualan. ElevenLabs juga memangkas harga Music v1 dan v2 hingga 50% untuk ElevenAPI dan hingga 40% untuk layanan mandiri ElevenCreative. Perusahaan mencapai pendapatan berulang tahunan sebesar $500 juta pada April 2026. Musik masih merupakan bagian kecil dari itu—tetapi ElevenMusic, yang diluncurkan sebagai aplikasi konsumen pada bulan April, merupakan serangan langsung ke basis pengguna Suno. Stable Audio 3.0: Bobot terbuka, pada perangkat, durasi lebih panjang Stable Audio 2.0 maksimal berdurasi tiga menit dan sudah tertinggal dari Suno saat diluncurkan pada tahun 2024. Stable Audio 3.0 menghadirkan empat model: Small SFX (efek suara pada perangkat), Small (komposisi musik penuh pada perangkat), Medium (hingga 6:20, perangkat keras lebih kuat), dan Large (hanya API). Tiga dari empat model memiliki bobot terbuka di Hugging Face. Model Small berjalan pada 459 juta parameter masing-masing—tidak perlu GPU. (Parameter adalah ukuran kapasitas model AI.) Medium mencapai 1,4 miliar parameter dan menghasilkan output 6:20 dalam waktu sekitar 1,31 detik pada GPU H200. Large, dengan 2,7 miliar parameter, hanya tersedia melalui API untuk organisasi dengan pendapatan di atas $1 juta. Granularitas generasi per detik berarti Anda mendapatkan panjang trek yang tepat seperti yang Anda minta, bukan perkiraan. Ini juga didukung di ComfyUI untuk pengaturan lokal. Arsitekturnya baru: autoencoder semantik-akustik yang disebut Stability sebagai SAME, dirancang untuk menjaga koherensi melodi pada output yang lebih panjang. Fine-tuning LoRA didukung, sehingga artis dapat menyesuaikan model dengan katalog mereka sendiri. Inpainting juga disertakan—segmen tunggal, multi-segmen, dan kelanjutan kausal untuk memperpanjang trek melewati titik akhir aslinya. Sebagai konteks, LoRA (Low-Rank Adaptation model) seperti model kecil yang mengondisikan
Status data✓ Teks lengkap telah diambilBaca artikel asli (Decrypt)
🔍Peristiwa serupa dalam sejarah· Pencocokan kata kunci + aset6 berita
💡 Saat ini menggunakan pencocokan kata kunci + aset (MVP) · Akan ditingkatkan ke pencarian semantik embedding di masa mendatang
Informasi mentah
ID:e953f81c65
Sumber:Decrypt
Diterbitkan:2026-05-27 19:33:13
Kategori:bearish · Kategori ekspor bearish
Aset:Tidak ditentukan
Voting komunitas:+0 /0 · ⭐ 0 Penting · 💬 0 Komentar