要聞列表ElevenLabs 與 Stability AI 發布全新 AI 音樂模型——它們能追上 Suno 嗎?
Decrypt2026-05-27 19:33:13 警示

ElevenLabs 與 Stability AI 發布全新 AI 音樂模型——它們能追上 Suno 嗎?

ORIGINALElevenLabs, Stability AI Drop New AI Music Models—Can They Catch Suno?
AI 影響分析Grok 分析中...
📄完整原文· 由 trafilatura 自動擷取Gemini 翻譯5719 字
簡述 - ElevenLabs 推出 Music v2,能在曲目進行中切換曲風、逐段建構歌曲,並對特定段落進行 inpainting。 - Stability AI 發布 Stable Audio 3.0,這是一個四模型家族,其中三個變體採用開放權重,使用授權資料訓練,可生成最長六分二十秒的曲目。 - 兩次發布都大力強調使用授權訓練資料——但估值達 24.5 億美元、擁有約 1 億用戶的 Suno,仍是大多數人首選的平台。 本週有兩項重大的 AI 音樂更新登場,但都不是來自 Suno。 ElevenLabs 是一家總部源自波蘭的語音 AI 公司,在 2026 年 2 月完成 5 億美元的 D 輪融資後估值達到 110 億美元,現推出 Music v2。Stability AI——也就是 Stable Diffusion 的開發團隊——發布 Stable Audio 3.0,這是一個採用開放權重、曲目長度超過六分鐘的四模型家族。 背景是 Recording Industry Association of America 於 2024 年對 Suno 與 Udio 提起的版權訴訟,這使得「以授權資料訓練」成為任何 AI 音樂公告中最重要的關鍵語。ElevenLabs 與 Stability 都大力強調這一點,確保你不會因為生成的內容而遇上麻煩。 Music v2:一首曲目,從歌劇到重金屬,毫無斷裂 Music v2 是 ElevenLabs 的第二代音樂模型,距離首代發布約 10 個月。核心賣點是高壓力下的連貫性。根據 ElevenLabs 的說法,單一曲目可以從歌劇切換到重金屬再切回來、在快速饒舌中保持完整,並嵌入非音樂類的音效——而整體編曲完全不會崩解。 生成式音訊往往在提示詞變得複雜時就會崩盤,所以這一點值得關注,尤其是在較長的編曲中。 Inpainting 現在真的實用了:選取一個段落,重新生成它,其他部分維持原樣。使用者也可以逐段建構歌曲——前奏、主歌、副歌——模型會在整體中維持連貫性,而不是把每個片段當作獨立生成處理。多語言支援也有所提升,不過 ElevenLabs 未公布具體細節。 該模型支撐三個平台:面向創作者的 ElevenMusic、面向開發者的 ElevenAPI,以及面向品牌的 ElevenCreative。目前已在 ElevenMusic 與 ElevenCreative 上線;API 存取需透過業務團隊申請早期試用。 ElevenLabs 也調降了 Music v1 與 v2 的價格,ElevenAPI 最多降 50%,ElevenCreative 自助服務最多降 40%。該公司於 2026 年 4 月達到 5 億美元的年度經常性收入。音樂目前只占其中一小部分——但 4 月作為消費者應用推出的 ElevenMusic,正是直接瞄準 Suno 的用戶群。 Stable Audio 3.0:開放權重、裝置端運行、真正更長 Stable Audio 2.0 最多只能做到三分鐘,在 2024 年推出時就已落後於 Suno。Stable Audio 3.0 推出四個模型:Small SFX(裝置端音效)、Small(完整音樂編曲,裝置端)、Medium(最長 6:20,需較強硬體)以及 Large(僅限 API)。四個模型中有三個在 Hugging Face 上採用開放權重。 Small 模型各為 4.59 億參數——無需 GPU。(參數本質上是衡量 AI 模型容量的指標。)Medium 達到 14 億參數,在 H200 GPU 上約 1.31 秒就能生成 6:20 的輸出。Large 為 27 億參數,僅供年營收超過 100 萬美元的組織透過 API 使用。每秒級的生成精細度意味著你能得到完全符合所要求長度的曲目,而非近似值。 它在 ComfyUI 中也支援本地端設置。 架構是全新的:Stability 稱之為 SAME 的語意—聲學自編碼器,專為在較長輸出中維持旋律連貫性而設計。支援 LoRA 微調,讓藝術家可以根據自己的作品集調整模型。Inpainting 也已加入——支援單段、多段以及因果延續,可將曲目延伸到原始終點之後。 補充說明,LoRA(Low-Rank Adaptation 模型)就像一個小型模型,用來調控完整模型如何生成輸出。如果你用藍調訓練一個 LoRA,模型就會產出藍調;如果你用 BB King 的藍調訓練 LoRA,模型就會生成聽起來像 BB King 的歌曲。Inpainting 則代表模型可以修正自己創作中的小錯誤。舉例來說,如果模型在 2:30 處出現幻覺,你可以選取幾秒的歌曲片段,要求模型把它改成你想要的內容,模型就會生成一段能完美嵌入該時間區段、並與整首歌融為一體的片段。 Stability 多年來在 AI 音樂領域技術上頗具聲望,但在商業上一直未能突破。開放權重的策略,就是把 Stable Diffusion 那套用在音訊上——種下開發者社群的種子,看看會長出什麼。授權方面也比 Stable Audio 過去推出的任何版本都更為乾淨,已與 Universal Music Group 和 Warner Music Group 建立合作夥伴關係。 目標:AI 音樂之王 Suno 如果 ChatGPT 是 AI 文字之王,Suno 就是 AI 音樂之王。其背後公司在 2025 年 11 月達到 24.5 億美元估值、跨越 3 億美元年度經常性收入,並已被約 1 億人使用。 它每天生成約 700 萬首歌曲。Warner Music 於 2025 年 11 月與 Suno 達成和解;Sony 和 UMG 仍在聯邦法院訴訟中。 為了避開這些版權戰爭,ElevenLabs 與 Believe、Kobalt 和 Merlin 簽訂了授權協議。Stability 則有 Warner 和 Universal。Udio 已與三大唱片公司全部和解,現在成了封閉花園——你在平台上生成的任何內容都無法帶出平台。 Stable Audio 3.0 Small 和 Medium 現已在 Hugging Face 上線。Large 透過 Stability AI API 提供。Music v2 對 ElevenMusic 使用者免費,商業方案則透過 ElevenCreative 和 ElevenAPI 提供。
資料狀態✓ 已擷取全文閱讀原文(Decrypt)
🔍歷史類似事件· 關鍵字 + 標的比對6 則
💡 目前用關鍵字 + 標的比對(MVP)· 之後會升級為 embedding 語意搜尋
原始資訊
ID:e953f81c65
來源:Decrypt
發佈:2026-05-27 19:33:13
分類:bearish · 導出分類 bearish
標的:未指定
社群投票:+0 /0 · ⭐ 0 重要 · 💬 0 留言