跳至主要內容

免費 AI 人聲分離指南:2026 年去除或隔離人聲

使用 AI 免費去除或隔離人聲。涵蓋 UVR、BandLab Splitter 和瀏覽器工具——附帶步驟、工具對比、質量提示和法律說明。

免費 AI 人聲分離指南:2026 年去除或隔離人聲

快速回答:免費 AI 人聲分離指南:2026 年去除或隔離人聲

快速回答: AI 人聲去除器用深度神經網路將人聲與歌曲器樂床分離。最佳免費選項是 Ultimate Vocal Remover (UVR)——支援 MDX-Net 與 Demucs 的桌面應用。BandLab Splitter 等免費瀏覽器工具無需安裝即可使用。

.

快速回答

AI 人聲分離器使用深度神經網路將人聲從歌曲的器樂伴奏中分離出來。最好的免費選項是Ultimate Vocal Remover (UVR)——一款支援 MDX-Net 和 Demucs 模型的桌面應用。BandLab Splitter 等免費瀏覽器工具也可使用,無需安裝。

AI 人聲分離的實際工作原理

老式的卡拉 OK 技巧——相位去除——透過反轉一個立體聲聲道來去除居中聲像的內容。聽起來簡單因為它確實簡單:任何在兩個聲道中不完全相同的內容都會完整保留,這意味著在任何帶有混響、立體聲加寬或背景和聲的現代混音中,人聲會嚴重洩漏。成果是一個空洞、相位失真的器樂,很少能用。

AI 人聲分離器基於完全不同的原理工作。Demucs[1]MDX-Net[2] 等模型是在大量已分離分軌資料集上訓練的深度神經網路。給定一個混合音訊檔案,網路預測各個分軌——人聲、鼓、低音、其他樂器——在混合之前的樣子(或聲音)。沒有相位技巧,沒有 EQ 切割:模型基於學習到的模式做出有根據的估計。

Hybrid Demucs v4 是當前最先進的架構,同時在時域(原始波形)和頻域(頻譜圖)中工作,在單一模型中結合了時間精度和頻率解析度。[2] 成果:幹淨的器樂和人聲分軌,比任何 AI 之前的方法產生的偽影少得多。

最佳免費工具一覽

工具格局分為兩大陣營:本地安裝的桌面應用(更強大,更多設定)和基於瀏覽器的工具(即時,無需安裝,但有使用限製或質量折衷)。下表涵蓋了最好的真正免費選項。

工具平臺免費限製分軌最適合
Ultimate Vocal Remover (UVR)[3]桌面(Win / Mac / Linux)無限——完全免費開源人聲、鼓、低音、鋼琴、吉他、其他想要最高質量並完全控制模型的製作人
BandLab Splitter[4]網頁 + 調整端免費層級無限上傳(4 分軌)人聲、鼓、低音、其他(付費版 7 分軌)無需安裝的快速瀏覽器分離
vocalremover.org[5]網頁免費有每日使用限製;付費去除限製人聲 + 器樂(2 分軌)一次性使用、卡拉 OK 製作
Moises[6]網頁 + 調整端(iOS / Android)每月 5 次上傳,每首最長 5 分鐘(免費層級)人聲、鼓、低音、其他(付費更多)調整端使用、偶爾人聲練習

Ultimate Vocal Remover:免費桌面標準

Ultimate Vocal Remover (UVR) 是一款免費、MIT 授權的開源桌面應用,適用於 Windows、macOS 和 Linux。[3] 它是經常處理分軌的製作人的首選,因為沒有上傳限製、沒有訂閱、沒有伺服器施加的質量上限。

該應用在一個介面下捆綁了三種獨立的 AI 架構:VR Architecture(原始 UVR 神經網路)、MDX-Net(包括 ZFTurbo 訓練的較新 MDX23C 模型)和 Demucs(v1 到 v4,包括 Hybrid Demucs)。[7] 不同模型對不同型別的處理效果不同——Demucs v4 傾向於在搖滾和流行上表現良好,而 MDX-Net 模型在處理過度的嘻哈人聲時可能略勝一籌,所以在棘手的音軌上嘗試兩種模型是常見工作流。

整合模式讓你同時執行多個模型並混合它們的輸出——這種技術可明顯降低困難素材上的偽影。支援 NVIDIA、AMD Radeon 和 Intel Arc 顯示卡的 GPU 加速(NVIDIA GPU 處理最低需要 GTX 1060 6 GB)。[7]

如何使用 UVR:分步指南

  1. 下載並安裝 UVR
    前往 ultimatevocalremover.com 下載適用於你的作業系統(Windows 10+、macOS Big Sur+ 或 Linux)的安裝檔。[3] 安裝檔捆綁了應用本身;AI 模型需要在應用內單獨下載。
  2. 下載你的第一個 AI 模型
    開啟 UVR 並進入設定 → 下載中心。對於大多數素材,從 MDX-Net — UVR-MDX-NET-Voc-FT(人聲)或 Demucs v4 (htdemucs)(完整 4 分軌分離)開始。下載大小為幾百 MB,選擇模型後自動開始。
  3. 匯入你的音訊檔案
    將你的音軌拖入主視窗,或使用選擇輸入按鈕。UVR 支援 MP3、WAV、FLAC、OGG 以及 FFmpeg 可讀的任何其他格式。[7]
  4. 選擇模型和輸出格式
    從下拉選單選擇 AI 模型。設定輸出資料夾和首選格式(WAV 無損,MP3 檔案更小)。對於簡單的人聲/器樂分離,選擇 2 分軌人聲模型。對於將鼓、低音和其他樂器分離為獨立檔案,選擇 4 分軌 Demucs 模型。
  5. 執行分離
    點選開始處理。在現代 CPU 上,一首 3 分鐘的音軌通常需要 1-3 分鐘(無 GPU 加速)。在設定中啟用相容 GPU 後,同一音軌可在 30 秒內處理完成。進度顯示在狀態列中。
  6. 獲取你的分軌
    UVR 將分離的分軌儲存到你選擇的輸出資料夾。你至少會有一個器樂和一個人聲檔案。如果運行了整合模式,還會儲存一個混合輸出檔案。匯入你選擇的 DAW 並在暴露的部分檢查偽影。
  7. 對困難音軌嘗試整合模式
    如果第一次處理有可聽偽影——混響洩漏、低頻串擾、幽靈泛音——切換到整合模式並選擇兩到三個不同模型。UVR 將執行所有模型並合並成果,這通常能降低困難素材上的偽影。

基於瀏覽器的選項:不想安裝桌面應用時

並非每個工作流都需要本地安裝。如果你在借用的機器上工作、使用平板電腦,或者只需要快速分離而不想配置軟體,瀏覽器工具是最快的途徑。

  • BandLab Splitter 最慷慨的免費瀏覽器選項:免費層級無限上傳,可分離為 2 或 4 個分軌(人聲、鼓、低音、其他)。[4] 支援網頁和調整端。BandLab 付費會員($1.99/月)可解鎖最多 7 個分軌、吉他和絃樂分離以及 MIDI 分軌匯出。無需註冊即可在 bandlab.com/splitter 試用。
  • vocalremover.org 一個長期執行的免費瀏覽器工具,從任何上傳的檔案輸出卡拉 OK 曲目(器樂)和清唱(隔離人聲)。[5] 免費層級有每使用者每日使用限製;付費會員可去除這些限製。介面極簡——上傳、等待、下載——是偶爾一次性分離的最快選項。
  • Moises 在網頁、iOS 和 Android 上提供強大的 AI 分離。[6] 免費計劃限製每月 5 次上傳,每首最長 5 分鐘,僅匯出 MP3 或 M4A。適合練習和調整工作流;免費限製使其不適合經常性製作使用而不升級。

預期效果:質量、偽影和型別差異

現代 AI 分離在幹淨的工作室錄音上表現良好——主唱居中聲像、樂器佔據可預測頻率範圍——這種素材在流行、R&B 和嘻哈中很常見。在這類音軌上,你可以期望得到一個可用的器樂,人聲洩漏極少,以及保留大部分人聲特徵的清唱。

偽影是所有當前分離工具的誠實侷限。最常見的是:混響尾音洩漏(一些來自人聲的房間聲音洩漏到器樂中)、與人聲範圍重疊嚴重的樂器上的頻率塗抹(200-800 Hz 附近的鋼琴和絃是常見的受害者)以及清唱上的幽靈泛音——未完全分離的微弱音符。這些偽影是估計過程的可預測副作用,不是任何特定工具的錯誤。

型別差異很大。稀疏的編曲——獨奏鋼琴、原聲吉他和人聲、極簡靈魂樂——往往分離更幹淨,因為人聲和樂器之間的頻譜對比度高。多個部分同時佔據同一頻率區域的音軌(密集絃樂、疊層合成器、在中頻競爭的失真吉他)對任何模型都更難。帶有原人聲器串擾的現場錄音是最困難的類別。

獲得更幹淨成果的技巧

使用 WAV 或 FLAC 作為源檔案。MP3 壓縮在 AI 開始之前就引入了偽影;輸入中的訊號資訊越多,模型的估計越好。始終使用你擁有的最高質量版本。

在同一音軌上嘗試多個模型。UVR 使這變得容易:執行 Demucs v4,然後執行 MDX-Net 模型,聽哪個器樂偽影更少。不同架構在同一素材上會犯不同的錯誤。

在 DAW 中對分軌進行後期處理。一個窄動態 EQ 來捕捉人聲洩漏最明顯的 2-4 kHz 範圍,可以在不影響混音平衡的情況下進一步清理器樂。將 AI 輸出視為起點,而非成品。

製作人實際用人聲分離器做什麼

  • 卡拉 OK 曲目 原始用例:提取器樂讓歌手可以對著原始編曲練習或現場表演。即使是略微不完美的分離也比通用 MIDI 重現有用得多。
  • 取樣和插值練習 隔離人聲 hook 以研究措辭、音高和節奏,然後再嘗試複製。分離的器樂讓你聽到單獨的編曲選擇——沒有混音的鼓 groove、沒有和絃的低音進行。
  • 人聲練習和聽力訓練 歌手使用隔離的器樂對著原始錄音練習而不需要引導人聲,或提取人聲分軌來分析表演的音高和氣息控制。
  • 混音和串燒起點 分離的清唱或器樂為你提供了非官方混音和串燒專案的粗略起點。在發行成果之前請參閱下方的法律說明。
  • 分軌恢復 如果你只有自己會話的立體聲混音且原始專案檔案丟失,AI 分離可以恢復粗略的分軌以供進一步工作。成果會有偽影,但從混音中恢復可用的人聲或鼓音軌是可以實現的。

AI 處理不會改變源素材的版權所有者。當你從受版權保護的歌曲中提取器樂時,生成的檔案仍是該受版權保護作品的衍生品——AI 沒有創作新作品,它只是估計了已經存在的內容。在未獲得授權的情況下發行、釋出或商業利用你未創作或未授權的歌曲的提取清唱或器樂,與未經授權使用原始錄音具有相同的法律風險。[8]

合理使用可以在有限的情況下適用——教育、評論或變革性作品——但這是逐案法律判斷,不是萬能盾牌。如果你正在版本使用第三方錄音提取分軌的公開釋出作品,請在釋出前諮詢熟悉音樂版權的律師。

最明確的安全用途是個人練習、聽力訓練以及使用你自己擁有或已獲得授權的錄音。在你自己會話匯出的混音上使用 UVR,或處理你已授權的免版稅素材,不會引起版權問題。

在 Plugg Supply 上瀏覽免費音樂製作軟體——精選工具,無水分。

Learning path

相關答案中心

相關目錄

目錄中的更多 software

來自 Plugg Supply 來源的更多 software,按目錄受歡迎程度排名。

瀏覽Software
Nico Baran The Motel v1.0.0 [WiN]
新品
免費

軟體

Nico Baran The Motel v1.0.0 [WiN]

常見問題

2026 年最好的免費人聲分離器是什麼?
Ultimate Vocal Remover (UVR) 在質量和控制方面是最好的免費選項——它完全免費、開源、本地執行且無上傳限製。[3] 對於無需安裝的瀏覽器使用,BandLab Splitter 在其免費層級上提供無限免費分離。[4]
AI 人聲分離與老式相位去除方法有什麼不同?
相位去除反轉一個立體聲聲道來去除居中聲像的內容——它只移除在兩個聲道中完全相同的訊號,這在現代製作中很少見。Demucs 和 MDX-Net 等 AI 模型是訓練過的神經網路,它們預測每個分軌在混合前的樣子,產生更幹淨的成果,洩漏更少,且沒有空洞的立體聲偽影。[2]
在我的音樂中使用提取的器樂或清唱合法嗎?
使用 AI 提取不會改變版權所有權。從受版權保護的音軌提取的器樂仍是該作品的衍生品,未授權發行或商業發行歸類為侵權。[8] 個人練習、聽力訓練和處理你自己的錄音是最明確的安全用途。
沒有 GPU 可以使用 UVR 嗎?
可以。UVR 預設在 CPU 上處理音訊。GPU 加速(NVIDIA、AMD Radeon 或 Intel Arc)是可選的,可以顯著加快處理速度——NVIDIA GPU 模式最低需要 GTX 1060 6 GB[7]——但應用在沒有 GPU 的情況下完全可用,只是處理長檔案時較慢。
為什麼我提取的器樂仍有人聲偽影?
AI 分離是一種估計,而非無損反轉。混響尾音、偏離中心的背景和聲以及與人聲佔據相同頻率範圍的樂器會部分洩漏。使用 UVR 的整合模式——混合多個模型輸出——通常能降低這些偽影。使用高質量 WAV 或 FLAC 源而非壓縮的 MP3 也有幫助。
基於瀏覽器的人聲分離器免費層級有什麼限製?
BandLab Splitter 在其免費層級上提供無限上傳,最多 4 個分軌。[4] Moises 將免費使用者限製為每月 5 次上傳,每首最長 5 分鐘。[6] vocalremover.org 在免費層級有每日使用限製,之後會提示付費賬戶。[5]
UVR 支援 Mac 和 Linux 嗎,還是隻有 Windows?
UVR 支援 Windows 10 或更高版本、macOS Big Sur 及以上版本以及 Linux(Debian 和 Arch 系統)。所有平臺使用相同的 AI 模型集。在所有支援的作業系統上,應用僅限 64 位。[3]