guides15 分鐘 read · Updated 2026-05-28

如何訓練你自己的 RVC 語音模型

打造自訂 AI 語音所需的一切——從原始音訊到可用的即時語音模型。涵蓋資料集準備、訓練工具、參數調整與疑難排解。

什麼是 RVC 訓練?

RVC(檢索式語音轉換)訓練是教導神經網路重現特定聲音的過程。你提供目標聲音的乾淨音訊樣本,模型會學習該聲音的特徵——音色、共鳴、共振峰結構、氣息感——以便能將任何輸入的語音即時轉換成該聲音。訓練好的模型不會記住訓練音訊,而是學習聲音的身份,然後將該身份應用於新的語音,同時保留原始說話者的用詞、節奏、情感和語調。

訓練前需要準備什麼?

訓練需要三樣東西:乾淨的音訊資料、一個訓練環境和耐心。資料集的品質是模型品質的最大單一因素——一個簡短、乾淨的資料集總是勝過一個冗長、嘈雜的資料集。

  • ●10-30 分鐘的乾淨、獨立的人聲音訊——沒有背景音樂、沒有噪音、沒有混響、沒有回音。超過 40 分鐘的多樣化音訊可以進一步提高自然度,但最好不要超過 60 分鐘,以避免效益遞減。
  • ●音訊必須是單一說話者,且錄音條件相當一致。
  • ●首選無損格式:WAV 或 FLAC,44.1kHz 或 48kHz 取樣率,單聲道。避免使用低位元率的 MP3——壓縮瑕疵會被「烤」進模型裡。
  • ●一張至少有 6 GB VRAM çš„ GPU(推薦 NVIDIA 以支援 CUDA)。8 GB+ VRAM 是舒適批次大小的理想選擇。
  • ●訓練軟體:Applio (applio.org — 推薦,開發最活躍,UI 最好)、Mangio-RVC 或原始的 RVC WebUI。
  • ●沒有 GPU?使用雲端服務:Google Colab (colab.research.google.com — 提供 T4 GPU 的免費方案)、Kaggle、Paperspace 或 RunPod。

步驟 1 — 準備你的資料集

資料集準備是大多數人失敗的地方。在嘈雜、有混響或不一致的音訊上訓練的模型,聽起來也會嘈雜、有混響且不一致。社群標準的清理流程使用 Ultimate Vocal Remover (UVR5 — github.com/Anjok07/ultimatevocalremovergui),這是一個免費工具,能利用 AI 將人聲與伴奏分離並去除混響。

  • ●獲取你的音訊:最好的來源是獨立的人聲軌道(使用人聲消除器從歌曲中提取人聲)、Podcast 錄音、有聲書旁白、訪談片段或在安靜房間中直接用麥克風錄音。
  • ●清理流程:去除伴奏(UVR5 搭配 Kim Vocal 2 或 MDX-NET 模型)→ 去除混響和回音(UVR5 VR-DeEchoDeReverb)→ 提取主要人聲 → 去除殘留噪音。不要過度處理——每一次處理都會稍微降低品質。
  • ●確保只有單一說話者:移除任何有重疊聲音、背景雜談或其他說話者的片段。
  • ●包含多樣性:不同的音高、情感、說話速度和音域有助於模型泛化。單調的資料集會產生單調的模型。
  • ●修剪靜音和非語音部分:移除長暫停、咳嗽和非人聲的聲音。保留自然的呼吸——移除所有呼吸會讓模型聽起來像機器人。
  • ●不要在單詞中間剪斷:保持片語完整,以保留自然的語調模式。
  • ●檔案路徑:確保你的資料集資料夾路徑不包含空格或特殊字元——這是所有 RVC 工具中常見的訓練失敗原因。

步驟 2 — 選擇你的訓練工具

有三種主要的開源工具可以處理 RVC 訓練。它們都使用相同的資料集並產生相同的 .pth 模型格式——區別在於使用者體驗。

  • ●Applio — 最受歡迎且開發最活躍的 RVC 訓練工具。乾淨的 UI、自動化的資料集預處理、用於監控損失曲線的 TensorBoard 整合,並支援所有主要的 f0 提取方法。推薦給大多數用戶。
  • ●Mangio-RVC / RVC-WebUI — 原始 RVC 專案的社群分支。透過瀏覽器中的 Gradio 網頁介面運行。需要更多手動配置,但文件齊全。如果 Applio 在你的系統上無法運作,這是一個很好的替代方案。
  • ●Google Colab 筆記本 — 使用免費的雲端 GPU 進行基於瀏覽器的訓練。無需本地 GPU。搜索「RVC training Colab」以尋找社群筆記本。最適合沒有獨立 GPU 的用戶。

步驟 3 — 配置訓練參數

了解這些參數有助於你獲得更好的結果。從推薦的預設值開始,並根據你聽到的效果進行調整。

  • ●Epochs (200-500):一個 epoch 是對你的訓練數據進行一次完整的遍歷。從 200-300 開始並進行評估。更多的 epochs 可以提高品質,但過度訓練會導致機器人般的瑕疵。沒有神奇數字——你的耳朵才是裁判。
  • ●Batch Size (取決於 VRAM):6 GB VRAM → batch size 4-6。8 GB VRAM → batch size 6-8。12 GB+ VRAM → batch size 8-12。更高的 batch size 訓練更快,但使用更多記憶體。如果出現 CUDA 記憶體不足的錯誤,請減小 batch size。
  • ●Sample Rate:40kHz 是社群標準,對大多數聲音效果很好。48kHz 能捕捉到稍微更多的高頻細節,但需要更多計算資源。除非你有特殊理由,否則使用 40kHz。
  • ●Save Frequency:每 10-50 個 epochs 儲存一次檢查點,這樣你就可以測試中間版本。這對於在過度訓練前找到最佳點至關重要。
  • ●RVC Version:對於新模型,務必使用 v2。v2 使用 768 維的特徵向量(v1 為 256),能產生更準確、更自然的轉換。

F0 提取方法詳解

f0(基頻)提取方法決定了如何從你的訓練音訊中偵測音高。這個選擇會顯著影響模型品質。

  • ●RMVPE (推薦) — Robust Multiscale Waveform-based Pitch Estimation。目前的社群標準。速度快,能很好地處理嘈雜的音訊,並在所有聲音類型上產生可靠的音高追蹤。除非你有特殊理由,否則就用這個。
  • ●Crepe — 比 RMVPE 有更高的音高準確度,特別是對於歌聲和乾淨的錄音。處理速度較慢。最適合需要最高保真度的高品質錄音室錄音。
  • ●FCPE — 快速、現代的演算法,具有高音高精度。在速度很重要時,是 RMVPE 的一個很好的替代方案。對於嘈雜的音訊,其穩健性稍差。
  • ●Hybrid (RMVPE + FCPE) — 一些訓練工具提供組合方法。在邊緣情況下可以改善結果,但會增加處理時間。先嘗試單一方法。

步驟 4 — 訓練與監控

啟動訓練並使用 TensorBoard(整合在 Applio 中)或透過測試儲存的檢查點來監控進度。根據資料集大小和 epoch 數量,在現代 GPU 上訓練通常需要 1-4 小時。觀察損失曲線——它應該穩定下降然後趨於平緩。當它趨於平緩時,模型已經從數據中學到了它能學到的一切。繼續訓練下去有過度訓練的風險。定期儲存檢查點,並透過在樣本音訊檔案上運行推論來測試它們。聽聽自然度、清晰度,以及輸出是否真的聽起來像目標聲音。最好的檢查點很少是最後一個——大多數有經驗的訓練者發現最佳點在 epoch 200 到 400 之間。

步驟 5 — 生成 Index 檔案

訓練完成後,生成 FAISS 索引檔案。這一步經常被忽視,但它能顯著提高輸出品質。索引檔案包含一個可搜尋的訓練音訊特徵向量資料庫。在推論期間,模型使用此索引來檢索目標聲音的真實聲學模式,從而減少原始說話者聲音滲透出來的「音色洩漏」。在 Applio 中,索引生成是訓練後的一鍵式步驟。在分享或匯入時,務必將 .index 檔案與 .pth 模型一起提供。

步驟 6 — 使用你的模型

你訓練好的模型會產生兩個關鍵檔案:.pth 模型檔案(50-100 MB)和 .index 檔案。要即時使用它們,請將它們匯入變聲器應用程式。Echo Live 接受 .onnx 格式的模型——使用 voicechanger.live/tools/model-converter 上的免費轉換器(基於瀏覽器,無需上傳)轉換你的 .pth 檔案。為了在訓練期間進行測試,大多數訓練工具都包含一個內建的推論分頁,你可以在那裡直接測試 .pth 模型而無需轉換。

常見問題疑難排解

如果你的模型聽起來不對,原因幾乎總是以下問題之一:

  • ●模型聽起來像機器人或有金屬感——過度訓練。回滾到早期的檢查點(試試 epoch 150-250)。如果所有檢查點聽起來都像機器人,那你的資料集可能含有需要清理的混響或噪音。
  • ●模型聽起來像原始說話者,而不是目標——資料集太短或太單一。增加更多樣性(不同的音高、情感),並確保至少有 15 分鐘的乾淨音訊。
  • ●模型聽起來很悶或品質低——源音訊位元率低或過度壓縮。務必使用無損的 WAV 或 FLAC。同時檢查你是否用太多 UVR5 處理而過度加工。
  • ●訓練因 CUDA 記憶體不足而崩潰——減小 batch size。如果已經是最小值,請降低取樣率或關閉其他佔用 GPU 的應用程式。
  • ●訓練損失沒有下降——檢查你的資料集是否充滿了靜音或非語音音訊。驗證檔案格式是否正確(WAV/FLAC、單聲道、正確的取樣率)。
  • ●模型對某些聲音效果好,對其他聲音效果差——RVC 轉換品質取決於輸入和目標聲音之間的音高範圍相似性。男轉男和女轉女的轉換通常效果最好。

FAQ

我需要多少音訊才能訓練出一個好的 RVC 模型?
10-30 分鐘的乾淨、獨立的人聲音訊是標準建議。少於 5 分鐘通常效果不佳。超過 40 分鐘的多樣化音訊可以進一步提高自然度,但品質比數量更重要——15 分鐘的乾淨音訊勝過 60 分鐘的嘈雜音訊。
我可以在沒有 GPU 的情況下訓練 RVC 模型嗎?
在 CPU 上訓練技術上是可行的,但不切實際——在 GPU 上需要 1 小時的 200-epoch 訓練,在 CPU 上可能需要 24 小時以上。如果你沒有本地 NVIDIA GPU,請使用像 Google Colab 或 Kaggle 這樣的免費雲端 GPU 服務。
我應該使用哪個訓練工具?
Applio 是 2026 年最推薦的 RVC 訓練工具。它擁有最活躍的開發、最乾淨的介面,以及用於監控訓練進度的內建 TensorBoard 支援。Mangio-RVC 和原始的 RVC WebUI 是可靠的替代方案。
我應該訓練多少個 epochs?
從 200-300 個 epochs 開始並測試輸出。沒有通用的最佳數字——這取決於你的資料集大小和品質。每 10-50 個 epochs 儲存一次檢查點並聽聽每一個。當聲音聽起來自然時就停止;繼續下去有過度訓練和產生機器人瑕疵的風險。
過度訓練聽起來是怎樣的?
一個過度訓練的模型聽起來像機器人、有金屬感或失真——尤其是在母音和持續音上。聲音失去了自然品質,開始聽起來不自然。如果發生這種情況,請回滾到早期的檢查點。這表示模型過於具體地學習了訓練數據,失去了泛化能力。
在別人的聲音上訓練 RVC 模型合法嗎?
為個人、非商業用途訓練模型通常被認為是可以接受的。使用克隆聲音冒充他人、進行詐欺或創建誤導性內容在大多數司法管轄區都是非法的。一些地區已經制定了專門針對 AI 語音冒充的深度偽造法律。務必負責任地使用語音模型。
我可以分享我訓練的模型嗎?
可以——.pth 和 .index 檔案可以自由分享。RVC 社群在 Hugging Face 和 Discord 伺服器上有數千個共享模型。請注意源音訊:如果你在未經同意的情況下使用受版權保護的材料或真人的聲音進行訓練,分享模型可能會產生倫理或法律問題。
我訓練的模型,.pth 和 .onnx 有什麼不同?
.pth 檔案是訓練產生的原生 PyTorch 模型。.onnx 檔案是一個優化版本,無需 Python 即可運行——推論更快、記憶體使用更少,並與像 Echo Live 這樣的原生應用程式相容。語音品質是相同的。當你準備在即時應用程式中使用模型時,使用免費的轉換工具將 .pth 轉換為 .onnx。

Ready to try it?

Download Echo and experience AI-powered voice conversion for yourself.

下載 Echo