guides15 分鐘 read · Updated 2026-05-31

如何尋找、轉換與匯入 RVC 語音模型

從零到擁有一個可用的 AI 語音,你需要知道的一切——去哪裡找模型、如何挑選好模型、轉換格式、匯入與疑難排解。

完整流程——從零到 AI 語音

在 Echo 中使用社群 AI 語音需要五個步驟。下面會詳細介紹每一步,但這裡先給出一個概覽,讓你在開始前心裡有數。

  • ●步驟 1 — 在 Hugging Face 或 AI Hub Discord 上尋找語音模型。社群模型可免費下載。
  • ●步驟 2 — 下載 .pth 檔案(以及 .index 檔案,如果有的話)。這是 RVC 社群使用的原始模型格式。
  • ●步驟 3 — 使用 voicechanger.live/tools/model-converter 上的免費瀏覽器轉換器將 .pth 檔案轉換為 .onnx 格式。這只需幾秒鐘,且絕不會上傳你的檔案。
  • ●步驟 4 — å°‡ .onnx 檔案匯入 Echo。打開 Echo → 語音庫 → 匯入 → 選擇你的 .onnx 檔案。
  • ●步驟 5 — 選擇語音,點擊「開始」,然後說話。你的聲音會透過任何使用你麥克風的應用程式即時轉換。

了解檔案類型

RVC 語音模型涉及三種檔案類型。你在過程中會遇到這三種,所以了解它們各自的作用可以避免混淆。

  • ●.pth (PyTorch 模型) — RVC 社群使用的標準格式。這就是你從 Hugging Face 下載的檔案。一個 .pth 檔案通常為 50–100 MB,包含了定義目標聲音的已訓練神經網路。你不能直接在 Echo 中使用 .pth 檔案——它們需要先轉換成 .onnx。
  • ●.index (FAISS 索引) — 一個可選的附屬檔案,透過參考原始訓練音訊中的真實聲學樣本來提高語音品質。對於在 Echo 中進行即時變聲,.index 檔案不是必需的——Echo çš„ ONNX 流程可以在沒有它的情況下處理轉換。然而,如果你使用其他 RVC 工具進行離線轉換(歌曲翻唱、配音),.index 檔案會帶來明顯的品質差異。如果有的話,務必下載它。
  • ●.onnx (Open Neural Network Exchange) — Echo 使用的優化格式。將 .pth 轉換為 .onnx 會產生相同的聲音,但格式可以在沒有 Python 或 PyTorch 的情況下原生運行——這意味著更快的推論、更低的記憶體佔用,且沒有沉重的依賴。轉換是免費的,只需幾秒鐘。

步驟 1 — 去哪裡找語音模型

RVC 社群已經製作了數千個語音模型,涵蓋了角色、名人、原創聲音和自訂創作。品質差異巨大——一個在乾淨音訊上訓練的模型聽起來令人信服,而一個訓練不佳的模型聽起來像機器人。以下是主要來源。

  • ●Hugging Face — 最大的專門 RVC 模型儲存庫。每個模型都有評分、下載次數、音訊預覽和元數據(模型版本、訓練輪數、取樣率)。從這裡開始。按角色名稱或聲音類型搜索。
  • ●Hugging Face — 許多高品質的 RVC 模型都託管在 Hugging Face 上,特別是那些認真記錄其訓練過程的創作者。搜索「[角色名稱] RVC」或「RVC v2 model」。這裡的模型通常同時包含 .pth å’Œ .index 檔案。
  • ●AI Hub Discord — 最大的 RVC 社群 Discord 伺服器,有活躍的模型分享頻道。最適合尋找公共平台上沒有的利基或自訂模型,或請求特定聲音。可透過 discord.gg/aihub 加入。
  • ●Reddit (r/RVC) — 模型推薦、品質評論和社群審核的建議。適合發現哪些模型被認為是特定角色的最佳選擇。

步驟 2 — 如何挑選一個好模型

並非所有模型都值得下載。一個訓練良好和訓練不佳的模型之間的差異是巨大的。以下是如何辨別好模型的方法。

  • ●聽音訊預覽——在 Hugging Face 上,許多模型都有音訊示範。一個 5 秒的預覽比任何描述都更能說明問題。如果它在預覽中聽起來不錯,那麼在 Echo 中也會聽起來不錯。
  • ●檢查訓練數據時長——在 15–40 分鐘乾淨音訊上訓練的模型通常聽起來最好。少於 5 分鐘的往往聽起來單薄或普通。
  • ●尋找 v2 模型——RVC v2 模型使用 768 維的特徵向量,聽起來比 v1(256 維)更自然。務必優先選擇 v2。
  • ●閱讀描述——好的創作者會記錄他們的參數。一個描述為「在 25 分鐘乾淨人聲上訓練,300 輪,RMVPE,40kHz」的模型比沒有描述的更值得信賴。
  • ●檢查下載次數和評分——在 Hugging Face 上,受歡迎且評分高的模型已經過社群驗證。在 Discord 上,可以在模型分享頻道中尋求推薦。
  • ●檢查是否包含 .index 檔案——帶有 .index 檔案的模型通常品質更好,特別是對於離線使用。即使你在 Echo 中不使用該檔案,這也是一個很好的品質信號。

步驟 3 — 將 .pth 轉換為 .onnx

Echo 使用 .onnx 格式的語音模型——它更快、更輕量,且不需要 Python。從社群下載 .pth 模型後,你需要將其轉換一次。這是免費的,只需幾秒鐘。

  • ●在瀏覽器中前往 voicechanger.live/tools/model-converter。
  • ●選擇你下載的 .pth 檔案。該檔案永遠不會離開你的電腦——轉換完全在你的瀏覽器中進行。
  • ●選擇模型版本(v1 或 v2)。如果你不確定,先試試 v2——大多數現代模型都是 v2。
  • ●點擊「轉換」並下載生成的 .onnx 檔案。
  • ●輸出的語音品質與原始 .pth 相同——只有格式改變了。

步驟 4 — 匯入 Echo

準備好 .onnx 檔案後,匯入 Echo 大約需要 10 秒鐘。

  • ●打開 Echo 並前往語音庫(側邊欄中的語音分頁)。
  • ●點擊庫頂部的「匯入」按鈕。
  • ●從你儲存的地方選擇你的 .onnx 檔案。
  • ●語音會立即出現在你的庫中——無需重新啟動。
  • ●你可以匯入的模型數量沒有限制。想匯入多少就匯入多少。

步驟 5 — 開始使用你的語音

匯入後,從你的庫中選擇語音並點擊「開始」。Echo 會擷取你的麥克風輸入,透過 AI 模型即時運行,並透過虛擬音訊線輸出轉換後的聲音。任何使用麥克風的應用程式——Discord、遊戲、OBS、Zoom——都可以透過選擇虛擬音訊線作為其輸入裝置來使用轉換後的聲音。

  • ●音高偏移——如果聲音聽起來太高或太低,請在 Echo 中調整音高偏移。對於男聲轉女聲,試試 +12。對於女聲轉男聲,試試 -12。然後根據聽起來自然的感覺進行微調。
  • ●GPU 加速——啟用 GPU 模式以獲得最低延遲。Echo 支援 NVIDIA (CUDA)、AMD/Intel (DirectML) å’Œ Apple Silicon (CoreML)。
  • ●虛擬音訊線——確保已安裝 VB-Cable (Windows) 或 BlackHole (macOS) 並在 Echo 中選擇為輸出裝置。然後在 Discord、OBS 或你的遊戲中將其選為麥克風。

關於 .index 檔案

你會在許多 .pth 下載旁邊看到 .index 檔案。以下是它們何時重要以及何時可以忽略它們的確切說明。

  • ●對於在 Echo 中進行即時變聲——.index 檔案不是必需的。Echo çš„ ONNX 流程無需 FAISS 索引即可完成完整的語音轉換。沒有它,你的聲音聽起來也會很棒。
  • ●對於離線語音轉換(歌曲翻唱、配音)——.index 檔案很有用。像 w-okada å’Œ Applio 這樣的工具在推論期間使用索引來從訓練數據中檢索真實的聲學細節,這可以減少瑕疵並提高較長音訊的保真度。
  • ●對於模型品質評估——一個附帶 .index 檔案的模型通常品質更高。這意味著創作者多花了這一步來生成索引,這與更好的整體訓練實踐相關。
  • ●儲存——.index 檔案通常為 10–50 MB。如果有的話就下載它們,並將它們與你的 .pth 檔案放在一起,以備將來想使用離線工具時使用。

疑難排解

如果匯入後聲音聽起來不對,問題幾乎總是以下之一。大多數問題無需尋找新模型即可解決。

  • ●聲音聽起來像機器人或有金屬感——模型可能過度訓練了。嘗試同一角色的不同模型,或尋找訓練輪數較少的模型。
  • ●音高聽起來不對——在 Echo 中調整音高偏移。男轉女通常需要 +12,女轉男需要 -12。在該範圍內進行實驗。
  • ●聲音聽起來完全不像目標——你可能在 v2 流程中使用了 v1 模型,反之亦然。在模型轉換器中選擇正確的版本重新轉換。
  • ●輸出聲音聽起來很悶——模型可能是在低品質音訊上訓練的。尋找在更乾淨的源材料上訓練的不同模型。
  • ●出現爆音或噼啪聲——這通常是音訊流程問題,而不是模型問題。在 Echo 設定中增加區塊大小,或檢查你的 GPU 是否過載。
  • ●轉換聲音聽起來很普通——對於離線工具,這通常意味著缺少 .index 檔案。對於 Echo,請嘗試不同的模型——有些模型就是比其他模型轉換得更好。

想創建自己的語音模型嗎?

如果你在社群儲存庫中找不到想要的聲音,你可以從頭開始訓練一個自訂 RVC 模型。這是一個更進階的過程,需要 GPU 和一些耐心,但工具是免費的,社群也非常樂於助人。你需要 10–30 分鐘來自目標聲音的乾淨、獨立的人聲音訊。推薦的訓練工具是 Applio (applio.org)——它有最好的介面和最活躍的開發。對於沒有本地 GPU 的用戶,Google Colab 筆記本提供免費的雲端 GPU 存取權限進行訓練。我們有一份完整的逐步訓練指南,涵蓋了使用 UVR5 準備數據集、訓練參數、f0 提取方法、評估檢查點和解決常見問題。

語音模型的倫理使用

RVC 語音模型是強大的技術,應負責任地使用。不要在真人不知情或未經同意的情況下創建他們的模型。不要使用語音模型冒充他人進行欺騙、詐欺或騷擾。如果你創建 AI 生成的語音內容,請清楚標示。一些司法管轄區已頒布針對 AI 語音冒充的立法——使用克隆聲音誤導他人越來越多地被視為刑事犯罪。RVC 社群在創作者、模型訓練者和用戶之間的相互尊重中茁壯成長。

FAQ

Echo 使用什麼檔案格式的語音模型?
Echo 使用 .onnx 格式。社群模型以 .pth 檔案分發,所以你需要先使用 voicechanger.live/tools/model-converter 上的免費瀏覽器轉換器進行轉換。轉換只需幾秒鐘,完全在你的瀏覽器中運行,並產生相同的語音品質。
我可以匯入多少個語音模型?
沒有限制。只要你的磁碟空間允許,可以匯入任意數量的模型。它們儲存在本地,你可以在對話中即時切換。
RVC 語音模型是免費的嗎?
絕大多數是免費的。社群在 Hugging Face 和 Discord 伺服器上公開分享模型。有數千個高品質的角色、名人和原創語音模型可免費使用。
我需要 .index 檔案嗎?
對於在 Echo 中進行即時變聲,不需要。Echo 的 ONNX 流程可以在沒有它的情況下運作。 .index 檔案對於離線轉換工具(w-okada、Applio)很有用,它可以提高像歌曲翻唱這樣的較長音訊的品質。如果有的話就下載它,以備將來想使用離線工具時使用。
我應該使用什麼音高偏移?
對於男聲轉女聲,從 +12 開始調整。對於女聲轉男聲,從 -12 開始。同性別轉換通常需要 0 或小幅調整。憑耳朵微調,直到聲音聽起來自然為止。
v1 和 v2 模型有什麼不同?
RVC v2 模型使用更高維度的特徵向量(768 vs 256),聽起來更自然。務必優先選擇 v2 模型。在模型轉換器中轉換時,請確保選擇正確的版本——v1 和 v2 不可互換。
我可以訓練自己的語音模型嗎?
可以。你需要 10–30 分鐘的乾淨人聲音訊和一個 GPU。推薦的工具是 Applio (applio.org)。請參閱我們的完整訓練指南以獲取完整步驟。
語音模型合法嗎?
在大多數司法管轄區,創建和使用語音模型是合法的。使用模型冒充真人進行詐欺或騷擾是非法的,且越來越多地被起訴。請負責任地使用語音模型。

Ready to try it?

Download Echo and experience AI-powered voice conversion for yourself.

下載 Echo