explainers10 分鐘 read · Updated 2026-05-28

什麼是 RVC?

檢索式語音轉換(Retrieval-based Voice Conversion)是驅動最逼真即時變聲器的開源 AI 技術。本文將深入解析其運作原理——從神經網路架構到社群生態系。

用白話文解釋 RVC

RVC 代表檢索式語音轉換(Retrieval-based Voice Conversion)。它是一個開源的 AI 系統,能即時將一個人的聲音轉換成另一個人的聲音,同時保留你說話的一切特徵:你的用詞、你的節奏、你的情感和你的語調。只有聲音的身份會改變。結果聽起來就像一個真正不同的人說出了你一字不差的話,而不是你自己的聲音經過濾波或音高變換後的版本。

RVC 如何運作——四階段處理流程

當你透過 RVC 模型說話時,你的音訊在到達輸出端之前會經過四個不同的處理階段。了解這些階段可以解釋為什麼 RVC 聽起來比傳統的語音效果逼真得多。

  • ●階段 1 — 內容特徵提取:一個名為 HuBERT(或其變體 ContentVec)的神經網路會分析你的原始音訊,並提取與說話者無關的內容特徵——基本上就是你說了什麼以及你是怎麼說的,但移除了你的聲音身份。RVC v2 使用 768 維的特徵向量(高於 v1 çš„ 256 維),能捕捉更細微的語音細節。
  • ●階段 2 — 音高提取:一個名為 RMVPE(Robust Multiscale Waveform-based Pitch Estimation)的獨立模型會提取你語音的基頻(F0)——也就是你的音高輪廓、旋律和韻律。這就是為什麼轉換後的輸出能保留你自然語調的原因。
  • ●階段 3 — 索引檢索(FAISS):這就是「檢索式」語音轉換中的「檢索」。在訓練期間,目標語音的特徵會被儲存在一個向量資料庫中。在推論期間,FAISS(Facebook AI Similarity Search)會為你語音的每個片段找到最匹配的聲音特徵。這透過將轉換建立在目標語音的真實樣本上,減少了「音色洩漏」——即原始聲音滲透出來的現象。
  • ●階段 4 — 神經合成(VITS / HiFi-GAN Vocoder):一個基於 VITS(Variational Inference with adversarial learning for end-to-end Text-to-Speech)的生成模型會結合你提取的內容特徵、音高數據和檢索到的聲音特徵,來合成一個全新的音訊波形。輸出不是你聲音的修改版本——而是由神經網路生成的全新音訊。

為什麼 RVC 聽起來比 Pitch Shifting 更逼真

傳統的變聲器對你現有的聲音套用音訊效果——Pitch Shifting、共振峰轉移、EQ 濾波。這就像在照片上套用 Instagram 濾鏡:你可以改變外觀,但底下顯然還是同一張圖片。原始的聲音特徵總是會滲透出來,尤其是在持續的語音中。RVC 的運作方式則完全不同。它將你的語音解構成內容和音高,完全捨棄你的聲音身份,然後使用一個訓練好的神經網路從頭開始重構音訊。輸出的是一個新的聲音,而不是舊聲音的濾波版本。這就是為什麼 RVC 的聲音常常與真實人聲難以區分——因為它們是由一個學習了人類實際聲音模式的模型合成的。

RVC 模型檔案詳解

當人們分享或下載 RVC 語音模型時,會涉及三種類型的檔案。了解每種檔案的作用有助於你獲得最佳效果。

  • ●.pth (PyTorch 模型) — 核心語音模型,包含訓練好的神經網路權重。這是語音轉換所需的主要檔案。一個典型的 .pth 模型大小為 50-100 MB,它捕捉了目標語音完整的聲音特徵:音色、共鳴、氣息感和共振峰結構。
  • ●.index (FAISS 索引) — 一個可選但建議使用的附屬檔案,包含一個可搜尋的訓練音訊特徵向量資料庫。在推論期間,模型使用此索引來檢索訓練數據中的真實聲學模式,從而顯著提高輸出品質並減少瑕疵。沒有 .index 檔案,轉換仍然可以進行,但聲音可能聽起來更普通。
  • ●.onnx (Open Neural Network Exchange) — 一種優化過的可攜式模型格式。將 .pth 模型轉換為 .onnx 可以實現更快的推論、更低的記憶體使用量,並與非 Python 的運行環境相容。像 Echo Live 這樣的應用程式使用 .onnx 模型,因為它們可以被原生加載,而無需 Python 解譯器或 PyTorch 安裝。

RVC v1 vs v2

RVC v2 是目前的標準。相較於 v1,最顯著的改進是特徵提取的維度:v1 使用來自 HuBERT 的 256 維特徵向量,而 v2 使用 768 維向量。這種更高的維度能捕捉更詳細的聲音特徵,產生更自然、更準確的轉換——尤其是在跨性別變聲時,差異最為明顯。RVC v2 還受益於改進的訓練穩定性和降低的推論延遲。代價是稍高的計算需求。重要的是,v1 和 v2 模型不可互換——在 v1 上訓練的模型無法在 v2 流程中使用,除非重新訓練。對於新專案,請務必使用 v2。

RVC 與其他語音 AI 技術的比較

RVC 並非唯一的語音 AI 技術,但它佔據了一個特定的利基市場,使其非常適合即時變聲。

  • ●RVC vs Pitch Shifting — Pitch Shifting 修改頻率。RVC 生成全新的音訊。Pitch Shifting 聽起來像機器人;RVC 聽起來像人類。品質上沒有可比性。
  • ●RVC vs TTS (文字轉語音) — TTS 從文字輸入生成語音。RVC 從音訊輸入轉換語音。TTS 用於內容生成(配音、有聲書);RVC 用於即時通訊(遊戲、通話、直播)。它們解決的是不同的問題。 用任何角色的聲音生成高品質語音。在 Echo Live 中選擇內建聲音,或使用相容的 RVC 角色模型。 Kokoro 或 Supertonic 生成語音,RVC 將其轉換為角色的聲音。全程本機執行,支援匯出 WAV 和儲存至 Soundboard。匯入自訂模型需要 Pro。
  • ●RVC vs SVC (歌聲轉換) — SVC 是 RVC 的近親,專為歌唱而優化。它能比標準 RVC 更好地處理持續音、顫音和音樂樂句。使用 SVC 進行 AI 歌曲翻唱;使用 RVC 進行即時變聲。
  • ●RVC vs GPT-SoVITS / VALL-E — 這些較新的架構提供零樣本語音克隆:只需幾秒鐘的參考音訊即可將你的聲音轉換為目標聲音,無需訓練。代價是更高的計算成本、較不一致的結果,且對於低延遲的即時使用尚不實用。RVC 仍然是即時轉換方面最經得起考驗的選擇。

即時效能

RVC 的架構效率高,足以在消費級硬體上即時運行。在現代 GPU(NVIDIA GTX 1650 或更高階)上,單次推論通常需要 10-30 毫秒,這對於即時對話、遊戲喊話和直播來說已經足夠快。強烈建議使用 GPU 加速(透過 NVIDIA 的 CUDA、Windows 上的 AMD/Intel 的 DirectML 或 Apple Silicon 的 CoreML)以實現即時使用。僅使用 CPU 進行推論是可能的,但會增加顯著的延遲,使得大多數用戶的即時對話變得不切實際。

去哪裡找語音模型

RVC 社群已經產生了數千個免費的語音模型。最大的儲存庫是 Hugging Face(搜尋「RVC model」)、Hugging Face(專門的語音模型託管)以及社群 Discord 伺服器,創作者每天都會在上面分享新模型。模型涵蓋了原創聲音、角色、名人以及自訂創作。品質參差不齊——在乾淨、獨立的人聲數據上訓練,並使用 10-30 分鐘音訊的模型能產生最佳效果。

開源生態系

RVC 最初由 GitHub 上的 RVC-Project 團隊開發,並作為開源軟體發布。這種開放性使得生態系成為可能:任何人都可以訓練模型,任何人都可以基於 RVC 開發應用程式,任何人都可以貢獻改進。基於 RVC 的主要專案包括 Applio(領先的訓練工具)、w-okada Voice Changer(一個多模型語音轉換伺服器)和 Echo Live(一款專注於即時 RVC 並整合了 DSP 音效和音效板的原生桌面變聲器)。該技術是免費且寬鬆的——核心 RVC 引擎沒有授權費或使用限制。

開始使用 RVC

使用 RVC 最快的方法是透過一個能為你處理整個流程的桌面應用程式。Echo Live (voicechanger.live) 將整個 RVC 推論引擎打包到一個原生安裝程式中——無需 Python、無需命令列、無需手動管理模型。對於想要訓練自訂語音模型的用戶,Applio 是最受歡迎的開源訓練工具。對於希望在多種模型架構(包括 Beatrice 和 so-vits-svc 以及 RVC)上擁有最大控制權的技術用戶,w-okada Voice Changer 提供了一個可配置的基於伺服器的設定。

FAQ

RVC 是什麼的縮寫?
RVC 代表檢索式語音轉換(Retrieval-based Voice Conversion)。「檢索」指的是在推論過程中,FAISS 索引會查找並將你的語音特徵與儲存的目標聲音特徵進行匹配。
RVC 是免費的嗎?
是的。RVC 是開源軟體。核心技術、訓練工具以及數千個社群語音模型都是免費的。基於 RVC 開發的應用程式(如 Echo Live)可能有自己的定價——Echo Live 提供免費使用,並可選擇升級到 Pro 版以獲得無限語音。
我需要 GPU 才能使用 RVC 嗎?
對於即時變聲,強烈建議使用獨立 GPU(NVIDIA GTX 1650 或更高階,或 Apple Silicon Mac)。僅使用 CPU 的推論適用於批次處理,但對於即時對話來說延遲太高。
我可以訓練自己的 RVC 語音模型嗎?
可以。你需要 10-30 分鐘來自目標聲音的乾淨、獨立的人聲音訊,以及一張至少有 6 GB VRAM 的 GPU。Applio 是最受歡迎的免費訓練工具。訓練通常需要 1-4 小時。
什麼是 .pth 檔案?
一個 .pth 檔案是一個 PyTorch 模型檔案,包含了一個 RVC 語音模型訓練好的神經網路權重。它是語音轉換所需的核心檔案。一個典型的模型大小為 50-100 MB。
.index 檔案是用來做什麼的?
.index 檔案是一個 FAISS 搜尋索引,包含了來自訓練音訊的特徵向量。它透過讓模型在推論時從目標聲音中檢索真實的聲學模式來提高轉換品質。它是可選的,但建議使用。
.pth 和 .onnx 有什麼不同?
.pth 是用於訓練和基於 Python 推論的原生 PyTorch 格式。.onnx 是一種優化的可攜式格式,無需 Python 即可運行——它更快、使用更少記憶體,並與像 Echo Live 這樣的原生應用程式相容。語音品質是相同的。
RVC 和語音克隆是一樣的嗎?
RVC 是一種即時應用的語音克隆形式。它將你的即時語音轉換為目標聲音。這與基於 TTS 的語音克隆不同,後者是從文字生成語音。RVC 保留了你自然的說話模式、情感和節奏——只有聲音的身份會改變。 用任何角色的聲音生成高品質語音。在 Echo Live 中選擇內建聲音,或使用相容的 RVC 角色模型。 Kokoro 或 Supertonic 生成語音,RVC 將其轉換為角色的聲音。全程本機執行,支援匯出 WAV 和儲存至 Soundboard。匯入自訂模型需要 Pro。

Ready to try it?

Download Echo and experience AI-powered voice conversion for yourself.

下載 Echo